方案 · 03 · 方向二

实用工具:一个订阅替代多个会员

PDF 转 Word 要 WPS 会员,格式转换要格式工厂加广告,图片处理要美图会员,数据恢复要几百块。把这些打包进一个订阅,用拖文件的方式触发。

先说实话:AI 做不了转换,引擎才做

大模型本身做不了 PDF 转 Word、去水印、数据恢复。这些靠传统引擎。AI 的角色有三个:

所以这个方向的工程主体是能力包。现有的 run_python 调的是用户机器上的 python,目标用户机器上大概率没有,这是前置改造,见 技术改造。

能力包

包内置引擎(候选)体积估计覆盖功能替代的付费产品
基础运行时嵌入式 Python + 常用库约 40-80 MB所有包的基础;表格处理直接可用
文档包PDF 引擎(解析与渲染)、OCR(中英文模型)、LibreOffice portableOCR 约 50 MB,LibreOffice 约 300 MB,按需PDF 转 Word / Excel / 图片、扫描件识别为可编辑文字、合并拆分、加水印去空白页、Office 互转、批量重命名WPS 会员、Adobe、在线转换站
音视频包ffmpeg约 100 MB格式转换、压缩、裁剪拼接、提取音频、加字幕、录屏、调速、手机可放格式格式工厂、剪映部分功能
图片包去背景模型、超分模型、修复(inpainting)模型约 100-200 MB去背景、放大修复、去除用户自己图片上的水印与杂物、批量压缩与格式转换、证件照美图会员、在线去背景
表格包pandas、openpyxl、绘图库含在基础运行时多表合并、清洗、透视、公式修复、做图。这是 AI 真正有优势的地方。无直接对应,属于 AI 独有价值
数据恢复包回收站与简单文件系统恢复工具小误删回收站、U 盘文件恢复等低风险场景各类数据恢复软件(深度恢复导流)
能力包的分发按需下载、独立版本号、校验签名,复用现有知识库 zip 同步机制(manifest 加 archive,zip-slip 防护已有)。首次使用某功能时提示「需要下载 XX 包(约 100 MB)」,之后静默更新。

场景清单

场景用户怎么触发小D 做什么依赖包频次付费点
PDF 转 Word把 PDF 拖进来,选「转 Word」判断是文字版还是扫描版,文字版直接转,扫描版先 OCR 再排版;结果进交付物面板文档包高订阅
扫描件转文字拖图片或 PDFOCR,保留段落,输出 Word 或纯文本文档包中订阅
视频转格式 / 压缩拖视频,说「发微信」「放手机上」按目标场景选编码与码率,不让用户懂参数音视频包高免费版限时长,订阅不限
提取音频 / 加字幕拖视频提取 mp3;音频转字幕后烧录或外挂音视频包 + 云端语音识别中订阅
图片去背景 / 放大拖图片本地模型处理,批量可选图片包中订阅
去除自己图片上的水印或杂物拖图片,框选区域修复模型填充图片包低订阅
表格合并与清洗拖一堆 Excel,说要什么结果写脚本执行,出汇总表与图,解释做了什么基础运行时中订阅(按积分)
批量重命名 / 整理拖文件夹按规则或按内容整理,先列影响范围再执行,快照可撤销无高免费
误删恢复「我刚删了个文件」查回收站、查快照、低风险恢复;深度恢复导流数据恢复包低订阅

交互流程:文件就是提示词

  1. 用户把文件拖进窗口、拖到托盘图标,或右键「发送到小D」。
  2. 按文件类型弹出意图菜单:PDF 给「转 Word / 提取文字 / 压缩 / 合并」,视频给「转 MP4 / 压缩 / 提取音频 / 加字幕」,一堆文件给「整理 / 重命名 / 去重」。
  3. 用户点一项。需要的话小D 再问一个问题(比如「发微信还是放手机」)。
  4. 执行,进度在任务中心,结果进交付物面板,带「打开」「打开所在文件夹」。
  5. 结束时问「要不要以后自动做」(比如下载目录每周整理)。

原型见 界面原型 · 拖文件意图菜单。

降优先级与边界

待核实