实用工具:一个订阅替代多个会员
PDF 转 Word 要 WPS 会员,格式转换要格式工厂加广告,图片处理要美图会员,数据恢复要几百块。把这些打包进一个订阅,用拖文件的方式触发。
先说实话:AI 做不了转换,引擎才做
大模型本身做不了 PDF 转 Word、去水印、数据恢复。这些靠传统引擎。AI 的角色有三个:
- 编排:听懂「把这 12 个月的 Excel 合并成一张汇总表并做个图」,拆成步骤,调对引擎,选对参数。
- 兜底:引擎失败时看报错、换参数、换引擎重试,而不是把报错甩给用户。
- 解释:告诉用户转出来的文件在哪、有什么没转好、下一步能做什么。
所以这个方向的工程主体是能力包。现有的 run_python 调的是用户机器上的 python,目标用户机器上大概率没有,这是前置改造,见 技术改造。
能力包
| 包 | 内置引擎(候选) | 体积估计 | 覆盖功能 | 替代的付费产品 |
|---|---|---|---|---|
| 基础运行时 | 嵌入式 Python + 常用库 | 约 40-80 MB | 所有包的基础;表格处理直接可用 | |
| 文档包 | PDF 引擎(解析与渲染)、OCR(中英文模型)、LibreOffice portable | OCR 约 50 MB,LibreOffice 约 300 MB,按需 | PDF 转 Word / Excel / 图片、扫描件识别为可编辑文字、合并拆分、加水印去空白页、Office 互转、批量重命名 | WPS 会员、Adobe、在线转换站 |
| 音视频包 | ffmpeg | 约 100 MB | 格式转换、压缩、裁剪拼接、提取音频、加字幕、录屏、调速、手机可放格式 | 格式工厂、剪映部分功能 |
| 图片包 | 去背景模型、超分模型、修复(inpainting)模型 | 约 100-200 MB | 去背景、放大修复、去除用户自己图片上的水印与杂物、批量压缩与格式转换、证件照 | 美图会员、在线去背景 |
| 表格包 | pandas、openpyxl、绘图库 | 含在基础运行时 | 多表合并、清洗、透视、公式修复、做图。这是 AI 真正有优势的地方。 | 无直接对应,属于 AI 独有价值 |
| 数据恢复包 | 回收站与简单文件系统恢复工具 | 小 | 误删回收站、U 盘文件恢复等低风险场景 | 各类数据恢复软件(深度恢复导流) |
能力包的分发按需下载、独立版本号、校验签名,复用现有知识库 zip 同步机制(manifest 加 archive,zip-slip 防护已有)。首次使用某功能时提示「需要下载 XX 包(约 100 MB)」,之后静默更新。
场景清单
| 场景 | 用户怎么触发 | 小D 做什么 | 依赖包 | 频次 | 付费点 |
|---|---|---|---|---|---|
| PDF 转 Word | 把 PDF 拖进来,选「转 Word」 | 判断是文字版还是扫描版,文字版直接转,扫描版先 OCR 再排版;结果进交付物面板 | 文档包 | 高 | 订阅 |
| 扫描件转文字 | 拖图片或 PDF | OCR,保留段落,输出 Word 或纯文本 | 文档包 | 中 | 订阅 |
| 视频转格式 / 压缩 | 拖视频,说「发微信」「放手机上」 | 按目标场景选编码与码率,不让用户懂参数 | 音视频包 | 高 | 免费版限时长,订阅不限 |
| 提取音频 / 加字幕 | 拖视频 | 提取 mp3;音频转字幕后烧录或外挂 | 音视频包 + 云端语音识别 | 中 | 订阅 |
| 图片去背景 / 放大 | 拖图片 | 本地模型处理,批量可选 | 图片包 | 中 | 订阅 |
| 去除自己图片上的水印或杂物 | 拖图片,框选区域 | 修复模型填充 | 图片包 | 低 | 订阅 |
| 表格合并与清洗 | 拖一堆 Excel,说要什么结果 | 写脚本执行,出汇总表与图,解释做了什么 | 基础运行时 | 中 | 订阅(按积分) |
| 批量重命名 / 整理 | 拖文件夹 | 按规则或按内容整理,先列影响范围再执行,快照可撤销 | 无 | 高 | 免费 |
| 误删恢复 | 「我刚删了个文件」 | 查回收站、查快照、低风险恢复;深度恢复导流 | 数据恢复包 | 低 | 订阅 |
交互流程:文件就是提示词
- 用户把文件拖进窗口、拖到托盘图标,或右键「发送到小D」。
- 按文件类型弹出意图菜单:PDF 给「转 Word / 提取文字 / 压缩 / 合并」,视频给「转 MP4 / 压缩 / 提取音频 / 加字幕」,一堆文件给「整理 / 重命名 / 去重」。
- 用户点一项。需要的话小D 再问一个问题(比如「发微信还是放手机」)。
- 执行,进度在任务中心,结果进交付物面板,带「打开」「打开所在文件夹」。
- 结束时问「要不要以后自动做」(比如下载目录每周整理)。
原型见 界面原型 · 拖文件意图菜单。
降优先级与边界
- PPT 美化降优先级。做 PPT 的 AI 产品已经饱和,而且它是生成而非执行,不发挥本机执行的优势。可以作为后期的「文档包」附加项。
- 数据恢复只做低风险。深度恢复涉及磁盘底层读写,出错会让情况更糟,导流给专业软件。
- 去水印限定用户自己的内容。功能名用「修图 / 去杂物」,不宣传「去别人的水印」。
- 云端能力按需。语音识别、高质量翻译走云端模型并计积分;本地引擎能做的不上云。
待核实
- 是否内置 Python 运行时,还是检测到缺失时引导安装。建议内置。
- 能力包体积上限与下载源(国内 CDN)。
- OCR 与图片模型的选型,以及 CPU 机器上的速度是否可接受。
- 免费版的转换限制(时长、页数、次数)。