自动化的第一步不是抓更多,而是明确什么有资格进入系统。
“我想留下”与“平台上出现过”不是一回事
抖音里真正想保留的内容,常常先被我转发给自己。这个动作已经包含一次人工判断:它值得以后继续看。相比扫描关注流、收藏夹或全部私信,自分享入口更窄,却更接近真实意图。
所以这个本地工具不做公共爬虫,也不批量抓账号。它只观察已经登录用户自己的网页私信,并只处理新增的本人自分享。
| 输入方案 | 优点 | 主要风险 | 结论 |
|---|---|---|---|
| 批量抓公开内容 | 数量大 | 来源意图弱、噪声高、验证成本大 | 不做 |
| 读取全部私信 | 不容易漏 | 会处理与知识目的无关的私人会话 | 不做 |
| 只处理本人自分享 | 意图明确、可去重 | 需要主动转发一次 | 采用 |
一条自分享如何变成知识入口
基础记录先写入,视频再进入异步队列。这样转写或摘要失败时,来源链接和去重 ID 仍然存在;修复后只需要重放失败层,不必重新扫描私信。
精确资源核验比“抓到一个视频”更重要
页面可能同时加载多个媒体请求。如果目标作品 ID 无法确认,工具会失败,而不是下载页面里碰巧出现的其他视频。签名媒体直链、Cookie 和请求头也不打印、不持久化。
无法证明媒体属于目标卡片,也可能把无关内容写入知识库。
目标资源不能确认就停止,错误不会被包装成成功。
字段越少,状态越容易负责
MVP 写入标题、内容类型、原始链接、原始文本、作者或来源、摘要、捕获时间、处理状态、去重 ID、错误信息和知识库链接。“关键点”和“标签”没有为了显得完整而加入当前契约。
来源、标题、时间和去重 ID 已经存在。
媒体核验、音轨、转写和摘要独立运行。
飞书记录可以打开对应 Obsidian 笔记。
隐私不是最后一层遮罩
浏览器登录态、下载媒体、转写全文、日志和服务凭据留在本地忽略目录。网站不使用私人消息截图证明项目存在,也不公开浏览器目录、私信链接或运行日志。
| 数据 | 存在位置 | 公开状态 |
|---|---|---|
| 登录态、Cookie、请求头 | 本地浏览器目录 | 永不公开 |
| 下载媒体与转写全文 | 本地处理目录 | 永不进入官网 |
| 系统流程与失败边界 | 项目说明与测试 | 可以公开 |
| 概念视觉 | 官网自包含资产 | 只解释流程,不冒充界面证据 |
当前仍然不稳定的地方
这不是云服务,也没有长期无人值守的承诺。抖音页面结构可能变化,纯无头模式容易触发验证,转写和外部摘要服务也会失败。当前证据支持本地工作流、去重、重试和隐私边界,不支持规模化采集结论。
在自动化任何私人信息流之前,先写出唯一入口、明确不处理的内容、精确资源标识、每层失败状态和公开证明方式。入口说不清时,模型和队列只会更快地放大错误。
