去重怎样生效
- 同一个视频 ID
新任务排除已完成抽帧的视频;仅见过链接不算采集完成。
- 同一批次多次遇见
关键词与账号之间按 ID 去重,原始发现来源继续保留。
- 同一份媒体
校验 SHA-256 复用抽帧。不同发布者的同内容视频保留独立研究身份。
- 同一个模型请求
结果按请求指纹复用。不确定是否已发送的请求不会自动重试。
跟踪采集与编码进度,在需要时暂停,之后从原处继续。
正在读取浏览器状态…
关键词搜索 → 找到店铺 / 品牌账号 → 扩展作品链接。保存页面已返回的简介、公开账号资料和 AI 提示,不逐条采评论、不下载。
从已有链接库筛选。先预览符合条件的数量,再冻结本次名单;优先按 AI 提示甄别广告候选,排除教程,保存视频和可得评论。
采集完成后再抽帧、模型编码和人工复核。前两阶段不发起模型请求。三阶段分开提交,浏览器与研究库串行执行。
第一阶段能保存返回数据里的 AI 提示,但不是每条链接都有标签字段。未取得字段的保留待补查;没有返回标签不等于非 AI。
新建任务提交后会自动开始或等待前一个任务结束,无需再点一次“开始”。暂停会先保存进度;显示“已暂停”后可继续。
这里的暂停针对整个队列。上方阶段卡片只暂停对应任务。旧任务仍沿用启动时的配置。
| 研究批次 | 类型 | 记录状态 | 更新时间 | 操作 |
|---|
历史状态与当前任务分开显示。候选数不等于人工确认广告数。
搜索账号、作品文案、视频 ID 或来源关键词。跨批次去重,采集期间也可查看。
正在读取数据库…
评论按评论 ID 去重;有评论作品 = 已取得至少 1 条一级评论或二级回复。平台评论数与已采评论数口径不同,不直接计算采全率。横向滑动查看全部列。
第一阶段的账号扩展入口:选择店铺 / 品牌账号,再确认建档;保存公开作品链接及返回的 AI 标签。
区分检索关联、视频标识和媒体内容,保留每一次观察的来源。
新任务排除已完成抽帧的视频;仅见过链接不算采集完成。
关键词与账号之间按 ID 去重,原始发现来源继续保留。
校验 SHA-256 复用抽帧。不同发布者的同内容视频保留独立研究身份。
结果按请求指纹复用。不确定是否已发送的请求不会自动重试。
按已记录的文件校验值分组;不代表语义相似或画面近似。
迁移前先暂停两个任务队列,等正在执行的操作收尾。
任务显示“已暂停”,而非“正在收尾”。不要在模型请求发送中强行断电。
保留研究库、媒体、抽帧、请求账本、配置与提示词。登录态和密钥在新机重新配置。
使用迁移工具记录旧数据根目录,保持原始研究记录和请求指纹。
零模型试采、检查素材和去重,再扩大采集。Windows 使用 Linux / WSL 环境。
浏览器执行采集,关闭这张网页不会结束后台任务。平台要求验证时,需要在受管浏览器中正常处理。
远程访问使用 SSH 隧道。控制台共享密钥适用于受控研究环境,当前没有多用户角色系统。
旧批次的预算不会因“恢复”自动增加。预算已用完或请求结果不确定时,先复核账本。