LEARNING NOTES · 2026.08.19

我没有从 Agent 开始

这次真正学到的,不是怎样给 AI 起一个名字,而是怎样把一段反复返工的工作,慢慢整理成一个可以交接的岗位。

一开始,我只是想完成一条视频。文案写完以后,要先区分电脑实拍和 AI 动画,再把 AI 部分拆成分镜、写场景参考图提示词、适配视频模型,最后一遍遍抽卡和修改。

第一次认真记录时间,我才看到问题到底出在哪里:镜头分类只用了约 5 分钟;把 AI 镜头转成分镜和提示词却花了约 35 分钟,仍只完成了八成;第一张满意参考图又用了约 20 分钟,第一个满意的 5 秒视频再用了约 30 分钟。

5 分钟区分镜头类型
35 分钟提示词完成约 80%
20 + 30 分钟首张图与首段视频

先找重复劳动,不急着造 Agent

过去我很容易从工具出发:这个模型能做什么,那个平台能接什么。但这次课程给了我一个更稳的顺序:先判断任务是否高频、输入是否清楚、过程能否说明、结果能否验收、风险是否可控,再选择最小够用的载体。

“SOP → Prompt → Skill → Agent → 产品模块”不是升级打怪的等级表。它更像一组不同大小的容器:工作能装进哪个,就先用哪个。

于是,我没有一开始就搭一个包办文案、分镜、生图、视频、配音和发布的“大 Agent”。我先把最痛、最重复、也最容易验收的一段圈出来:把已经完成的口播,转化为下游可以直接拿去生图、生视频的完整提示词。

规则不是想出来的,是在失败里长出来的

真实执行很快暴露出许多课堂案例里看不到的问题:Vidu 的经验不能写成所有模型的规律;可灵 2.6 能控制音色,却可能让不该说话的人物对旁白口型;可灵 3.0 的能力又不同;输入图上的水印、Logo 和乱码可能被视频继续继承;文案里标记的网络梗图还必须在时间轴上避开关键动作。

这些失败没有被藏起来,而是被分到正确的层级:跨模型成立的写进通用规则;只对某个模型成立的放进模型适配器;人物与账号的品牌设定单独维护;某个镜头的取舍只留在那个镜头里。这样,换模型不必推翻整个 Agent,确认过的镜头也不被下一次修改覆盖。

我最终搭出的,是一个很小的岗位

她叫“分镜小文”,只服务一个固定的内容账号。她不会假装无所不能,也不替我生图、剪辑和发布。她先给整条视频的情节与画面方向,等我确认;再一次只交付一个镜头。已经确认的镜头锁定,修改时另开版本。

Codex 帮我把真实经历梳理成可以维护的文件结构;Skill 保存岗位方法;Hermes 让身份、模型、规则和工具一起运行;飞书则把这一套东西变成一个日常可以对话的工作入口。

我现在对 Agent 的理解:它不是一个“更会聊天的机器人”,而是一项被写清职责、规则、工具、边界、异常处理和人工验收的工作。

仍然没有完成的部分

小文目前能稳定完成提示词策划,但还不是全自动生产线。她对不同视频模型的认识仍要通过真实生成不断修订;视觉检查能力还要接入多模态模型或外部视觉工具;“原来 35 分钟,现在究竟稳定缩短到多少”也需要更多任务计时,而不能用一次成功就下结论。

但我已经跨过了最重要的一步:不再把每一次修改留在聊天记录里,而是把它变成下一次工作会主动遵守的规则。

AGENT SHOWCASE

认识分镜小文

查看她的输入、触发方式、真实输出、人工审核点和复现步骤。这是展示页,不对外开放机器人使用权限。