Agent SOP
先看这里 · 该用哪一套 不用判断「复杂不复杂」——那个词太虚,判断不了。只问自己一句话:如果做到一半发现方向错了、要推翻重来,我大概损失多少时间? 凭感觉答就行,估不出来就让 AI 替你估。
推翻重来的损失 以后还会再做吗 用哪一套
十几分钟 不用问 直接问,别用流程。 上流程比做完还慢
一小时以上 就这一次 C · 单任务 · 小白版
下个月还要再做 A2 · 工作台 · 定制版 (原版 A 保留做对比)
★ 新版 · 一条指令四条路 自动分诊 · 不许停 · 原版全保留
A · 搭建工作台 长期复用 · 多对话多分支 · 会沉淀成 skill
B · 单任务攻坚 一次做对 · 复杂但只做一次 · 不做沉淀
C · 单任务 · 小白版 1 条开场 + 8 张救急卡 · 它带着你走
A2 · 工作台 · 定制版 5 步 · 贴合你的习惯 · 机制一条没少
D · 维护说明 换 Claude 账号也能改 · 给接手的 AI 看
核心约定: 全程你只在对话框说话,所有文件由 agent 建、agent 写。你从不手动开文件夹。
零基础最容易搞错的一件事:第 1 到第 7 步的所有指令,全部发在同一个 00-总控 对话里,一条接一条往下发,中间不要开新对话。 只有到第 8 步才会新建别的对话。
指令发给谁 · 总表
指令 发在哪个对话 什么时候发
指令 1 立项 00-总控这个对话的第一条消息
指令 2 调研 00-总控 同一个对话它问完三轮、你答完之后
指令 3 出方案 00-总控 同一个对话你接受调研结果之后
指令 4 闸门①自检 00-总控 同一个对话它给出方案之后,你自己先别读
指令 5 打回 00-总控 同一个对话自检表里有「不通过」时
指令 6 建目录 00-总控 同一个对话六项自检全过之后
指令 7 生成启动指令 00-总控 同一个对话目录建完、你确认完那 5 处之后
指令 8 开工 新建的部门对话 粘完《启动指令》之后的第二条消息
指令 9 闸门②自检 同一个部门对话 它交付产物之后
指令 10 补漏 同一个部门对话 自检发现有隐藏步骤时
指令 11 复盘 回 00-总控 一条链跑通之后
指令 12 派子 agent 00-总控某部门跑通多次、要批量时
指令 13 重置 出问题的那个对话本身 同一问题拉扯超过 3 轮时
指令 14 每周沉淀 00-总控每周固定一次
四条原则
不许动手 先复述理解、列风险、提问,确认后才产出。第一轮改的成本是零
一条路走到底 最窄的链从头跑通再加宽。各做一半 = 没有一条路能验证
3 次才固化 做满 3 次且步骤不变才写 skill。提前写的是想象
对话可以丢,提示词不能丢 对话是运行实例,提示词文件才是资产
五种东西的定位
东西 是什么 什么时候出现 判据
部门 一种产物 = 一个职能 第 4 步方案里定 输出物不同就必须是不同部门
插件 / 工具 部门碰外部系统的手 第 3 步调研就要定 要读写外部文档、抓网页、发消息
分支 同部门的不同方案 随时 我要同时保留两个结果吗
子 agent 同部门的并行副本 第 12 步扩展阶段 已跑通 + 能自证对错 + 真要并行
skill 同部门做熟了的固化 第 3 次之后 步骤已经不再变
关键顺序:插件在最前,子 agent 在最后。 插件是能力前提——某个部门必须读外部文档而你没有连接器,那个部门根本建不起来。子 agent 是扩容手段——部门自己都没跑通,拆成三个并行只会同时错三份。
主流程(点开看指令)
附录
四个痛点 → 四个机制
你的痛点 真正的根因 机制 在第几步
老说重复话 约束散落在对话各处,它只记得最近几轮。你纠正一次,下轮又忘 约束编号化 。所有约束编号 C1、C2…,每轮输出前它必须原样贴回并逐条打勾。以后你只报编号第 0 步 + 第 3 步
AI 犯低级错误 低级错几乎都是「它没回读」,不是「它不会」。一次性生成,从不检查自己 强制自检 + 引用证据 ,再加一份会累积的低级错误清单 ,每次交付前逐条扫第 6 步 + 第 7 步
AI 不懂我要干嘛 你给的是形容词,它需要的是样例。语言描述的歧义空间极大 一个正例 + 一个反例 。没有正例就让它造 3 个候选,你选 1 个当锚第 0 步 + 第 2 步
一直打太极 任务大而模糊时,它的安全策略是给通用框架——听起来对,但没一句能用 正向输出规则 + 可用占比自评 。禁词是黑名单,追不上语义变体;改成规定形状,再让它自报「能直接复制走的内容占比」第 4 步
它问的问题我答不上来 让人从零填空本身就是设计错误。你脑子里有判断力,但没有现成的表述 它起草,你增删 。你只填三项,其余由它替你拟草稿;它以后问你话一律给 2–4 个选项 + 推荐值第 0 步 + 第 1 步
整套 SOP 的核心是一张表:《本次口径》。 它把散在对话里的约束固定成带编号的清单,每轮回带。有了它,你纠错从「再解释一遍我想要什么」变成「违反 C3,重做」——这是把重复劳动降到最低的唯一办法。
全程在同一个对话里完成。 这是单任务,不建文件夹、不开部门、不做 skill。中途换对话,《本次口径》就丢了,你又要从头解释一遍。
主流程(点开看指令)
随时可用的四把刀
C 版 = B 版的全部机制,但流程从 10 步降到 1 步。 做法不是删内容,而是把「你要记得发的步骤」改写成「它自动执行的规则」。B 版有的每一样,下面的对照表逐条列出它在 C 版的哪一条。
开场指令很长,但那是给 AI 读的,你只需要复制一次。 第一条消息是唯一一次全新的上下文,它决定了后面每一轮的表现。宁可第一条长,也不要后面反复补规则。
第一步 · 发这一条(整个任务只发一次)
覆盖对照表:B 版的每一样在 C 版哪里
B 版的机制 在 C 版的位置 谁来触发
第 0 步 · 三项必填 + 它替你起草 开场指令 · 第二件 你发一次
第 0 步 · 查有没有现成的(五类) 开场指令 · 第一件 它主动做
第 0 步 · 砍范围 / 20% 力气 80% 目的 开场指令 · 第一件 它主动做
第 0 步 · 流程守卫(口径没冻不许出活) R5 末尾 它自己守
第 1 步 · 改草稿、选选项 R4 + R1 导航 它带着你
第 2 步 · 造锚(3 个候选样本) 开场指令 · 第二件末尾 你说不对时它自动给
第 3 步 · 冻结口径(两级 / 来源可追溯 / 冲突指出 / 每 3 段复核) R5 完整保留 它自动出表
第 4 步 · 任务类型分流(执行型 / 探索型) R7 它自己判断
第 4 步 · 输出规则 + 可用占比自评 R7 它每段自评
第 5 步 · 分段交付(4 条判据 / 先给计划 / 超 5 段提醒拆任务) R8 完整保留 它自动分段
第 6 步 · 反向自检(自我举报 / 引用证据 / 存疑 / 查流程漏洞) R9 完整保留 每段自动做
第 7 步 · 低级错误清单 R10 它自动记,不用你发指令
第 8 步 · 最终验收 + 段间漂移检查 R11 做完自动执行
第 9 步 · 导出通用错误清单 R11 末尾 验收后自动导出
刀 1 纠错 卡 4 你发
刀 2 急停 卡 5 你发
刀 3 重置 卡 6 + R12 主动提醒 它先提醒,你发
刀 4 止损 卡 7 + R12 主动提醒 它先提醒,你发
C 版新增 · 每次告诉你下一句发什么R1 它每次都写
C 版新增 · 树状工作图R6 它自动更新
C 版新增 · 一句话说清这轮完成了什么R2 ① 它每次都写
C 版新增 · 换对话不丢记忆卡 2 你发
你会看到的回复长这样
【这轮做完了什么】
起草了 5 条约束(C1–C5),查到 2 个现成模板可以直接用
【产物】
...(正文内容)
本段我能直接被复制走使用的内容占比约 88%
【我不确定的】
1. 开头用不用第一人称?推荐:用。A 用 / B 不用
【口径自检】
C1 已遵守 · C2 已遵守 · C3 本轮不涉及 ...
【工作图】
任务:把 8 月选题做成 3 版脚本
├─ ✓ 口径已冻结(C1–C7)
├─ ✓ 分段计划(共 4 段)
├─ ▶ 第 1 段:开头钩子 ← 现在在这
├─ ○ 第 2 段:主体演示
└─ ○ 最终验收
【下一步】
请从上面 3 个选项里选一个,直接回数字。选不出来就发:"你定"
每一次回复都长这样,你永远知道三件事:它刚做完什么、现在走到哪、下一句该发什么。 如果哪次漏了【下一步】,直接回一句「你违反了 R1」。
八张救急卡(卡住时用)
交接到新对话:一段文字 + 一批文件
交接什么 怎么给 为什么
接手指令 (40 行以内)粘贴在正文里 它必须先看到"要读哪些文件、读完要报什么回执"
规则 / 口径表 / 错误清单 / 工作图 / 产物 拆成独立文件上传 体量大,粘贴容易被截断。改成让它读文件
那怎么保证它真的把文件读完了?靠读取回执。 上传的附件 AI 不一定会完整读完,很多工具是「用到哪查哪」。所以接手指令里强制它先报:规则几条、口径几条、最后一条编号是什么、随机抽查的两条原文一字不差念出来、现在进行到哪一步。报不出来就是没读全,必须回去重读,不许开工。 抽查一定要挑中间编号——开头结尾都在、中间丢了,是长文件最常见的坏法。
这一页是给「以后接手的 AI」看的,不是给你看的。 换 Claude 账号、或者换成别的 AI 工具时,把下面那条启动指令粘给它,它就能安全地接着改这个网站。你自己只需要记住三步:连文件夹 → 新开对话 → 粘启动指令。
换账号三步
第几步 你做什么 做完的样子
1 在新账号里,把桌面的 sop总指令大全 文件夹连接进去 它能看到里面有一个 SOP.html
2 新开一个对话(不要用旧对话) 空白对话
3 粘贴下面的《启动指令》,发送 它会先读文件、复述禁区、提 3 个问题,然后等你下指令
启动指令
这套东西的三个部分,分别在哪
部分 在哪 谁能改
内容 (你看到的所有 SOP 文字)/Users/kaka/Desktop/sop总指令大全/SOP.html你和 AI
自动发布管道 (保存后 60 秒上线)后台服务 + Cloudflare,已配置好 谁都不要碰
入口 (程序坞里的 SOP 网站)/Users/kaka/Applications/ 里的两个 app谁都不要碰
只有第一行是可以改的。 后两行任何 AI 都不该碰——碰了会跟后台自动同步打架,网站可能直接停更。启动指令里已经把这两条写成禁区了。
内容写作规范(新增内容时的标准)
规矩 为什么
每张卡五样俱全:发给谁 / 零基础操作建议 / 可复制指令 / 通过条件 / 易犯的错 缺任何一样,你用的时候都会卡住
指令必须整段复制就能用 要求你自己组织语言 = 又回到从零写
凡是要你回答的,一律给 2–4 个选项 + 推荐值 你脑子里有判断力,但没有现成的表述。指认比创作容易一个数量级
简化只能靠「把你要记得发的步骤,改写成 AI 自动执行的规则」 靠删机制求简化不叫简化,叫缩水
已有的设计决定,不许被当成缺陷改掉
设计 原因
Tab A 和 B 是原版,永久保留不动 你要拿它们做对比验证
口径表一级硬约束最多 7 条 超过 7 条,人和模型都会开始失焦、机械打勾
自检必须是「反向举报」而不是自证清白 让被测者写自己的测试报告,在工程上是无效的
交接时规则粘贴正文、产物才用文件 附件不保证被完整读取。规则只读一半 = 没有规则
skill 做满 3 次才固化 两个样本分不清「规律」和「巧合」
开场指令故意很长 第一条消息是唯一一次全新上下文。宁可第一条长,也不要后面反复补规则
改完必须验证
A2 = A 版的全部机制,步骤从 13 步降到 5 步。 做法只有一个:把「你要记得发的步骤」改写成「它自动执行的规则」。没有删掉任何机制 ——调研五类、闸门六项自检、外部依赖、失败判定、部门淘汰、3 次才固化,全都还在,只是搬进了 R1–R12 和「五件事」里。
按你的十个习惯改了什么
你的习惯 A2 里对应的规则
结论先行,一次问多个问题要逐条对应 R2 先给结论再给理由;按你的编号逐条回,不许合并
只做选择题,不填空 R3 任何要你提供的信息都给 2–4 个选项 + 推荐值
能看的别写成段落 R6 每个阶段的产出都要带一张纯文本图或表
先怀疑再采纳 R7 每个方案它自己先提 3 条最强的反对意见
拿真任务实测,带具体问题回来 R10 你的实测问题必须改成规则,不许只修补这一次
简化可以,降质不行 R9 简化只能靠「把你要记的改成它自动做」,删机制一律不许
零接触文件夹和命令行 R8 文件全由它建它写;非要你开文件夹的步骤必须给对话框替代方案
会把活派给别的 AI R11 任何时候说「要交接」,它都能产出接手指令 + 文件清单 + 读取回执
要能一直复用,换账号不能断 第五件事 工作台建成时自动产出《维护交接文档》
不重要的事别刷屏 R4 默认最简:自检全过只写一行,有问题才展开;工作图没变只写一行进度
R4 详略自适应 是这一版最实用的一条。以前每轮都贴一整张全绿的自检表,占满屏幕、零信息量。现在的规则是:全部通过就一行,只要有一条出问题才摊开那几条。 另外你随时可以发「简单说」或「展开」手动切换。
五步流程(点开看指令)
七张工具卡
和原版 A 的对照:机制一条没少
原版 A 的步骤 在 A2 的哪里 谁来触发
第 1–2 步 立项 + 三轮提问 第一件事 它主动问
第 3 步 调研五类 + 外部依赖表 第二件事 它主动查
第 4 步 出方案 第三件事 它主动出
第 5 步 闸门① 六项自检 + 打回 第三件事末尾 它自己审完再给你
第 6 步 建目录 + 待确认 5 处 第四件事 它自动建
第 7 步 生成启动指令并存文件 第四件事 它自动存
第 8 步 开部门对话 流程第 3 步 你手动开
第 9 步 垂直切片 流程第 4 步 你发一次
第 10 步 闸门② 验收 + 隐藏步骤 流程第 4 步的指令里 它交付前自动做
第 11 步 复盘 + 失败判定 R12 + 卡 5 它主动提醒
第 12 步 派子 agent 三条件 卡 4 + R12 你发
附录 A 分支判据 保留在原版 A,A2 不重复 —
附录 B 3 次才固化 R12 最后一条 它主动提议
附录 C 跑偏 3 轮重置 R12 第一条 它自己数
附录 D 每周沉淀 + 淘汰 R12 + 卡 5 它主动提醒
A2 新增 维护交接文档第五件事 建成时自动产出
这一版最大的变化:你不用再选用哪一套。 不管简单还是复杂,都发同一条《连跑指令》。它第一件事就是分诊,然后自己宣布"我会做第几件、跳过第几件、为什么"。四条路全在这一条指令里。
它会自己路由到四条路之一
你的两个答案 它宣布的路线 它会做哪几件
损失十几分钟 + 一个对话够 直接干 跳过全部流程,直接给答案
损失十几分钟 + 要好几个对话 轻量并行 第 4 件(简版)+ 第 7 件
损失一小时以上 + 一个对话够 单任务 第 2–6 件
损失一小时以上 + 要好几个对话 工作台 七件全做
再加一问:这件事以后还会反复做吗? 回答"会",它会额外产出一份《维护交接文档》,你以后换 AI 或换账号时把这份给新的 AI 就能接手。
三步流程
五张工具卡
这一版新增了什么(相比 A2 / C)
新增 解决什么
自动分诊路由 (第一件事)你不用判断该用哪一套,它自己决定并宣布,还会说跳过了什么、为什么
R13 不许停 四层流程最大的风险是你半路放弃。现在它答完一个问题就自动往下,不许问"要不要继续"
把它要猜的地方全问成选择题 (第四件)第一次跑完总有一堆"自动判断还是我勾""能不能返工""在哪确认"的小问题反复改。现在它按你这次任务的性质自己出题、自己定数量,问完还要自查"还有哪里我仍然在猜",答案直接编成口径
空壳先看 (第五件)功能一律先不做,先给字段清单和界面骨架。交互问题在看空壳时就发现,那时候改一行字,不用改代码
开对话清单 (第七件)连标题和第一条消息都给你准备好,你只需要复制粘贴。明确要求是当前项目里的子对话 (不是独立任务),标题强制 00- / 01- / 02- 编号
最小任务循环内置进启动指令 以前它开完对话就自己跑了,因为第一条消息里没有循环规则。现在验收前置、反向自检、逐条给证据全部写进每个对话的第一条消息,不用你另外再发
空壳分两种 (第五件)有界面的任务必须直接出一个能打开能点的单文件页面(假数据、不接功能),标清功能区分布;没界面的给结构表就够。看得见才判断得出来
R14 卡住必须报告 缺权限、缺文件、工具报错都算卡住,必须停下来说"我卡在哪 / 需要你做什么 / 之后我会做什么"。同一方法失败 2 次要停下来征求同意再换,不许悄悄换路线
R15 完成必须给证据 每做完一件立刻报"第 N 件 · 完成 · 证据:____",没证据的完成视为未完成。七件走完再出一张真实状态核对表。防的就是跳了 5 件还报告"全部完成"
R16 收尾边界 给出对话清单就必须停,不许自己开始执行任务。R13「不许停」只管中途,不管收尾——这两条要一起看
验收前置 (最小任务循环第一步)动手前先定"怎么算这个过了",而且给你候选让你选。不定的话做完才发现方向不对
固化由你决定 (第三步)要不要变成 skill 你说了算,但不到 3 次它会先告诉你代价
不降质量的逐条核对:原版每一条在哪
原版的机制 在这一版的位置 谁触发
产物倒推三轮提问(带选项) 第二件 它主动问
调研五类 + 外部依赖表 + 砍范围 + 不值得就直说 第三件 它主动查
方案:分线清单读→做→写 / 只标一个先做 / 风险 3 条 第五件 它主动出
闸门① 六项自检 + 证据原文 + 拿不准记不通过 第五件末尾(扩成七项,加了偏好覆盖检查) 它自己审完再给你
建目录 + 待确认 5 处 第七件 + R8 它自动建
启动指令存成文件 + 越界拒绝 + 输出前自检 + 另存上一版 第七件 它自动存
垂直切片(一条路走到底) 最小任务循环 你发一次
闸门② 反向自检 + 自我举报 + 引用证据 + 隐藏步骤 最小任务循环第二步 它交付前自动做
口径表两级 / 一级最多 7 条 / 来源可追溯 / 只追加不重排 R4 + 第四件编成 C1–C8 它自动出表
可用占比自评 / 不许给框架只给成品 R5 + 最小任务循环 它每次自评
低级错误清单(自动记录、不许道歉) 最小任务循环第二步 + 第三步导出 它自动记
最终验收 + 段间漂移 最小任务循环第三步 它自动做
复盘 + 失败判定(连续 2 次大改 = 划分错了) R12 它主动提醒
淘汰(连续 3 周没用就删或合并) R12 它主动提醒
跑偏 3 轮重置 / 重置 2 次止损 R12 它自己数
3 次才固化 skill R12 + 第三步 它主动提议,你拍板
子 agent 三条件(接口冻结 / 能自证 / 真要并行) 卡 4 你发
分支判据(要不要同时保留两个结果) 卡 5 你发
交接:短文字 + 文件 + 读取回执 + 抽查中间条目 R11 + 卡 3 你发
详略自适应(全过一行,有问题才展开) R4 它自动判断
零接触文件 / 结论先行逐条编号 / 有问必给选项 / 自我质疑 / 眼睛优先 / 实测反馈回流 R2 R3 R6 R7 R8 R10 一直生效
原版全部 21 项机制,现在一条不缺。 子 agent 三条件和分支判据做成了卡 4、卡 5——它们是「特定情况才用」的,放进连跑指令只会让它更长,所以做成工具卡,用到才翻。核对表上任何一条对不上,就是降质,报给我。
内容最后更新:2026-07-29 · 分诊 Q1 改写 · 加"你帮我判断"兜底