# GPT‑5.6 使用经验交流会：20 Agent「道法术器势」学习报告

> 面向没参会的同学。分析日期：2026-07-14。会议日期：2026-07-13。

## 先说结论

这场会真正值得带走的，不是“哪个档位最强”，而是五个工作原则：

1. **先定义问题类型，再选模型和工具。** 速度、成本、覆盖率、审美、风险、可验证性往往互相冲突，不能用单一“模型强弱”替代任务判断。
2. **把隐性要求变成可检查的规格。** 模型越强，人的工作越应从亲自生成迁移到目标、约束、反例、证据与验收。
3. **多 Agent 是组织设计，不是数量游戏。** 独立模块用分治，有限资源与创意取舍用竞争，高风险与完整覆盖用验证；强依赖链保持串行。
4. **模型自检不是安全边界。** 最小权限、沙箱、备份、审批、日志和回滚必须由系统提供，不能押注 Ultra 或安全 Prompt。
5. **Skills/Harness 是阶段性脚手架。** 模型升级后应做回归测试，删除重复编排，保留领域知识、确定性检查、权限治理与可观测性。

一句话概括：**当执行能力越来越便宜，稀缺的会变成问题定义、评价标准、领域事实、组织方式和责任边界。**

## 材料与证据口径

- [飞书原始逐字稿](https://vi8r050ecuz.feishu.cn/docx/JBIudF8bRoCOhuxUjglcZzpGn9f?from=from_copylink)：主要证据源，录音时间码至 `01:53:01`。
- [飞书 AI 智能纪要](https://vi8r050ecuz.feishu.cn/docx/F75bdlsFOonAwJxX4ZIcgrYtnlb)：用于章节定位，不把机器总结当原始证据。
- [腾讯会议页面](https://meeting.tencent.com/crm/2ZyyVZPZ46)：同一场会议的另一加工/承载版本，不是独立信源；当前公开页返回“暂无文本内容”。

注意：

- 三份材料来自同一场会议，不能按“三个来源互相印证”计算。
- 会议发生在模型上线约三天半时，核心内容是少数重度用户的早期经验，不是官方规格、公开基准或普遍结论。
- 飞书逐字稿的 `00:06:19–00:43:44` 被合并成一个长发言段；本报告对该段使用区间时间码，不伪造更细时间。
- 腾讯时间码相对飞书约早 6 分钟；全文统一采用飞书时间码。
- 转写存在名称歧义：`Sol` 常被写成 `Soul/搜/So`，`Terra` 写成 `Tara/Kara`，其他工具名也有 FIBO/Fable/Able 等不确定转写。

## 可信度总览

### 高可信：可以直接迁移的方法

- 先分类任务，再路由模型、档位、工具与并发。
- 用依赖图拆任务；独立分支并行，强依赖链串行。
- 把要求转成 lint、测试、证据清单与人工门禁。
- 高风险操作必须具备最小权限、备份、日志和回滚。
- 模型升级后重测旧 Skills/Harness，避免与原生编排重复。

### 中可信：值得在自己团队复测的观察

- 不同模型族可能有任务特化，Luna 在设计提示词/文学场景可能有优势。
- 原生 subagent 可降低部分长上下文压力，但不能消除全局一致性需求。
- Computer Use 更适合后台采集、截图、下载与证据整理，但写操作仍容易越界。
- 多 Agent 竞争可能改善创意取舍，前提是存在有限资源、差异化角色与裁决机制。

### 低可信：不能直接当结论传播

- “所有 Ultra 约束符合率 100%”。逐字稿同段还说部分 Max/Ultra 有 1%–2% 漏项，内部矛盾。
- `100:70:45` 是参会者内部测算，不是已核实的官方定价。
- Luna 的设计优势是团队样本，不是普遍排名。
- “Superpowers brainstorming 已彻底过时”“长上下文不再重要”都过度外推。
- 135G 文件事件根因未确定，不能归因于 GPT‑5.6、Remotion、旧 Skill、某个档位或勒索软件。

---

## 一、道：真正稀缺的是什么

### 1. 人的价值从“亲自生成”上移到“定义与裁决”

模型降低了生成、尝试和实现的成本，却没有替人回答：什么值得做、谁真正需要、什么事实不能编、失败由谁承担、怎样才算完成。会上最后的“先定义问题，定义问题的类型，再选工具”是最值得带走的一句（`01:35:21`）。

因此，人的工作重心应迁移到：

- 选题与价值排序；
- 真实业务事实和领域数据；
- 目标、边界、反例和失败代价；
- 可观察的验收标准；
- 冲突裁决、证据核验和最终责任。

### 2. “最强”不等于“最适合”

任务真正优化的是一个多目标函数：质量、成本、墙钟时间、覆盖率、审美、可解释性、可回滚性。设计分享者甚至明确说“并不是越聪明就越好”（`00:44:00`）；较强模型也可能替用户做未经授权的“正确化”，把本来正确的页面和客户数据改乱（`01:04:49`）。

### 3. 多 Agent 的本质是三种组织算子

- **分治**：独立模块、超长材料、批量任务按依赖图拆开；
- **竞争**：创意方向、功能优先级、有限镜头或版位让候选互相否定和说服；
- **验证**：安全、合规、事实、约束覆盖由不同轨迹交叉检查。

强依赖链不应硬并行；没有统一评分和最终裁判的“专家团”，只是并行制造意见。商业短片中的多 Agent 价值来自争夺有限镜头资源，而非数量本身（`00:57:33`）。

### 4. 越自动，越要把治理移到系统层

自检是概率性能力，权限、备份、审计和回滚是确定性控制。高推理档位不能替代系统边界；安全 Prompt 也不能阻止一个拥有全盘写权限的 Agent 误操作。

### 5. 最耐久的资产不是某个 Skill

长期资产是任务分类、依赖图、评测集、领域数据、约束清单、失败样本、权限规则和审计记录。Skill/Harness 只是当期实现；模型升级后应做回归和消融，而不是继续叠补丁，也不是一刀切清空。

## 二、法：怎样形成稳定方法

### 标准闭环

```text
定义任务与失败代价
→ 标注风险、时限、创意度、可验证性
→ 写必须项、禁止项、证据要求和回滚条件
→ 画依赖图，决定串行/分治/竞争/验证
→ 选择最低够用模型、档位和工具
→ 小样本或基线测试
→ 执行并留证
→ lint / 测试 / 独立复核
→ 人工验收
→ 记录成本、返工、事故和可复用规则
```

### 四类任务 SOP

#### 快任务

单 Agent、最低够用档位；明确输出格式；跑一次确定性检查。失败后先补上下文和验收标准，再升级档位。日常对话、成熟小任务没有必要默认 Ultra（`00:06:19–00:43:44`）。

#### 高风险任务

只读勘察 → 计划 → 人工批准 → 沙箱小范围执行 → diff/测试 → 回滚演练 → 再放大。执行者与审查者分离。任何删除、批量覆盖、部署、客户数据写入和对外承诺都要设人工闸门。

#### 创意任务

先定受众、目标、硬约束和稀缺资源；用较低成本模型产生 6–12 个明显不同方向；再竞争淘汰、综合 2–3 案，由人按品牌与业务价值拍板。普通润色不需要多 Agent。

#### 长工程任务

先做 Spec/依赖图；节点必须有输入、输出、前置依赖、文件所有权和验收。分阶段 checkpoint，主控只调度，Worker 不重复修改同一状态。并发根据依赖与预算扩缩，不按 Agent 数量追求热闹。

### 升级与停止条件

- 连续两次未通过验收，先检查任务规格，再考虑升档；
- 高风险、跨模块回归、关键约束难程序验证时，增加独立 Reviewer；
- 连续重复失败、无产出、预算/时间/轮数封顶时停止；
- 配置变化不得自动视为“新任务”，使用唯一 `task_id` 与幂等队列。

## 三、术：可直接复用的做法

1. **受控 A/B**：同任务、同上下文、同 effort、同工具权限；随机顺序、匿名输出、盲评。
2. **约束 lint**：把“安全、专业、无 AI 味”拆成可判定原子项，同时报告约束违规率和任务零违规率。
3. **设计提示词链**：业务 brief → 模型生成绘图提示词 → 同一图像模型/参数出图 → 统一评分；再加“共用同一中间 prompt”的控制组。
4. **Anti-slop 编辑链**：真实用户视角 → 论证地图 → 正向文风规格 → 反模式清单 → 事实审校与文风审校分离。
5. **Computer Use 证据包**：来源页面、原始 CSV、筛选条件、计算公式、截图和“结论—证据”映射一起交付。
6. **SEO 数据链**：垂类参考站 → Semrush/Ahrefs/自有站数据 → 关键词聚类与搜索意图 → 页面/功能/内容/设计方案 → 联合验收 → 上线复盘。
7. **多 Agent 竞争**：不同角色必须争夺明确的稀缺资源，并有统一评分与最终裁判。
8. **依赖图拆分**：只有无依赖分支并行；跨模块共享约束留在 Master/共享 Spec。
9. **安全预检**：任务开始前生成允许目录、禁止命令、权限、备份、审批点和回滚步骤。
10. **Skill 消融**：同任务开/关 Skill 对比通过率、成本、时延、无产出与冲突；没有可测增益就默认停用。

## 四、器：模型、档位与工具怎么选

以下只是把会议观察转成“待验证路由”，不是官方推荐。

| 任务 | 会议中的起步选择 | 多 Agent | 必须护栏 | 何时升级 |
|---|---|---|---|---|
| 日常对话、成熟小任务 | Terra High | 通常不要 | 输出格式、基本核验 | 连续不过验收 |
| C++ 算法/性能达标 | Terra High，平行 3 案 | 可做方案竞争 | 编译、测试、Benchmark | 跨模块或关键约束复杂 |
| Rust、原生移动端 | Sol High/Max | 独立模块才并行 | 专家审查、测试、回归 | 安全/完整覆盖要求高 |
| 数十项强约束、安全、合规 | 中高档起步，必要时 Ultra | 验证型 | 外部 lint、独立复核、系统权限 | 漏项或失败代价越线 |
| 形式化证明 | Sol Ultra（会议观察） | 搜索＋验证 | proof assistant / 专家验证 | 不以自评作为完成 |
| 普通写作 | Luna Medium/High | 通常不要 | 事实源、用户视角、编辑清单 | 高强度 Anti-slop 才升档 |
| Landing Page / 图片提示词 | Luna Medium | 多候选而非盲并发 | 同 brief 横测、人工审美 | 质量不稳再换族/升档 |
| 商业广告、有限资源竞争 | 多个候选 Agent | 竞争型 | 品牌规则、时长/镜头预算、创意总监 | 无法形成明显差异时停止 |
| 大批量独立任务、赶时间 | 多个 Max/够用档 | 分治型 | 幂等 ID、限流、预算、抽检 | 关键分片单独升档 |
| SEO 数据采集 | 会议未明确族/档 | 通常单执行器 | 只读账号、证据包、禁止直改线上 | 写入另走审批流程 |

### 工具退场判断

“五个 Skill 可能剩两三个”不能改写成“60% 已被模型内化”。该说法没有逐项清单和消融实验。可优先停用的是重复做 Spec 拆分、自动开 Agent、同源自检且导致冲突的补丁；应保留的是领域规则、异构路由、弹性并发、任务幂等、成本追踪、确定性检查、安全审批和回滚。

Superpowers brainstorming“彻底过时”同样只是个人判断。先用真实任务 A/B，再决定归档。

## 五、势：哪些变化值得关注

1. **工作流能力从外置 Harness 向模型原生编排迁移。** 外部框架的价值会收缩到灵活调度、异构模型、可观测性、安全与合规。
2. **模型家族更可能走向任务专门化。** 不能再只按“尺寸越大越好”路由，但具体专门化需盲测。
3. **长上下文与分治是替代关系，不是消灭关系。** 分治降低局部上下文压力，跨块依赖、全局一致性和综合判断仍需要共享上下文。
4. **Computer Use 正从前台演示走向后台执行器。** 真正的生产门槛不只是会点击，而是证据、权限、幂等、审批和回滚。
5. **AI for Science/Math 的工作流可能是“搜索—形式化—验证—解释”。** 会议没有提供可复现实验，不能外推到所有自然科学和社会科学问题。
6. **成本单位从一次请求转向一个验收通过结果。** 便宜模型和并发降低墙钟，但协调、重复上下文、无产出和返工会吞掉节省。

这些均是早期趋势信号，不是“行业已经确定”。

## 六、专题拆解

### 1. 成本、吞吐与并发

`10/30/100/200` 来自不同目的：Spec 辩论、额度重置前测试、2.6 万项任务的弹性批处理，不能拼成一条并发曲线。`100:70:45` 也只能作团队样本内先验。

建议统一计算：

```text
EAC =（模型账单 + 工具/编排成本）÷ 验收通过数
J = EAC + 每小时延期价值 × 墙钟时间 + 一次错误损失 × 失败概率
```

每批记录总 token、P50/P95 墙钟、一次通过率、返工轮数、无产出率；并发按阶梯放量，只有吞吐提升且重复率不升时继续扩容。

### 2. 设计与前端

可采信的是“受控横测、视觉重心、功能—设计—SEO 耦合”，不能采信“Luna 普遍最强”。统一评分应覆盖三秒可理解性、单一视觉重心、信息密度、主 CTA、功能完整、SEO 可实现、品牌与事实准确。会议中的反例是首屏同时堆两个大动效和高密度文字，用户不知道眼睛看哪里（`01:04:49`）。

### 3. 写作与 Anti-slop

会议指出的 AI 味主要是套路化转折和为一个观点强加过多论证（`00:53:25`）。正向文风规格“陈述性、朴实、具体”比只列禁词更有效（`00:54:29`）。

质量分三层：内容真不真、视角准不准、表达像不像人。Anti-slop 只治理第三层，删掉“不是……而是”不会自动补足事实和洞察。所谓 30 项清单是高召回验收思路，不是通用黄金标准。

### 4. SEO / GEO

SEO 应在页面立项时和功能、设计、内容一起定义，而不是开发结束后再补（`00:49:35`）。“Google 官方不承认 GEO/AEO”“数据投毒会导致某种确定处罚”在会议里没有官方链接、处罚通知或因果对照，只能标为参会者观点。

风险方向仍成立：批量虚假内容、账号操纵、伪造评价和数据污染可能违反平台规则并伤害品牌，不应尝试。

### 5. Computer Use

会议样例显示浏览器任务可以后台运行、下载 CSV、截图和计算，但同一分享者也观察到它会擅改 HTML、客户数据和业务承诺（`01:04:49`）。

生产 SOP：

```text
只读账号/副本
→ 输出访问与计算计划
→ 采集并生成证据包
→ 人工审批拟改字段和业务事实
→ 只在 staging/分支写入
→ 机器 diff + 人工事实核对
→ 失败回滚并保存日志
```

### 6. 135G 文件事件

已知：约 135G、近 50 万文件的目录被整体移入废纸篓，随后恢复；`03:27–03:28` 附近有前台切换与磁盘活动；原路径残留 Remotion/Webpack 痕迹（`01:29:54`）。

未知：发起进程、命令、触发链、模型档位、Skill 调用记录和同名目录重建者。日志调查不完整，当事人明确说根因未确定（`01:34:42`）。

因此不得归因 GPT‑5.6、Remotion、旧 Skill 或某个档位，也不能称为 ransomware。应落实版本库外快照、异机备份、沙箱、最小权限、危险操作审批、文件事件日志和恢复演练。把 `rm` 改为 move-to-trash 只是一层兜底。

### 7. 可复现评测协议

- 预注册任务、主指标、最小有意义差异和停止规则；
- 固定 prompt、上下文、effort、工具、版本、账号和时间窗；
- 任务—模型顺序随机化，匿名输出，2 人盲评，分歧交第三人；
- 硬约束用机器 lint，语义约束用盲评；
- 报 Wilson 95% CI、中位数、P95、成本、墙钟、返工和无产出；
- 每轨先做 5 题 pilot，冻结协议后再正式跑；证据不足就明确写证据不足。

## 七、给没参会同学的一周实践计划

### Day 1：任务分类

把 10 个真实任务按 precision/recall、可逆/不可逆、风险、依赖标注，补齐输入、边界和完成定义。歧义超过 30% 时，先补需求，不选模型。

### Day 2：模型路由小样本

抽 6 项任务，固定输入与提示，比较 2–3 个候选模型/档位，各跑 2 次；盲评质量、时延和成本。以“达到质量门槛后的最低成本”作为默认路由。

### Day 3：约束 lint

选一个真实产物，写 10–20 条原子硬约束，人工植入 3 个违规；生成者与检查者分离。两轮仍失败就拆任务或升级人工。

### Day 4：依赖图与三种多 Agent

画一个中型任务 DAG；独立节点分治，稀缺资源竞争，最终结果验证。每节点有负责人、输入、输出、依赖和合并点；冲突超过 20% 退回串行。

### Day 5：Computer Use 证据包

只做只读网页任务，保存 URL、时间、步骤截图、下载文件校验值和结论映射；遇登录、支付、个人信息或写操作立即停。

### Day 6：安全演练与旧 Skill 消融

在沙箱里模拟删除/部署边界，做 Skill 开/关 A/B。沙箱外写入必须为 0，并能在 5 分钟内恢复。只有通过率不降且成本或时延改善明显时才保留 Skill。

### Day 7：复盘

按任务类型、路由和 Skill 开关统计：成本/通过项、P50/P95、一次通过率、返工率、越权率、无产出率。每条结论链接样本量和证据；日志缺失超过 10% 时只报不确定。

## 八、原文时间码索引

| 飞书时间码 | 主题 |
|---|---|
| `00:06:19–00:43:44` | 模型族、推理档位、内部成本、约束测试、Ultra、依赖树、设计提示词 |
| `00:44:00–00:53:23` | Luna/Terra/Sol 设计对比、视觉重心、前端与 SEO 耦合 |
| `00:53:25–01:01:18` | 写作去 AI 味、Anti-slop、广告分镜多 Agent 竞争 |
| `01:02:14–01:04:46` | 真实用户视角、SEO 文案 |
| `01:04:49–01:11:04` | Computer Use、Semrush/Ahrefs、CSV/截图、误改 HTML/业务事实 |
| `01:11:35–01:16:08` | 多 Agent 同调 Skill 空烧 Token、SEO/GEO 与数据投毒观点 |
| `01:17:05–01:29:47` | 工具内化、Spec 辩论、10–30 Agent、长上下文观点、AI for Math 外推 |
| `01:29:54–01:35:21` | 135G/近50万文件事件与未完成日志调查 |
| `01:35:21–01:52:34` | 旧 Harness 冲突、10/200 并发、precision/recall、安全与 Anti-slop |

飞书 AI 章节时间通常比逐字稿段落起点晚几秒；腾讯时间码约比飞书早 6 分钟。引用时应写明基准。

## 九、20 Agent 分工与交叉结论

20 个 Agent 角色（受 4 并发槽限制，分批执行）覆盖：证据审计、道、法、术、器、势、安全、成本、评测、设计、写作、SEO、Computer Use、多 Agent 架构、红队、教学设计、一周行动与最终综合等。主 Agent 未把任何单个 Agent 输出直接当事实，而是回到逐字稿检查时间码、内部矛盾和方法完整性。

| Agent | 角色 | 状态/用途 |
|---:|---|---|
| 1 | 首轮证据审计 | 完成，识别同源材料与关键误读 |
| 2 | 首轮“道” | 中途停止，由 5 号完整补做 |
| 3 | 首轮“法” | 中途停止，由 6 号完整补做 |
| 4 | “术” | 完成，提取可迁移动作 |
| 5 | “道”重做 | 完成，提炼第一性原则与反例 |
| 6 | “法”重做 | 完成，形成闭环与四类 SOP |
| 7 | “器” | 完成，输出模型/工具选型矩阵 |
| 8 | “势” | 完成，分析能力内化与行业信号 |
| 9 | 证据台账 | 完成，审计 15 项关键主张 |
| 10 | 安全 | 完成，复盘文件事件与分层护栏 |
| 11 | 成本经济性 | 完成，统一成本/通过项与并发口径 |
| 12 | 设计/前端 | 完成，拆提示词链、视觉重心与联合验收 |
| 13 | 写作/Anti-slop | 完成，形成编辑 SOP |
| 14 | SEO/GEO | 完成，区分可迁移链路与未经核验观点 |
| 15 | Computer Use | 完成，形成受控执行与证据包 SOP |
| 16 | 多 Agent 架构 | 完成，区分分治、竞争、验证 |
| 17 | 独立红队 | 完成，核对 8 条危险传播口径 |
| 18 | 教学设计 | 完成，形成 90 分钟学习单元 |
| 19 | 行动计划 | 完成，形成 7 天实践营与指标盘 |
| 20 | 最终综合 | 完成，汇总共识、分歧与选择树 |

### 交叉共识

1. 无全任务最优模型或档位；
2. 任务类型和失败代价先于模型选择；
3. 模糊提示应改写成可验收规格；
4. 多 Agent 只有在分治、竞争或验证结构明确时才有价值；
5. Ultra/self-review 不能替代独立验证和系统安全；
6. 新模型上线后必须重测旧 Skills/Harness；
7. 会议数字只能生成团队实验假设。

### 仍有分歧

- Luna 是否真实存在可复现的设计特化；
- Ultra 的收益主要来自更深推理、自动 subagent，还是样本和评分偏差；
- 原生多 Agent 能在多大程度上替代外置 Harness 和长上下文；
- Computer Use 后台化在不同系统、站点和账号上的稳定性；
- 旧 Skills 中哪些应保留、改写或退场。

### 最终选择树

```text
高风险或不可逆？
├─ 是：沙箱 + 备份 + 最小权限 + 人工审批 + 独立复核
│      Ultra 只能作为辅助，不能替代安全控制
└─ 否：是否要求约束完整覆盖？
       ├─ 是：中/高档 + lint + 独立检查；仍漏再升 Ultra/多Agent验证
       └─ 否：是否创意/设计？
              ├─ 是：低成本模型产多个明显不同候选，盲评选优
              └─ 否：够用档起步，失败后按证据升级

任务可独立拆分？
├─ 是：按依赖图分治，设置幂等ID、预算和停止条件
└─ 否：保持串行或少量强Agent，保留全局上下文
```

## 最后给缺席者的三句话

1. **先看任务类型和失败代价，再决定模型、档位和 Agent 数量。**
2. **真正的生产力来自“生成—证据—验收—回滚”，不是一次生成。**
3. **自主性越强，权限边界、独立验证和可恢复性越要优先。**
