# EP144｜Claude Tag 深度拆解与公众号写作方案

> 基于用户提供的中文音频、原节目转录和 Anthropic 官方发布资料整理。目标不是复述功能，而是提炼一篇公众号文章真正值得写的判断。

## 一句话结论

Claude Tag 真正激进的地方，不是“把 Claude 塞进 Slack”，而是第一次把 AI 从一个由个人调用的软件工具，重新设计成一个拥有**组织身份、共享上下文、持续记忆、主动性、行动权限和责任记录**的团队成员。

如果文章只写“Claude 可以在 Slack 里帮你写代码”，会把这期节目最有价值的部分写浅。更准确的主线是：

> AI 产品的下一场竞争，不只是模型更聪明，而是谁能让模型在真实组织里获得一个可协作、可授权、可追责的位置。

## 一、先校正三个关键事实

### 1. “65%”不能写成“Anthropic 65% 的代码都由 AI 完成”

节目里出现了两种相近表述：

- 嘉宾在节目中说，产品工程团队约 65% 的 PR 由 Claude Tag 发起。
- Anthropic 官方发布页写的是，产品团队 65% 的代码由内部版 Claude Tag 创建。

这两个口径并不完全相同。“发起 PR”不等于“独立完成并直接合并”，“产品团队”也不等于“整个 Anthropic”。文章中最稳妥的写法是：

> Anthropic 称，其内部版 Claude Tag 已参与产品团队大量开发工作；官方发布口径为“创建了产品团队 65% 的代码”，节目访谈则表述为“约 65% 的 PR 由它发起”。这足以说明采用深度，但不能推导为 65% 的代码未经人工审查便自动进入生产。

### 2. METR 的“四个月翻倍”要加限定

嘉宾引用 METR 图表时说，智能体可自主完成任务的时间跨度大约每四个月翻一番。METR 当前总览给出的长期趋势约为七个月翻倍；较近期模型或部分软件、推理领域的趋势可接近四个月。

文章中可写：

> METR 的研究显示，前沿智能体能够可靠完成的任务跨度长期呈指数增长；长期口径约七个月翻倍，近期部分口径更接近四个月。这里衡量的是“相当于人类专家需要多长时间完成的任务难度”，不是 AI 自己连续运行了多久。

这句限定很重要，否则容易把“任务时间跨度”误解成“模型能在后台持续运行的钟表时间”。

### 3. Claude Tag 不是 Claude Code 的替代品

节目反复强调，两者解决的是不同层次的问题：

- Claude Code 更适合个人主导、需要细粒度掌舵的编码会话。
- Claude Tag 更适合从团队讨论中接任务，异步推进跨工具、跨角色、长时间的工作流。

它们不是“旧产品—新产品”的简单替代关系，而是“个人执行界面—团队协调界面”的分工。

## 二、Claude Tag 到底改变了什么

| 维度 | 普通聊天助手 | Claude Code | Claude Tag |
|---|---|---|---|
| 交互位置 | 独立聊天窗口 | 终端或代码环境 | 团队正在工作的 Slack 频道 |
| 基本单位 | 一次问答 | 一个人的一次编码会话 | 一个团队持续推进的工作流 |
| 启动方式 | 用户提问 | 用户下达任务并持续掌舵 | 被 @、定时触发，或在允许时主动介入 |
| 上下文 | 当前对话 | 当前会话、代码库和工具 | 频道历史、团队知识、连接器、代码库及获准的其他频道 |
| 工作时长 | 短回复 | 可持续执行复杂任务 | 可异步推进数小时或数天并回来交付 |
| 协作对象 | 单个用户 | 单个开发者为主 | 同一频道里的多名成员共同协作 |
| 身份与权限 | 通常继承用户权限 | 通常以调用者身份行动 | 拥有独立的智能体身份、权限、密钥和审计记录 |
| 最终价值 | 给出答案或内容 | 完成编码任务 | 让整个流程继续向前移动 |

最核心的变化可以压缩成四个转向：

1. **从 session 到 continuity**：不再每次从零开始解释，而是在受控范围内持续积累上下文。
2. **从 single-player 到 multiplayer**：AI 不再只服务一个人，而是在团队共享空间里与多人协作。
3. **从 command 到 delegation**：用户不必逐步操作工具，而是定义目标、边界和验收条件后进行委派。
4. **从 user proxy 到 agent identity**：AI 不再只是借用某个人的身份做事，而是拥有独立、可审计的组织身份。

## 三、为什么它更像“队友”，而不是“工具”

“队友感”不是靠拟人化语气产生的，而是由五个结构性条件共同形成：

> 队友 = 角色身份 × 共享上下文 × 主动性 × 持久执行 × 可追责的权限

### 1. 它拥有一个稳定角色

传统工具没有组织位置。谁打开它，它就临时为谁服务。Claude Tag 则在频道中拥有相对稳定的身份：团队成员知道去哪里找它，也能看到别人如何与它协作，并接续同一个任务。

### 2. 它掌握的是团队上下文，而非个人提示词

普通 AI 的隐性成本，是人不断扮演“上下文搬运工”：复制 Slack 讨论、贴工单、解释代码库、补充客户背景。Claude Tag 的设计试图把这些信息留在它们自然产生的地方，由智能体在权限允许的范围内自己组织。

这意味着产品竞争的重点从“谁会写更漂亮的 Prompt”，转向“谁能提供更准确、更新鲜、权限正确的上下文”。

### 3. 它能主动发现未闭环事项

工具等待操作；队友会在事情可能掉到地上时提醒你。Claude Tag 的 ambient 模式允许它发现无人跟进的线程、相关信息或临近截止的任务。但节目也强调，主动性必须是一个可调节的连续光谱，而不是开或关两个极端。

### 4. 它能在你离开后继续工作

真正改变工作方式的，不是回答速度，而是异步性。用户可以把任务交出去，去处理别的工作，等 Claude Tag 完成研究、编码、测试或整理后再回来接手。此时，人从“陪 AI 一步步做事”转变为“管理多个并行委派”。

### 5. 它需要承担责任边界

队友不是“权限越大越好”。恰恰相反，只有明确它能看什么、能做什么、何时必须申请批准、每一步如何审计，组织才可能把真实工作交给它。独立的智能体身份是 Claude Tag 最重要、却最容易被功能演示掩盖的设计。

## 四、一个完整工作流是怎样被重写的

节目给出的典型链路可以还原为：

> 用户反馈进入频道  
> → Claude Tag 识别问题和背景  
> → 找出需要参与的销售、产品和工程成员  
> → 创建 Linear 工单  
> → 在设定的审批关卡征求人工同意  
> → 启动隔离沙箱并修改代码  
> → 运行测试，对照最初需求验证结果  
> → 创建 Pull Request  
> → 通知相关人员审查和合并  
> → 把结果、证据和未决问题带回原线程

传统自动化通常只优化其中一个节点，例如“帮我建工单”或“帮我生成代码”。Claude Tag 的野心是掌握节点之间的衔接关系，让人不再充当流程胶水。

因此，人的工作重点也随之变化：

- 过去：自己操作 Linear、Slack、代码仓库和测试工具，把信息从一个系统搬到另一个系统。
- 现在：定义成功标准、权限边界、审批关卡和异常处理方式，审核智能体交付的结果与证据。

这不是“人从流程中消失”，而是人从**操作层**上移到**目标与治理层**。

## 五、信任不是态度，而是一套产品机制

节目里“离代码越远，越需要信任”的判断非常重要。但文章不能把信任写成“多用几次就习惯了”。更准确的表达是：

> 可委派信任 = 能力 × 可评估性 × 可观察性 × 可逆性 × 边界清晰度

这是乘法关系，任何一项接近零，整体信任都会坍塌。

- **能力**：模型能否完成足够长、足够复杂的多步骤任务。
- **可评估性**：团队能否明确什么叫完成、正确和高质量。
- **可观察性**：智能体是否提供过程日志、测试结果、影响范围和交付证据。
- **可逆性**：错误操作能否撤销，变更是否经过 PR、沙箱或版本控制。
- **边界清晰度**：哪些动作可自主完成，哪些必须向人申请批准。

这也解释了为什么软件开发是智能体最早突破的领域之一：代码天然拥有 Git、测试、CI、PR、日志和回滚机制，成功标准比“写一份好战略”更容易被机器验证。

## 六、这期节目里最值得写的三层产品哲学

### 第一层：上下文不是附属输入，而是产品本体

Claude Tag 的表面界面只是一个 `@Claude`。真正复杂的产品工作发生在界面以下：

- 哪些频道可以读取；
- 哪些信息可以跨频道调用；
- 哪些连接器和工具可用；
- 记忆如何更新、过期和纠错；
- 任务的来源、执行过程和责任人如何被记录。

因此，AI 产品的护城河会从模型调用逐步移向“上下文基础设施”。

### 第二层：为未来模型设计，并敢于删除脚手架

Anthropic 的经验不是不断给模型加更多 Prompt、规则和中间层，而是随着模型能力增强，定期重新评估哪些脚手架已经多余。节目中提到，他们曾尝试更结构化、更有规定的记忆系统，后来发现简单文件系统配合 `bash`、`grep` 等原生工具有时反而更有效。

这里的产品原则是：

> 不要把今天模型的弱点永久固化成明天产品的架构。

AI 产品需要“可拆卸的脚手架”，否则模型每升级一次，旧架构就可能从帮助变成阻碍。

### 第三层：记忆不是数据库项目，而是持续维护的组织资产

长期运行的智能体一定会出现记忆问题：旧信息过时、关键事实缺失、组织方式混乱，甚至错误信息不断影响后续任务。

节目中的 Dreaming 机制，本质上是给智能体记忆做一次“睡眠整理”：另一个智能体审查历史会话和记忆库，提出需要新增、纠正、删除或重组的内容，并给出证据链接，由人决定是否应用。

它揭示了一个新的工程学科：

> 未来组织不仅要维护代码债务，还要维护“智能体记忆债务”。

## 七、Dogfooding 真正教会了 Anthropic 什么

Claude Code 最初只是 Boris Cherny 的内部业余项目，在 Slack 首次分享时只得到六个表情回应。后来，随着少数用户持续使用、模型能力跨过可用门槛，采用率才快速增长。

这个故事可以提炼出三点：

1. **第一次反馈不是最终判决**：创新产品早期可能因为能力、习惯或配套设施尚未成熟而显得普通。
2. **内部试用是时间过滤器，不是一次投票**：真正重要的是持续留存、任务深度和组织扩散，而非发布帖的即时反应。
3. **模型能力是产品市场契合的一部分**：同一产品形态在模型不够强时可能不成立；模型能力越过阈值后，需求会突然爆发。

因此，“数据驱动”不应被理解为只看最早的一组量化信号。面对能力快速变化的平台，团队还需要方向判断和耐心。

## 八、不要忽略的反面与风险

一篇可信的文章不能只有兴奋，还要写清这些前提：

### 1. Anthropic 的文化条件不一定能复制

Anthropic 倾向于在公开 Slack 频道工作，这使智能体获得高质量共享上下文。许多公司更依赖私聊、会议和隐性知识，直接部署同类产品可能只会得到一个“看见很多碎片、却不知道真实决策”的智能体。

### 2. 主动性很容易退化成噪音

如果智能体对每条消息都插话，团队很快会关闭它。主动行为必须可调、可反馈、可学习，并且有明确的介入阈值。

### 3. 上下文越多，不代表答案越好

更多上下文会带来权限泄露、陈旧信息、错误关联和成本上升。真正重要的是相关、最新、可授权，而非无限读取。

### 4. “完成 PR”不是“创造业务价值”

PR 数量、代码行数和生成速度很容易测量，但维护成本、缺陷率、技术债、客户价值和团队认知是否改善更难衡量。文章应把 65% 当成采用深度信号，而不是生产力已被证明提升 65%。

### 5. 人可能从执行瓶颈变成审核瓶颈

当多个智能体并行提交成果时，人的注意力、判断力和审批速度会成为稀缺资源。未来最重要的能力不只是“会不会用 AI”，而是能否设计高质量的验收标准和分级审查机制。

## 九、推荐的公众号文章主线

### 推荐标题

**Claude Tag 真正激进的地方，不是进入 Slack，而是第一次拥有了“同事”的组织位置**

备选标题：

1. Anthropic 65% 的产品代码背后：AI 正从工具变成主动型队友
2. 不是更强的聊天机器人：Claude Tag 正在重写团队协作的基本单位
3. 当 AI 不再等你下命令：Claude Tag 背后的五层产品设计
4. AI 的下一站不是 IDE，而是组织本身
5. 从 Claude Code 到 Claude Tag：为什么“会写代码”只是开始

### 推荐结构

#### 开头：用 65% 制造冲击，再立刻校正口径

先写 Anthropic 的 65% 数据，引发读者注意；紧接着指出，真正值得关注的不是代码比例，而是 AI 开始出现在需求讨论、工单、编码、测试、PR 和跨部门协调的整条链路中。

#### 第一部分：表面是 `@Claude`，底层是组织结构变化

用“如果只是 Slack 机器人，这件事毫无新意”反转读者预期。提出四个转向：持续上下文、多人协作、异步委派、独立身份。

#### 第二部分：还原一条端到端工作流

用用户反馈到 PR 的完整链路，让抽象概念变得可见。重点写人从“流程搬运工”变成“目标和关卡设计者”。

#### 第三部分：为什么我们现在才敢把 AI 放进团队中心

引出 METR、模型自验证、测试与回滚。提出“信任乘法公式”，说明信任来自工程机制，而非心理适应。

#### 第四部分：Claude Tag 最难的不是模型，而是权限和身份

解释频道级权限、独立智能体身份、审计记录和跨频道边界。把这部分写成文章的认知增量。

#### 第五部分：Anthropic 的三个反常识经验

- 六个表情不代表产品没价值；
- 模型越强，脚手架有时越应该删；
- 记忆需要像代码一样持续维护，Dreaming 是一种“记忆债务治理”。

#### 第六部分：冷静判断它的边界

讨论公开协作文化、主动噪音、上下文污染、审核瓶颈和 65% 指标的局限。这样文章不会变成产品发布稿。

#### 结尾：从“如何使用 AI”转向“如何给 AI 一个组织位置”

结论不要落在“大家赶紧用 Claude Tag”，而要落在更普遍的问题：当 AI 能长时间工作后，企业真正要设计的是角色、权限、上下文、验收和责任。

## 十、可直接使用的开头草稿

Anthropic 最近公开了一个很夸张的数字：其内部版本的 Claude Tag，已经创建了产品团队 65% 的代码。

但如果你因此把 Claude Tag 理解成“一个更会写代码的 Slack 机器人”，反而错过了这款产品真正激进的地方。

它最重要的变化，不是让工程师可以在 Slack 里 `@Claude`，而是让 AI 第一次拥有了一个接近真实同事的组织位置：它待在团队共同工作的频道里，记得之前发生过什么，知道哪些人应该参与，能够跨越数小时或数天推进任务，也有自己独立的权限、身份和审计记录。

换句话说，Claude Tag 不是在回答“AI 还能替人做多少工作”，而是在回答一个更底层的问题：如果 AI 真要成为队友，一个组织究竟需要为它准备什么？

答案不是一句更好的 Prompt，而是一整套新的协作基础设施。

## 十一、可直接使用的结尾草稿

过去两年，我们讨论 AI，最常问的是：它会不会写、会不会做、能不能替代某项任务。

Claude Tag 把问题向前推了一步。当模型已经能连续完成越来越长的任务，真正限制它的就不再只是智力，而是组织是否给了它正确的上下文、权限、工具、验收标准和责任边界。

所以，AI 从工具变成队友，不是因为它说话更像人，也不是因为我们愿意把它叫作“同事”。而是因为它开始拥有同事才有的东西：一个稳定角色、一段共同历史、一组清晰权限，以及把事情真正推进到结果的责任。

下一代 AI 产品的竞争，表面上发生在模型和界面里，底层却会发生在组织设计里。

## 十二、文章中可提炼的原创判断

以下句子属于基于节目内容的二次提炼，不是嘉宾原话，写作时不要加引号冒充直接引用：

- 真正的 AI 队友，不是更拟人的聊天机器人，而是拥有组织位置的软件行动者。
- Prompt 工程解决一次任务，上下文工程解决持续协作。
- 当 AI 从单人会话进入公共频道，产品设计的核心会从交互变成治理。
- 模型能力越强，人越需要把注意力从“怎么做”转向“什么算做好”。
- 未来企业最大的技术债之一，可能不是代码债务，而是智能体记忆债务。
- 智能体真正替代的第一份工作，可能不是程序员，而是每个人身上的“流程搬运工”。
- AI 的主动性不是越强越好；好的主动性，是在正确时刻以正确权限推动正确事项。
- 65% 的 PR 是采用信号，不是价值证明；价值仍要回到质量、客户结果和长期维护成本。

## 资料与证据

- Anthropic 官方发布：[Introducing Claude Tag](https://www.anthropic.com/news/introducing-claude-tag)
- 原节目与英文转录：[Inside Anthropic: How Claude Tag Is Changing Agentic Work](https://tessl.io/podcast/113/)
- METR 当前定义与数据：[Task-Completion Time Horizons of Frontier AI Models](https://metr.org/time-horizons/)
- 中文校订稿：[transcript.md](content/transcript.md)
