一个月烧 900 亿 token 的人,
是怎么用大模型的
对一场 63 分钟一对一用户访谈的匿名化拆解:聚焦 Codex / Claude / DeepSeek / Kimi 的任务分工、使用成本与国产模型格局判断。
三十秒速览
TL;DR访谈方(从提问看,像是在为 DeepSeek 做深度用户调研)只关心三件事:你的 token 花在哪、你怎么评价各家模型、你未来会用谁更多。而嘉宾给出的回答,是一份罕见的、用真金白银换来的模型选型地图。
使用特征
30 天消耗约 900 亿 token,主要用于多 Agent 调度、研究与开发;其中约 96% 集中在 Codex。
分析重点
关注模型能力边界、缓存成本、任务分层、工具链可靠性,以及新模型在真实任务中的表现。
最核心的判断
DeepSeek 将成国内龙头(份额看 40%);终局剩约六家;竞争从刷榜转向分层路由;能力若趋同,价格定胜负。
Token 账单:900 亿去了哪
THE BILL钱具体花在什么任务上
- 并行 Agent 调度:长期项目不断复刻出大量子 Agent,研究、复核、汇总,消耗最大。
- SEO/流量研究:分析公开页面、搜索流量结构、外链与转化路径。
- 公开数据整理:批量收集、清洗和归档可用于后续研究的数据。
- 知识管理自动化:把会议纪要等信息自动提取、结构化并沉淀到资料库。
道 · 底层认知
PRINCIPLES「道」回答的是:他相信什么。这六条认知是他的操作系统,后面所有的方法都是它们的应用。
1. 能力优先,价格次之
选模型的排序是 能力 > 价格 > 速度/稳定性。他不用 DeepSeek 做主力开发,不是嫌贵,而是「Codex 怎么样都比 DP 强」。「能力」在他这涵盖速度、稳定性等所有实际体感。
2. 模型是大脑,Harness 是身体和工作环境
评价 DeepSeek 前一天发布的 Harness 时,他给出全场最完整的认知框架:模型负责「谁在干活、怎么决策」;Harness 负责「给它什么环境、工具、权限、运行机制」。他还特意考证了词源:harness 原指马具——「把马的力量组织起来连接到车」;软件工程里也早有 test harness(测试支架)——不是被测的算法本身,而是为运行测试准备的数据和环境。
3. 「万物皆可插件」的价值在平台和企业,不在个人
文件系统、终端这些基础能力,Claude Code 已经打磨得很好,个人开发者没必要为了架构先进去迁移、去重新造轮子。但企业场景完全不同:同一个任务,有人在本机跑、有人在远程 Docker 跑;有人允许读写整个仓库、有人只让读几个目录;还有审计、权限、内部 MCP、私有工具链——对 Agent 来说都是「调用终端」,底层实现千差万别。把这一层做成标准可替换的扩展点、又不用改 Agent 的决策逻辑,才是 Harness 的真正价值。他的结论非常克制:
「普通开发者现在还用不上……但做 Agent 的、做平台的、做企业系统的人,这种架构思路很值得研究。」36:32 – 37:05
4. 榜单是生意,实测才是真相
「榜单其实也是一门生意,他们很多刷榜的。你自己实际开发实际用的时候,其实还是能感觉到的。」53:11
每出一个新模型(GLM 新款、DP V4、Flash 他都测过),他就拿自己历史真实任务做回归测试;跑不过现有组合,就不深入、不迁移。
5. AI 的能力边界由开源生态决定
为什么 AI 写代码强?因为软件开源语料多。为什么 AI 在硬件上帮助很小?因为硬件生态不开源。但在嵌入式软件/固件上帮助很大。
6. 竞争是用户的红利
「国产模型变强,逼着 Codex、Claude Code 一直降价……Luna 降了 93%。鹬蚌相争,我们得利。」56:59 – 01:01:43
法 · 方法论
METHODS「法」回答的是:他怎么组织工作。核心是一套「贵模型思考、便宜模型干活」的多 Agent 流水线。
主工作流:规划 → 并行执行 → 验收合并
出 plan、出 PRD、方案审查,制定完整开发计划
按功能拆分给多个子 Agent 并行开发,「非常丝滑、非常划算」
验收、合并、候选;验收合格立即回收对应 Agent
成本逻辑:Luna 按 API 计价约为 DP V4 Pro 的 6 倍,但订阅制下「跑一天才消耗百分之几」,反而远便宜——所以子 Agent 全用 Luna Max 是「最便宜的方式」。
访谈中的工作流提示词
「我不懂这个领域 → 先喂给你官方信息 → 你自己思考,用 50 个 Agent 去研究 → 后续全由你自主规划任务、持续开发 → 不需要请示,所有权限开放 → 用 plan 制定完整开发计划 → 每个功能分配子 Agent 并行开发 → 验收合格立即回收对应 Agent。」03:13 – 04:01 · 提示词结构还原
900 亿消耗的根源正在于此:几个长期项目不断复刻出大量 Agent,Agent 的研究、复核、汇总层层放大 token 用量。
新模型评估法
- 不看榜单、不看参数——榜单「是一门生意」。
- 每出新模型,拿自己以前的真实任务跑回归测试。
- 测不过「现有模型搭配」就放弃,保证「能力范围内用最好的」。
术 · 实操技巧与坑
TACTICS「术」是可以直接抄走的细节,包括他踩过的坑。
Flash 类便宜模型:能用,但三个坑
- 定位:批处理、测试修补、低风险子任务、不用人验收的高频执行层。便宜,所以「可以多跑几轮」。
- 坑一·错误扩散:没有 define 边界、没有 schema、没有回滚时,「多跑几轮只会把错误扩散得更快」。
- 坑二·假长上下文:标称 1M 只是容量规格,不代表能从几十万 token 里稳定揪出每个关键约束。
- 坑三·首次通过率低:视觉是缺口;对开发而言首次通过率很重要。
Pro 类大模型:强在规划,坑在过度思考
- 适合:复杂规划、修改前影响分析、疑难 bug 排查计划、数据迁移、权限兼容性设计、长文档、架构问题。中文工程性价比高、判断密度高。
- 坑:过度思考——「为了减少错误,只增加了等待和输出 token,不一定保证质量」。小任务上 Pro 的额外思考没有收益,用 Flash 反而高效。
工具链的暗坑
他实测 DP Flash:第一轮能正常调用 Agent 工具,第二轮因上下文丢失直接报 400,后面的子 Agent 全部断掉——「Agent 的工具链不够完善」。另外视觉搜索、浏览器模式、OCR 这些能力,模型能输出函数调用,但 API 不自带搜索索引。「强模型配上错误的回复,就会表现为不会调用工具」——能力受工具协议和 Harness 适配的制约。
器 · 模型武器库
TOOLBOX「器」是他对 11 款模型的分工定位与亲测打分。这是全场信息密度最高的部分。
分工定位表
| 模型 | 在他工作流里的位置 | 一句话评价 |
|---|---|---|
| Codex | 主力:高风险工程、结构化执行、复杂任务闭环 | 消耗占比约 96%;工具生态与工程闭环最好 |
| Claude Sonnet | 规划层:出 plan、出 PRD,最后合并收口 | 能力 9 分全场最高;与 Luna 搭配性价比最优 |
| Luna (Max) | 执行层主力:批量子 Agent | 低成本,适合规模化执行 |
| Kimi | 前端、长上下文任务、网站诊断监控、多模态 | 前端能力约持平 Sonnet 4.5;1M 上下文 |
| DeepSeek Flash | 批处理、低风险子任务 | 低成本执行「跨过了可用的标准线」 |
| DeepSeek Pro | 复杂规划、难 bug、数据迁移、兼容性设计 | 复杂规划好,但慢(过度思考) |
| Claude | 写作、架构讨论、需求澄清、review、图片/PDF | 需求澄清与细致审查能力突出 |
| Gemini | 多模态 + 谷歌生态入口 | 「没落了」,能力没跟上 Codex/Claude |
| 千问 Qwen | 本地/私有化部署、OCR、定制 | 部署便宜、生态开放;缺点是版本更新太频繁 |
| 智谱 GLM | 中文 PRD、规范类、长文本工程规划、结构化输出 | 适合国内业务与中文表达 |
| MiniMax | 视频与多模态场景 | 不卷 coding 的差异化样本 |
访谈评分(10 分制 · 价格分越高越便宜)
| 模型 | 能力 | 价格 | 速度 | 解读 |
|---|---|---|---|---|
| DeepSeek Flash | 6.5 | 9 | 8.5 | 便宜快,能力刚跨过可用线 |
| DeepSeek Pro | 7.5 | 9 | 7 | 规划强,速度慢半拍 |
| Claude Sonnet | 9 | 6.5 | 7 | 能力天花板,价格也最贵 |
| Luna | 8 | 9 | 7 | 性价比之王,执行层首选 |
| Kimi | 8.5 | 6 | 8 | 前端与长上下文值回票价 |
补充:访谈里对 DP 最大的期待是多模态——「有了多模态,它就能跟很多模型在实际开发中碰一碰,不是说那些指标榜单」。
势 · 趋势判断
THE FUTURE「势」是他对未来 6 个月到 3 年的行业判断——访谈方最关心、他也答得最干脆的部分。
判断一 · DeepSeek 国内份额 → 40%
理由:国家扶持力度(党政背书、华为、国家电网)+ 模型自身争气 + 公司不差钱。「肯定留下来,而且是龙头、是老大。」
判断二 · 采用率有望提升
前提是多模态、上下文与工具调用补齐;届时 DeepSeek 可以承接更多原本交给其他执行模型的任务。
判断三 · 终局约六家
DeepSeek(龙头)、千问、智谱、Kimi、MiniMax、豆包(靠用户基数)。腾讯混元「能力太差,很难留下」。厂商会转向细分赛道:多模态、桌面 Agent、办公等。
判断四 · 竞争形态变了
从「单模型总榜竞争」转向任务类、风险类、模态类、成本、部署方式的分层路由竞争。一家刚在某领域拿第一,马上被追上——「谁第一的状态很短很短」。
判断五 · 能力不会真正趋同
各家一起上升,部分能力持平,但不可能所有能力持平;中国模型在供给、成本、采购选择权上持续给美国同行压力。
判断六 · 若能力持平,价格定胜负
「如果最后大家模型能力都差不多,能决定你用谁的,那就是价格。」
「他(DeepSeek)是以一种取之不尽的生态在这里……我觉得最强的肯定是 DP。」01:02:13
语录墙
QUOTES以下均为逐字稿原文(保留口语质感),可直接引用。
「我其实是一直在验证这个 AI 的边界能力是在哪里。」02:07
「最便宜的方式就是:主模型规划好整个 PRD,所有子 Agent 都用 Luna Max——非常丝滑,非常划算。」21:18
「榜单其实也是一门生意,他们很多刷榜的。」53:11
「标称 1M 上下文只是容量规格——能读很多,不代表能稳定找出分散在几十万 token 里的每个关键约束。」30:09 · 评 Flash
「它只是增加了等待和输出 token,不一定保证任务质量。小任务用 Pro 没有收益,用 Flash 更高效。」31:26 · 评过度思考
「AI 写代码强是因为开源语料多;硬件生态不开源,所以 AI 在硬件上帮助非常少。」08:09
「一个强模型配上错误的回复,就会表现为不会调用工具。」55:35 · 评工具链
「鹬蚌相争,我们得利。我是相信 DP 会越来越好的。」57:10
「如果最后大家模型能力都差不多,能决定你用谁的,那就是价格。」01:03:19
阅读须知
DISCLAIMER- 转写失真:原始材料为语音识别逐字稿,错别字较多。本文已按上下文还原(如 code s → Codex,售/瘦 → Sonnet,底气/DP → DeepSeek,质谱 → 智谱,可乐 → Claude,君子兰 → Gemini,A准 → Agent,honest → Harness);个别名称(如「露娜/Luna」型号归属)无法完全确认,数字引用前请与录音核对。
- 一家之言:所有模型评价与行业预测均为嘉宾个人体感。这是一份真实的一手用户视角,而非客观结论。