会议逐字稿详拆(加深版):道法术器势
会议一:OpenAI 官方博客:GPT 5.6 是如何自己优化自己的
会议速览
- 时间/时长:2026-08-02 17:59 上传,全长 11 分 37 秒,单主播口播。
- 性质:解读类分享(播客「AI 智识录」),解读对象是 OpenAI 2026 年 7 月 29 日发布的官方技术博客《GPT 5.6 是如何将前沿的智能与前沿的效率融合在一起的》。
- 一句话结论:GPT 5.6 的高效率来自模型、推理系统、代理控制框架三层全栈优化的复利叠加,而最值得关注的是——这些优化里大量环节是 GPT 5.6 自己(跑在 Codex 里)全自动完成的,「AI 优化 AI」的飞轮已经在 OpenAI 内部转起来。
- 核心要点:
- 背景是算力短缺:模型需求增速远超算力容量增速,效率成为系统设计的核心,目标是同一批硬件榨出更多 token。
- 推理侧四大优化:负载均衡派单、前向传播/内核重写(端到端成本降 20%)、推测解码(token 生成效率提升超 15%)、KV cache 按负载定制配置。
- 代理控制框架(agentic harness)两大招:避免上下文膨胀(延迟发现 + 工具输出默认 1 万 token 上限)、保住提示词缓存精确前缀(append-only + 确定性顺序),换来极高缓存命中率。
- 所有优化遵循「生产测量 → 找差距 → 改 → 全链路验证」的持续反馈循环,拒绝只在跑分上好看的假优化。
- 单点优化只快一点点,成百上千个叠加出质变——复利逻辑贯穿始终。
AI 智能纪要精华(来源:飞书智能纪要 AI 总结,非逐字稿原文,仅供参考)
纪要给出的结构化总结:
- 推理优化的定位:算力短缺背景下,效率是推理系统设计的核心优先级;目标是在不牺牲智能度、响应速度、可用性、稳定性的前提下,从同批硬件挖掘更多 token 产出。
- 负载均衡:由 GPT 5.6 分析生产流量特征,定位过往被忽略的派单不平衡根源,迭代路由调度规则,覆盖全球节点调度、集群实例分配、硬件资源细分全链路,大幅降低全局服务成本。
- 内核自动优化:GPT 5.6 基于 Triton、Gluon 开源 GPU 编程语言全自动重写线上核心内核代码,配 FP3 做数学正确性验证,端到端服务成本降 20%。
- 推测解码:GPT 5.6 自主完成草稿模型架构实验和训练全流程管控(含自动处理硬件故障),token 生成效率提升超 15%。
- KV 缓存配置:分析生产端不同场景负载特征,生成定制化缓存管理规则,解决了过去配置空间过大、只能靠工程师经验的痛点。
- 代理控制框架:Rust 编排层,对接模型、工具与用户环境,核心是降低复杂任务的重复算力消耗;靠延迟发现 + 1 万 token 上限抑制上下文膨胀,靠 append-only + 工具固定顺序 + 运行时配置动态加载保住提示词缓存前缀。
- 迭代闭环:「生产表现测量 → 差距定位 → 方案落地 → 全链路验证」,拒绝只适配跑分的无效优化;最终产出延迟更低、容量更大、单位成本更低的规模化推理系统。
纪要「关键决策」部分(原话:本次会议为分享类会议,无关键决策,纪要改为归纳关键内容):
- GPT 5.6 核心优化逻辑:围绕模型本身、推理、代理控制框架三个方向,实现智能与效率双重提升。
- 推理阶段优化方案:负载均衡、内核重写、推测解码、KV cache 配置四个环节的落地效果,累计大幅降本增效。
- 代理控制框架设计:Rust 框架 + 延迟发现 + 精确前缀缓存,减少重复工作。
- 相关产品信息:主播的 AI 创业产品 Unavi 已上线(多平台会议解读 Agent,支持播客链接转写总结)。
纪要「金句时刻」摘录(AI 纪要评选):
「虽然每一个小优化单拿出来看,好像只是快了一点点,但当成百上千个小优化叠加在一起,就产生了质的飞跃,让它们能在智能和效率的最前沿双管齐下。」——点明微小优化的复合叠加效应。
「在现在算力短缺的世界,模型的需求增长速度远远超过了算力容量的增长速度,这种情况下,效率必须是每个系统设计的核心。」——点明行业核心背景与设计优先级。
「我们在 GPT 5.6 上看到的效率收益,是多年来在研究、推理系统和代理控制框架等整个技术栈上,一点一滴复合改进的结果。」——印证技术迭代需要长期全栈积累。
逐字稿全流程详细解读
第 1 段 00:00–01:21|开场:文章来源与三大优化层面
主播说明今天要聊的是 OpenAI 2026 年 7 月 29 日发布的官方文章《GPT 5.6 是如何将前沿的智能与前沿的效率融合在一起的》,核心概念是 GPT 5.6 参与到推理和 agentic harness(代理控制框架) 两个层面来自己优化自己的速度和效果。随后给出文章的总体结构:研究和技术团队把系统每一层都做了巨大优化,集中在三个方面——第一是模型本身,第二是推理(模型怎么运行来生成回答),第三是内部叫「代理控制框架 agentic harness」的东西,主要用在 Codex 和工作版 ChatGPT 上。接着抛出全篇的题眼:OpenAI 认为 GPT 5.6 实现了「有史以来最高的每个 token 的智能效率」;本讲重点是推理和代理控制框架,而且最神奇的是 GPT 5.6 自己在很多优化环节里全自动帮人类工程师完成了任务。主播在这里埋下贯穿全篇的复利论点(原话):「虽然每一个小优化单拿出来看,好像只是快了一点点。但当成百上千个小优化叠加在一起,就产生了质的飞跃,让它们能在智能和效率的最前沿双管齐下。」
第 2 段 01:21–02:41|推理优化总论:算力短缺、餐厅比喻、四个优化层面
进入第一大板块「推理阶段 Inference」。逻辑链条是:背景(算力短缺)→ 目标(同硬件多产 token)→ 手段(全系统优化)。背景原话:「现在的世界是个算力短缺的世界,模型的需求增长速度远远超过了算力容量的增长速度。在这种情况下,效率必须是每个系统设计的核心。」推理系统的目标是「在不牺牲你期待的聪明度、响应速度、可用性和稳定性的前提下,用同一批硬件炸出更多的 Token 产出」。主播强调单优化模型没用:「一个模型哪怕自己再高效,如果订单分配的很烂,硬件总是闲着没事干,或者搬运数据的速度慢吞吞的,那整体跑起来还是会非常贵。」并给了个餐厅比喻:大厨手艺再好,前台接单乱七八糟、服务员传菜慢得像蜗牛,餐厅效率一样高不起来。随后列出 OpenAI 优化的各个层面:路由(请求派给哪个服务器)、调度(什么时候开始处理)、内核(在显卡上跑的底层软件)、缓存(保存并重复使用的工作)、模型的实现逻辑。并点题:在 Codex 里运行的 GPT-5.6 在这些优化里「立下了汗马功劳」。
第 3 段 02:41–03:38|推理优化一:负载均衡(派单)
讲派单的三层结构:全球层——根据用户地理位置、哪里有空闲容量、加速器类型(运行模型的专门芯片)决定把请求发给谁;集群层——看各模型实例当前的负载、上下文长度、有没有缓存可用等属性进一步分配;实例层——活还要高效细分给加速器、模型的子网络和计算核心。主播说「以前这事很难搞,但这次他们竟然让 GPT 5.6 亲自上阵」:它去分析生产环境的流量,找出以前被忽视的派单不平衡源头,测试新的路由策略,不断调整规则。效果(文章口径):单单这个派单改进,就极大降低了模型的服务成本(未给具体数字)。
第 4 段 03:38–04:52|推理优化二:前向传播与内核重写(降本 20%)
先解释概念:前向传播(Forward pass)是「把你的输入变成下一个词预测的核心数学计算过程」。问题在哪:有时每个单独运算都很快,但如果有多余的内存移动需要同步等待、或者数据摆放乱七八糟,就会导致 GPU 闲置。GPT 5.6 的解法:找出那些可以提前算好、可以干脆避免、或者可以同时平行进行的工作。更猛的是:「在 Codex 的帮助下,GPT 5.6 甚至全自动的重写并且优化了 OpenAI 线上跑的最底层的核心内核代码。」能做到的前提是 OpenAI 早就教过 GPT 5.6 用 Triton 和 Gluon——两个由 OpenAI 维护的开源 GPU 编程语言——来写和优化内核代码。关键数据:通过这一系列内核改进,端到端的服务成本直接砍掉了 20%。同时主播点出配套兜底:为了防止 AI 瞎写,团队投入大量精力做验证工具,比如用一个叫 FP3 的开源工具,专门验证 AI 写的内核代码在数学上到底对不对。
第 5 段 04:52–05:51|推理优化三:推测解码(效率提升超 15%)
概念讲解很完整:推测解码 = 主力模型旁边配一个小一点的草稿(推测)模型;小模型先猜、先草拟几个词,大模型只需在平行的时间里快速验证;如果大模型接受了,系统就能通过大模型的一次运算直接产出好几个词,大大减少「昂贵的、必须一步一步来的顺序计算」。GPT 5.6 在这个环节干了三件事:① 改进小草稿模型——自己设计并运行了成百上千次架构实验,测试尺寸、结构和特征的改变;② 包揽了小模型训练过程的启动和监控;③ 训练中出现硬件故障或不稳定时自动插手解决。效果:生成 token 的效率提升了超过 15%。
第 6 段 05:51–07:19|推理优化四:KV cache 配置 + 持续反馈循环
先讲 KV cache(键值缓存)的场景:处理新输入(未缓存输入)时,模型要在一次密集计算中建立这个缓存;生成回答时又要不停读取并拉长它。难点:怎么配置这些操作——批处理、分片、缓存管理——极其依赖当前工作负载(提示词多长、回答多长、批次多大、缓存命中率多高)。过去的痛点:「配置空间大到无法系统性的去调整,工程师只能靠宽泛的经验法则。」现在的做法:有了 Codex 里的 GPT-5.6,团队能直接分析生产环境的工作负载,生成并评估候选配置,为每一种特定场景给引擎和模型做「超级优化」,从相同硬件里榨出更多有用的推理能力。随后主播总结推理优化的方法论闭环(这是全篇方法论浓度最高的一段):测量生产表现 → 找出最大差距 → 实施修改 → 验证这些修改是不是真的提升了整个系统,而不是只在某个跑分测试里好看。GPT 5.6 和 Codex 加速了循环里每一个环节,让团队能尝试更多点子、更快响应负载变化,最终造出延迟更低、容量更大、成本更低的推理系统。
第 7 段 07:19–08:38|第二大板块开场:代理控制框架与乘数效应
转入文章的第二大板块:agentic harness 怎么精简重复工作。先给场景:ChatGPT 工作版和 Codex 完成复杂任务时,要通过一连串模型请求和工具调用——单个回合里(从提要求到给回答),Codex 可能要去看源代码、搜索部署历史、读故障报告、修改文件、最后跑测试。每一步都要发请求、准备上下文、传输数据、跑推理、调用工具、启动进程,全都要时间和算力。关键论证(乘数效应):「如果一个任务需要 30 次模型请求,那每次请求多花哪怕 1 秒,累积起来也是巨大的负担。所以,要提升整体性能,就必须减少整个系统里的重复工作。而不仅仅是让模型本身跑得快。」随后给出框架定位:这是一个用 Rust 语言写的编排层,负责把模型、工具和用户的环境连接起来;它通过避免上下文膨胀、加载工具和复用工作三条线让每次请求更高效,主讲两招。
第 8 段 08:38–09:16|框架第一招:避免上下文膨胀
问题:随着代理能用的工具、技能、插件和聊天历史越来越多,上下文窗口很容易膨胀——这不仅增加成本,还会让模型分心、引发不必要的推理。两个具体机制:① 延迟发现机制——只有在需要的时候,集成功能、自定义 MCP 工具、技能和插件才会「浮出水面」(即动态加载进上下文,而不是常驻);② 工具输出限额——防止单个工具意外把上下文窗口占满,除非模型自己要求不一样的限制,否则工具输出结果默认最多只能有 1 万个 Token。
第 9 段 09:16–10:15|框架第二招:为提示词缓存保留精确前缀
问题:在一个代理循环里,系统可能在单个回合里把同样的指令、聊天历史、工具定义和早先的结果一遍又一遍发给 GPU,处理这些重复输入非常贵。解法:提示词缓存复用之前处理过的前缀的计算结果。难在怎么保住前缀不被破坏,框架做了三个设计:① 所有模型可见的历史记录都当做只往后追加(append only)处理——新消息、工具结果、环境更新统统加在最后面,绝不插队插入到早先的上下文里;② 工具按确定的顺序呈现;③ 审批策略这类运行时设置在执行期间才去应用,而不是直接嵌死在工具定义里。效果(原话):正是这种设计选择,造就了 Codex 和工作版 ChatGPT 极高的整体提示词缓存命中率。
第 10 段 10:15–11:37|总结、展望与广告
总结(原话):「我们在 GPT 5.6 上看到的效率收益,是多年来在研究、推理系统和代理控制框架等整个技术栈上,一点一滴复合改进的结果。」GPT 5.6 自己在许多改进里扮演的角色,让 OpenAI 对未来优化的加速步伐非常乐观;未来还会继续在内核优化和基础架构等领域做更大改进,并期待把这些「引擎盖底下的进步」转化成更广泛、更划算的智能回馈用户和客户。最后是频道口播(欢迎订阅 AI 智识录)和广告:主播自己的 AI 创业产品 Unavi——能一键整合飞书、钉钉、腾讯会议、Plaud 和其他录音卡/录音豆,解读日常会议与沟通背后的深意、锁定关键信息的 Agent 应用,已正式上线;最新版支持直接给播客链接完成转写、总结、分析,甚至多个播客的关联解读。
道
- 「AI 优化 AI」的自我加速飞轮已经出现,这是比单个效率数字更重要的信号。GPT 5.6 不只是被优化的对象,还是优化的执行者:分析生产流量、重写内核、跑架构实验、监控训练、处理故障,很多环节全自动。为什么重要:人类工程师的带宽是线性的,AI 的实验带宽可以近乎无限扩张——优化这件事本身的成本被压低了。对我们意味着:效率迭代速度的差距会越拉越大,会用 AI 优化自己系统的团队,对不会用的团队是降维打击。
- 算力短缺是常态约束,效率从「工程问题」上升为「战略问题」。原话是「模型的需求增长速度远远超过了算力容量的增长速度」,这不是周期性短缺,而是结构性缺口。所以 OpenAI 把「不牺牲聪明度、响应速度、可用性、稳定性的前提下榨出更多 token」定为推理系统的核心目标。对应用层意味着:上游会持续降价提质,但短期内成本敏感的产品设计仍然是必修课。
- 系统观大于单点观:瓶颈永远在链条最弱的一环。主播的餐厅比喻(大厨再强,接单乱、传菜慢照样完蛋)说的就是 Amdahl 定律的通俗版——模型本身高效,但路由烂、GPU 闲置、数据搬运慢,整体照样又贵又慢。OpenAI 因此在路由、调度、内核、缓存、模型实现逻辑五个层面同时下手。对我们意味着:做性能优化前先画全链路图找瓶颈,别盯着一个环节猛改。
- 复利思维:效率收益是无数小改进的乘积,不是银弹。全篇反复强调「每个小优化只快一点点,成百上千个叠加产生质变」,结尾又收在「多年来一点一滴复合改进的结果」。为什么重要:它解释了为什么这种领先难以被单点抄袭——你可以抄一个技巧,抄不走整个改进体系和迭代速率。对我们意味着:建立自己的持续优化机制,比追逐任何单个技巧都值钱。
- 乘数效应决定 Agent 产品的成本结构。30 次请求 × 每次浪费 1 秒 = 任务级灾难,所以 Agent 系统的优化重点是「减少重复工作」而非单次推理速度。这是 Agent 产品和传统单轮 API 调用在成本工程上的本质区别。对我们意味着:我们做的正是多轮 Agent 产品,这个视角必须内置到每个功能的设计评审里。
法
- 三层分层优化框架:模型 / 推理 / 代理控制框架。OpenAI 把整个系统的优化空间切成三层来分别攻关,互不混同。为什么重要:分层让每层的优化目标、度量指标和负责手段清晰化,避免「什么都想优化等于什么都没优化」。细节:模型层本次没展开,重点是推理层(四个杠杆)和框架层(两招)。对我们意味着:给自己的产品做性能审计时也可以按「模型选择 / 调用效率 / 编排层开销」三层分别列问题清单。
- 推理优化四板斧:负载均衡 → 前向传播 → 推测解码 → KV cache 配置。四个杠杆按系统层次从外到内:先把请求派对地方(全球/集群/实例三级),再让单次计算不空转(消除内存移动和同步等待),再改变计算方式本身(草稿模型先猜、大模型并行验证),最后按负载特征定制缓存配置。为什么重要:这是一个可复用的检查清单——任何推理服务的成本问题都可以沿这四个方向排查。对我们意味着:虽然我们不用自建推理,但选 API 供应商、评估自建 vs 调用的边界时,这四条就是尽调问题。
- 「生产驱动」的持续反馈循环:测量生产表现 → 找最大差距 → 实施修改 → 全链路验证。特别强调最后一步:验证改动是否真的提升了整个系统,「而不是只在某个跑分测试里好看」。为什么重要:这是对「benchmark 驱动开发」的明确否定——局部指标好看的优化可能是全局负收益。细节:GPT 5.6 和 Codex 加速了循环的每一环,循环转得越快,能试的点子越多,形成第二个复利。对我们意味着:我们的 prompt 迭代、模型选型也该按这个循环跑,用线上真实任务评估,而不是拍脑袋或看 demo 效果。
- 把「配置空间搜索」变成 AI 可执行的实验问题。KV cache 配置空间大到人类只能凭经验法则,OpenAI 的破法是让 AI 分析生产负载、生成候选配置、评估效果、按场景定制。方法论本质:凡是「空间太大、人类搜不动」的问题,都可以尝试交给 AI 做系统化搜索。细节:草稿模型的「成百上千次架构实验」也是同一套路。对我们意味着:我们自己产品里的 prompt 变体、召回参数、chunk 大小等调参问题,都可以照这个思路办「AI 自动实验」。
- Agent 框架设计两条军规:抑制上下文膨胀 + 保住缓存前缀。前者管「别给模型塞垃圾」(延迟发现、输出限额),后者管「别浪费算过的账」(append-only、确定性顺序、运行时配置外置)。为什么重要:这两条直接同时决定成本和效果——上下文越脏模型越分心,前缀越碎缓存越废。对我们意味着:这是可以直接照抄到我们 Agent 编排层的设计原则,零研究成本。
术
- 让 AI 找派单不平衡的源头:GPT 5.6 分析生产流量 → 定位被忽视的负载不均 → 测试新路由策略 → 持续调规则。细节:派单分全球(地理位置、空闲容量、加速器类型)、集群(实例负载、上下文长度、缓存可用性)、实例(加速器、子网络、计算核心)三级。为什么值得学:它演示了「AI 做 A/B 实验科学家」的完整闭环。对我们:我们也能让 Agent 分析自己的调用日志,找出哪类请求最贵、哪条链路最慢。
- AI 全自动重写生产级内核代码:前提是先教会它 Triton 和 Gluon 这两门 GPU 编程语言,然后它在 Codex 里全自动重写并优化线上最底层内核。结果是端到端服务成本砍 20%——注意是「端到端」,不是某个 kernel 的 micro-benchmark。对我们意味着:AI 写底层高性能代码已经过了玩具阶段,我们产品里的性能热点(比如转写 pipeline、检索索引)值得让 coding Agent 试试重写。
- AI 生成 + 形式化验证的兜底模式:团队专门投入做验证工具,用开源的 FP3 验证 AI 写的内核数学上对不对。为什么重要:这是敢让 AI 动生产代码的前提——信任来自可验证,不来自模型变聪明。对我们意味着:把 AI 引入关键路径时,必须同时投资「自动验证器」(测试、校验、回归集),验证器越硬,AI 能放权的范围越大。
- AI 全生命周期管理草稿模型:自己设计并运行成百上千次架构实验(尺寸、结构、特征),还包揽训练的启动与监控,硬件故障或不稳时自动介入。效果:token 生成效率提升超 15%。细节亮点是「连训练运维都包了」——这已经是 MLOps 自动化。对我们意味着:fine-tune 或小模型蒸馏这类工作,未来也可以大部分委托给 Agent 看管。
- 延迟发现(lazy discovery):集成功能、自定义 MCP 工具、技能、插件只在需要时才加载进上下文。解决的是「工具越接越多、system prompt 越来越胖」的通病。对我们意味着:我们接的数据源(飞书/钉钉/腾讯会议…)越来越多,工具描述应该按任务阶段动态注入,不能全量常驻。
- 工具输出默认 1 万 token 上限:除非模型主动要求别的限制,单工具输出最多 1 万 token,防止某个工具把上下文窗口撑爆。细节:是「默认上限 + 模型可申请例外」,不是硬截断。对我们意味着:会议全文、长文档这类输出必须默认截断/分页,让模型自己决定要不要更多。
- Append-only 上下文:所有模型可见历史(新消息、工具结果、环境更新)一律追加到末尾,绝不插入到早先上下文中——因为前缀动一个字,后面的缓存全废。这是三条设计里的核心。对我们意味着:review 一下我们拼 prompt 的代码,任何「往历史中间插内容」的写法都在烧钱。
- 确定性工具顺序 + 运行时配置外置:工具按确定顺序呈现(顺序乱前缀也变);审批策略等运行时设置在执行时才应用,不嵌死在工具定义里(嵌死意味着定义变、缓存炸)。为什么重要:这两条说明缓存命中率是「设计出来的」,不是模型给的。对我们意味着:prompt 模板里任何动态内容(时间戳、随机 ID、用户特定配置)都要放到前缀之后。
- Rust 写编排层:agentic harness 是 Rust 实现的编排层,连接模型、工具和用户环境。为什么提:说明 OpenAI 对编排层的性能和可靠性要求按基础设施标准做,不是脚本级。对我们意味着:编排层的技术选型值得认真对待,它是要扛所有请求热路径的。
器
- GPT 5.6:本次主角。OpenAI 宣称「有史以来最高的每个 token 的智能效率」,并亲自参与了自身推理和框架的大量优化环节。逐字稿里的「SOL / SO / Soo」是转写谐音,指的应是在 Codex 中运行的 GPT-5.6(具体内部代号以 OpenAI 原文为准)。
- Codex:OpenAI 的编程 Agent 产品。本次它的角色是「优化的执行环境」——GPT 5.6 在 Codex 里运行,完成流量分析、内核重写、实验运行等任务。它本身也是代理控制框架的服务对象。
- 工作版 ChatGPT(ChatGPT 企业/团队版):与 Codex 共用代理控制框架,同样受益于上下文精简和高缓存命中率。
- Agentic harness(代理控制框架):OpenAI 内部用 Rust 写的编排层,负责连接模型、工具和用户环境,是 Codex / 工作版 ChatGPT 跑复杂多步任务的底座。本次第二大板块的主角。
- Triton:OpenAI 维护的开源 GPU 编程语言,让开发者不写 CUDA 也能开发高性能内核;GPT 5.6 被专门训练过用它写和优化内核。
- Gluon:OpenAI 维护的另一门开源 GPU 编程语言(较新),与 Triton 并列提及,同样用于内核开发。
- FP3:开源工具,用于验证 AI 生成的内核代码的数学正确性,是「AI 写代码 + 机器验证」模式的关键一环。
- MCP(Model Context Protocol):模型上下文协议。文中提到自定义 MCP 工具走延迟发现机制,需要时才加载——说明 MCP 生态工具多了之后也要治膨胀。
- Unavi(播客广告,非 OpenAI 内容):主播的 AI 创业产品,整合飞书/钉钉/腾讯会议/Plaud 等录音源做会议解读的 Agent 应用,支持播客链接转写、总结、多播客关联解读。与我们业务场景高度相近,建议作为同类产品持续观察。
势
- 推理成本进入陡峭下降通道,应用层红利持续释放。内核降 20%、推测解码提效 15%+,再加缓存和调度优化,而这些只是 OpenAI 公开承认「还会加大投入」的方向。为什么重要:单位智能价格下降会直接改变应用层的产品可行性边界——去年亏本的 Agent 流程,今年可能有毛利。对我们意味着:做产品规划时可以给「推理成本」假设一个年度下降曲线,而不是按现价线性外推。
- 「AI 优化 AI」飞轮将拉开头部与追随者的迭代速度差。当优化工作本身被 AI 加速,头部厂商的效率迭代从「人速」变「机速」,OpenAI 自己也明说「非常乐观」。为什么重要:这是马太效应的新机制——领先者不只模型强,改进模型的方式也更强。对我们意味着:押注底座时要看厂商有没有这种自我加速能力;同时我们自己也要尽快建立小一号的飞轮。
- 竞争维度从「模型能力」扩展为「智能 + 效率」双前沿。OpenAI 官方叙事就是「前沿的智能与前沿的效率融合在一起」。为什么重要:同样的智能水平,谁的推理便宜、延迟低,谁就能开到更大的市场。对我们意味着:评估模型供应商不能只看 benchmark 分数,要看价格、延迟、缓存计费方式这些「效率参数」。
- 算力短缺常态化,让「效率工程」成为长期值钱的 know-how。需求增速持续压过容量增速,效率优化能力本身就是稀缺竞争力。为什么重要:推理系统工程人才、成本优化经验会持续溢价。对我们意味着:团队里至少要有人系统性懂成本工程,这会是面试和培养的重点方向。
- 上下文工程与缓存设计成为应用层的显性杠杆。前缀缓存命中率高 = 直接吃厂商的缓存折扣 + 更低延迟,这是应用侧不用求人就有的成本武器。为什么重要:它把「系统设计能力」直接换算成「单位经济模型」。对我们意味着:缓存命中率应该上我们的监控看板,和 DAU 一样天天看。
- 风险提示:自建/自研推理基础设施的门槛被进一步抬高。头部把效率做到这种深度后,中小团队自建推理的性价比越来越差。对我们意味着:坚持「应用层创新」定位,把工程火力集中在场景、数据和编排层,不重复造推理轮子;但保留对开源推理栈的跟踪,防止供应商锁定风险。
对我们业务的启发
- 把「前缀缓存命中率」当成一等 KPI,并照抄 OpenAI 的三条保前缀设计:append-only 拼上下文、工具定义确定性排序、运行时配置(时间戳、用户配置、审批策略类动态内容)放前缀之后、不嵌死在工具定义里。建议本周就 review 一遍 Agent 循环里每次请求拼 prompt 的代码,把任何「往历史中间插内容」的写法改掉——这是零模型成本、纯工程改动就能省的钱。
- 工具输出设默认上限(参考 1 万 token),并让模型可申请例外:我们的会议全文、文档全文场景完全适用——默认给截断版/摘要版,模型需要更多再翻页。既控成本,又防长上下文把模型注意力冲散。
- 工具与数据源描述走「延迟发现」,别全量常驻 system prompt:随着接入飞书/钉钉/腾讯会议等数据源增多,工具定义按任务阶段动态注入;同时把这套机制和缓存前缀设计对齐(动态注入的位置要在可变段,别破坏前缀)。
- 用生产数据反向驱动配置与选型:记录真实请求的 prompt 长度分布、轮次分布、缓存命中率、成本分布,用这些数据调整上下文组装策略和模型路由(长任务/难任务用大模型,起草/验证类用小模型——这就是推测解码思想在应用层的翻版:小模型起草、大模型把关)。
- 把 AI 用在「优化我们自己的系统」上,建一个小号自我优化飞轮:每周让 coding Agent 跑一次「找出系统里最贵的请求/最慢的链路」的分析任务;prompt 变体、chunk 大小、召回参数这类「空间大、人懒得搜」的调参问题,交给 Agent 跑自动实验。GPT 5.6 自己改内核是顶配版,我们做平替版。
- 投资「自动验证器」,换取对 AI 的更大放权:OpenAI 敢让 AI 重写生产内核,靠的是 FP3 这类数学验证兜底。对应到我们:评估集、回归测试、输出校验做得越硬,就越敢让 Agent 自动改 prompt、改代码、改配置。验证器先行,自动化随后。
- 按「模型 / 调用 / 编排」三层做定期成本审计:照搬 OpenAI 的分层框架,每层单独列问题清单和指标(模型层:选型与价格;调用层:缓存命中、重复发送;编排层:轮次数量、工具开销),避免优化只盯一处。
- 跟踪同类产品 Unavi 的动态:它也是「多平台会议源 + 播客链接转写总结 + 关联解读」的 Agent 定位,与我们业务高度重叠,建议纳入竞品观察清单,定期对比功能和叙事。
值得记住的知识点
- 推理(Inference):模型运行生成回答的过程。训练是一次性投入,推理是每次请求都在烧钱,所以它是成本优化的主战场。
- 前向传播(Forward pass):把输入变成下一个词预测的核心数学计算过程。单次运算快不等于整体快——多余的内存搬运和同步等待会让 GPU 空转。
- 内核(Kernel):在 GPU 上跑的底层计算程序,决定硬件利用率,是推理优化最底层的一环。
- Triton / Gluon:OpenAI 维护的两门开源 GPU 编程语言,降低高性能内核开发门槛;GPT 5.6 被训练过用它们写内核,才有了「AI 全自动重写内核」。
- 推测解码(Speculative decoding):小草稿模型先猜几个 token,大模型并行验证,接受就一次产出多个 token,绕开一步步顺序生成的昂贵计算。本次靠 AI 改进草稿模型,效率提升超 15%。
- KV cache(键值缓存):生成时保存中间注意力计算结果的缓存,避免每生成一个词都把整段历史重算。配置(批处理、分片、管理策略)高度依赖负载特征,过去只能凭经验,现在 OpenAI 让 AI 按场景定制。
- 提示词缓存 / 前缀缓存(Prompt caching):重复发送的相同前缀(指令、历史、工具定义)可复用之前的计算结果,省算力省钱。前提:前缀必须一字不差——往中间插一个字,后面缓存全失效,所以要 append-only。
- 缓存命中率:请求中被前缀缓存覆盖的比例。越高则重复计算越少、成本和延迟越低。Codex 和工作版 ChatGPT 靠框架设计拿到「极高」命中率。
- 负载均衡(Load balancing):把请求派给合适服务器的调度策略,分全球(地理位置/空闲容量/芯片类型)、集群(实例负载/上下文长度/缓存可用性)、实例(加速器/子网络/计算核心)三级。派单派得好,同样硬件能服务更多请求。
- Agentic harness(代理控制框架):包裹模型外的编排层,串起模型、工具和用户环境,管理多轮请求与工具调用。OpenAI 的这个用 Rust 写。
- 上下文膨胀(Context bloat):工具、插件、聊天历史越积越多把上下文窗口撑爆,既贵又让模型分心。对策:延迟发现 + 输出限额。
- 延迟发现(Lazy discovery):工具/插件/技能不提前全量加载,只在真正需要时才进入上下文。
- 乘数效应:Agent 任务一次要几十次模型请求,单次请求的微小浪费乘以请求次数就是巨大开销——所以 Agent 系统优化要盯「减少重复工作」,不只是单次推理速度。
- FP3:验证 AI 生成内核代码数学正确性的开源工具,代表「AI 生成 + 自动验证」的可靠落地模式。
- 复利式优化:单个优化只快一点点,成百上千个叠加产生质变——GPT 5.6 效率收益的本质,也是技术领先难以被单点抄袭的原因。