今日精读:GPT-5.6 降价背后的推理成本曲线
[AINews] GPT 5.6 price cut by 20%-80%: Cost of GPT 5.4 Intelligence dropped 13x in 4 months due to GPT 5.6 recursi…
AINews 以 OpenAI GPT-5.6 降价为主线,讨论“同等智能成本”是否仍在高速下降。邮件指出,OpenAI 不只是简单降价,而是通过推理加速、自优化生产内核、改进 speculative decoding、优化 KV cache,以及在 Codex 和 ChatGPT Work 等 agentic harness 中减少上下文膨胀、提高 prompt cache 命中率,降低了实际服务成本。核心判断是:如果只看非微调场景下的高性价比智能,OpenAI 当前很难被击败。
这封 AINews 最值得精读的地方,不是“OpenAI 降价”这个表层新闻,而是它把降价解释为一条仍在陡峭下行的智能成本曲线。邮件回顾了一年前的观察:在 LMSys Elo 等能力水平相当的前提下,GPT-4 级别智能的价格曾在 18 个月里下降约 1000 倍。当时外界可能以为那只是早期优化红利,来自从 completion 到 reasoning、从 dense 到 MoE、从未优化到工程化部署的一次性收益。但 GPT-5.6 的新一轮降价让作者认为,这条曲线还没有明显变平。 邮件给出的关键事实是,OpenAI 近期公布了 GPT-5.6 服务侧优化:Sol 被用于分析生产流量、调整负载均衡,并自动改写 Triton 和 Gluon 生产内核,据称将端到端 serving 成本降低 20%;改进 draft model 和 speculative decoding 后,token 生成效率提升超过 15%;同时针对 Codex 等工作负载优化 KV cache、batching 与 sharding。更重要的是,OpenAI 还优化了 agentic harness:工具、技能、插件按需暴露,工具输出默认限制在 10000 tokens,模型可见历史保持 append-only,以提高 prompt prefix cache 的复用率。 作者随后把这些工程优化与价格变化联系起来:Luna 的新价格达到每百万 input tokens 0.20 美元、output tokens 1.20 美元,而它在某些能力点上接近几个月前 GPT-5.4 full 的水平;后者当时价格是 input 2.50 美元、output 15 美元。由此得出的判断是,约四个月内,OpenAI 把三四月份旗舰级能力以约十三分之一的 token 价格卖出。 对 builder 来说,这意味着许多原本因成本不成立的 agent、多轮工作流、自动化代码审查、批量知识处理任务,可能会重新进入可行区间。但邮件也提醒,这种估算需要打折看待,因为公开 benchmark 可能被训练或优化影响。另一层含义是,开源模型仍在控制权、主权、可部署性上有价值,但若目标只是便宜地调用强模型完成通用任务,闭源 API 的工程化推理效率可能继续形成强势竞争。
这篇把模型价格、推理工程和 agent harness 放在同一张成本曲线上看,直接影响 AI 产品的单位经济模型。它提醒 builder:模型能力进步之外,服务系统和上下文管理同样会改变可做产品的边界。
短期看,多轮 agent、代码自动化和知识工作流的成本压力会下降。中期看,模型选择会从“谁最强”转向“在目标任务上谁的真实每任务成本最低”。
- 01OpenAI 将 GPT-5.6 Luna 价格大幅下调,并推出更快的 Sol 推理模式。
- 02GPT-5.6 Sol 被用于优化生产流量、负载均衡和生产内核,邮件称带来 20% 的端到端 serving 成本下降。
- 03speculative decoding、KV cache、batching、sharding 和 prompt caching 共同降低了推理成本。
- 04AINews 认为 Luna 当前价格下提供了接近数月前旗舰模型的能力,显示同等智能价格继续快速下降。
- 05开源模型仍有主权与控制权优势,但通用非微调智能的性价比竞争正在被 OpenAI 拉高门槛。
- — 看降价时不要只看 token 单价,要看每个真实任务需要多少轮、多少上下文、多少工具调用。
- — 关注 OpenAI 的优化是否主要来自工程红利,还是可持续的模型自优化循环。
- — 评估自建开源模型时,应把运维、延迟、缓存、可靠性和数据边界一并计入成本。
- — 对 agent 产品,harness 设计可能和底层模型选择一样重要。
AI 工程从提示词走向上下文、harness、循环和图
Opinion AI 讨论 AI 工程范式的变化:真正的提升不一定来自新模型,而来自模型周围的系统。文章用 GPT-5.6 Sol 在长程评测中从标准 harness 的 13.3% 提升到加入保留推理和更好上下文压缩后的 38.3% 作为例子,说明上下文工程、harness 工程、循环工程和图工程正在接替单纯提示词,成为构建可靠 agent 的关键。
它给 AI builder 一个清晰框架:提示词只是最内层,真正决定长期任务表现的是记忆、工具、权限、验证、循环和多 agent 协作结构。
- — 同一个模型在不同系统设置下,长程任务表现可能差距巨大。
- — prompt、context、harness、loop、graph 分别控制越来越大的工作单元。
- — 可靠 agent 需要真实完成条件和外部验证,而不是模型自称完成。
TLDR AI:Inkling-Small、GPT-5.6 降价与 agent 基础设施
TLDR AI 覆盖了多条模型和 agent 基础设施新闻:Thinking Machines 发布 276B 参数、12B active 的 Inkling-Small,保留多模态推理、可变 thinking effort 和 100 万 token 上下文;OpenAI 下调 GPT-5.6 Luna 与 Terra 价格并提升 Sol API 速度;Gemini Robotics ER 2 强化机器人自动化。深度内容还包括 WASTE 推理引擎让大于本机内存的模型在本地运行、Cursor 如何为 coding agent 构建云环境、企业 AI 项目如何从“agent graveyard”走向生产,以及开放权重模型在监管和临床任务上接近闭源模型。
这封邮件集中反映了三条并行趋势:强模型更便宜、小模型和开源推理更可部署、agent 工作环境正在工程化。
- — Inkling-Small 以 12B active 参数提供大上下文和多模态推理。
- — WASTE 试图让大模型在更小硬件上运行,首个完整支持模型是 Kimi K3。
- — Cursor 的云环境优化让 agent 贡献的合并 PR 比例显著提高。
TLDR Design:AI 时代的信息架构、协作 UX 与生成式创作工具
TLDR Design 的 AI 相关重点是信息架构:文章认为 AI 幻觉和错误答案很多时候不是模型弱,而是内容标签、结构和检索体系混乱,AI 会把这些问题放大成可度量的错误和责任。邮件还提到 Google Lyria 3.5 提升音乐生成的旋律、歌词和人声真实感,OpenAI 首款硬件可能更像带屏智能家居设备;设计方法上则总结 Figma 的多人协作、评论和链接分享如何推动采用,以及界面重排动画如何降低用户迷失感。
对 AI 产品设计者来说,信息架构从后台内容治理问题变成了模型输出质量问题。
- — 差的信息架构会直接增加 AI 检索错误和幻觉率。
- — Lyria 3.5 提升音乐生成质量和控制能力。
- — OpenAI 硬件被传可能走智能家居屏幕设备路线。
TLDR Dev:stacked PR、AI 代码库重构经济学与 coding agent 工作流
TLDR Dev 重点覆盖 GitHub stacked pull requests 公开预览,它允许大变更拆成可独立审查的小 PR,并可整体合并。邮件还关注 AI 生成代码库的重构经济学:一次重构让后续更新 token 消耗减少 83%,说明结构化代码对 AI 开发成本很关键。其他内容包括 2026 年 LLM 编程更接近 2 倍而非 10 倍效率提升、computer use 仍未解决、World Model Optimizer 用 trace 优化 agent 模型,以及 tmux 中管理 coding agent session 的 Agent Manager。
它把 AI 编程从“模型能写代码”推进到“代码库、PR 流程和 agent session 怎么组织才便宜、可审、可持续”。
- — GitHub stacked PR 支持把大功能拆成多个聚焦变更。
- — 重构 AI 生成代码库可显著降低后续 token 消耗。
- — coding agent 工具链正在围绕 trace、session 管理和闭环训练成形。
TLDR:OpenAI 降价、Stripe 知识 AI 平台与 GitHub stacked PR
TLDR 的主线横跨大科技、AI 成本和企业知识系统。AI 相关最重要的是 OpenAI 将 Terra 降至每百万 input tokens 2 美元、output tokens 12 美元,Luna 降至 input 0.20 美元、output 1.20 美元,以回应客户对成本更敏感的现实;Sol 价格不变。开发者侧,GitHub stacked PR 进入公开预览。企业应用侧,Stripe 的 Kai 知识 AI 平台支持员工查询数据仓库、销售前研究账户、事故分诊、收入建模和合规审查,显示大公司内部 AI 平台正在深入具体工作流。
这封邮件把 AI 的两端放在一起:底层模型调用变便宜,企业内部工作流平台变更具体。
- — OpenAI Terra 与 Luna 降价,Sol 价格保持不变。
- — Stripe Kai 已覆盖多类员工日常工作流。
- — GitHub stacked PR 与 TLDR Dev 内容形成重复但重要的开发流程信号。
TLDR Product:AI 产品护城河、算力价格与 agent 入口
TLDR Product 聚焦 AI 对产品管理和产品形态的影响。邮件认为 AI 会把 PM 工作推向“决定做什么、怎么卖”,而不是单纯产出文档;未来护城河不只是更好模型,而是能快速集成、验证、部署和改进自治机器的工程系统。它还讨论算力可能因 AI 创造更多经济价值而变贵,导致低价值应用被挤出;以及当 AI 助手成为任务入口时,产品需要既能被 agent 理解和调用,也保留适合深度工作的原生界面。
它提醒产品决策者:AI 时代的竞争点正在从功能堆叠转向判断力、系统化迭代、算力效率和 agent 可调用性。
- — AI 强化 PM 的判断和商业决策责任,而不是替代这些责任。
- — 算力价格可能上升,影响 AI 应用的商业可行性。
- — 软件入口可能被聊天式 AI 折叠,产品需要面向 agent 可理解。
The Neuron:AI 基金撞上杠杆墙
The Neuron 的主文是 Leopold Aschenbrenner 的 Situational Awareness 基金在 AI 股票下跌后,将公开股票组合出售给 Citadel。邮件称该基金从 2024 年的数亿美元快速增长到超过 200 亿美元,押注 AI labs、芯片、电力、内存和数据中心,并通过借款放大收益;当 AI 股票下跌时,融资方要求追加现金或抵押品,导致被迫出售。它的核心教训是:长期 AI 叙事可能仍成立,但高杠杆会把短期波动变成强制卖出。
这是 AI 资本市场的一次风险教育:即便押中方向,融资结构也会决定你能不能活到 thesis 兑现。
- — Situational Awareness 保留私有投资,包括 Anthropic 持仓。
- — 公开股票组合据称被 Citadel 接手。
- — AI 股票随后反弹,使争议集中到杠杆和时点,而不只是 AI thesis 本身。