今日精读:模型竞争从最强转向更便宜、更快、更可控
😺 Why Gemini 3.7 Flash just got half price
The Neuron 把当天 AI 模型更新概括成一场“价格、速度、灵活性”的同日竞争:Google 发布半价的 Gemini 3.7 Flash,OpenAI 预览 GPT-5.6 Sol 的 Ultrafast 模式,DeepSeek 发布 V4-Pro 并加入可调 thinking level 与低谷定价。它的核心判断是,企业真实使用正在从追逐最聪明模型,转向把高性价比模型用于日常自动化,把最强模型留给真正需要的任务。
这封 newsletter 最值得精读的部分,是它没有把 Google、OpenAI、DeepSeek 的更新看成孤立发布,而是放在同一条竞争轴上:AI 模型市场正在从“benchmark 第一”进入“生产可用性第一”。Google 的 Gemini 3.7 Flash 被描述为面向 coding 和 agent 的 workhorse 模型,重点不是刷新最强智力上限,而是在更低价格下提升开发任务与文档理解能力;文中提到它在一个编码 benchmark 上从 34% 提升到 44%,在 dense document 阅读测试中从 22% 提升到 34%。OpenAI 的 Ultrafast 则走另一条路:不换小模型,而是在 GPT-5.6 Sol 上通过 Cerebras 芯片把速度提升到最高 750 tokens/s、最多 14 倍,适合欺诈检测、实时客服这类延迟直接影响价值的场景。DeepSeek 的 V4-Pro 更强调可控性,允许开发者按任务调节 reasoning 强度,并用低谷价格降低运行成本。The Neuron 还用 Ramp AI Index 的例子提醒:即便 Anthropic 的 Fable 5 被称为最强模型,企业实际购买的 token 和 spend 占比也不高,说明“最聪明”并不自动等于“最常用”。对 builder 来说,这个判断非常关键:模型选择会越来越像系统架构问题,而不是品牌偏好问题。你需要按任务拆分:哪些请求要低成本批量跑,哪些需要低延迟响应,哪些值得用强推理模型,哪些可以靠插件、工具、验证器补足。真正的产品优势可能来自路由、缓存、评测、成本控制和用户体验,而不只是接入最新旗舰模型。
它把一天内多个模型发布抽象成一个更大的行业信号:模型能力进入可商品化阶段后,价格、延迟和可控性会成为实际采用的关键变量。
AI builder 需要把模型选择纳入产品架构:为不同任务设计模型路由、成本预算、延迟目标和 fallback,而不是默认用最贵或最强的模型处理所有请求。
- 01Google 发布 Gemini 3.7 Flash,主打 coding、agent 与更低价格。
- 02OpenAI 预览 GPT-5.6 Sol Ultrafast,最高 750 tokens/s、最多 14 倍速度。
- 03DeepSeek V4-Pro 加入可调 thinking level,并提供低谷更便宜的 pricing。
- 04企业实际采购不一定流向最强模型,成本和规模化使用正在改变模型竞争逻辑。
- 05模型市场可能进入“强模型负责关键任务,便宜快模型负责日常自动化”的分层使用阶段。
- — 你的产品里哪些任务真的需要最强推理,哪些只是需要便宜稳定地跑完?
- — 低延迟是否能改变某些 AI 产品体验,比如实时协作、客服、监控和交易场景?
- — 可调 reasoning 与 off-peak pricing 会不会让 agent 调度器变成新的基础设施层?
- — 评测模型时是否同时记录质量、速度、成本和失败恢复,而不是只看一次输出效果?
AI 工作流的新技能:从 prompt 到执行图
这封 Opinion AI 把“Graph Architect”定义为 prompt 之后的重要 AI 工程技能:不是改一句提示词,而是重新设计任务如何流动、哪些步骤并行、哪些节点要验证、失败如何返工、什么动作需要人工批准。文中用 Anthropic 多 agent 研究系统的例子说明,执行图设计可能带来显著能力提升和时间缩短,但也可能带来约 15 倍 token 成本,因此关键不是盲目上多 agent,而是区分真实依赖和伪依赖。
它抓住了 agent 产品化的核心问题:能力不只来自模型,而来自任务拆解、并行、验证、修复和权限边界。
- — 执行图描述的是 work 的依赖关系,不是知识图谱里的信息关系。
- — 好的 graph 能并行研究、独立检查、路由不同模型,并支持失败修复。
- — 多 agent 能力提升可能伴随显著 token 成本,必须判断何时不该使用 graph。
ChatGPT Computer History、Cursor 并入 SpaceX 与 Grok 构建能力
AI Valley 今天关注桌面级 AI 助手与编码 agent:OpenAI 将 Chronicle preview 替换为 opt-in 的 Computer History,记录 Mac 上的点击、输入、应用切换和可访问性事件,并生成本地摘要供 ChatGPT 与 Codex 理解上下文、自动化重复任务;同时称 Cursor 已被 SpaceX 收购并加入 SpaceX AI 团队,Grok 4.6 也更强调 coding、research、long-running agents 和 visual projects。邮件还提到 Gemini 3.7 Flash 降价与一批 trending tools。
Computer History 指向 AI 助手从聊天框走向操作系统上下文,能显著提升自动化能力,也会把隐私和权限问题推到前台。
- — Computer History 是 opt-in,跟踪桌面活动并生成本地摘要。
- — 邮件称 Cursor 加入 SpaceX AI 团队,将参与 Grok、Grok Build、Grok Bot、Grok API 和 Cursor。
- — Grok 4.6 被描述为更擅长构建、测试和多步改进。
TLDR AI:Gemini 3.7、Ultrafast、Anthropic 估值与 agent 风险
TLDR AI 汇总了当天模型、资本和 agent 基础设施新闻:OpenAI 预览 GPT-5.6 Sol Ultrafast,Google 推出面向 coding 和 agent 的 Gemini 3.7 Flash 并在年底前半价,投资者预期 Anthropic IPO 估值可能超过 2 万亿美元。深度文章部分关注 Anthropic 基建融资是否会限制 AI compute、AI agents 大规模交互可能带来的系统性失败,以及递归 subagents 为什么应被设计成 dependency graph。工程部分还提到 Agent Plugins、Cursor cloud agents 预构建环境和 OCR 4.1。
它把模型发布、融资能力、agent 风险和插件化生态放在一起,展示 AI 产业正在同时扩张能力、资本和复杂性。
- — Gemini 3.7 Flash 年底前 API 价格为每百万 input tokens 0.75 美元、output tokens 3.75 美元。
- — Anthropic 相关内容同时覆盖高估值预期、基建融资和 agent 系统性风险。
- — Agent Plugins 试图把 skills 与 MCP 依赖打包成可移植标准,但认证问题仍未解决。
TLDR Design:Figma Make 省时实验、AI 设计治理与 LLM 偏见
TLDR Design 今天的 AI 相关重点在设计工具如何被量化、治理和审查:Figma 数据科学团队用 100 人 RCT 测量 Figma Make,发现整体设计工作快 20%、容易 16%,PM 收益尤其明显;另一篇讨论 AI 进入设计工作流后,组织需要数据分类、供应商评估、可追溯和 CI/CD 控制;LLM 偏见文章提醒设计师不要把 AI 生成的 persona、研究摘要和建议当成客观结论。非 AI 部分包括 Instagram 字标、Pixel 设备、iPhone Ultra 摄像头泄露和若干设计工具。
设计 AI 不再只是生成 UI,而进入可量化效率、数据治理、偏见审查和组织流程控制阶段。
- — Figma Make RCT 显示整体快 20%、容易 16%,PM 在简单任务中收益最大。
- — AI 设计治理需要明确数据、责任、供应商与工作流控制。
- — LLM 输出可能放大主流群体视角,设计师应把它当输入而非结论。
TLDR:OpenAI Ultrafast、X 开源算法与 DeepSeek Harness
TLDR 主刊重点报道 OpenAI 的 Ultrafast API tier:GPT-5.6 Sol 最高 750 output tokens/s,是 Standard 的 14 倍,初期只向部分客户开放,并由 Cerebras 支撑。其他重点包括 X 以 Apache v2 开源 For You 算法和核心 ranking engine,并计划让用户查看账号或帖子是否受到 ranking 系统影响;DeepSeek Harness 进入 developer preview,以插件化方式组织模型、工具和能力,并用 append-only session log 记录模型看到的一切。邮件还介绍了 Foreman 这类把 AI agents 放入软件开发各站点的“软件工厂”。
这封同时覆盖了低延迟模型服务、平台算法透明化和可组合 agent harness,都是 AI 产品走向生产系统的关键基础设施。
- — OpenAI Ultrafast 初期限制客户使用,后续随 capacity 扩大再推广。
- — X 开源 ranking 相关代码,并试点账号影响查看工具。
- — DeepSeek Harness 强调插件化和完整 session log。
TLDR Dev:模型选择成本差异、上下文压缩与理解成为瓶颈
TLDR Dev 的核心是开发者如何在 AI 编码时代做更理性的工具选择:一篇文章用同一 prompt 测试 11 个模型生成网页,显示质量和 credit 成本差异巨大,DeepSeek V4 Flash 与 GPT-5.6 Sol low effort 在特定静态网站任务上性价比较突出;另一篇解释 coding agents 中 compaction 如何把长对话压缩成较小上下文,避免超出窗口;观点文章强调 AI 能更快地产生代码后,人类理解代码、参与创造和团队讨论反而成为瓶颈。工具部分包含 Gemini 3.7 Flash、DeepSeek Harness 和 Cerebras/OpenAI Ultrafast。
它把模型评测从抽象能力拉回到具体任务、成本和团队理解能力,适合实际做 AI coding workflow 的人参考。
- — 同一网页生成任务下,不同模型的效果和 credit 成本差异很大。
- — Compaction 是长时间 coding agent 会话延续的关键机制。
- — AI 生成代码越快,人类理解和协作越成为系统瓶颈。
TLDR Product:AI 时代产品瓶颈从实现转向判断、决策和规格
TLDR Product 今天的主线是 AI 降低生产成本后,产品组织真正的约束转向判断、意图和决策:AI competence/judgment gap 指出 AI 扩大产出速度,但人类判断质量、专业性和责任的能力没有同步扩大;roadmap 文章建议在 AI 减少实现瓶颈后,路线图应围绕未解决决策而不是日期;spec-driven development 则认为,当代码生成更便宜,活的、版本化的产品规格应成为 source of truth。其他文章还讨论如何定义 value、如何完成项目最后 10%、如何做 demo,以及 AI 写作带来的作者身份问题。
它提醒产品团队:AI 不会自动解决产品管理,反而会放大策略、判断、规格和审查的缺口。
- — AI 提升产能后,质量判断和 accountability 成为更大问题。
- — 路线图可以从日期驱动转向决策驱动。
- — Spec-driven development 把活规格作为生成和验证代码的中心。