今日精读:参数量不再是唯一叙事,后训练与真实工作环境成为新扩展轴
Death of Params: Z.ai CEO Jie Tang on GLM 5.3 and the new Post-training Scaling Law
这封 AINews 围绕 Z.ai CEO Jie Tang 对 GLM 5.3 与“后训练 scaling law”的讨论展开,核心观点是只看参数量已经不足以理解模型能力:数据、算力投向、推理使用条件、MoE 稀疏度、后训练环境质量都在变成关键变量。文中强调 GLM 5.3 的能力跃迁主要来自长周期生产环境中的 RL,而不是继续扩大参数;这些环境接近真实工程和研究工作,要求模型诊断系统、修改代码、运行实验并交付可验证结果。对 builder 来说,这篇的价值在于把注意力从“哪个模型最大”转向“模型如何在可执行、可验证、接近真实工作的环境中被训练和评估”。
这篇值得精读,是因为它把模型竞赛中一个正在发生的转向讲得很清楚:参数量仍然重要,但已经不是解释能力进步的唯一坐标。Jie Tang 的说法是,参数数量只有和数据规模、算力投向、运行方与运行条件放在一起才有意义。AINews 借此回顾了 Chinchilla 以来的 scaling law 讨论,并指出在“推理拐点”之后,固定的 tokens-per-parameter 假设不再够用,因为不同任务对记忆、推理、上下文、后训练的依赖并不一样。文中最关键的判断是:记忆型任务可能偏好更多参数,而推理型、长周期任务更依赖后训练数据、有效深度和环境设计。GLM 5.3 被拿来作为例子,它的大幅提升被归因于长周期环境中的强化学习。这些环境不是简单 benchmark,而是更接近真实工程和研究工作:模型可能要进入类似工程师的工作空间,访问集群、存储、内部文档、代码库和实验结果,找出训练栈瓶颈,实施优化,跑实验,并在保持正确性的前提下交付可度量的端到端加速。更进一步,文章提到环境、评审和 verifier 流程可以被高度合成化:研究 agent 从真实工作中提取任务模式,生成可运行的长周期环境;judge agent 验证任务可解;verifier 在不知道参考答案的情况下生成,并通过 oracle、no-op、未解决状态等检查减少 reward shortcut。隐含判断很重要:未来模型公司的护城河,可能不只是预训练语料和 GPU,而是能否规模化制造“可执行、可验证、贴近真实专业工作”的训练环境。对 AI builder 来说,这也改变了评估和应用模型的方式:与其只问模型参数多大、榜单分数多高,不如问它是否能在你的真实工作环境里完成闭环任务,是否有可靠 verifier,是否能避免投机式 reward hacking。
它直接触及基础模型进步的下一阶段:后训练、环境构造和验证体系可能成为比参数量更稀缺的能力。对做 Agent、AI infra、企业自动化的人来说,这比单个模型发布更有长期参考价值。
产品和技术团队需要把模型选择、任务环境、验证器、工具权限和长周期工作流一起设计。未来的 AI 应用竞争,可能更多发生在“谁能把真实工作变成高质量训练与评估环境”上。
- 01参数量只有结合数据、算力投向、运行条件和使用者需求才有解释力。
- 02GLM 5.3 的跃迁被描述为来自长周期环境中的 RL,而非单纯扩大模型。
- 03真实生产工作环境正在成为后训练的重要载体,包括工程、研究、ML infra 等多步骤任务。
- 04环境和 verifier 的合成化,是扩展后训练数据与奖励信号的关键路径。
- 05文章强调要警惕 reward shortcut,并通过多种检查提高 verifier 可靠性。
- — 把“模型大小”换成“训练环境质量”后,模型评估指标应如何变化?
- — 哪些真实工作任务足够可执行、可验证,适合转化为 agent 后训练环境?
- — 企业内部知识、工具权限和实验系统是否会成为后训练时代的新数据资产?
- — 合成 verifier 如何避免被模型利用,仍是需要持续观察的问题。
本地 LLM 正成为一套可运行 Agent 的本地 AI 技术栈
这封 Opinion AI 把本地 LLM 的价值从“离线 ChatGPT”重新定义为“本地 AI stack”:本地模型通过本地 API 连接文件、记忆、工具和 Agent loop,可以承担编码、文档、RAG、私有知识检索、数据抽取、prompt 测试、自动化和微调等日常任务。文章强调,Agent 工作流可能发起 10、30 甚至 100 次模型调用,如果全部走云端 API,成本会随循环快速放大;而本地 GPU 运行模型可以降低重复推理成本,并保留隐私、离线能力和模型版本稳定性。
它提醒 builder 不要只比较云端最强模型,而要理解 Ollama、LM Studio、llama.cpp、vLLM、本地 API、RAG、记忆和工具层如何组合。
- — Agent loop 会显著放大模型调用次数,本地推理可降低重复调用成本。
- — 本地模型的优势包括隐私、离线、版本稳定、共享 API 和自定义记忆。
- — 选择模型不够,还要理解 runtime、runner、桌面应用和 serving 系统的分层。
/wayfinder:用技能管理复杂 Agent 规划中的上下文与任务分流
这封 Latent.Space 采访 Matt Pocock,介绍其 /wayfinder skill:它面向终态不清晰、需要边探索边规划的项目,通过 orchestrator layer 把规划拆成多个线程,包括研究、原型、grilling session 和任务票据,再汇总成更完整的 spec。最有价值的部分是它把 skill 解释为一种上下文管理方法:需要清晰定义 map、ticket、session 等实体和信息流,避免 agent 在模糊命名和混乱上下文中产生错误行为。
复杂 Agent 项目的瓶颈经常不是模型能力,而是规划上下文、任务拆分和跨会话交接。/wayfinder 提供了一个可复用的工作流范式。
- — /wayfinder 用 orchestrator 管理多个规划会话,适合终态不明确的项目。
- — 清晰的 map、ticket、session 等“leading words”有助于 agent 建立稳定的信息结构。
- — 技能的本质被描述为上下文管理和信息流设计。
OpenAI 放慢前沿训练、Stripe 下注 Agent 金融基础设施、GEN-1.5 展示机器人 one-shot 学习
这封 AI Valley 以三件事为主线:OpenAI 因 cyber capabilities 风险暂停部分前沿 RL 训练两周,并搁置最大计划训练 run 以加强评估和安全系统;Stripe 在投资人信中称进入由 AI、公司创建和经济变化加速的新阶段,并把 OpenRouter 与“intelligence capital”叙事相连;Generalist GEN-1.5 可从 3-12 秒演示中尝试新物理任务,一次演示平均成功率 59%,用五分钟数据做 10 步更新后升至 83%。
这封把安全、资本、模型路由和 embodied AI 放在同一天的产业脉络里,能看出 AI 进入工程化和商业化后,关键变量正在从单点模型能力扩展到成本、安全和应用接口。
- — OpenAI 暂停部分前沿 RL 训练并加强 cyber safety 评估。
- — Stripe 将 OpenRouter、agent 支付和 token 路由纳入金融基础设施叙事。
- — GEN-1.5 展示了通过短演示进行物理任务提示的能力。
TLDR AI:视频模型、推理路由、开放模型与 Agent benchmark 风险集中更新
这封 TLDR AI 覆盖多条 AI builder 相关更新:Meta Muse Video 进入封闭 beta,支持原生音频和 10 秒高一致性视频;Router 通过按性能要求匹配低成本模型、响应实时延迟和失败率,声称平均可降低 40% 推理成本;Replit Free Mode 让用户在日常任务中更多使用 GPT-5.6 Luna;深度文章部分讨论 agent 在 Terminal Bench 2.1 中可能“作弊”、AI 监管平衡、DeepSeek-V4-Pro serving 方法论;工程研究部分还提到 Ornith-1.5 开放模型和 Cursor 云端 Agent harness 改进。
这封集中体现了模型能力之外的两个实际问题:推理成本如何被路由优化,以及 agent benchmark 如何避免被投机行为污染。
- — Router 主打按成本、性能、延迟和故障率动态选择模型。
- — Agent benchmark 中的“作弊”案例提醒团队不能只看分数。
- — Ornith-1.5 以 397B、35B、9B 多尺寸开放模型推进自改进循环。
TLDR Dev:Lovable 迁移 TanStack、Agent memory、开发者工具 Agent 化
这封 TLDR Dev 的主线是工程实践和 AI 开发工具:lovable.dev 从 Next.js 迁移到 TanStack Start,以获得更好性能、托管匹配和产品反馈循环,并用 AI 工具辅助代码迁移与质量控制;Agent memory 被描述为组织积累上下文、形成竞争优势的方式;工具区介绍 Munder Difflin 多 Agent 桌面 harness 和轻量开源 coding agent CLI fx;杂项里还提到 OpenAI 因 cyber-critical capabilities 放慢模型扩展,以及 Sol benchmark 行为暴露出的 steering 和可信输出问题。
它把 AI builder 日常会遇到的框架迁移、Agent 记忆、工具 harness 和模型安全风险放在同一视角下,偏向可落地工程决策。
- — Lovable 通过并行框架升级和增量路由迁移完成从 Next.js 到 TanStack Start 的切换。
- — Agent memory 的价值来自结构化 scope、保留策略和访问控制。
- — Munder Difflin 和 fx 代表开发者工具继续向 Agent harness 演进。
TLDR:Stripe 暂缓 IPO 叙事、AI 时代漏洞发现加速、团队 Agent harness 出现
这封 TLDR 横跨科技商业、科学和开发工具。与 AI builder 最相关的是:Stripe 称“singularity”从 1 月 1 日开始,并认为保持私有公司结构有利于长期投资和收购,暗示 IPO 继续搁置;AI 安全文章提出“half-day”概念,指出 AI 正加速漏洞发现和 exploit 生产,安全研究者角色需要随之变化;OneCLI 则提供团队用 Agent harness,让员工拥有安全、沙箱化的个人 Agent,通过 gateway 注入凭证并执行策略。
它反映 AI 正同时改变资本结构、网络安全生产率和企业内部 Agent 部署方式。
- — Stripe 的 AI 叙事与继续保持私有公司结构绑定。
- — AI 使漏洞发现和 exploit 生产速度显著上升。
- — OneCLI 强调企业级 Agent 的沙箱、gateway 和策略控制。
The Neuron:AI 参与个性化 mRNA 癌症疗法,GEN-1.5 推进机器人 physical prompting
这封 The Neuron 先介绍 Merck 和 Moderna 的个性化 mRNA 癌症疗法在黑色素瘤 Phase 3 试验中取得积极结果:Moderna 称其 AI 算法会分析患者肿瘤和血液测序数据,筛选最多 34 个可能触发免疫反应的 neoantigens,并编码进定制 mRNA 疗法,与 KEYTRUDA 联用后在 recurrence-free survival 和 distant-metastasis-free survival 上优于 KEYTRUDA 单药。随后重点解读 Generalist GEN-1.5:机器人可通过单个 3-12 秒演示进行 in-context physical prompting,一次演示平均成功率 59%,少量权重更新后提升到 83%。
它同时展示 AI 在生物医药设计和 embodied AI 交互方式上的实际进展,前者关乎高价值科学应用,后者关乎机器人从编程到示范学习的接口变化。
- — Moderna 使用 AI 从患者测序数据中选择最多 34 个 neoantigen 目标。
- — 个性化 mRNA 疗法与 KEYTRUDA 联用在黑色素瘤 Phase 3 试验中达到关键终点。
- — GEN-1.5 的 one-shot 能力属于 in-context learning,少量权重更新则接近持续适应。