今日精读:Thinking Machines 的 Inkling 开源权重模型登场
[AINews] Thinky's Inkling: 975B-A41B multimodal, new best American Apache 2.0 open model (with Inkling-Small, 276B…
这期 AINews 以 Thinking Machines Lab 发布 Inkling 为主线,汇总了模型规格、团队表态和社区生态响应。Inkling 是一个 975B 总参数、41B 激活参数的 MoE 多模态模型,支持最高 100 万 token 上下文,训练数据覆盖文本、图像、音频和视频,并以开源权重、Tinker 平台微调、Hugging Face 与推理生态支持作为发布重点。
Inkling 不是一个单纯追逐榜单第一的发布,而更像 Thinking Machines Lab 对“开放、可定制、可部署 foundation model”的首次公开落子。邮件里反复强调几个信号:第一,模型体量足够大,975B 总参数、41B 激活参数,属于大规模 MoE 路线;第二,它原生覆盖文本、图像和音频,并支持最长 100 万 token 上下文,明显面向长上下文推理、代码、研究和 agent 工作流;第三,它不是只给 API,而是开放权重,并当天接入 Tinker、Playground、Hugging Face 以及 vLLM、SGLang、Modal、Baseten、Databricks 等生态。对 builder 来说,最重要的不是“又多了一个模型”,而是一个由顶级团队推出、可自托管、可微调、可接入现有推理栈的美国开源权重基座模型。邮件也给了团队定位:Mira Murati 称其为从零训练的第一款模型,John Schulman 提到预训练从去年冬天开始,之后小团队补上 coding、reasoning、agentic training;Lilian Weng 则把它描述为覆盖广泛能力、面向实际使用和定制的 foundation model。这意味着 Inkling 的竞争点不是一次性封顶,而是为后续迭代、企业私有化、垂直 agent 和多模态工作流提供底座。值得继续观察的是:它的开放许可、真实推理成本、长上下文稳定性、微调体验,以及 Tinker 是否能形成类似“模型即平台”的开发者入口。
这是当天重复出现最多、事实增量最明确的 AI 基础模型事件。它同时影响开源模型格局、企业自托管选择和 agent 基础设施选型。
AI builder 可以把 Inkling 视为一个值得评估的新基座:适合关注长上下文、多模态、代码、agentic workflow 和私有化部署的团队。模型发布也会推动推理框架、微调平台和垂直 agent 应用围绕新权重快速适配。
- 01Inkling 是 975B 总参数、41B 激活参数的 MoE transformer。
- 02支持最高 100 万 token 上下文,原生覆盖文本、图像和音频。
- 03预训练数据包含 45 万亿 token 的文本、图像、音频和视频。
- 04同时发布 Inkling-Small 预览版,强调更低成本和延迟。
- 05开放权重并接入 Tinker、Playground、Hugging Face 及多个推理生态。
- 06团队将其定位为 day-1 foundation release,而不是最终 frontier push。
- — Inkling 的优势究竟来自模型本身,还是来自 Tinker 与生态集成?
- — 100 万 token 上下文在真实 agent 工作流里是否稳定、经济、可控?
- — 开源权重是否足以改变企业对闭源 API 的依赖?
- — Inkling-Small 是否会比大模型更适合实际产品集成?
把未来实验室做成数据中心:Lila Sciences 的 AI 科学工厂
这期 Latent.Space 访谈 Lila Sciences 的 CTO Andy Beam 和 CSO Rafa Gómez-Bombarelli,核心观点是把科学实验室视为类似 AI 数据中心的系统:仪器是节点,机器人和调度系统是基础设施,自然实验结果是 verifier,实验过程生成大规模、经验证的科学推理 token。Lila 的野心不是单点自动化,而是把生物、化学、药物发现和材料科学放进同一个 AI 驱动实验工厂。
它把“AI for science”的关键矛盾讲清楚了:不是缺模型口号,而是缺高质量、可验证、可规模化生成的数据。对长期主义 builder 来说,这是 AI 系统和真实世界闭环结合的典型案例。
- — Lila 将科学方法视为尚未被充分开发的互联网级数据源。
- — 邮件称其已有超过 10 万亿 experimentally validated scientific reasoning tokens。
- — 他们强调灵活性和通用性,而不是只追求单一实验吞吐。
TLDR AI:Inkling、安全沙箱、递归自我改进与 GPT-Red
这期 TLDR AI 覆盖了当天 AI infra 与安全方向的多个重点:Thinking Machines 发布 Inkling;Perplexity 的 SPACE 用短生命周期沙箱、凭证隔离、快照和加密存储来支持 agent 处理敏感任务;Anthropic 被报道推进潜在 IPO;研究者展示了 autonomous autoresearch agent 优化自身 harness 的实验;还提到 OpenAI 的 GPT-Red 用于自动生成 adversarial prompts、暴露模型漏洞。
这封邮件的价值在于把模型发布、安全执行环境、agent 自我改进和红队测试放在同一天的技术脉络里。它显示 agent 产品化正在快速逼近工程系统问题,而不是只靠模型能力。
- — Inkling 被描述为 975B 参数 MoE、41B 激活参数、100 万 token 上下文的多模态模型。
- — Perplexity SPACE 强调 ephemeral sandbox 和凭证隔离。
- — 自我改进 harness 实验显示 agent 可优化代码、提示长度和抗 reward hacking 结构。
TLDR Dev:自我改进 agent harness 成为工程焦点
这期 TLDR Dev 对开发者最有价值的是 agent harness 主题:文章认为 AI 开发正在从手工调 prompt 转向设计可被 agent 分析、修改、验证的执行框架。邮件还讨论了面向 agent 的 API 设计、SQLite 默认行为问题、Inkling 开源权重模型、Grok Build 终端 coding agent、Capn-Hook 跨会话记忆工具、Boop iMessage 个人 agent,以及 agentic misalignment 风险。
它抓住了 AI 编程工具下一阶段的核心:真正可用的 agent 不只需要模型,还需要 harness、日志、记忆、错误恢复、权限和可验证的改进流程。
- — self-improving harness 让 agent 能分析执行轨迹、提出修改并验证更新。
- — API for agents 要更清晰、显式、错误处理精确。
- — Capn-Hook 和 Boop 代表个人 agent 记忆与消息入口方向。
The Neuron:OpenAI 的家庭设备与 Codex Micro 暗示新交互入口
这期 The Neuron 主打 OpenAI 硬件方向:据 Bloomberg 报道,OpenAI 首款重要消费设备可能是一个便携、无屏、带摄像头和传感器的 ChatGPT 智能音箱,支持自然语音、移动和智能家居控制;同时 OpenAI 发布 Codex Micro,一个 230 美元的 coding agent 控制键盘。邮件还提到 Inkling、Anthropic 潜在 IPO、Ode 企业 AI 实施融资,以及用高 token 成本拖慢模型的 CAPTCHA 思路。
它把 AI 的界面竞争从聊天框推进到物理空间:家庭设备、语音视觉和专用控制硬件都会改变用户与 agent 的关系。
- — OpenAI 家庭设备被描述为无屏、可移动、带摄像头和传感器的 ChatGPT companion。
- — Codex Micro 用专用按键、状态灯、摇杆和 reasoning-effort dial 控制 coding agent。
- — 邮件认为界面竞争会走向房间、语音视觉和物理伴随。
AI Valley:Inkling 发布与 OpenAI Codex Micro
这期 AI Valley 以两条新闻为主:Mira Murati 的 Thinking Machines Lab 发布首个旗舰模型 Inkling,一个开源权重、多模态、100 万 token 上下文、面向推理、编码和 agent 工作流的模型;OpenAI 发布 Codex Micro,一个与 Work Louder 合作的 230 美元可编程键盘,用专用按键、摇杆和自定义命令控制 coding agent。邮件还列出 Pocket、Reframe、Oak、Inkling 等趋势工具。
这封邮件用大众化方式捕捉了同一天两个界面层事件:一个是开放模型底座,一个是 coding agent 的物理控制器。
- — Inkling 被定位为可自托管、可定制的开放权重模型。
- — Codex Micro 展示了 coding agent 专用硬件控制的方向。
- — Oak 代表企业为人类、应用和 AI agent 建立身份控制平面的趋势。
TLDR:Stripe 收购 PayPal 传闻、自动驾驶博弈与 SDK 被 agent 改写
这期 TLDR 是综合科技简报,重点包括 Stripe 与 Advent 据称提出以每股 60.50 美元收购 PayPal、Uber 与 Waymo 围绕 robotaxi 展开舆论和监管博弈、阿尔茨海默血液检测进展、现代汽车工人因类人机器人威胁而罢工。对 AI builder 最相关的是“为什么我们停止使用 SDK”:文章认为 AI 降低了直接写 REST client 的成本,未来公司可能从发布 SDK 转向发布 agent skills,教 agent 正确调用 API。
它提供了一个对开发者生态很有启发的判断:AI 可能削弱传统 SDK 的分发价值,增强文档、技能、可观测性和 API 一致性的价值。
- — 文章认为定制 REST client 的成本因 AI 下降。
- — 未来厂商可能发布 agent skills,而不是强推每种语言的 SDK。
- — 现代汽车罢工显示 humanoid robot 已开始触及劳工议题。
Opinion AI:从知识库、技能到循环,把 AI 变成可工作的系统
这期 Opinion AI 汇总了近期最受读者欢迎的 10 篇实践指南,主题不是“获得更强模型”,而是如何把 AI 变成真实工作系统:用 Obsidian 和 Markdown 建立可被人和 AI 共同读取的知识库;用 CLAUDE.md、AGENTS.md、SKILL.md 等项目文件沉淀规则;从 Daily Briefing Agent 入门 agent;用 Claude Skills 保存可复用流程;用 loop 结构让 AI 有开始、执行、检查、保存状态和停止条件。
它把 2026 年实用 AI 的方法论讲得很清楚:价值来自上下文、规则、工具、记忆、检查和产出,而不是单次聊天。
- — Markdown vault 可以成为人、Claude、编辑器、终端和 AI 工具共享的知识层。
- — 项目文件比长 prompt 更适合保存长期规则和工作定义。
- — Skills 和 loops 能把反复纠正沉淀为可复用流程。