ChatGPT Work:十亿用户的知识工作 Agent 预演
Unpacking ChatGPT Work: the Agent for a Billion Users
这封 Latent Space 重点拆解 OpenAI 在 7 月 9 日发布的 ChatGPT Work:它把 ChatGPT、Codex、云端 agent、桌面应用、浏览器使用、子 agent 和大量工作连接器揉进一个面向知识工作的产品形态。文章最值得关注的判断是,Work 当前虽与 Chat 模式并列,但 Greg Brockman 已确认二者会在年底前合并,因此它更像是 ChatGPT 十亿级用户未来使用方式的预览,而不是只给 power user 的独立工具。
这篇文章的价值不在于复述 OpenAI 又发布了一个新产品,而在于把 ChatGPT Work 放到 OpenAI 从 Plugins、Devday、Codex 到云端 agent 的连续路线里理解。文章指出,Work 是一种面向知识工作的 agent:用户连接 Slack、邮件、Drive、日历、CRM、项目管理器和插件后,它跨来源收集上下文并产出完成品。更关键的是,它运行在 Codex harness 之上,因此继承了 Codex 的模型、子 agent、浏览器使用、文件编辑和云端执行能力。发布本身也很重:三种新模型、十四种配置、ChatGPT 与 Codex 桌面应用整合,以及云 agent 进入更主流的入口。文章引用的一个重要信号是,Work 连同 Codex 三周内已据称超过 1000 万用户,而 ChatGPT 被估计在 6 月跨过 10 亿月活、并在本月接近 10 亿周活。当前 Work 与 Chat 在 ChatGPT 内仍是并列模式,产品线也显得混乱:ChatGPT、Codex app、Codex harness、原始云 agent、ChatGPT agent、Atlas、OpenClaw 等概念交叠,且网页、移动端、桌面端能力并不完全一致。但文章认为,这种混杂状态反而说明 OpenAI 正在把 agent 能力从开发者工具迁移到大众知识工作界面。对 builder 来说,重点不是模仿界面,而是理解未来 AI 产品的基本结构:上下文连接器、可控执行环境、任务状态、工具调用、子 agent、人工交互与最终交付会被组合成一个统一工作空间。
它把 agent 从“开发者和早期用户玩具”推进到 ChatGPT 主入口的可能形态。只要 Chat 与 Work 合并,这类模式就会直接影响大众对 AI 助手、工作台和自动化产品的默认预期。
做 AI 应用的团队需要重新评估自己的护城河:单点聊天、单一插件或轻量自动化会被平台吸收,价值更可能来自垂直上下文、专有工作流、可靠执行和深度集成。
- 01ChatGPT Work 于 2026 年 7 月 9 日发布,定位为面向知识工作的 agent 产品。
- 02它连接 Slack、邮件、Drive、日历、CRM、项目追踪器等工作上下文,并产出完成品。
- 03Work 运行在 Codex harness 上,继承模型、子 agent、浏览器使用和云端执行等能力。
- 04文章称 Work 与 Codex 三周内已超过 1000 万用户。
- 05Chat 与 Work 目前并列,但 Greg Brockman 已确认年底前会合并。
- 06当前产品线混乱,但这可能是 OpenAI 把 agent 能力并入 ChatGPT 主体验的过渡状态。
- — Work 真正的产品边界在哪里:聊天界面、桌面 app、云端 agent 还是统一工作空间?
- — 当 ChatGPT 主入口内置 agent,第三方 agent 产品还能靠什么差异化?
- — 哪些工作流适合完全代理,哪些仍需要人类在关键节点做判断?
- — Codex harness 这种执行层是否会成为未来 AI 产品的事实基础设施?
Eval Engineering:让 Agent 不只走到终点,还要真的完成任务
这封 newsletter 用一个典型失败场景解释为什么 eval engineering 正在成为严肃的 AI 技能:agent 可以完成所有可见步骤、调用工具、写文件、交给下一个节点并给出自信答案,但如果搜索结果为空、上游编造细节、下游继续采纳,系统会安静地失败。文中引用的生产分析显示,响应质量可达 83.9%,但对工具结果的忠实度只有 32.3%。指南主张把 eval 放进 agent 图、循环和发布流程中,检查任务承诺、证据、路径、工具结果忠实度、代码检查、LLM 判断与人工判断。
agent 可靠性问题正在从 prompt 问题变成工程治理问题。对 builder 来说,能否把真实 trace 转成长期 eval,可能决定产品能否从 demo 进入生产。
- — agent 完成可见步骤不等于完成真实任务。
- — 文中案例显示响应质量与工具忠实度可能严重背离。
- — eval 的作用是判断工作是否有证据、路径是否可接受、结果是否应继续流转。
TLDR AI:AI 医疗数据、持续学习、实时语音和 Agent Harness
这封 TLDR AI 覆盖了多条 builder 值得关注的线索:Fidji Simo 离开 OpenAI 领导团队后创办 ChronicleBio,用慢性病血液数据和 AI 改善 POTS 等疾病研究;Mind Lab 的 Macaron-V1 用多个 LoRA 专家模块挂到 GLM-5.1 上,动态选择任务专家并尝试持续学习;OpenAI GPT-Live 的全双工语音架构结合状态化推理、异步委派、动态上下文和低延迟传输;Kiro agent harness 则强调服务端 agent 进程与 IDE、CLI、Web 客户端通过协议边界解耦。它还提到 Astra 数学成果、Orchard agentic modeling framework 等基础设施内容。
这封邮件把 AI 在生物医疗、模型持续学习、实时语音交互和 agent 基础设施上的进展放在一起,显示 AI 产品正在从单点模型能力转向系统工程能力。
- — ChronicleBio 已收集 153TB 慢性病血液数据。
- — Macaron-V1 通过多个 LoRA 专家模块和动态路由测试持续学习。
- — GPT-Live 使用全双工语音架构支持同时听说、推理和工具使用。
TLDR Design:Google Earth AI 回滚与 AI-ready 设计系统
这封 TLDR Design 的 AI 相关重点有两条:Google Earth 网页版上线了基于 Nano Banana 2 的地点图像生成,可用真实卫星、航拍和 3D 数据生成地点改造图,但次日因部分生成图疑似违反政策而回滚;另一篇讲如何让设计系统 AI-ready,认为 AI 原型质量差往往不是模型能力不足,而是设计决策未文档化、硬编码和系统不一致造成。邮件还覆盖 Googlebook 泄露、Mac Studio M5/M7 路线、创意技术角色兴起和字体细节等设计趋势。
Google Earth 的回滚说明生成式 AI 一旦接入真实世界地理语境,安全和政策问题会快速放大。AI-ready 设计系统则提醒团队:让 AI 可靠产出界面,需要治理设计资产而不是只换更强模型。
- — Google Earth AI 生成地点图像功能上线后次日回滚。
- — AI 原型问题常来自设计系统债务,而非模型本身。
- — 创意技术人员在 AI 时代从边缘角色进入更核心的位置。
TLDR Dev:长周期编码评测、AI Code Review 与 Next.js 16.3
这封 TLDR Dev 对开发者最有价值的是三条线:MirrorCode 用“从零重建完整软件项目”评估 AI 的长周期自主编码能力;Wealthfront 多年实验 AI 辅助 code review,从怀疑走向结构化使用 Opus 4、Gemini 等模型做缺陷检测并降低误报;Next.js 16.3 则带来开发内存下降、更快构建、更好 SSR、自定义错误边界、Instant Navigations、Instant Insights 和 Partial Prefetching。观点部分强调 LLM 奖励专家,真正的领域知识仍能显著放大模型能力。
它把 AI 编码从“能写函数”推进到“能否长期完成项目、参与评审、融入工程流程”的层面。
- — MirrorCode 评估 AI 从零重建完整软件的能力。
- — Wealthfront 的 AI code review 实验强调迭代流程和误报控制。
- — Next.js 16.3 优化性能与开发体验,尽量不要求应用改代码。
TLDR:Cloudflare Computer 与 AI 垂直整合终局
这封 TLDR 是综合科技摘要,其中与 AI builder 最相关的是 Cloudflare Computer 和 AI 垂直整合。Cloudflare Computer 被描述为运行在 Durable Object 内的虚拟文件系统,以 SQLite 保存权威状态,并提供可插拔执行表面,屏蔽代码运行在 isolate、容器沙箱或浏览器中的细节,为每个 agent 提供高效可扩展的“计算机”。另一篇认为模型实验室和 agent 实验室正在汇合:模型公司做第一方应用,agent 公司也会走向模型训练,因为模型与 harness 的协同设计能带来优势。
agent 不只需要模型,还需要可持久化、可隔离、可扩展的执行环境。Cloudflare Computer 这类抽象说明“给 agent 一台电脑”正在成为基础设施问题。
- — Cloudflare Computer 用 Durable Object 和 SQLite 维护 agent 文件系统状态。
- — 它抽象 isolate、容器沙箱和浏览器等执行表面。
- — 模型实验室和 agent 实验室都在向对方领域扩张。
The Neuron:OpenAI Astra 十项数学进展与复现争议
这封 The Neuron 聚焦 OpenAI 内部模型 Astra 产出的十项数学成果,覆盖几何、密码学、量子计算和纯数学问题,其中包括自 1978 年以来首次改进某个高维球堆积界限,并构造 non-sofic group 以反驳 Connes 相关猜想。OpenAI 称人类与 Astra 共同准备论文,模型把证明转成 Lean 由证明检查器验证。文章也加入批判视角:Gary Marcus 认为可验证数学不等于通用科学推理,Anthropic 数学家 Levent Alpöge 称公开 Claude Fable 在 24 小时内复现约一半结果,这削弱了 Astra 作为单一门槛突破的叙事。
这可能标志着 AI 在可验证科研中的新范式:人类选题,模型大规模搜索,形式化系统检查答案。
- — Astra reportedly 生成十项长期数学问题成果。
- — 证明被转换为 Lean 文件进行形式化验证。
- — Claude Fable 据称可在 24 小时内复现约一半结果,带来可比性争议。
TLDR Product:AI 时代产品管理更需要结果、质量和判断力
这封 TLDR Product 不是单一 AI 新闻,而是一组面向产品决策者的判断框架:停止纠结 epic 和 user story,转向结果、机会和可衡量实验;质量只有在客户和市场愿意奖励时才可持续;AI 模型易复制,持久价值更可能来自嵌入公司数据和工作流的专用系统;Canva 的优势被归因于能把创始人判断快速转进产品的操作系统。它还强调大规模 UX writing 中每个字都会影响信任,并给出识别 2026 年 AI 写作痕迹的线索。
当 AI 降低软件生产门槛后,产品判断、组织机制和质量取舍会成为更稀缺的能力。
- — 产品规划应围绕结果、机会和实验,而不是形式化需求标签。
- — AI 模型优势短暂,嵌入式专用系统更可能形成耐久价值。
- — AI 写作和 AI 产出增加后,清晰表达与判断力更重要。
AINews:Qwen 3.8 Max 和 27B 承诺开源权重,主攻编码与协作
这封 AINews 的核心是 Alibaba Qwen 发布 Qwen 3.8 Max,并承诺 Qwen3.8-Max 与 Qwen3.8-27B 都将开放权重。邮件称 Qwen 3.8 Max 是 2.4T 参数模型,API 价格为每百万输入 2 美元、输出 6 美元、缓存 token 0.25 美元,重点能力包括 10 天以上无人值守编码、125 小时自主 AI 研究循环、24 小时内参加多模态对话意图识别挑战并超过 87% 人类团队、完整硅设计流程优化,以及把视觉反馈纳入规划、编码和 GUI 交互执行循环。AINews 的判断是,此次发布基本消除了外界对 Qwen 是否继续保持开放模型竞争力的疑虑。
如果承诺的开放权重兑现,Qwen 会继续给开发者和模型服务商提供高性能开放模型选择,尤其是在编码、长周期 agent 和多模态执行任务上。
- — Qwen3.8-Max 被描述为 2.4T 参数旗舰模型。
- — Alibaba 承诺 Qwen3.8-Max 和 Qwen3.8-27B 将开放权重。
- — 重点能力包括长周期编码、自主研究、多模态 agent 和芯片设计优化。