2026-07-05:产品工作台之后,提示、验收和运行层也在继续变具体

今天真正值得记住的,不是又多了几个模型口号,而是产品工作流、验收动作和运行层细节继续往下收口了。

快速概览

  • Codex 这条线上午最重要的变化,是它已经被直接讲成 PM 工作台,开始同时接设计探索、Slack 自动化和 thread 管理。
  • 多模态提示、真实使用验收、责任归属、插件接口和 session backend 这些层,也都比前几天更具体。
  • 晚上新增不多,主要补在 Fable 的 final review、claude.md / skills 约束,以及 Vercel AI Gateway 的长期 token 使用可视化。

今天重要的信息

1. Codex 已经被直接讲成产品经理工作台

  • 发生了什么:petergyang 预告了一期 OpenAI Codex PM 访谈,里面点得很细。Rohan 会先用 Image Gen 探设计方向,再从 Slack 触发 Codex automations,同时用一个 Codex thread 去管理其它 thread。这里不再只是“拿 coding agent 写代码”,而是把设计、触发和线程协调都放进同一个工作台语境里。
  • 为什么值得关注:这说明 Codex 的实际竞争点已经开始往产品工作流扩,不只是在 IDE 里补一段代码。
  • 我应该关注什么点:后面更值得看的是,这些 PM 工作流动作会不会继续收进同一个 thread / automation 体系里,而不是停在演示片段。
  • 相关帖子:Codex 做产品工作的预告,包含 Image GenSlack 自动化和 thread 管理(petergyang)
  • 你的判断:这是今天最值得记的一条主线,因为它把 Codex 的边界从 coding 往组织工作流推开了一截。

2. 多模态输入和真实使用验收,开始一起变成 agent 工作流的默认层

  • 发生了什么:omarsar0 给了多模态提示的 walkthrough,明确说自己已经把这套交互方式接进 coding agents。另一边,thenanyu 把验收边界说得更直接,抓 bug 最有效的办法还是去用产品、故意把它弄坏,代码评审更多是看架构和 API 设计;如果模型把生产表删了,最后被追责的还是人。这两组内容放在一起,刚好对应 agent 的输入面和验收面。
  • 为什么值得关注:模型更强以后,真正影响交付质量的,还是它怎么拿到上下文、怎么被验收,而不是大家少看了多少代码。
  • 我应该关注什么点:后面要继续看,多模态输入是不是只改善前期理解,还是会稳定改变后续工具调用和真实验收结果。
  • 相关帖子:把多模态提示接进 coding agents(omarsar0)抓 bug 更该直接用产品(thenanyu)如果模型删掉生产表,最后谁负责(thenanyu)
  • 你的判断:今天关于 agent 边界最清楚的结论就在这里,输入面和责任面都在往真实工作条件靠。

3. Fable 开始同时进入方法选择、终检和 prompt 配置层

4. Hermesfirstmate 继续把运行层和扩展层做厚

  • 发生了什么:Teknium 上午公开征集 Hermes Agent 的插件接口扩展建议,希望开发者即使不等主仓合并,也能把功能、修复和安全层做成稳定插件。kunchenguid 这边则继续给 firstmatecmux backend,并把实现细节讲清楚:每个 task 对应一个 cmux workspace,通过 CLI 去 spawn / steer / read / tear down。到了晚上,Teknium 又转引了一条更轻的外围样本,PetDex 已经能把 Teknium 装成桌面宠物和 Hermes Agent 连起来。
  • 为什么值得关注:同一天里,核心运行层、扩展接口和外围交互壳都在补,说明 agent 平台正在形成更完整的生态层次。
  • 我应该关注什么点:后面值得盯的是,插件接口、backend 和外围壳会不会继续共用一套更稳定的权限、状态和审批边界。
  • 相关帖子:征集 Hermes Agent 插件接口扩展建议(Teknium)firstmate 原生支持 cmux,并把 task workspace 执行细节讲清楚(kunchenguid)Teknium 装成桌面宠物并和 Hermes Agent 连起来(tonysimons_)
  • 你的判断:这比单独一个新 feature 更重要,因为它说明平台层已经开始往“可扩展、可接壳、可组织”的方向走。

5. Vercel AI Gateway 给了一个更接近真实调用结构的观察窗口

  • 发生了什么:rauchgVercel AI Gateway 聚合到的长期 token 消耗做成了动态赛跑图,覆盖数百万开发者、每月数万亿 token 的使用轨迹。帖子直接点出几个观察:不同实验室份额会波动,Anthropic 当前占优,open weight 模型也在抬头。它不是 benchmark,也不是宣传页,而是更接近真实调用分布的可视化。
  • 为什么值得关注:很多关于模型份额的讨论都停在印象层,这条至少给了一个更接近实际使用的数据观察面。
  • 我应该关注什么点:后面要继续看,这类平台侧聚合数据是短期噪声,还是已经能持续反映模型迁移方向。
  • 相关帖子:Vercel AI Gateway 的长期 token 消耗做成动态赛跑图(rauchg)
  • 你的判断:这条适合拿来校正“大家到底在实际用什么”,而不是继续靠时间线热度猜。

6. Fable demo 叙事开始有人主动做归因校正

  • 发生了什么:ammaar 把用 Fable 5 把《命令与征服:将军》移植到 iPhone / iPad 这件事讲得很猛,dotey 随后去翻 commit,指出大部分跨平台移植工作从 2025-02 起就已经由上游 GeneralsX 持续完成,Fable 做的是最后一段 iOS 适配,涉及 DXVKMoltenVK 和触控系统重做。这里的重点不是拆台,而是把真实工程积累和模型补完的边界重新摆正。
  • 为什么值得关注:类似 demo 以后只会更多,谁去补归因、看 repo 历史、分清底座和最后一段,很影响你对模型能力的真实判断。
  • 我应该关注什么点:后面看到高传播 demo,最好都顺手看一下仓库历史,别把已有工程底座全算到模型头上。
  • 相关帖子:校正 Fable 5 移植《命令与征服》叙事(dotey)原始展示帖(ammaar)
  • 你的判断:这条不是新能力发布,却很重要,因为它直接影响怎么判断 AI demo 的含金量。

7. 视觉模型这边还有人在继续补论文级结果

  • 发生了什么:NielsRogge 转的 PointDiT 是晚间少数还有方法含量的研究样本。原帖说它在 KITTIiBims-1 上拿到新 SOTA;被引用帖补充,方法尽量做简,只用像素空间上的 ViT 估计 dense 3D point maps,不靠混合架构、VAE 或复杂损失。
  • 为什么值得关注:这条和今天主线不是同一个层,但能提醒一件事,视觉研究这边还在继续走“更少结构假设、更多直接建模”的路。
  • 我应该关注什么点:后面更值得看的是,这类极简方法能不能走出 benchmark,进入更真实的 3D 重建和感知任务。
  • 相关帖子:PointDiTKITTIiBims-1 上拿到新 SOTA(NielsRogge)PointDiT 直接用像素空间 ViT 做 dense 3D point maps(haofeixu)
  • 你的判断:晚间新增本来就少,这条至少提供了一个不是节日噪声、也不是空泛判断的补充样本。

关于这个日报

这份内容基于 LBan2050 关注列表中的每日信息流,由 AI 先做过滤和初步总结,再由 半庄 整理、取舍和补充判断。