2026-07-05:产品工作台之后,提示、验收和运行层也在继续变具体
今天真正值得记住的,不是又多了几个模型口号,而是产品工作流、验收动作和运行层细节继续往下收口了。
快速概览
Codex这条线上午最重要的变化,是它已经被直接讲成 PM 工作台,开始同时接设计探索、Slack 自动化和 thread 管理。- 多模态提示、真实使用验收、责任归属、插件接口和 session backend 这些层,也都比前几天更具体。
- 晚上新增不多,主要补在
Fable的 final review、claude.md/ skills 约束,以及Vercel AI Gateway的长期 token 使用可视化。
今天重要的信息
1. Codex 已经被直接讲成产品经理工作台
- 发生了什么:
petergyang预告了一期OpenAI Codex PM访谈,里面点得很细。Rohan会先用Image Gen探设计方向,再从Slack触发Codex automations,同时用一个Codexthread 去管理其它 thread。这里不再只是“拿 coding agent 写代码”,而是把设计、触发和线程协调都放进同一个工作台语境里。 - 为什么值得关注:这说明
Codex的实际竞争点已经开始往产品工作流扩,不只是在 IDE 里补一段代码。 - 我应该关注什么点:后面更值得看的是,这些 PM 工作流动作会不会继续收进同一个 thread / automation 体系里,而不是停在演示片段。
- 相关帖子:用
Codex做产品工作的预告,包含Image Gen、Slack自动化和 thread 管理(petergyang) - 你的判断:这是今天最值得记的一条主线,因为它把
Codex的边界从 coding 往组织工作流推开了一截。
2. 多模态输入和真实使用验收,开始一起变成 agent 工作流的默认层
- 发生了什么:
omarsar0给了多模态提示的 walkthrough,明确说自己已经把这套交互方式接进 coding agents。另一边,thenanyu把验收边界说得更直接,抓 bug 最有效的办法还是去用产品、故意把它弄坏,代码评审更多是看架构和 API 设计;如果模型把生产表删了,最后被追责的还是人。这两组内容放在一起,刚好对应 agent 的输入面和验收面。 - 为什么值得关注:模型更强以后,真正影响交付质量的,还是它怎么拿到上下文、怎么被验收,而不是大家少看了多少代码。
- 我应该关注什么点:后面要继续看,多模态输入是不是只改善前期理解,还是会稳定改变后续工具调用和真实验收结果。
- 相关帖子:把多模态提示接进 coding agents(omarsar0)、抓 bug 更该直接用产品(thenanyu)、如果模型删掉生产表,最后谁负责(thenanyu)
- 你的判断:今天关于 agent 边界最清楚的结论就在这里,输入面和责任面都在往真实工作条件靠。
3. Fable 开始同时进入方法选择、终检和 prompt 配置层
- 发生了什么:上午
_catwu给了一个很实的样本,自己没点名方法,Fable 5却主动选了propensity score matching去做 retention analysis。到了晚上,simonw又把它放到发布前最后一道 review 里,结果直接找出并修掉5个 release blockers,估算成本是149.25美元。alliekmiller则把经验继续往下收,提醒要检查claude.md是否冲突、skills 不要写太死、提示里要把目标和成功标准讲清楚。 - 为什么值得关注:这条线最重要的变化,不是模型更会说,而是它开始被放到更细的判断层和更贵的验收位上。
- 我应该关注什么点:后面值得继续看,哪些工作真的适合让高价模型做 final review,哪些只需要在
claude.md和 skills 层把约束写清楚就够了。 - 相关帖子:
Fable 5主动选propensity score matching做 retention analysis(_catwu)、让Fable做发布前最后一轮 review,并找出5个阻塞问题(simonw)、把Fable的 prompt 技巧收口到claude.md、skills 和目标说明(alliekmiller) - 你的判断:今天关于
Fable最有价值的信息,不在情绪化口碑,而在它被放进了哪些更高杠杆的位置。
4. Hermes 和 firstmate 继续把运行层和扩展层做厚
- 发生了什么:
Teknium上午公开征集Hermes Agent的插件接口扩展建议,希望开发者即使不等主仓合并,也能把功能、修复和安全层做成稳定插件。kunchenguid这边则继续给firstmate补cmuxbackend,并把实现细节讲清楚:每个 task 对应一个cmux workspace,通过 CLI 去spawn / steer / read / tear down。到了晚上,Teknium又转引了一条更轻的外围样本,PetDex已经能把Teknium装成桌面宠物和Hermes Agent连起来。 - 为什么值得关注:同一天里,核心运行层、扩展接口和外围交互壳都在补,说明 agent 平台正在形成更完整的生态层次。
- 我应该关注什么点:后面值得盯的是,插件接口、backend 和外围壳会不会继续共用一套更稳定的权限、状态和审批边界。
- 相关帖子:征集
Hermes Agent插件接口扩展建议(Teknium)、firstmate原生支持cmux,并把 task workspace 执行细节讲清楚(kunchenguid)、把Teknium装成桌面宠物并和Hermes Agent连起来(tonysimons_) - 你的判断:这比单独一个新 feature 更重要,因为它说明平台层已经开始往“可扩展、可接壳、可组织”的方向走。
5. Vercel AI Gateway 给了一个更接近真实调用结构的观察窗口
- 发生了什么:
rauchg把Vercel AI Gateway聚合到的长期 token 消耗做成了动态赛跑图,覆盖数百万开发者、每月数万亿 token 的使用轨迹。帖子直接点出几个观察:不同实验室份额会波动,Anthropic当前占优,open weight 模型也在抬头。它不是 benchmark,也不是宣传页,而是更接近真实调用分布的可视化。 - 为什么值得关注:很多关于模型份额的讨论都停在印象层,这条至少给了一个更接近实际使用的数据观察面。
- 我应该关注什么点:后面要继续看,这类平台侧聚合数据是短期噪声,还是已经能持续反映模型迁移方向。
- 相关帖子:把
Vercel AI Gateway的长期 token 消耗做成动态赛跑图(rauchg) - 你的判断:这条适合拿来校正“大家到底在实际用什么”,而不是继续靠时间线热度猜。
6. Fable demo 叙事开始有人主动做归因校正
- 发生了什么:
ammaar把用Fable 5把《命令与征服:将军》移植到 iPhone / iPad 这件事讲得很猛,dotey随后去翻 commit,指出大部分跨平台移植工作从2025-02起就已经由上游GeneralsX持续完成,Fable做的是最后一段 iOS 适配,涉及DXVK、MoltenVK和触控系统重做。这里的重点不是拆台,而是把真实工程积累和模型补完的边界重新摆正。 - 为什么值得关注:类似 demo 以后只会更多,谁去补归因、看 repo 历史、分清底座和最后一段,很影响你对模型能力的真实判断。
- 我应该关注什么点:后面看到高传播 demo,最好都顺手看一下仓库历史,别把已有工程底座全算到模型头上。
- 相关帖子:校正
Fable 5移植《命令与征服》叙事(dotey)、原始展示帖(ammaar) - 你的判断:这条不是新能力发布,却很重要,因为它直接影响怎么判断 AI demo 的含金量。
7. 视觉模型这边还有人在继续补论文级结果
- 发生了什么:
NielsRogge转的PointDiT是晚间少数还有方法含量的研究样本。原帖说它在KITTI和iBims-1上拿到新 SOTA;被引用帖补充,方法尽量做简,只用像素空间上的ViT估计 dense 3D point maps,不靠混合架构、VAE 或复杂损失。 - 为什么值得关注:这条和今天主线不是同一个层,但能提醒一件事,视觉研究这边还在继续走“更少结构假设、更多直接建模”的路。
- 我应该关注什么点:后面更值得看的是,这类极简方法能不能走出 benchmark,进入更真实的 3D 重建和感知任务。
- 相关帖子:
PointDiT在KITTI和iBims-1上拿到新 SOTA(NielsRogge)、PointDiT直接用像素空间ViT做 dense 3D point maps(haofeixu) - 你的判断:晚间新增本来就少,这条至少提供了一个不是节日噪声、也不是空泛判断的补充样本。
关于这个日报
这份内容基于 LBan2050 关注列表中的每日信息流,由 AI 先做过滤和初步总结,再由 半庄 整理、取舍和补充判断。

