2026-07-13:AI 开始进入人真正操作的工作台

今天值得看的,是 AI 从聊天框走进了剪辑、渲染和屏幕操作这些具体界面。

快速概览

  • ChatCut 把完整视频编辑器放进 Codex,用户和 agent 可在同一条时间线上工作。
  • 一款食物记录 app 公开了图像生成、Gaussian splatting 和原生高帧率渲染的制作链路。
  • open-clicky 已能在屏幕上画线标注,作者也公开了自验证尚未解决的部分。

今天有趣的信息

1. ChatCut:人和 agent 开始共用一条视频时间线

  • 发生了什么:ChatCut 发布了一个 Codex 插件,会在 app 内打开完整的非线性视频编辑器。它的演示重点是让用户和 agent 一起剪辑,而非让 agent 在聊天框里给出剪辑建议。
  • 为什么值得关注:选段、排列、试听和细修都发生在时间线上。agent 能进入这里,同时让人保留随时改动的权利,才有机会接住真实制作过程。
  • 我应该关注什么点:发布帖还没有说明复杂项目中的素材管理、撤销和导出稳定性,这些才会决定它能否持续使用。
  • 相关帖子:在 Codex 内打开完整视频编辑器(chatcutapp)
  • 你的判断:这是今天最想亲自上手的样本。它把 agent 的执行和人的判断放进同一块操作面。

2. 食物记录 app:生成图片之后,还有一长段工程工作

  • 发生了什么:作者做了一款食物记录 app。用户输入文字或图片后,系统先生成统一风格的食物图,再转为 Gaussian splatting 资产;为解决约 10 FPS 的性能问题,作者将多视图渲染改成单个 CAMetalLayer,目标达到 120 FPS。
  • 为什么值得关注:这条内容把图像生成、3D 资产处理、加载和移动端渲染接在一起。可见效果背后仍有一条具体的性能链路。
  • 我应该关注什么点:这是个人项目经验,不能据此判断为通用方案。更值得看的是,模型生成的资产怎样接受性能和交互的约束。
  • 相关帖子:公开图像到 3D 移动端渲染链路(anshuc)
  • 你的判断:制作过程里保留返工和取舍,比只放成品视频更有参考价值。

3. open-clicky:浏览器 agent 多了一种直接指向界面的方式

  • 发生了什么:open-clicky 的短演示里,agent 已能直接在屏幕上绘制。作者同时说,语音交互调试仍需要自己把 Codex 拉回正确方向,自验证循环尚未完成。
  • 为什么值得关注:绘制是一个小动作,却能让 agent 圈出问题、提示下一步,并把自己的意图留在界面上。
  • 我应该关注什么点:完整功能和可用入口还没有公开。它能否和点击、截图理解、语音和验证机制组合成稳定交互,仍待观察。
  • 相关帖子:浏览器 agent 直接在屏幕上绘制(jaeyun_ha)
  • 你的判断:早期样本的成熟度很低。作者把人工介入说清楚,使这段演示更可信。

关于这个日报

这份内容基于 X 的关键词搜索发现,由 AI 先做过滤和初步总结,再由 半庄 整理、取舍和补充判断。它关注别人用 AI 做出的探索性作品,不把单条演示当成行业结论。