2026-07-06:治理、skills 入口和持久工作流开始接到一起
今天更值得记住的,不是又多了几个模型演示,而是 agent 生态里那些更难做的层,开始互相接上了。
快速概览
- 上午的信息先把几条底层问题讲清楚了:现有 agent 协议表达不了企业治理,always-on agents 真正难的是 durable state,代码验收也开始被重新拉回 ownership。
- 晚上新增的信息更偏产品和操作层:小红书把
REDSkill接进笔记分发,Hermes Agent开始补 session 数据库管理,Claude Code的 dynamic workflows 被补上更细的执行方式。 - 这一天放在一起看,一个更具体的判断是:agent 工作流已经不只是在争谁的模型更强,而是在争谁能把治理、skills、状态和执行层收成完整工作面。
今天重要的信息
1. 现有 agent 协议还表达不了企业里的治理规则
- 发生了什么:
dair_ai转了一篇很具体的 gap analysis,核心判断是MCP、A2A、ACP这类协议能处理能力发现和消息传递,但还表达不了成员资格、讨论、投票、异议保留、人工升级和审计回放这些治理维度。问题已经不在 agent 能不能连起来,而在组织能不能把它们真正管起来。 - 为什么值得关注:这条把 agent 协作从技术互通问题,直接拉回组织治理问题。只要 agent 真进入团队和企业,这会比“再多接几个 tool”更快变成硬约束。
- 我应该关注什么点:后面值得继续看,谁会先把成员权限、人工升级、异议保留和审计 replay 收成可执行协议,而不是继续靠外围系统硬补。
- 相关帖子:协议互通还没走到企业治理这一层(dair_ai)
- 你的判断:今天最重的一条主线,从这里开始。
2. Claude Code 已经进入异步工作流,晚上又补上了 map-reduce 细节
- 发生了什么:上午
_catwu给了一个很实的样本,她会告诉Claude Code岗位要求,再让它动态找出100个候选人,补上LinkedIn、Twitter、博客、播客和一句话判断,最后直接做成 artifact 发邮件。晚上她又补了一层,说 dynamic workflows 会拉起数百个 agent,按 map-reduce 方式并行研究候选人,再合并结果;workflow JSON 可以看,但除非出错,她平时不会保存。 - 为什么值得关注:这说明
Claude Code不是只在“帮你写点代码”,而是在接真正的异步办公室工作,而且编排层已经变得很具体。 - 我应该关注什么点:后面值得继续看,这类 workflow 什么时候需要沉淀成固定模板,什么时候继续保持按需即时生成更合适。
- 相关帖子:
Claude Code做候选人搜集 workflow(_catwu)、Claude Code用 dynamic workflows 拉起数百个 agent 做 map-reduce 式搜集(_catwu) - 你的判断:今天关于“agent 真在接什么工作”的最好样本之一,在这里。
3. 代码验收这条线重新回到 ownership,review 范围也开始按 scope 放大
- 发生了什么:上午
thenanyu连着几条把问题说得很直,大家其实不擅长认真读代码、跑代码、exercise 代码,代码作者自己又容易被知识诅咒蒙住,最后谁做出来谁负责。晚上kunchenguid又补了一句更偏 scope 的判断:AI 让开发者能交付更多范围,所以 review AI 代码的力度,也应该接近“过去工程总监 review 这部分 scope”的强度。 - 为什么值得关注:模型更强以后,很多团队会本能地想把 review 缩掉。这两组内容合起来,刚好反过来,提醒你 scope 放大时,验收要求也会跟着放大。
- 我应该关注什么点:后面值得继续看,团队会不会把这类 scope-based review 收成更明确的规则,而不只是时间线里的观点。
- 相关帖子:代码阅读和 exercise 还是稀缺技能(thenanyu)、谁做出来谁负责(thenanyu)、AI 代码的 review 力度应该按开发者实际拥有的 scope 来看(kunchenguid)
- 你的判断:如果只看模型能力,这条容易被忽略;如果看交付质量,它反而是今天最现实的一条线。
4. Hermes Agent 上午补审批边界,晚上开始补长期 session 管理
- 发生了什么:上午
Teknium先把 Discord 审批门槛补到 admin 层,说明Hermes已经在处理真实协作里的权限分层。到了晚上,重点换成 session 生命周期管理:Hermes Agent新增按时间、模型、用户和工作目录做 prune / archive 的过滤器;转引的Hermes browser extension v2又把 full session management、vision、截图和 tab 常驻侧栏补到浏览器工作面。 - 为什么值得关注:这说明
Hermes这条线已经从“模型接得多不多”,进入“权限怎么设、历史 session 怎么管、浏览器壳怎么接”的更长期使用问题。 - 我应该关注什么点:后面值得继续看,这套 session 管理会不会继续接到恢复、同步、审计和更细的权限边界上。
- 相关帖子:
Hermes Agent给 Discord 审批补上 admin 门槛(Teknium)、给Hermes Agent的 past sessions 增加 prune / archive 过滤器(Teknium)、Hermes browser extension v2补 full session management 和 vision(tonysimons_) - 你的判断:
Hermes现在更像在补“长期可用的 agent 工作台”,而不是继续堆新功能。
5. Fable 同时补上了交互式 3D 世界、living wiki 协作和新的人机分工
- 发生了什么:上午
omarsar0把Fable 5和gpt-realtime-2接到交互式 3D 世界里,说明它已经不只是做静态 demo。晚上Thom_Wolf又给了一个更长期的样本,用一组 agent 持续读 RL 论文、写摘要、互相 review PR,再共同维护一个关于“用 RL 训练 LLM”的 living wiki。另一条补充来自dotey整理的 Thariq 经验,人的工作开始从盯执行,改成给足上下文、设目标、给验证方式,再把任务野心拉高。 - 为什么值得关注:这三条合起来,说明
Fable的价值已经不只是“更会写”,而是开始进入持续协作、知识资产维护和更高杠杆的人机分工。 - 我应该关注什么点:后面值得继续看,这种工作方式在哪些任务里稳定成立,living wiki 这类长期协作又靠什么维持质量。
- 相关帖子:把
Fable 5和gpt-realtime-2接成交互式 3D 世界(omarsar0)、用 agent 持续维护 RL for training LLMs 的 living wiki(Thom_Wolf)、Thariq 关于Fable 5的使用重心变化整理(dotey) - 你的判断:今天关于
Fable最有价值的信息,不在跑分,而在它被放进了哪些更长期、更高杠杆的位置。
6. skills 这一层开始同时碰到组织方式、分发入口和安装链路
- 发生了什么:上午
dair_ai转的HASTE说明,技能库存如果按global、domain和competition-specific三层组织,效果和 token 消耗会明显优于平铺加载。晚上ruanyf又给出一个更贴产品层的样本,小红书的REDSkill社区已经允许在笔记里上传 skill 文件,读者直接从内容页进入 skill 详情和安装链路。一个在讲 skills 怎么组织,一个在讲 skills 怎么分发。 - 为什么值得关注:这意味着 skills 已经不只是提示词碎片,而是在同时变成编排单元和传播单元。
- 我应该关注什么点:后面值得继续看,skills 会不会出现更稳定的 metadata、版本、评价和安装生态,而不是继续停在零散分享。
- 相关帖子:
HASTE用三层技能库存拉开效果差(dair_ai)、小红书开始把 Skill 上传、分享和安装入口做进笔记(ruanyf) - 你的判断:如果这层真的跑通,skills 会更像 agent 时代的“可安装能力包”,不再只是工作流备注。
7. always-on agents 的关键开始被重新讲成 durable state
- 发生了什么:
omarsar0转的130+页 survey 给了一个很有用的定义,always-on agents 的关键不是聊天记忆,而是 durable state。任务账本、权限、凭证、承诺、来源、触发器和外部已提交效果,都属于会影响未来行为的状态对象。 - 为什么值得关注:这条和上面的协议治理、session 管理、skills 分发都能接起来。只要 agent 真正长期运行,最后更容易卡住它的,往往是状态如何写入、恢复、撤回和审计。
- 我应该关注什么点:后面值得继续看,这个 durable state 框架会不会被产品化成更具体的 state model、rollback 机制和外部 effect 边界。
- 相关帖子:always-on agents 被重新定义成持久状态系统(omarsar0)
- 你的判断:它是今天很多样本背后共享的一层底座。
关于这个日报
这份内容基于 LBan2050 关注列表中的每日信息流,由 AI 先做过滤和初步总结,再由 半庄 整理、取舍和补充判断。

