2026-07-07:模型工作区、harness 和 eval 开始一起外显
今天更值得记住的,是 agent 生态里那些过去藏在后台的层,开始被成组地抬到前台。
快速概览
- Anthropic 直接把
global workspace和J-space讲成可读、可审、可调的解释层,说明模型内部工作区已经不只是研究概念。 - Replit、harness engineering 和
eve eval这几条放在一起看,agent 的外层脚手架正在从“临时 workflow”变成核心产品层。 Hermes、Claude Code和Hy3这几条,则把操作面、形成路径和模型分发入口补得更具体了。
今天重要的信息
1. Anthropic 把模型内部工作区这层直接讲成可操作界面
- 发生了什么:Anthropic 连着发了三条,把
global workspace、J-space和Neuronpedia上的交互 demo 放到一起。重点不只是“有一篇解释性论文”,而是它明确说J-space可以用来读、审和塑造 Claude 当前真正活跃的思维内容。这个说法把模型内部解释层从事后分析,往前推到“可被操作的工作区”。 - 为什么值得关注:如果这条线继续成立,解释性工具就不只是研究附件,而会更像能力边界管理和可信控制层的一部分。
- 我应该关注什么点:后面更值得看的是,
J-space这种读写界面能不能稳定复现,以及它和现有 steering / interpretability 工具相比,到底多了哪些真实可操作性。 - 相关帖子:Anthropic 公开
global workspace研究主帖(AnthropicAI)、J-space的可读可审可塑说明(AnthropicAI)、Neuronpedia交互 demo(AnthropicAI) - 你的判断:今天最重的一条,还是这条。它把模型内部这层往产品和控制面推了一步。
2. Replit 和 harness engineering 一起说明,agent 的改进越来越不只在模型里
- 发生了什么:
amasad一边说 Replit 之所以改进快,是因为已经把反馈闭环接回去,让 agent 进入自我改进;另一边又给了一个业务样本,亚特兰大一家房地产公司用 Replit 搭的 CRM 替掉 Salesforce,省下了100k美元。到了晚上,lilianweng又把 harness engineering 直接讲成 AI self-improvement 的关键脚手架,并明确说 goals 和 context 这一层不会消失。 - 为什么值得关注:这几条放在一起,已经很难继续把 agent 改进只理解成“更好的模型发布”。模型外的 harness、上下文和反馈闭环,正在一起变成主战场。
- 我应该关注什么点:后面更值得看的是,哪些改进会留在 harness 层,哪些最终会被模型内化,以及两者怎么分工。
- 相关帖子:Replit 解释 agent 自我改进闭环(amasad)、房地产公司用 Replit-built CRM 替掉 Salesforce(amasad)、harness engineering 被直接讲成 AI 自我改进的脚手架(lilianweng)
- 你的判断:今天最清楚的共识,是 agent 进步越来越不是一个单点变量。
3. eval 开始从外围工具变成 agent framework 的默认层
- 发生了什么:
rauchg解释eve eval时,先做了一个很有意思的对比。Web 框架时代,测试往往是生态系统后来补上的;agent 时代,eval 已经成了必需品,所以eve直接把它做成内建能力,既给用户的 agent 用,也给eve自己做演化闭环。 - 为什么值得关注:这说明 agent 产品的完整形态已经在变。以后真正成熟的框架,很可能从第一天就要同时带执行层和验收层。
- 我应该关注什么点:后面更值得看的是,更多 agent framework 会不会把 eval、trace、回放和 benchmark 一起放进核心体验。
- 相关帖子:agent framework 开始把 eval 做成内建能力(rauchg)、
eve eval作为 first-class evals 发布(evedev_) - 你的判断:如果这条线跑通,很多“框架”和“评测工具”的边界会重新画一次。
4. Claude Code 这条线今天同时补了形成路径和方法论
- 发生了什么:一条是
Claude Code的形成历史。Anthropic 最早做的是 VS Code 编程助手,后来在容器里做持久 shell,让模型能执行代码、处理 IO 和超时;内部工具clide一度可以并发拉起100个 Claude Haiku;再靠小团队、高频修补和自动更新把 Claude CLI 推成 Claude Code。另一条是 Thariq 的方法补充:很多能力问题先不该继续雕 prompt,而该看是不是缺了对的工具面。你问模型现在几点,怎么改提示词都没用;给它取时间的工具,它就能做对。 - 为什么值得关注:这两条放在一起,刚好回答了两个问题。
Claude Code为什么会长成今天这样,以及类似产品为什么越来越把工具使用放在比提示词更高的位置。 - 我应该关注什么点:后面更值得看的是,更多 coding agent 会不会也走类似路径,先靠粗糙但有效的 harness 撑起来,再等模型越过能力阈值。
- 相关帖子:
Claude Code的形成路径与早期工程细节(dotey)、Claude Code官方历史回顾(claudeai)、工具使用优先于继续雕提示词(dotey) - 你的判断:今天关于 coding agent 最有价值的信息,不在口碑,而在它背后的工程演化路径。
5. Hermes 开始把学习、历史、成本和桌面操作面收成一个更完整的工作台
- 发生了什么:昨晚
Hermes重点还是 session 生命周期管理,今天晚间补的是一组更具体的入口:Mixture of agents、/learn自动产 skill、/journey可视化记忆和 skill 时间线、背景自我改进改走便宜模型、桌面端 diffs/commit/PR,以及把Fable 5内建进去。这让Hermes更像一个完整工作面,而不是一堆零散 feature。 - 为什么值得关注:agent 产品现在竞争的,越来越是“谁能把执行、学习、历史和成本一起收顺手”,而不只是单条模型能力。
- 我应该关注什么点:后面更值得看的是,这套操作面会不会继续接上更明确的权限、恢复、同步和审计边界。
- 相关帖子:
Hermes Agent新一轮功能汇总入口(Teknium)、Hermes Agent这轮6个具体入口(AlexFinn) - 你的判断:这条最适合拿来观察,agent 工作台会不会很快分化出更明确的产品层级。
6. Hy3 的入口在一天里从试用活动扩到了工具内直接切换
- 发生了什么:上午
Nous Portal把Hy3讲成两周免费试用入口,强调 coding、tool-calling reliability、reasoning 和256K长上下文。到了晚上,OpenClaw又补了一层分发方式,现在还能通过OpenRouter直接在工具里切成openrouter/tencent/hy3:free,免费窗口到7月21日。新增信息不在参数,而在入口更短了。 - 为什么值得关注:模型供给越来越多以后,采用动作很可能先被入口摩擦决定,而不是先被榜单决定。
- 我应该关注什么点:后面更值得看的是,窗口期曝光会不会换来真实留存,以及
Hy3在 coding 和 tool use 上到底能不能留下来。 - 相关帖子:
Hy3在Nous Portal免费开放两周(NousResearch)、Hy3在OpenClaw里作为OpenRouter免费模型直接可切(openclaw) - 你的判断:这条很适合拿来观察“模型发布”怎么越来越像“渠道竞争”。
7. 成本和效率开始同时进入评测与推理优化这两层
- 发生了什么:上午
fchollet已经明确说,单独报一个 benchmark 分数几乎没有意义,至少要同时带效率和每任务成本。晚上ThinkingCap这条又往方法层补了一步,目标是尽量少入侵原模型行为的前提下,把 thinking token 平均降到原来的1/2,个别例子生成速度最高提到10x。 - 为什么值得关注:这两条合在一起,让“成本意识”进入了模型设计和模型比较的正面指标。
- 我应该关注什么点:后面更值得看的是,这类效率优化能不能稳定进入更多模型、更多任务,而不是只在少量展示例子里成立。
- 相关帖子:评测应该带效率分数(fchollet)、边际成本才是关键变量(fchollet)、
ThinkingCap让思考 token 平均降到1/2(JaroslavBeck) - 你的判断:今天关于“什么才算真正可用”的标准,也比前几天更清楚了一点。
关于这个日报
这份内容基于 LBan2050 关注列表中的每日信息流,由 AI 先做过滤和初步总结,再由 半庄 整理、取舍和补充判断。

