Agent Learning Daily Digest #89 — 2026-08-24

周一(295 条采集,arXiv 4 查询全部成功;08-23 周日未跑、继承两天结果,跨天去重跳过 ~17 条 #86-88 已覆盖项:Skill Misevolution、Context Leakage、Agent-Friendly Docs、Jagged Frontier、VAL、Least-Privilege、Shopify Gisting、Codex Platform、Huzzah、Nvidia harness、AI-Infra-Guard、ai-memory、StagedWorkspace、Agent Lightning、LEGO-RL、TDD-Agent、Mind Viruses(08-13)、orca(07-12) 等)。今日主题:评测与训练侧的"地面真值危机"——SWE-bench Science 显示最强 agent(Claude Code + Opus-5 max)在科学软件上 pass@1 不足 50%,Credit Without Ground Truth 审计发现现有步级 credit 信号全部不优于随机;平台暗改争议——社区实锤级讨论(HN 196p/175c)指控 Anthropic 在 Claude Code 中 A/B 测试暗中调低 effort 级别,模型不自知其推理档位成为信任裂缝;插件化 harness 成风向——Cursor 官方插件规范(4.8k★)把 orchestrate/Thermos 式多 agent 工作流标准化,Apache Maka(ASF 孵化)把权限决策与终止事件写入 append-only log;难度可预测——CoderForge 实证显示 issue 解决任务难度 86.3% 可由静态特征预测,为"难度可控 benchmark"奠基。

今日高信号

1. Anthropic 疑似 A/B 测试降档 effort — Claude Code 暗改争议:模型不知自己的推理档位(HN 196p/175c)

用户 @argofowl 发现 Claude Code 同一设置下 effort 级别表现不一致,推测 Anthropic 正在 A/B 测试暗中调低的 effort 档位。HN 175 条评论的三层分化:质疑证据(Wowfunhappy:证据只是"问 Claude 它的 effort 是多少"——模型本身可能根本不知道自己的推理配置);归因机制(arjie:effort 部分由 harness 侧的 reasoning token 预算与 compaction 实现,模型对自身档位无可见性,所以"问模型"不是可靠探针);共鸣抱怨(Opus 5 被指"读配置文件"级别任务跑 43 分钟拉起容器与沙箱、subagent 疑似超量烧 token;多人称已改用 Low reasoning 档省钱且满意)。对 Claude Code Skills 是信任模型级信号——effort/推理档位若是 harness 侧变量,用户与模型都无法直接观测——"模型自述档位"不可作为调试依据,A/B 暗改若属实则 agent 行为漂移的第一嫌疑永远是平台层。

  • 来源: HN 讨论 · 原始推文 twitter.com/argofowl
  • 信号: HN 196p/175c · 社区实锤级讨论 · 未获官方回应(待验证)
  • 关键词: Claude Code Skills · coding-agent-harness · strained-coherence

2. SWE-bench Science — 科学软件工程基准:最强 agent pass@1 < 50%(arXiv:2608.19799)

软件越来越成为科学仪器本身的一部分,科学代码的失败不仅破坏程序行为,更动摇科学结论的证据基础。基准规模:119 个任务、98 个 GitHub 仓库、20 个科学领域,按三种范式组织(Issue 驱动 / 专家探索式 / 工程集成式)。核心结果:表现最好的 agent(Claude Code + Opus-5 (max))pass@1 仍低于 50%。论文识别出四类反复出现的失败机制:科学知识/抽象缺失、误导性探索或表面修补、修补覆盖不全或系统集成失败、无法把科学知识泛化到观察样例之外。配对消融最有信息量:移除显式科学指导后,科学知识并非 uniformly beneficial——对口的指导能约束修补范围、提升均分与 token 效率,不对口的指导反而诱发锚定效应、并不必然提升精确修补成功率。对 agent-evaluation 是基准级贡献——"给 agent 喂领域知识"不是免费午餐:知识质量与任务对齐度决定它是护栏还是锚——这为 vibe coding agent 的领域知识注入策略提供了反直觉警示。

  • 来源: arXiv:2608.19799
  • 信号: arXiv cs.CL/cs.SE · 119 任务/98 仓库/20 领域 · Opus-5 max pass@1 <50% · 四类失败机制
  • 关键词: agent-evaluation · Coding Agent Failure Patterns · coding-agent-harness

3. Credit Without Ground Truth — 步级 credit 信号审计:全部不优于随机(arXiv:2608.19760)

Agent RL 训练普遍依赖步级 credit 信号(LLM-judge 打分、outcome-conditioned logprob 比、policy 自身置信度)来分配奖励。论文用执行重放(executed replay)构造因果地面真值(在 ALFWorld 单 agent 工具环境中,在每个决策点重采样 policy 自己的替代选项并向前滚动,看结果实际改变什么)来审计这些信号。核心发现(反直觉级):没有任何一个步级 credit 信号在识别"哪些步骤因果重要"上优于随机;隐式 credit 只是回响 policy 的流畅度(中位秩相关 +0.75);以结果为条件不增加因果信息(偏相关 −0.004)。地面真值本身的结构:因果贡献是稀疏的(仅 30.5% 的可定义决策点有可测效应);可测性依赖模型(两个同规模 policy 之间"无 policy 支持的反事实"比例差 2 倍)。七臂预注册训练实验:没有任何臂可靠超越未训练 policy,检查点的表面提升完全由训练剂量(更稀疏的 credit 保留更少样本 → 优化器步数差一个数量级)解释——比较 credit 规则必须匹配有效样本量,否则测的是剂量不是 credit。对 agent-evaluation 与 Coding Agent Verification 是方法论警示级贡献——"步级打分"目前无地面真值支撑;agent 训练里的 reward shaping 有效性声明需要先过"剂量混淆"这一关。

  • 来源: arXiv:2608.19760
  • 信号: arXiv cs.LG · 49 页 · 预注册 · ALFWorld 执行重放 · 信号≈随机 · 剂量混淆
  • 关键词: agent-evaluation · Coding Agent Verification · Coding Agent Failure Patterns

4. Munder Difflin — 本地多 agent"克隆办公室" harness:用现有订阅跑 12 个 CLI(HN 294p/132c)

Show HN 热帖(294p/132c)。定位:免费开源、本地优先的多 agent harness,包装你已有的订阅(Claude Code、Codex、Copilot 等 12 个 CLI agent,走小时限额而非加价 API),把 agent 组织成一个像素风的"克隆办公室"——你在 Michael(老板)视角给克隆分派任务。社区反应两极:一边是"cringe"(nylonstrung)与"AI 网站都太啰嗦"的吐槽,一边是作者(Chaitanya Giri)现场答疑与"可爱且真的有用"的辩护,还有人纯为像素素材包付费。工程上值得关注的是其资源模型:多 agent 编排最大的成本障碍是 API 加价,Munder Difflin 用"复用订阅 + 小时限额调度"绕开了它——与 orca(51.8k★,#84 前已覆盖)的"自有订阅跑舰队"思路同源,但走了开源 + 本地路线。对 coding-agent-harness 是生态参照级信号——多 agent 编排的消费级形态正在成型:订阅复用是价格杠杆、像素办公室是注意力管理 UI(低带宽感知多 agent 状态)、本地运行是隐私默认——三者组合比"再做一个 orchestrator 框架"更有差异化。

5. Cursor 插件规范与官方插件 — orchestrate/Thermos 式工作流标准化(4.8k★)

Cursor 开源了插件规范 + 官方插件集(cursor/plugins,4,822 stars,2026-01 创建):每个插件是仓库根目录的独立目录 + .cursor-plugin/plugin.json manifest。官方插件实际上是一套多 agent 工程实践的标准件:orchestrate(planner/worker/verifier 分层 + 结构化交接的并行云 agent 扇出)、thermos("热核分支审查":安全/正确性深审 + 严苛质量 rubric + 并行 subagent)、continual-learning(transcript 驱动的 AGENTS.md 增量记忆更新)、ralph-loop(自引用迭代循环)、cli-for-agent(为 agent 设计 CLI 的模式:flags/示例 help/管道/幂等/dry-run)等 13 个第一方 + 20+ 第三方(Gmail、GitHub、Playwright、Salesforce 等)。对 coding-agent-harness 与 Claude Code Skills 是生态级信号——Cursor 把"插件 = 目录 + manifest"做成了与 Claude Skills 同构的分发格式,且官方插件内容(编排、审查、记忆、CLI-for-agent 模式)就是当前 harness 工程的最佳实践清单——IDE 阵营的 skills 生态竞争正式开始,跨格式兼容(npx skills add 支持 70+ agent)成为第三方作者的刚需。

  • 来源: GitHub cursor/plugins
  • 信号: 官方规范 · 4,822 stars · 13 一方 + 20+ 三方插件 · manifest 格式
  • 关键词: Claude Code Skills · coding-agent-harness · Coding Agent 编排模式

6. Apache Maka — ASF 孵化的本地优先 agent workspace:一切事件写入 append-only log(2,356★)

Apache Maka(孵化中):local-first AI agent workspace,核心设计是把模型消息、工具调用、工具结果、权限决策、终止事件全部记录为 append-only log——不可变事件流是审计与回放的基础。2,356 stars、Apache-2.0、2026-05 进入 ASF 孵化器、活跃(08-24 仍有推送)。这延续了 #86-88 追踪的"agent 事件溯源"主线(Agentic Transaction 的 ACID、LEDGER 的 claim-to-evidence 追溯),但 Maka 是第一个把这个设计带进 Apache 基金会孵化流程的项目——若毕业,append-only 事件日志可能成为大型开源社区推荐的 agent workspace 默认架构。对 coding-agent-harness 是基础设施级信号——"事件溯源 + 权限决策入日志"从论文概念走向基金会级开源实现——vibe coding agent 的 harness 若从一开始就把权限决策记为不可变事件,后续的审计、回放、争议仲裁都有地基。

  • 来源: GitHub apache/maka
  • 信号: ASF 孵化 · 2,356★ · Apache-2.0 · append-only 事件日志 · 2026-05 创建
  • 关键词: coding-agent-harness · Agent Safety · Agent Observability

7. What Makes Issue Resolution Tasks Difficult — 任务难度 86.3% 可由静态特征预测(arXiv:2608.18280)

benchmark 分数快速饱和,但"什么让一个任务比另一个难"几乎没有被系统量化。论文在 CoderForge-Preview(迄今最大的开放 coding-agent 轨迹数据集)上提取任务 patch、仓库、prompt 三层静态特征,用集成方法 + SHAP 归因 + 效应量分析预测任务结局。核心结果:任务难度可被静态特征实质性预测(AUC = 0.863),主要由 patch 碎片化程度与仓库规模驱动;prompt 语言特征只在中等难度带进入顶层贡献因子——难度呈现分层结构。ESEM 2026 已接收。对 agent-evaluation 是方法论级贡献——难度可静态预测意味着 benchmark 可以做"难度可控"构造(分层采样任务而非随机堆任务)——对 vibe coding agent 的自建 benchmark 直接可用:先用静态特征给任务池分层,再按难度配额抽样,避免"简单任务刷分、难任务无人问津"的假分辨率。

  • 来源: arXiv:2608.18280
  • 信号: arXiv cs.SE · ESEM 2026 · CoderForge-Preview · AUC 0.863 · patch 碎片化主导
  • 关键词: agent-evaluation · coding-agent-harness

8. RTPO — 逆向轮次策略优化:多轮 agentic RL 的三个不稳定源统一解(arXiv:2608.18682)

多轮 agentic RL 训练普遍不稳定,轮次越多性能退化越严重。论文通过理论分析识别出三个紧耦合的不稳定源:rollout-训练上下文错配、稀疏终端奖励下的弱轮级 credit 分配、长短轨迹在不同 policy 版本下优化产生的异步 policy 漂移——三者共同的结构性根源是扁平化轨迹优化。RTPO(Reverse-Turn Policy Optimization):把多轮 rollout 组织为稀疏逆向树、按时间逆序做轮级 policy 更新,使每个决策与它的下游延续对齐——因果一致的轮级 credit 分配 + on-policy 延续控制异步漂移。理论保证:消除上下文错配与异步漂移、降低 credit 偏差、收敛到递归最优。实验:在多轮 agentic RL 基准上比轨迹级基线 +21.50%、比轮级基线 +10.76%。对 agent-harness 是训练方法级贡献——与 #87 的 Agent Lightning/LEGO-RL(harness 参与训练)同谱系但解决的是训练侧稳定性:把"轨迹"还原为"树"是概念修正——多轮 agent 的每一步都是在为"尚未发生的分支"做决策,扁平化丢掉了这个结构。

  • 来源: arXiv:2608.18682
  • 信号: arXiv cs.AI · 理论保证 · 轨迹级 +21.50% / 轮级 +10.76% · 稀疏逆向树
  • 关键词: agent-harness · agent-evaluation

9. Repo0 — 从零到整库生成:Dual-DAG 架构状态的结构演化(arXiv:2608.19854)

现有 codegen 系统大多假设仓库架构已定;zero-to-all(从自然语言需求直接构建整个项目并全程保持模块化架构)是更难的开局设定。Repo0:维护显式架构状态——Dual-DAG(需求级 DAG + 组件级 DAG + 两者的对齐关系),从 NL 需求出发,在模块度指标引导下通过结构动作迭代演化组件边界直到结构收敛,收敛后的架构再指导测试驱动开发式代码生成。评测:RepoCraft 的 6 个真实仓库 × GPT-5 mini / DeepSeek V3.2,功能覆盖率最高比最强基线 RPG 高 20.08pp、通过率高 29.74pp;消融证实 Dual-DAG 架构状态、模块度引导演化、显式结构收敛各自必要。对 Context Engineering 与 coding-agent-harness 是任务表示级贡献——"架构即状态"是 intent-as-code(#88 Huzzah)的工程化版本:意图文件不是静态 spec,而是随开发持续演化、可对齐、可判收敛的结构——vibe coding agent 的任务表示层可直接借用 Dual-DAG 双层结构。

  • 来源: arXiv:2608.19854
  • 信号: arXiv cs.SE · Dual-DAG · 功能覆盖 +20.08pp / 通过率 +29.74pp vs RPG · 代码开源
  • 关键词: Context Engineering · coding-agent-harness · Coding Agent Verification

10. MidTool — 工具使用能力进 mid-training:开源语料管线(arXiv:2608.20314)

工具使用能力通常被留给后训练(SFT/RL);论文提出通用工具使用也值得专门的中期训练(mid-training)。MidTool 开源语料构造管线:大规模 web/PDF/代码数据 + 来自真实工具 API、MCP skills、文档接地工作流的合成监督,教模型识别工具可供性(affordances)、从上下文接地参数、组合调用工作流、从残缺信息中恢复。实验:Qwen3-4B/8B-Base 在 MidTool-Mix 上 mid-train 后再 SFT/RL 后训练,在 BFCL、tau2-Bench、MCP Universe 三个基准上持续优于基线。数据与模型开源。对 Context Engineering 与 mcp-security 是训练经济学级信号——MCP skills 直接进入 mid-training 语料——"模型出厂就会用 MCP"与"harness 运行时注入工具"是两条正在合流的路线——工具使用从 prompt 工程问题变成预训练数据问题,skill 作者写的 MCP server 描述可能正在变成训练语料。

  • 来源: arXiv:2608.20314
  • 信号: arXiv cs.AI · Qwen3-4B/8B · BFCL/tau2-Bench/MCP Universe · 数据模型开源
  • 关键词: Context Engineering · mcp-security · agent-harness

11. Code Health 与 LLM 测试生成 — 可维护性是弱但一致的信号(arXiv:2608.18645)

LLM 生成的单元测试质量如何随代码可维护性变化?用 CodeScene 的 CodeHealth(CH)指标分级,跨 Python/Java/C++ 测覆盖率与 mutation score,并测不同 CH 代码的输入 token 消耗。核心发现:CH 对 LLM 生成测试的有效性提供弱但一致的信号,且与输入 token 数负相关——代码越健康,agent 生成有效测试的把握略高、花的 token 略少。SCAM 2026 工程轨已接收(作者含 CodeScene 创始人 Adam Tornhill——有工具利益关联,但结论措辞克制)。对 Coding Agent Verification 是实践级贡献——"先还技术债再让 agent 写测试"有了初步实证支撑:可维护性不只是人类工程学,也是 agent 效率变量——但"弱信号"意味着它不构成硬门槛,别把它写进 CI 强制规则。

  • 信号: arXiv cs.SE · SCAM 2026 · Python/Java/C++ · 弱但一致 · CH 与 token 负相关
  • 来源: arXiv:2608.18645
  • 关键词: Coding Agent Verification · Coding Agent 成本优化

12. Henka — Trino 之父的语义感知重构 MCP server(martint)

Martin Traverso(Presto/Trino 创造者,GitHub bio 实证)的个人项目 Henka:多租户 MCP server,提供结构化、语义感知的代码重构——rename/extract/inline/change-signature/organize-imports/find-usages 由语言自己的编译器视图(Eclipse JDT 等 LSP 工具链)计算,而非文本匹配编辑。HN 上仅 1 点、repo 仅 1 star(2026-05 创建,08-23 由 martint 本人提交)——信号不在热度而在作者与思路。数据库领域顶级工程师亲自验证了一个判断:agent 的代码编辑需要"编译器级语义"而非字符串替换——这与 patchloom(结构化文件编辑 MCP)、Locus(Rust AST 引擎)、DOCSCHISEL(#87 工具文档优化)同谱系。对 coding-agent-harness 是工具设计级信号——"让 agent 用语言服务(LSP/JDT/AST)而不是正则改代码"正在从论文建议变成基础设施老兵的亲手实践——vibe coding agent 的编辑工具层应优先绑定语言服务器而非文本 diff。

  • 来源: GitHub martint/henka · HN
  • 信号: Trino 创造者个人项目 · 1★(早期)· Apache-2.0 · Eclipse JDT + LSP 工具链
  • 关键词: coding-agent-harness · Coding Agent Verification

观察清单

主题 信号强度 备注
地面真值危机 ★★★★★ SWE-bench Science <50%; credit 信号≈随机; 剂量混淆
平台暗改信任裂缝 ★★★★ effort A/B 疑云 196p/175c; 模型不知自身档位; 待官方回应
插件化 harness 生态 ★★★★ Cursor 规范 4.8k★; Maka 进 ASF; 订阅复用编排
难度可控评测 ★★★★ AUC 0.863 静态预测; patch 碎片化主导; ESEM 2026
多轮 RL 稳定性 ★★★★ RTPO 逆向树 +21.5%; 三不稳定源统一解
架构即状态 ★★★ Repo0 Dual-DAG +29.74pp; 结构收敛先行
工具能力进 mid-training ★★★ MidTool 开源语料; MCP skills 入训练数据
语义编辑基建 ★★★ Trino 之父 Henka; LSP/AST 替代文本编辑
可维护性弱信号 ★★ CH 弱一致; SCAM 2026; 勿作硬门槛
落选备查 ★★ amux 365★ 控制平面; Knowl 自修剪记忆; Voro 注意力管理; Epho curl 跑 Claude Code