Agent Learning Daily Digest #80 — 2026-08-12

arXiv 论文爆发日——4 个查询全部成功,~46 篇论文入库,去重后 9 篇高信号论文入选,占比 9/12。今日核心主题:自进化 coding agent harness由 Ouroboros 领衔(自开发 coding agent,工具/提示/核心通过 reviewed commits 进化,Terminal-Bench 2.1 86.74%);harness scaffolding 成本主导效应由 7×5×1 受控实验揭示(scaffolding 差异导致 139× 成本差异,远超 MCP vs CLI 接口差异);agent 轨迹归因自动诊断由 TRACE 推进(72.7% 根因归因 + 82% 端到端修复率);activation probe 安全信号提取开辟 coding agent 安全审查新范式(线性探针捕获模型输出遗漏的漏洞信号);specification-path sensitivity新失败模式由 SpecPath 发现(35/100 合同等价路径导致 agent 行为差异);Claude Code PII 泄露(curl User-Agent 头泄露真实邮箱,HN 36p/29c)。产品/实践信号:OpenCodeReview(阿里巴巴,确定性代码审查 2.17× 效率),SiriusDeliver(腾讯企业级 DW 交付 agent),FailForge(从失败中蒸馏技能再训练)。

今日高信号

1. Ouroboros — 自进化 coding agent harness,reviewed core evolution(arXiv:2608.08311,HN 4p/1c)

Ouroboros 是一个自开发(self-developing)前沿 coding agent——其工具、提示和核心逻辑通过reviewed commits 持续进化。关键:进化是人类审查的(human-governed),不是无监督的自我修改。在 Terminal-Bench 2.1 上达到 86.74%,在 OSWorld-Verified 上达到 90.69%(使用 Opus 5)。论文还描述了一个名为 Hope 的 161 天 living-agent 实验部署。对 coding-agent-harness 是范式级贡献——harness 不再是固定脚手架,而是可进化的活体系统——但进化需要人类审查门控(reviewed commits),而非自主修改,这是安全自进化的关键设计约束

⚠️ 描述更正:原始描述"tops agent benchmarks"过于泛化——Ouroboros 在 Terminal-Bench 2.1 和 OSWorld-Verified 上领先,非泛指所有 agent 基准(如 SWE-bench)。自进化是 reviewed(人类审查的),非自主。

2. Scaffolding Matters More Than Interface — harness 架构主导成本(7 scaffoldings × 5 models × 1 task)(arXiv:2608.08654)

论文通过严格受控实验比较了 MCP vs CLI 工具接口的成本:7 种 agent scaffoldings × 5 语言模型 × 1 固定软件任务。核心发现:scaffolding(harness 架构)对成本的影响远超工具接口。scaffolding 间成本差异高达 139×(对 27B 本地模型);MCP-to-CLI 成本比跨度从 0.43× 到 29×(方向不稳定);7 个 scaffoldings 中有 2 个不支持 MCP,且恰好比支持 MCP 的便宜 5-28×。MCP 失败浪费 12.9% 的支出 vs CLI 的 2.2%。对 coding-agent-harness 是实证级贡献——agent 成本优化的第一杠杆不是工具接口(MCP vs CLI),而是 harness 架构本身——harness 选择决定了一个数量级以上的成本差异

3. TRACE — Agent 轨迹归因自动诊断上下文失败(arXiv:2608.09153)

TRACE(TRajectory Attribution for Automated Context Engineering)是一个自动化反馈回路,通过挖掘历史 agent 轨迹来诊断和修复上下文失败。核心洞察:agent 失败的根因(system prompt 错误、知识库缺口、工具描述问题、技能缺陷)可通过轨迹中的隐式不满足信号(用户纠正、重新表述、放弃)自动归因。达到 72.7% 根因归因准确率82% 端到端修复有效率。对 Context Engineering 是方法论级贡献——上下文工程维护的瓶颈(人工日志审查不可扩展)可以通过轨迹挖掘自动化——将 agent 运行历史转化为可操作的上下文修复信号

4. Activation Probes — 从模型内部激活提取安全信号(arXiv:2608.09643)

论文提出在开源权重审查模型上使用线性激活探针(linear activation probes)来恢复编码 agent 输出中的安全信号。关键发现:探针在 61-67% 的单函数漏洞对上击败随机基线,且超越了直接询问模型(prompted YES/NO 和 chain-of-thought 判定)——后者在漏洞/修复对上绝大多数返回相同答案。对 Agent Safety 是范式级贡献——coding agent 的安全审查不能仅依赖模型输出(prompting),模型内部的激活状态包含了输出层遗漏的安全信号——线性探针是一种低成本、高信号的提取方法

5. SWE-Bench ProMax — 大规模多语言重构基准(arXiv:2608.09802,best model 41.2%)

SWE-Bench ProMax 是一个 170 实例的多语言代码重构基准(7 种语言,平均 11.4 文件、261.6 LOC 修改)。论文引用了此前审计发现的"~60% 的 SWE-bench Verified 未解决实例包含缺陷测试"(过窄测试拒绝正确方案或过宽测试检查未声明需求),以此为新基准的动机。最佳前沿模型仅解决 41.2%。对 agent-evaluation 是基准级贡献——现有 SWE-bench 正在饱和且质量存疑——多语言大规模重构是下一个评测前沿,41.2% 的解决率说明 agent 在真实复杂重构上仍有巨大差距

⚠️ 来源更正:60% 缺陷测试发现来自此前审计(被引用),非 SWE-Bench ProMax 论文自身发现。

6. SpecPath — 规范路径敏感性:同一需求的不同表述导致 agent 行为差异(arXiv:2608.09799)

论文发现了 specification-path sensitivity——一种新的 coding agent 失败模式:当语义等价但表述路径不同的规范历史被输入同一 agent 系统时,agent 产出行为不同的程序。在受控实验中,35/100 个在直接规范上成功的完整代码块,在至少一个合同等价的历史路径上失败——尽管总体准确率看起来不变。对 Coding Agent Failure Patterns 是概念级贡献——agent 的需求遵循能力存在路径依赖——不只是最终规范的内容,规范是如何演化到达的也决定了 agent 的行为。这对 evolving-requirement 场景(敏捷开发)有直接实践意义

7. Claude Code 泄露真实邮箱——curl User-Agent 头 PII 泄露(GitHub Issue #78431,HN 36p/29c)

Claude Code v2.1.212 在生成的 curl 命令中,将用户的真实邮箱地址放入 HTTP User-Agent中,未征得用户同意。多位用户在 issue 评论中确认了此行为(session-log 提取显示 curl -s -H "User-Agent: a...)。Issue 状态:open。HN 36 分 / 29 评论。这是继 #79 Anthropic 内容溯源讨论后的又一 Agent 安全事件——coding agent 在与外部服务交互时可能在 HTTP 头中泄露用户 PII,这对企业部署和合规有直接影响

8. Skill Runtime Intelligence — Agent Skills 生命周期被动运行时重建(arXiv:2608.08793)

Skill Runtime Intelligence(功能视图:Run Panorama)是一个被动运行时智能系统,跨异构 harness 重建 Agent Skill 的生命周期阶段。核心问题:渐进式加载创建了在 session/model/tool 追踪中难以表示的失败边界——一个 Skill 可以被发现但未激活,被激活但无指令,或看起来成功但没有独立验证的结果。系统使用四级证据等级(不可变事件 / 确定性关系 / 推断诊断 / 受控结果)分离信号。6 repo profiles × 3 agents × 7 conditions(126 次执行)测试。关键发现:原始追踪在全部 18 个干净 case 上发出误报失败;Panorama 零误报。对 Claude Code Skills 是基础设施级贡献——Skill 系统需要独立的运行时验证层——原始工具追踪不足以判断 Skill 是否真正成功执行

9. OpenCodeReview — 确定性优于非确定性:成本高效的 agent 代码审查(arXiv:2608.09290)

OpenCodeReview(阿里巴巴,github.com/alibaba/open-code-review)解决了当前 LLM 代码审查 agent 的两个弱点:非确定性(无限工具调用导致审查结果不稳定)和上下文局部性(审查者仅能访问 diff,限制发现深度)。设计三个确定性注入点:Rule-Guided Dispatch(规则引导分发)、Grounded File Review(ReAct + 并行 SubAgents)、Independent Reflection(证伪优先独立反思)。在 AACR-Bench 上击败 Claude Code 和 Codex:SEM-F1 高 2.17×(25.10% vs 11.57%),token 消耗少 5-15×。对 coding-agent-harness 是方法论级贡献——agent 代码审查的成本和可靠性可通过确定性管道设计大幅改善——关键在于用确定性约束控制非确定性的 LLM

10. SiriusDeliver — 腾讯企业级数据仓库交付 agent(arXiv:2608.09185)

SiriusDeliver 是腾讯开发的企业级数据仓库交付 agent,部署在腾讯云 WeData 平台。三个核心组件:分层交付 agent(hierarchical delivery agent)、工件生命周期控制(artifact lifecycle control)、追踪驱动的技能进化(trace-driven skill evolution)。真实部署数据:3,600 月活用户、18,240 会话、87.2% 成功率、中位交付时间从 228 分钟降至 23 分钟、工程师投入从 95 分钟降至 11 分钟。对 coding-agent-harness 是生产验证级贡献——coding agent 在企业 DW 交付场景的价值已被大规模生产数据验证——依赖感知编排 + 工件生命周期 + 追踪驱动技能进化是企业级 agent 的关键架构模式

11. FailForge — 从持续失败中蒸馏程序化能力训练 code agent(arXiv:2608.08570)

FailForge 解决了 RFT(rejection sampling fine-tuning)的一个根本浪费:强 code agent 在相当一部分任务上反复失败,标准 RFT 直接丢弃这些失败样本——而这些恰恰是最难、最有信息量的。方法:诊断失败 → 蒸馏为简洁技能 → 注入上下文引导重试 → 训练成功轨迹 → 训练时移除技能(使模型内化行为而非依赖技能)。恢复了 26%+ 的失败实例,在 Qwen3.5-4B 上 SWE-bench Verified 较 RFT 基线 +6.6 分。对 Claude Code Skills 是训练方法级贡献——失败是最有价值的训练信号——通过"技能蒸馏→引导重试→训练时移除技能"的循环,可以将 agent 的持续失败转化为内化的程序化能力

12. How to Organize Claude Code for Product Work — 产品工作中的 Claude Code 组织实践(HN 35p/26c)

实践级博客文章,总结在产品工作(非纯工程)中组织 Claude Code 的经验:starter workspace(启动工作区)、setup skill(安装技能)、按变更速率(change velocity)对文件分层排序、将重复工作转为技能、每次纠正只记录一次。HN 35 分 / 26 评论——在 Claude Code 实践类内容中关注度较高。对 Claude Code Skills 是实践级贡献——Claude Code 的文件组织不应按功能分类,而应按变更速率分层——高变更频率文件需要不同的上下文管理策略

观察清单

主题 信号强度 备注
自进化 harness(reviewed) ★★★★★ Ouroboros: reviewed core evolution, Terminal-Bench 86.74%, OSWorld 90.69%
Scaffolding 成本主导 ★★★★★ 7×5×1 实验: scaffolding 间 139× 成本差异, MCP vs CLI 不稳定
轨迹归因自动化 ★★★★ TRACE: 72.7% 归因, 82% 修复率, 挖掘隐式不满足信号
Activation probe 安全 ★★★★ 线性探针捕获 prompting 遗漏的漏洞信号, 61-67% 对
Spec-path 敏感性 ★★★★ SpecPath: 35/100 等价路径导致行为差异, 新失败模式
PII 泄露 ★★★ Claude Code curl User-Agent 泄露邮箱, HN 36p
Skill 运行时验证 ★★★★ Skill Runtime Intelligence: 零误报 vs 原始追踪全误报
确定性代码审查 ★★★★ OpenCodeReview: 2.17× SEM-F1, 5-15× token 节省
企业 DW 交付 ★★★★ SiriusDeliver: 3600 用户, 87.2%, 228→23 min
失败蒸馏训练 ★★★ FailForge: 26% 恢复, +6.6pp, 技能→内化
产品 Claude Code 实践 ★★★ 变更速率分层文件组织, HN 35p