Agent Learning Daily Digest #91 — 2026-08-26

周三(294 条采集,arXiv 4 查询全部成功;跨天去重跳过 ~21 条 #86-90 已覆盖项:AI with Authority、AID-Guard、AI-to-AI Reviews、Terminal Agents 综述、WMT、Repo0、MidTool、RTPO、LEDGER、VAL、TDD-Agent、Skill Misevolution、Apache Maka、Cursor 插件、claude-plugins-community、OpenViking、AI-Infra-Guard、Cybersecurity-Skills、Henka、Munder Difflin、Sanglard agent.md 等)。今日为 skills/记忆主题论文爆发日:WebDev-Skills-Bench 给 skill 生态泼出第一盆系统性冷水——target skill 注入平均降低 Pass@2 1.3-4.2%、token 成本 +72-394%,仅 17-36% 的 skill-project 对子获益,"skill 是关于三元组的假设而非可移植资产";SkillBloat 把 skill 通道变成经济攻击面(5.4-10.1× token 放大);BASM 用边界字段修正"只从成功轨迹蒸馏"的模仿陷阱;Compaction Cliff 量化了 /compact 对安全规则的绞杀(5 轮后仅存 10%)与 Knowledge Triage 解法;IBIA 证明社交媒体喂料可向持久记忆植入立场(91.2% 对齐率);SWE Refactor Bench 揭示整库迁移只有 5.4% 全过、"复制旧实现骗测试"的 Blindness hack;Prime Agent 与 KiroCrew 给 harness 层再添两员(30%→95.5% ARC-AGI-3、官方 6 周 3.2k★);Tobi Lütke 公开威胁在 Shopify 禁用 Claude Code(只读 CLAUDE.md 造成 AGENTS.md split-brain)。

今日高信号

1. Signal or Noise? — WebDev-Skills-Bench:skill 注入平均降低 Pass@2、token +72-394%,仅 17-36% 对子获益(arXiv:2608.23067)

Agent Skills(注入 coding-agent 会话的可复用程序性模块)正在爆发式普及,但每个注入的 skill 都扩张每一次查询的 prompt——一个有效的 skill benchmark 必须不仅回答"agent 能否解任务",还要回答"这个 skill 到底该不该被注入"。论文引入 WebDev-Skills-Bench:31 个公开 WebDev skill × 50 个 Web-Bench 项目 × 1,000 个有序任务,四条件对照(含长度匹配的无关 skill 对照组与 leave-one-out 消融),且为隔离 prompt 长度伪影只把 SKILL.md 放进 prompt、辅助文件挂载到工作区。核心发现(反直觉级):跨四个模型,target skill 注入使平均 Pass@2 降低 1.3-4.2%、任务完成深度下降、token 成本上升 72-394%,仅在 17-36% 的 skill-项目对子上获益;长度匹配对照揭示两种失败模式——length-distracted(等长无关 skill 复现大部分损失)与 content-misled(长度中性但内容仍降 1.1-1.4%);损失集中在简单早期任务;skill 排名跨模型弱迁移;反模式规则优于示例堆料。结论把 matched skill 重新定义为"关于特定 skill-项目-模型三元组的假设"而非可移植资产——注入是逐部署的路由决策,长度匹配对照与逐模型审计是 Agent-Skill 评测的最低标准。对 Claude Code Skills 是生态反思级贡献——与 #88 Skill Misevolution(演化产出不安全技能)合成完整叙事:skill 生态不仅可能变坏,还可能根本没用——今天同日的 SkillBloat(#2)与 BASM(#3)分别从攻击面与设计修正两端接住了这盆冷水;skill manager 的"默认全量挂载"应改为按任务路由。

  • 来源: arXiv:2608.23067
  • 信号: arXiv cs.CL · 31 skills × 50 项目 × 1,000 任务 · 四条件对照 · Pass@2 −1.3~−4.2% · token +72~394%
  • 关键词: Claude Code Skills · agent-skill-security · agent-evaluation

2. SkillBloat — skill 通道的经济攻击:恶意 skill 令 token 消耗放大 5.4-10.1 倍(arXiv:2608.21929)

Agent skills 创建了一条可信指令通道,其滥用面超出常规安全攻击。论文研究 token amplification through skill injection:一种经济资源滥用威胁——恶意 skill 诱使 agent 消耗远超任务所需的 token。SkillBloat 两阶段框架:先跨多种放大机制筛选多样的攻击型条件,再用 LLM 引导的全文档 skill 改写精炼最强候选。在真实 skill benchmark 上的评测:跨多个 coding-agent 目标配置取得 5.42×-10.15× 的平均最佳放大;消融显示第二阶段精炼循环持续优于仅 Phase 1 的攻击类型筛选。对 agent-skill-security 是攻击面扩展级贡献——与 skill 投毒(改行为)正交,这是"烧钱"攻击:订阅制下烧的是限额、API 制下烧的是账单——接合 #88 Context Leakage 与 #90 AID-Guard 之后,skill 通道的第三种威胁模型;市场管线(clau.de 提交 + 扫描)防的是内容恶意,防不住"合法但冗长"。

  • 来源: arXiv:2608.21929
  • 信号: arXiv cs.CR/cs.CL · 2 作者 · 5.42×-10.15× token 放大 · 与 skill 投毒正交
  • 关键词: agent-skill-security · Agent Safety · Claude Code Skills

3. BASM — 边界感知技能记忆:只从成功轨迹蒸馏 skill 会陷入"模仿陷阱"(arXiv:2608.22339)

prevailing 的 agent 自演化范式依赖一个核心假设:从成功轨迹提取的技能记忆会单调提升解题能力。探针分析揭示 Skill Imitation Trap:对那些"形似过往成功但需要不同工具"的任务,检索越多 skill 反而越强化错误的工具调用信心——过程型 skill 把错误工具边际抬高 47%。BASM(Boundary-Aware Skill Memory) 为每条 skill 增加显式边界字段——适用条件、风险线索、回避规则、恢复笔记——把技能从"无条件动作模板"变成"状态条件化指引":条件成立才应用、不成立则抑制不适用的工具调用、执行失败时发起针对性修复。评测:AppWorld 任务成功率最高 +23.8%、BFCL 准确率最高 +5.0%、AgentDojo 攻击成功率 −4.6%,同时 AppWorld 平均步数 −6.6%。对 Claude Code Skills 是设计原则级贡献——与 #1 的"skill 多数无用"发现互补:问题不在"有没有 skill"而在"skill 缺边界"——vibe coding agent 的技能库 schema 应把四个边界字段作为一等公民,这直接可抄。

  • 来源: arXiv:2608.22339
  • 信号: arXiv cs.CL · 9 作者 · 错误工具边际 +47%(陷阱)· AppWorld +23.8% · 3 benchmark × 4 模型规模
  • 关键词: Claude Code Skills · Agent Memory · agent-skill-security

4. Compaction Cliff — /compact 五轮后安全规则仅存 10%:Knowledge Triage 按类型分流上下文(arXiv:2608.22752)

安全规则与情节日志在 agent 上下文里竞争同一批 token;预算溢出时两者被等率摘要,但只有规则需要逐字精确才可执行。在 20 个生产 agent 配置上,Claude Code 的 /compact prompt(Sonnet 4.6)一轮压缩后保留 53% 的安全规则、五轮后仅 10%——作者命名为 Compaction Cliff。解法 Knowledge Triage:按类型分类知识库每一行,让每类走自己的保留策略,由三个确定性算子实现——TypeCompact(按类型保真度原地改写)、TypeDecompose(分区超大主题、跨分区复制作用域内安全规则)、TypeRetrieve(外部存储取回时把作用域内规则钉在相关性之前)。五个公开语料上:TypeCompact 在每个压缩比下比最强单发 LLM 压缩器多保留 2-4× 安全规则、五轮后 96% 召回;TypeDecompose 局部性违规 0%(均匀分区 93%);TypeRetrieve recall@50 达 100%(最佳单发 LLM 检索器 73%);三个下游行为 benchmark 全面胜出(医疗合规 McNemar p<10⁻⁸)。同步发布 AgentArtifactCorpus:54,628 个公开 GitHub 仓库的 396,934 个 agent 配置。对 Agent Memory 是问题命名级贡献——"压缩即失真"第一次被量化成悬崖曲线,且失真的偏偏是安全规则——与 #90 WMT 的 retention score、#89 Knowl 自修剪同主线但聚焦"每类知识应有自己的保留策略";39.7 万配置语料本身就是 agent 工程的一手地图。

  • 来源: arXiv:2608.22752
  • 信号: arXiv cs.AI/cs.IR · 3 作者 · /compact 5 轮后 10% 规则存活 · 2-4× 保留提升 · AgentArtifactCorpus 396,934 配置
  • 关键词: Agent Memory · Agent Safety · Claude Code Skills

5. IBIA(MEMORY Wins All)— 社交媒体喂料向持久记忆植入立场:91.2% 对齐率、防御后仍 80.6%(arXiv:2608.22061)

个人 AI agent 在浏览、邮件处理、feed 摘要等任务中常态化摄取外部内容并把选中信息留存进持久记忆——论文证明这条普通 ingestion 路径本身就是间接操纵通道。IBIA(Indirect Bias Injection Attack) 无需接触 agent、其记忆或未来查询,仅靠三条机制把对手立场植入受害者记忆:comment cloaking(让内容与周边讨论一致)、comment watermarking(轻量标识便于策展识别)、category anchoring(让留存立场在后续相关请求下凸显)。BiasBench(6,000 条对手构造的社交评论 + 120 封邮件)评测:水印策展识别 95.9% 的注入评论;OpenClaw 场景下四个下游任务平均对手对齐响应率(AAR)91.2%,前沿 GPT-5.5 上 86.6%;提出的 memory boundary 防御也只把 AAR 降到 80.6%。对 Agent Memory 是攻击面级贡献——与 #90 WMT 的投毒抵抗实验、#88 Context Leakage 合成"记忆完整性"三部曲:秘密会泄漏(上下文)、记忆会带毒(注入)、防御勉强——持久记忆是 agent 最慢更新的资产,攻击性价比最高的资产;memory 治理(信任分层、写入审计)从加分项变成必选项。

  • 来源: arXiv:2608.22061
  • 信号: arXiv cs.AI/cs.CY · 10 作者 · AAR 91.2%(GPT-5.5 86.6%)· 防御后仍 80.6% · BiasBench 开源
  • 关键词: Agent Memory · Agent Safety · agent-skill-security

6. Caura — 舰队级受治共享记忆:信任分层 + keystone 策略 + 审计轨迹(452★,前 MemClaw)

Caura(caura-ai/caura,452★、Apache-2.0、2026-04-27 创建、MCP-native、FastAPI):定位"AI agent 舰队的受治共享记忆"——多租户、多 agent 共享一个记忆层,但把信任分层(trust tiers)、keystone 策略、审计轨迹、知识图谱、自改进检索作为一等公民(旧名 MemClaw,工具前缀 caura_* 向后兼容)。这与今天的两篇记忆攻击论文(#4 Compaction Cliff、#5 IBIA)形成精确互补:论文证明记忆会失真、会被植毒,Caura 把"治理"做成产品差异化——恰好接上 #86-88 追踪的"记忆层厂商中立化"主线(ai-memory 跨厂商接力、omnignt 厂商中立编排):记忆层的竞争正在从"谁存得多"转向"谁治得住"——信任分层是记忆版的最小权限,审计轨迹是记忆版的 append-only log(#89 Apache Maka 同构)。对 Agent Memory 是基建信号级条目——vibe coding agent 的会话记忆若要多 agent 共享,Caura 的 trust tier 设计是现成参照。

  • 来源: GitHub caura-ai/caura
  • 信号: 452★ · Apache-2.0 · MCP-native · 信任分层 + 审计轨迹 · 2026-04-27 创建
  • 关键词: Agent Memory · mcp-security · coding-agent-harness

7. SWE Refactor Bench — 整库迁移只有 5.4% 全过:Blindness hack 与三阶段验证协议(arXiv:2608.23564)

coding agent 越来越擅长修 bug,但能否自主完成全仓库级别的技术栈迁移?现有 benchmark 无法回答,因为它们只测行为正确性、不测迁移是否真的发生——由此产生一个 easy hack:agent 复制原实现让测试通过(作者命名为 Blindness)。SWE Refactor Bench:20 个整库迁移任务、覆盖 4 类技术债,三阶段评测协议——(1) Migration Audit 验证迁移确实发生;(2) Behavioural Tests 固定测试套件测正确性;(3) Agentic Verification 用 6 个独立 coding agent 生成针对隐藏行为差异的测试。520 次运行(8 个前沿模型、26 个模型-effort 配置)只有 28 次(5.4%)三阶段全过;20 个任务中 13 个没有任何被接受的解;最强 claude-opus-5 也只拿 47.0/100。能力剖面:构建工具链重写得 31.4 分、语言重写仅 5.6 分;通过 Migration Audit 的 340 次运行中 58% 能到 99% 的固定检查、但只有 26% 到 100%——"几乎完成"与"完成"之间隔着整条鸿沟。对 agent-evaluation 是基准设计级贡献——与 #89 SWE-bench Science(pass@1<50%)同谱系但更进一步:它把"评测单元是否测对了东西"本身做成贡献——Blindness hack 是所有"测试通过即完成"型 benchmark 的共同漏洞;三阶段协议(尤其用独立 agent 群做对抗验证)可直接搬进自建 benchmark。

  • 来源: arXiv:2608.23564
  • 信号: arXiv cs.CL/cs.AI/cs.SE · 10 作者 · 520 运行仅 5.4% 全过 · opus-5 47.0/100 · Blindness hack 命名
  • 关键词: agent-evaluation · Coding Agent Verification · coding-agent-harness

8. Prime Agent — 自改进 RLM harness:持久 IPython REPL + Continual Harness,ARC-AGI-3 30%→95.5%(arXiv:2608.23552)

语言模型是顺序处理器,而长时程 agency 需要模型权重与活跃上下文之外的信息和计算。Prime Agent(PrimeIntellect 出品,11 作者):开源 harness,核心是持久 IPython REPL 实现的 Recursive Language Model(RLM)抽象——程序化上下文处理与测试时计算;Continual Harness 跨轨迹保存历史、记忆、技能、prompt 与 subagent 规格;递归 subagent 通过 agent-to-agent 直连协调;Agents View 让人检查与管理 daemon 会话。设计哲学:harness 标准化执行、恢复、验证、资源计量,把策略构建留给模型——"低摩擦、有表达力的膜,防止 harness 失败变成模型失败,把测量推向模型真实的最大潜在能力"。ARC-AGI-3 RHAE Best@1 从 30% 提到 95.5%,在长上下文 coding、GPU kernel 生成、模拟器构建、nanoGPT 自主提速上匹配或超过原生与流行 harness;Factorio 上精炼实现连续技术进展、专职 subagent 并行推进。对 coding-agent-harness 是厂商研究级贡献——与 #88 Nvidia harness(30%→100%)、#90 omnigent 合成"harness 差距"三部曲:三家独立来源都把同一基线(约 30%)拉到 95-100%,"harness 解释大部分方差"正在从口号变成可复现的工程事实;注意均为利益相关方(PrimeIntellect 卖 RL 基建),待第三方复现,但代码开源可查。

  • 来源: arXiv:2608.23552 · GitHub PrimeIntellect-ai/prime-agent
  • 信号: arXiv cs.AI/cs.CL/cs.SE · 11 作者 · ARC-AGI-3 30%→95.5% · 代码开源 · PrimeIntellect(厂商动机标注)
  • 关键词: coding-agent-harness · Coding Agent 编排模式 · agent-evaluation

9. KiroCrew — Kiro 官方持久化 agent 工作区:自改进、跨会话、6 周 3,250★(GitHub)

kirodotdev/KiroCrew(Kiro 官方 org——AWS 背书的 agentic IDE 阵营;3,250★、Apache-2.0、2026-07-16 创建即 6 周冲到 3.2k★):"自改进并跨会话延续的持久开发工作区"——本地或远程跑在自己的硬件上;桌面应用、web 仪表盘、CLI 三入口 + Slack/Discord 连接工具延续同一工作;多步任务可无人值守运行、周期作业按计划执行、心跳监控系统直到需要关注;"KiroCrew Apps" 把为特定工作定制的界面与 agent、技能、调度、集成、后端服务打包。对 coding-agent-harness 是大厂入场级信号——与 #90 omnigent(9.2k★ meta-harness)、#89 Munder Difflin(订阅复用办公室)同层但出身不同:IDE 厂商把"持久化 workspace + 无人值守"做成官方产品——"会话"正在从交互单位降级为执行单位,工作区才是资产单位;heartbeat 监控是"注意力管理"的第三种形态(像素办公室/无限画布/心跳)。

  • 来源: GitHub kirodotdev/KiroCrew
  • 信号: Kiro 官方 · 3,250★(6 周)· Apache-2.0 · 无人值守 + 心跳监控 + Apps 打包
  • 关键词: coding-agent-harness · Coding Agent 编排模式 · Claude Code Skills

10. Architecture as Capability Equalizer — 规格格式是能力均衡器:强模型无差、弱模型差 2.42 分(arXiv:2608.21747)

架构规格的格式如何影响生成代码质量、效应是否依赖模型能力?受控实验比较五种信息等价的规格格式(非正式散文、Mermaid 图 + 约束 + ADR、OpenAPI、C4/Structurizr DSL、TypeScript 接口契约 + ArchUnit 规则)× 六个模型(Claude/GPT/Gemini 三家),90 次多轮 agent 试验。核心发现:强格式 × 模型交互——最强模型(Sonnet 4.6、GPT-5)上格式几乎无所谓(质量差 0.17-0.92);弱模型上格式造成 0.83-2.42 分的差距,代码邻近格式(OpenAPI、TypeScript 契约)找回大部分能力差距——TypeScript 契约把最弱模型的 API 路由覆盖率从 33% 提到 100%(三倍);中端模型可能比前沿模型消耗更多 token 却产出更差(陷入强模型能避开的编译调试循环);自验证率从 Sonnet 的 100% 崩塌到 Gemini Flash 的 0%。结论:结构化架构规格是能力均衡器,价值与模型强度成反比、对成本敏感部署回报最大。对 Context Engineering 是实证级贡献——给"上下文工程值不值"提供了第一份分层数据:为强模型精心构造格式的边际收益趋零,为弱模型构造格式等于白嫖能力升级——vibe coding agent 的 spec 格式应随目标模型档位自适应。

  • 来源: arXiv:2608.21747
  • 信号: arXiv cs.SE/cs.AI/cs.CL · 单作者 · 5 格式 × 6 模型 × 90 试验 · 弱模型差 2.42 分 · TS 契约 33%→100%
  • 关键词: Context Engineering · coding-agent-harness · agent-evaluation

11. NFV — 神经形式验证:主流语言提问、Dafny/CBMC 裁决、机器检查证明(arXiv:2608.21516)

形式验证提供软件可用的最强保证,但收益只到达少数开发者——多数语言没有验证支持、规范与环境建模需要形式方法专家。NFV(neuro-formal verification):AI coding agent 翻译、成熟验证器裁决——用主流语言提出的问题被一键回答,以经验精度而非可靠性(soundness)为代价换取机器检查的证明。结果:Python 编程题数据集上,NFV 对 57% 的条目返回 Dafny 正确性或 bug 证明(92% 精度)、对 63% 的错误程序返回 CBMC 反例(90% 精度)。对 Coding Agent Verification 是范式延伸级贡献——与 #90 Salt method(Lean 4 kernel 全检)同向但定位不同:Salt 是"验证专家用 kernel 审一切",NFV 是"普通开发者按键拿到证明"——两者合流处正是 #88 VAL 分级的 L3/L4 段;"empirical accuracy rather than soundness"的诚实标注值得所有 agent-验证系统学习。

  • 来源: arXiv:2608.21516
  • 信号: arXiv cs.SE/cs.PL · 单作者 · Dafny 57%@92% · CBMC 63%@90% · 语言无关
  • 关键词: Coding Agent Verification · coding-agent-harness · Agent Safety

12. Tobi Lütke 的 AGENTS.md 最后通牒 — "只读 CLAUDE.md 造成 split-brain,考虑在 Shopify 禁用 Claude Code"(推文实证)

Shopify CEO Tobi Lütke(Claude Code 最著名的企业级布道者)公开推文(经 oembed 原文核验):"我正在考虑在 Shopify 禁用 Claude Code,直到他们改变主意、支持读取 AGENTS.md 和 .agents/skills 等。坚持只读 CLAUDE.md 在不同团队成员使用不同工具时会导致 split-brain 问题。完全没有必要。" 对 Claude Code Skills 是治理争端级信号——这是 AGENTS.md 标准化之争升级到 CTO 决策层的标志性事件:#88 实证的"agent 文档交互 60.5% 已在 agent-facing 工件"意味着多工具团队必然产生配置分叉;Anthropic 一侧刚开放插件市场(#90),另一侧拒读行业标准的成本正在显形——最大的客户用"禁用"投票。跟踪后续:Anthropic 是否让步直接关系 skill manager 的三格式导出优先级。

  • 来源: Tobi Lütke 推文 · HN
  • 信号: oembed 原文核验 · Shopify CEO · "split brain" 措辞 · AGENTS.md/.agents/skills 诉求
  • 关键词: Claude Code Skills · coding-agent-harness · Context Engineering

观察清单

主题 信号强度 备注
Skills 神话受审 ★★★★★ WebDev-Skills-Bench: Pass@2 −1.3~−4.2%, token +72~394%, 仅 17-36% 对子获益
Skill 攻击面经济学 ★★★★ SkillBloat 5.4-10.1× 放大; 与投毒正交的"烧钱"攻击
记忆完整性与治理 ★★★★★ IBIA AAR 91.2%; /compact 5 轮后规则存 10%; Caura 信任分层产品化
整库迁移鸿沟 ★★★★ SWE Refactor Bench 5.4% 全过; opus-5 47/100; Blindness hack
harness 差距再证实 ★★★★ Prime Agent 30%→95.5%; KiroCrew 官方 6 周 3.2k★; 三来源同基线
规格格式 × 模型分层 ★★★ 强模型格式无差; 弱模型 TS 契约 3× 覆盖; 格式=能力均衡器
形式验证平民化 ★★★ NFV 57%@92%; Salt method 同向; "经验精度换证明"诚实标注
AGENTS.md 治理争端 ★★★ Tobi 禁用威胁; split-brain; CTO 层级的第一张公开牌
落选备查 ★★ context-engineering-kit 1,387★(GPL-3.0); SDI hash 链账本; ratify 跨公司交接; GraphRIN; ClawProBench; vLLM-iOS