Agent Learning Daily Digest #117 — 2026-09-30
📊 筛选总结
- 采集:254 条 — GitHub topic + Trending 全成功;HN RSS 双 502、Algolia 补偿;arXiv 4 查询约 47 篇全成功(curl 修复后第四日,0 错误);r/MachineLearning 与 r/LocalLLaMA 429、r/ClaudeAI 恢复
- 跨天去重约 18 条:arXiv 旧帖 0(今日 47 篇全是 2609.32xxx+ 新 ID,#116 的 30xxx 簇自然退场)+ HN 旧帖 5 条(Perfect Crime、DASP、Datadog、RRSI、Albanese Medicare 均前两日已录,同文同址)+ Trending skill 军团约 13 条再现(paperclip / orca / univer / hindsight / treg / Octop / CLI-Anything / security-audit-skill / financial-services / claude-code-action / claude-code-templates / harness-sdk / stagehand)
- 今日主线:"安全的重心从'检测 agent'搬到'基础设施不信任 agent'"——Tracekit 把执行痕迹搬出 agent 可写范围(#115 Perfect Crime 的工程回答)、Corvic Vault 把 API 密钥搬出 LLM 词表、SideKernel 把执行搬进 microVM、AgentBound 证明"该不该行动"要按反事实口径评测;同日 Break Judges 揭示连 LLM 评委本身也能被系统性攻破——信任链上每一环都在找"agent 够不着的位置"
- 高信号:Tracekit(哈希链+外部锚点,1,600 次篡改全捕获,但截断只有锚点能抓——检测率 0.47 的诚实边界);Break Judges(突变策略绕过 GPT-5.6-sol/Codex/Opus 5 全部受测评委);RepoReuse(50.8% 任务链到第 5 轮就在重复造轮子);AgentBound(GPT-5.5 未授权拦截 99.5% vs 风险 authorized 完成 28.7%——过度拒绝首次量化)
- 生态侧:Sonnet 5.5 发布日(CodeRabbit 厂商自测:catches 多于 Sonnet 5、耗时一半,但 Opus 5.5 同集仍 8-10/13 领先——差距未关);SideKernel 12★(Georgia Tech capstone,首个 macOS coding-agent 专用 microVM 沙箱)
今日高信号
1. Tracekit — Perfect Crime 的工程回答:intent/reasoning/action 三通道哈希链账本,agent 会话记录变得不可静默篡改;但截断攻击只有外部锚点能抓(arXiv 2609.35659,独立作者)
Tracekit: Tamper-Evident Intent-Reasoning-Action Auditing for Autonomous Coding Agents(arxiv.org/abs/2609.35659):#115 Perfect Crime 证明 9/10 harness 的执行痕迹可被 agent 删改,这篇就是补丁——开源、零依赖,把每个 agent 会话拆成三通道记录:人要了什么(intent)、模型自称在想什么(self-report)、实际执行了什么(actions),写入哈希链账本、可外部锚定,三通道交叉核对。实测:hook 开销 23.9ms;regex 门拦下 44 个有害样本中的 18 个(误伤 3/40);14 次注入运行全部 4/4 被披露;LLM 审查 98/98 判对(FP 1/14);1,600 次篡改全部检出。关键的诚实边界:哈希链本身只能保证"改了会断链",尾部截断/整链重算只有外部锚点能发现——300 条记录一锚的检测率 0.47。对 Coding Agent Verification 是审计链从原则到参考实现的落地——与 #115 Perfect Crime(结论)、#116 MetaPermit(LLM 归类+固定策略裁决)同线:'证据在 agent 手里就不算证据'现在有了第一个可直接抄的开源实现;'锚点间隔 vs 检测率'的取舍曲线提醒我们审计系统自己的参数就是攻击面。
- 来源: arxiv.org/abs/2609.35659
- 信号: 命名系统 Tracekit · 三通道哈希链账本 · 1,600 篡改全检出 · 截断仅锚点可抓(0.47@300 条)· 23.9ms hook · 独立作者参考实现
- 关键词: Coding Agent Verification · Agent Safety · Forge Guardrails
2. SDLI — 轨迹级安全债:不只看最终补丁,把 agent 走过的每个中间代码状态的安全风险积分起来(arXiv 2609.35199)
Trajectory-Level Security Debt in LLM Coding Agents(arxiv.org/abs/2609.35199):现有评估只看最终产物,但 coding agent 在提交前会经过数百个中间代码状态——安全缺陷可能在中途被引入、又被"顺路"埋进最优路径。提出 Security Debt Line Integral(SDLI):当 agent 刷新最佳测试通过率时,累积当时的静态分析风险;用 4 个 SAST 工具实例化,分析了 830 个通过的 SWE-bench 运行、712 个 ProgramBench 最终工作区。作者自己先把口径收紧:这是扫描器发现、不是已验证的漏洞率;能否用于引导 agent 行为"尚待建立"。对 Agent Safety 是"安全度量从产物级升到轨迹级"的第一份形式化——与 #1 Tracekit 共享同一个洞察:agent 的危险不在终点状态而在路径上;与 #116 Cost-Inefficient 三行为连读:浪费行为和安全债都是'轨迹级'现象,产物级评估对两者都失明;自建 harness 的安全门应该在每次刷新最佳通过率时快照扫描,而不是只在 PR 终点。
- 来源: arxiv.org/abs/2609.35199
- 信号: 命名指标 SDLI · 830 SWE-bench + 712 ProgramBench · 4 SAST 工具 · 轨迹级积分 · 作者自注"扫描器发现≠已验证漏洞率"
- 关键词: Agent Safety · Coding Agent Verification · Coding Agent Failure Patterns
3. AgentBound — 工具 agent 安全的反事实评测:风险、可行性与能力三者混杂,过度拒绝 ≠ 任务失败(arXiv 2609.33658)
AgentBoundary: Counterfactual Evaluation of Safety in Tool-Using LLM Agents(arxiv.org/abs/2609.33658,摘要中系统名为 AgentBound):对话场景的安全对齐只需回答"答还是拒",agent 场景变成执行中随权限证据浮现而动态决定"做不做"——表面的风险、动作的可许性、任务能力三者极易混淆,agent 式过度拒绝因此难以与普通任务失败区分。用反事实配对(同一动作、权限证据不同)来拆开这三个因素。GPT-5.5 上的量化结果扎眼:未授权动作拦截 99.5%,但看起来有风险的已授权动作完成率只有 28.7%;校准后 +18.2%/+5.4%。对 Agent Safety 是"过度拒绝"的首个系统评测口径——与 #6 Break Judges、#115 评分器偏向同属'评测口径诚实性':把 agent 的'怂'误记成'不会',安全分数就虚高;99.5% vs 28.7% 这对数字是给所有安全层的:拦截率高不等于可用,两个数必须成对报——与 #116 OpenAPPA 的 0% 攻击/89% 完成口径完全一致。
- 来源: arxiv.org/abs/2609.33658
- 信号: 命名系统 AgentBound(标题作 AgentBoundary)· 反事实配对评测 · GPT-5.5 拦截 99.5% vs 完成 28.7% · 过度拒绝与任务失败解耦
- 关键词: Agent Safety · agent-evaluation · Forge Guardrails
4. Corvic Security Vault — "API 密钥永远不该成为 LLM 词表里的 token":vault 中介执行实测 16 探针/7 域全过,但作者自认"必要而非充分"(arXiv 2609.33371)
API Secrets Should Never Become Tokens in the LLM's Vocabulary(arxiv.org/abs/2609.33371):工具型 agent 把凭证卫生从"存储问题"变成"执行安全问题"——贴进 prompt、嵌进 system prompt 或工具配置的密钥,从认证边界跨进数据管道,可能驻留在会话历史、日志、记忆库、生成代码和错误负载里;prompt injection 与过度权限再把被动泄露放大成未授权动作。论文形式化这条威胁链,并实测 vault 中介执行(Corvic Security Vault):密钥不进上下文,agent 拿到的是引用,工具调用时由 vault 侧注入——16 探针/7 域全部通过,但作者明说这是必要条件而非充分,且记录了一个负结果(某 connector 的 header 映射破坏了其 provider 的认证契约)。对 mcp-security 是"密钥与上下文隔离"的正式化——与 #1 Tracekit、#5 SideKernel 同日构成"agent 够不着的三件套":痕迹、密钥、执行全都搬到 agent 视野外;MCP 工具作者值得把'凭证引用而非字面量'作为工具设计的默认。
- 来源: arxiv.org/abs/2609.33371
- 信号: 命名系统 Corvic Security Vault · 密钥→词表 token 的威胁链形式化 · 16 探针/7 域实测 · 自注"必要而非充分" · 负结果在录
- 关键词: mcp-security · Agent Safety · agent-skill-security
5. SideKernel + 《Between Two Uncomfortable Choices》 — macOS coding-agent microVM 沙箱与沙箱地形图:进程级沙箱共用宿主内核、microVM 也有逃逸先例,"沙箱远胜于无,但别错误安心"(GitHub 12★ + sidekernel.com/essay)
SideKernel(github.com/minoansecurity/sidekernel,总 12★,Swift,Apache-2.0,Georgia Tech 硕士 capstone,research preview):基于 Apple Virtualization.framework + Kata 内核的 macOS coding-agent 沙箱,Apple Silicon 专用——把 agent 的 shell/文件/网络整体搬进 microVM。配套论文式 essay(sidekernel.com/essay)把沙箱地形讲透:现有沙箱瞄准的是生产 SDK agent 而非终端 coding agent;进程级沙箱(Landlock/Seatbelt)与 agent 共享宿主内核,CVE 在录;microVM 也有逃逸先例(Docker Sandboxes CVE-2026-77179);易用性功能本身在加攻击面——结论是"沙箱 ≫ 无沙箱,但不要错误安心"。对 Agent Sandbox Checkpoint 是 macOS 侧的落地样本+地形图——与 #4 Corvic Vault、#1 Tracekit 同一条'基础设施不信任 agent'主线;12★ capstone 品质但要按 research preview 对待;自建 harness 的执行层可以借它的分层威胁模型:先问'哪条读路线能区分是谁在读'(#206 同日论文证明容器/权限/沙箱都答不了),再谈隔离。
- 来源: github.com/minoansecurity/sidekernel · sidekernel.com/essay/
- 信号: Apple Virtualization.framework + Kata · macOS/Apple Silicon 专用 · 进程级沙箱共享内核 CVE · microVM 逃逸 CVE 在录 · 12★ capstone research preview
- 关键词: Agent Sandbox Checkpoint · Agent Safety · coding-agent-harness
6. Break Judges — LLM 评委可被系统性攻破:突变策略绕过 GPT-5.6-sol、Codex、Opus 5 全部受测评委,且评委可靠性在研究前沿处退化(arXiv 2609.33773,UPenn)
Learning Strategies to Break Judges(arxiv.org/abs/2609.33773,UPenn:Shabadi, Naik, Alur):agent 超过人类后,"谁来评 agent"变成 LLM-as-judge——但怎么信评委?提出 agent 引导的方法:自动发现 agentic judge 的弱点、并暴露可解释的失败机制(以数学推理为场)。结果:突变策略能绕过全部受测评委(GPT-5.6-sol/Codex、Opus 5/Claude Code 系),且评委可靠性在研究前沿处系统性退化。对 agent-evaluation 是"裁判也不可信"的定量证据——与 #115 迁移 skill 的评分器偏向、#115 SWE-Prometheus 双教师盲评连成一条线:评委是单点故障,被攻破时整条评测链失效;实际推论不是弃用 LLM judge,而是换族+对抗测试:先跑一遍'评委能不能被绕'再采信它的分数——自建评测的裁判层需要把这些突变策略当回归测试。
- 来源: arxiv.org/abs/2609.33773
- 信号: agent 引导突变攻击 · 绕过 GPT-5.6-sol/Codex/Opus 5 全部受测评委 · 可解释失败机制 · 前沿处可靠性退化 · UPenn(Alur 组)
- 关键词: agent-evaluation · Coding Agent Verification · Multi-Agent Communication Patterns
7. RepoReuse — coding agent 在重复造轮子的定量证据:50.8% 任务链到第 5 轮已包含重复实现,每次重复=同一个 fix 要打两遍(arXiv 2609.35357)
Do Coding Agents Reuse Existing Code or Reinvent the Wheel?(arxiv.org/abs/2609.35357):对真实仓库做迭代开发时 agent 到底复用还是重造?现有评测几乎不回答这个问题——而agent 产码速度远超人类审计速度,冗余在无人监督下累积。提出 RepoReuse,多轮 benchmark,在真实仓库中审计代码复用;3,000 轮审计的核心数字:50.8% 的任务链到第 5 轮已出现重复逻辑。对 agent-evaluation 是"复用行为"的首个专项评测——与 #116 Cost-Inefficient 的相似脚本重写行为互为印证:浪费行为的第三种(重写)在这里拿到仓库级定量;与 #116 Compact Documentation 的'有源码时文档不加分'合看:agent 不是不知道代码在,是检索/复用决策本身没被奖励;自建 harness 值得把'复用率'列进轨迹审计探针,与三个浪费探针并列。
- 来源: arxiv.org/abs/2609.35357
- 信号: 命名 benchmark RepoReuse · 50.8% 链条@第 5 轮重复 · 3,000 轮审计 · 多轮真实仓库 · "每个重复=fix 打两遍"
- 关键词: agent-evaluation · Coding Agent Failure Patterns · Coding Agent 成本优化
8. Sonnet 5.5 发布日的 code review 裁据 — CodeRabbit 厂商自测:catches 6/13 vs Sonnet 5 的 4/13、耗时减半、每评审成本 −60%,但"漏的不同"且 Opus 5.5 仍领先同集(coderabbit.ai 博客)
Claude Sonnet 5.5 for code review(coderabbit.ai/blog/sonnet-5-5-model-review):Sonnet 5.5(09-28 发布,Claude 5.5 家族第二款)的模型发布日里最有工程含金量的一份裁据——但注意这是 CodeRabbit(商业 code review 产品)的厂商自测:自有管线+自有 judge,OSS 复跑 judge 评分仍"pending",无 p 值无置信区间。数字:13 个已知问题集上 6/13 vs Sonnet 5 的 4/13,精确率持平(41.2% vs 40.0%),耗时 5:27 vs 9:55;44-PR 全量跑 6:33 vs 13:31、评论数 −24%、每评审 $0.46 vs $1.16(约省 60%)。关键细读:"catches 更多"的真相是两代模型漏的不一样(6/13 有分歧;Sonnet 5 挑出的 2 个 Sonnet 5.5 漏了);且同集上 Opus 5.5 仍 8-10/13 领先——Sonnet 5.5 没有关闭与 Opus 的差距。对 agent-evaluation 是模型发布日怎么读厂商 benchmark 的示范样本——与 #115 Nubank 仿真门同框架:单点厂商分数只当筛选信号不当结论;'漏的不同'对 code review 管线是可操作发现:双模型并行评审的召回并集可能显著大于任何单模型——但成本×2,值不值按缺陷后果定价。
- 来源: coderabbit.ai/blog/sonnet-5-5-model-review
- 信号: 厂商自测(judge 复跑 pending)· 6/13 vs 4/13 · 耗时减半 · $0.46 vs $1.16(−60%)· "漏的不同" · Opus 5.5 同集仍 8-10/13
- 关键词: agent-evaluation · Coding Agent Verification · Coding Agent 成本优化
9. Tool-Schema Bias — 同一个动作换等价工具定义,agent 行为就不一致:11 个 LLM、32 个变体上成功率从全崩到 97%,训练只修见过的变体(arXiv 2609.34971)
Action-Space Shaping for LLM Agents: Measuring and Mitigating Tool-Schema Bias(arxiv.org/abs/2609.34971):工具 schema 不是 agent 的动作空间,只是它的一种接口表示——同一个可执行动作可以用许多功能等价的工具定义暴露;真正学会任务的 agent 应该在它们之间表现一致。实测:当前 agent 往往不一致(命名为 schema bias),用 9 个变换算子在 11 个 LLM、32 个变体上测量,成功率从完全失败到 97% 不等;训练只能修复训练时见过的变体。对 coding-agent-harness 是工具接口层的"表示敏感性"定量——与 #111 WorkOS 的工具定义租金连读:工具定义不仅租 token,还在暗中决定成败——schema 写法本身就是 harness 的一部分;自建 MCP 工具的 schema 要用'等价变换不变性'自测:换一种等价写法成功率掉多少,掉得多说明 agent 在背接口而不是会任务。
- 来源: arxiv.org/abs/2609.34971
- 信号: schema bias 命名 · 9 变换算子 · 11 LLM×32 变体 · 成功率全崩→97% · 训练只修见过的变体
- 关键词: coding-agent-harness · agent-evaluation · CodeGraph
10. JAM — Just-In-Time Agent Memory:把"预先建好记忆"换成"查询时按需构建",训练侧 SFT + Hint 引导 GRPO(arXiv 2609.34385)
Just-In-Time Agent Memory with Runtime Agentic Research(arxiv.org/abs/2609.34385):主流 agent 记忆是 Ahead-of-Time(AOT)设计——请求到来前就把记忆建好,省线上成本,但与请求无关的构建会丢弃后来变重要的细粒度信息。提出 JAM:运行时按查询条件构建上下文的可训练框架——Memorizer 保留完整原始历史,Researcher 在查询时做 agent 式检索研究;配套 Memory-Gym(9 类任务/6 域);训练走 SFT 然后 Hint 引导的 GRPO。对 Agent Memory 是记忆构建时点的第三条路——与 #115 Motif(团队会话入图)、Knowledge-as-Skill(知识组织协议)正交:它们管'记忆的结构与归属',JAM 管'何时构建'——AOT 省 token 但丢细节、JIT 保细节但每次查询都要花推理钱;这正是 #116 CliffCompaction 压缩经济学的记忆版:'可再生内容按需重建、不可再生内容才持久化'——自建记忆层先给信息分'可再生性'等级再选时点。
- 来源: arxiv.org/abs/2609.34385
- 信号: 命名框架 JAM · Memorizer 保留全历史 · Memory-Gym 9 任务/6 域 · SFT→Hint-guided GRPO · AOT vs JIT 构建时点
- 关键词: Agent Memory · Context Engineering · coding-agent-harness
11. AfS — "研究原生"的科学 agent 平台:多数 science agent 是"通用 coding agent + skills 文件夹",承压时会编造/跳步/抹平——AfS 把可信度搬进可复验的工作流结构(arXiv 2609.35182,系统描述、无 benchmark)
Research-Native by Construction(arxiv.org/abs/2609.35182):AfS(Agent for Science)是为长时程科学工作建的平台——项目跑几十小时、跨几十次 agent 运行、人只在场偶尔。诊断很准:大多数 science agent 是挂了 skills 文件夹的通用 coding agent,继承了那个谱系的失败模式——在'完成'的压力下编造、跳步、抹平。设计主张:机器研究的大部分可信度可以从"问模型"搬到可复验的工作流结构——最小节点、可重复验证的步骤、复利式记忆。注意定位:这是系统描述论文,作者自报"不提供 benchmark",只测了运行成本。对 coding-agent-harness 是 harness 承载可信度的又一证词——与 #115 Datadog 验证金字塔同构但换了域:'可信度在工作流结构里而非模型里'是同一条设计律;'不提供 benchmark'反而是诚实的——它把自己放在设计提案位而不是结论位;AfS 的'最小节点+可复验步骤'可以直接映射进自建 harness 的任务分解规范。
- 来源: arxiv.org/abs/2609.35182
- 信号: 命名平台 AfS · "skills 文件夹谱系"失败诊断 · 可信度搬进工作流结构 · 最小节点+可复验+复利记忆 · 自报无 benchmark(设计提案定位)
- 关键词: coding-agent-harness · Coding Agent Verification · Agent Memory
12. Agent Swarms as Researchers — Purdue/Aalto 团队放出一群 coding agent 自主产出的大批研究笔记:"不供应科学想法、只给一条常驻指令",但作者自认未全验(arXiv 2609.35719)
AI Agent Swarms as Researchers(arxiv.org/abs/2609.35719,Gusev & Bernal Neira,Purdue/Aalto——独立学术团队,非前沿 lab):给一群现成 coding agent 一段范围陈述(从窄题目到整个领域)、文献与计算工具的访问权、一条常驻指令:做出真实、正确、有用的进展,不要停——不供应任何科学想法。数周内 agent 群产出大批研究笔记,09-25 未编辑直接放出。验证状态要读仔细:作者不声称内容全部正确或新颖;"就我们目前核查的部分,未发现重大科学错误,若干结果已在证明助手中形式化验证";完整评审预计需数月。对 Multi-Agent Communication Patterns 是"产出速度 >> 审查速度"的活样本——与 #115 Perfect Crime、#1 Tracekit 同一条信任链的终点:当产出量大到无法人审,'正确'就只能靠结构保证(证明助手、可复验工作流——正是 #11 AfS 的主张);这也是 #115 RRSI 自改进线的'社会实验版':常驻指令'不要停'就是无限循环授权——边界在哪、何时停,论文本身成了待验证对象。
- 来源: arxiv.org/abs/2609.35719
- 信号: Purdue/Aalto 独立团队 · 蜂群数周产出大批笔记 · 无科学想法输入 · 部分结果证明助手验证 · 自认未全验(完整评审需数月)· 09-25 未编辑放出
- 关键词: Multi-Agent Communication Patterns · Agent Safety · Coding Agent Failure Patterns
观察清单
| 主题 | 今日信号 | 强度 |
|---|---|---|
| 基础设施不信任 agent | Tracekit(痕迹外置)+ Corvic Vault(密钥外置)+ SideKernel(执行外置)+ AgentBound(权限反事实评测):安全层全部搬到"agent 够不着的位置" | 🔥 强 |
| 评测口径诚实性 | Break Judges(评委可被绕过)+ CodeRabbit(厂商自测的"漏的不同"细读)+ SDLI(作者自注扫描器≠已验证漏洞):三处都在给"分数"去魅 | 🔥 强 |
| 轨迹级审计 | SDLI(安全债沿轨迹积分)+ RepoReuse(50.8% 链条重复)+ TraceDance(2609.33295,从部署轨迹自动构行为 benchmark):轨迹成为一等审计对象 | 中 |
| 记忆构建时点 | JAM(JIT vs AOT)+ TraceDance 的 Anchor-and-Confirm 检索:记忆/检索的"何时"开始比"什么"更重要 | 中 |
| 产出-审查失衡 | Agent Swarms(数周产出、数月评审)+ AfS(可信度进工作流)+ 证明助手验证比例:自主产出的验证瓶颈浮出水面 | 中 |
| 待验证 / 弱信号 | The Compiler May Read It(2609.35557,15 条读路线无一能区分"谁在读"——容器/权限/沙箱三失效,与 SideKernel 互证);Codoku 2609.34661(可再生 program-reasoning benchmark,抗污染思路);AuxMark 2609.34597(蒸馏水印);Trajectory-Level 同场加映 TraceDance/PowerBench 域专项 benchmark;HN "Estela"(从 CC/Codex 日志重建工时——日志即资产侧应用);KISS(Rust 版 Pi 系 harness,2p) | 弱 |