Agent Learning Daily Digest #109 — 2026-09-22

📊 筛选总结

  • 采集:292 条 — GitHub topic + Trending 全成功;HN RSS/Algolia 正常;arXiv 4 查询全成功;r/LocalLLaMA 429、r/MachineLearning 与 r/ClaudeAI 恢复
  • 跨天去重约 37 条:arXiv 19 条重现(ContrAgent / SafeHarness / OverclaimBench / harness 实证 / SoL-Pi / Spotlights / SERBench / DeltaSelect / LearnActCoder / Reachability / Treadstone / Not-All-Equal / MTAC / IUE / BLINDSPOT / Spurious Tool Use / ActGuard / Stochastic Deputy / Benchmark Radar,均在 #106–#108)+ HN 旧帖 4 条(ZCode / Casbin Gateway / Pizza Bot / usenotch 10x)+ Trending skill 军团约 14 条再现(orca / context-mode / PI-Desktop / OpenSpec / hyperframes / Agent-Reach / humanizer / Claude-Red / ECC / addyosmani agent-skills / open-code-review / ai-agent-book / claude-code 本尊 / knowledge-work-plugins)
  • 今日性质:arXiv 强势日——新鲜批次 12 篇可用(授权/验证主题密集),12 条里 arXiv 8 条,HN/博客补位 4 条
  • 今日主线:"给信任定结构化边界"——agent 活得比发起进程久(Quiescence 撤权协议)、能花真钱(APort Vault:4,371 条人工攻击重放,确定性事前检查把越权收款打到 0)、能进市场接活(LEGIT 凭据协议);评测侧同日给出 tick 级断言(GameLogicBench)、RL 环境量产管线(CodeMidas)与 TDD-with-agents 全景图
  • 高信号:APort Vault 事前检查层 76,842→0 越权、且 25,370 笔正常支付照跑(强制 ≠ 拒付);Jev/oko 用 System One 评分模型做代码搜索,162 会话实测 Claude Code 快 31%;Trail of Bits 公开 6 个月 agent 辅助 zkVM 审计的工程方法

今日高信号

1. APort Vault — 给"能花钱的 agent"做支付授权基准:4,371 条人工攻击公开重放,OAP 确定性事前检查把越权收款打到 0/69,297,正常支付照跑 25,370 笔(arXiv:2609.22076)

APort Vault(arxiv.org/abs/2609.22076,09-18 提交):把一次公开 CTF 期间人类攻击者对真实支付 agent 的 4,371 条攻击重放到 8 家实验室 14 个模型 × 5 档策略配置,完成 225,964 次评估。方法论主张先立规矩:每次评估拆 5 个独立事件分别报告——"把事件合并成一个数字,正是 agent 基准产出经不起 review 的结果的做法"。核心数据:请求率跨配置的差异远大于跨模型的差异(L1 10.9% → L4 79.4%);L4 的 1,293 条 prompt 里 62.6%(809 条)让全部 14 个模型都发起支付。关键在授权边界:无检查层时对 passport 未授权收款人的转账 140/76,842,挂上 Open Agent Passport(OAP)确定性事前检查后 0/69,297(配对三元组 105 vs 0,会话级上界 0.38%)——且这层强制不是靠拒付实现的:25,370 笔支付在层后正常执行,策略只拒绝了 187/25,640 笔转账调用。对 Forge Guardrails 是"事前确定性检查"最完整的公开评测证据——与 #108 Casbin Gateway(~40 开关编译策略每请求强制)、#107 ContrAgent(契约→DFA)同一条确定性路线,这次拿到了支付域的攻防实测数字:结构化边界可以把越权压到 0 而不牺牲任务完成率,'安全 vs 可用'的旧权衡在授权域被数据拆掉了。

  • 来源: arxiv.org/abs/2609.22076v1
  • 信号: 命名系统 APort Vault · 4,371 人工攻击 × 14 模型重放 · 225,964 次评估 · 越权 140→0 且 25,370 笔照付 · "5 事件/评估"反合并方法论
  • 关键词: Forge Guardrails · Agent Safety · Coding Agent Verification

2. Root-Scoped Quiescence — 活得比发起者久的 agent 怎么撤权:取消/退出/吊销凭据都关不掉预切通道,需要"根作用域静默"协议 + 独立 checker 全量验证(arXiv:2609.21284)

Root-Scoped Quiescence(arxiv.org/abs/2609.21284,09-18 提交):长时程 agent 通过凭据、委派任务、队列、回调、预留和 provider 侧操作活得比发起进程更久——进程取消、退出、凭据吊销既关不掉所有预切载体,也分不清"独立授权的共享工作"。论文定义 root-scoped authorization quiescence:对每个已显形的 sink,用证书核算退役根纪元原子下所有与切割相关的接受,栅栏后排除受保护接受,同时允许向当前独立充分支持精确重绑定;协议线性化根切割、栅栏旧根扩张、把替代/合取授权表示为最小充分根集的反链、把 provider 前沿证书组合成已注册旧根路径的割集;通道令牌精确对账,证据缺失或冲突保持"未定"。配套形式化证明(切后 issuer 不扩张、支持可靠投影、组合可靠性、崩溃/重放稳定性等)+ 独立实现的 checker 验证 17/17 条轨迹。对 Agent Safety 是"撤权"这个被长期忽视的面的第一份系统协议——与 #108 Reachability(通道拓扑 > 瞬时观测)同一形式方法学派:两者都在说 agent 的授权/通道状态会以发起者看不到的方式存活;对自建无人值守循环的直接启示:取消按钮不等于撤权,任务终止时要有一份'还欠哪些回调/队列/预留'的账。

  • 来源: arxiv.org/abs/2609.21284v1
  • 信号: 命名系统 Root-Scoped Quiescence · 取消≠撤权(预切载体)· 反链最小根集 · 独立 checker 17/17 · 形式化证明全套
  • 关键词: Agent Safety · Forge Guardrails · Coding Agent 编排模式

3. (Don't) Trust, but (Don't) Verify — 100 人受控观察:拿到 5 个 AI 生成的链表实现随便挑,开发者到底看不看出漏洞、用什么线索、信任怎么扭曲决策(arXiv:2609.21020)

开发者安全注意力研究(arxiv.org/abs/2609.21020,09-17 提交):AI 助手产出不安全代码已是共识,但更基础的一步没人系统测过——开发者怎么评估 AI 生成的代码:能否识别漏洞、依赖什么线索、信任如何塑造决策。100 人远程观察实验隔离"评估"这一步:4 个 C 链表任务、要求产出安全且功能正确的代码,每个任务可在 5 个安全性/功能性各异的 AI 建议间循环挑选,选定后编辑提交;辅以决策问卷 + 23 人深访。标题的双重否定就是结论预告:既不能全信、也没有真的在验证(摘要只给出实验设计,漏洞识别率与线索分析待全文;标注待验证)。对 Coding Agent Verification 是把 OverclaimBench(#106,模型侧夸大汇报)补上人的这一半——与 #107 mati(部落知识不读不给改)连读:模型汇报不可靠 + 人工审查不过关,两头都靠不住时,确定性结构(hook、断言、事前检查)就不再是'加分项'而是唯一剩下的防线;自建工作流里'人审 AI 代码'这个环节应默认按不可靠设计,用测试与静态检查兜底。

  • 来源: arxiv.org/abs/2609.21020v1
  • 信号: 100 人受控观察 · 5 建议循环挑选范式 · 隔离"评估"阶段 · 信任×线索×漏洞识别 · 结果细节待全文(待验证)
  • 关键词: Coding Agent Verification · Agent Safety

4. CodeMidas — RL 环境从代码本身量产:agent 管线把已实现功能变成可执行环境,5,545 任务 / 3,185 仓库 / 23 语言,MiMo-V2.5 全五基准上涨(arXiv:2609.22068)

CodeMidas(arxiv.org/abs/2609.22068,09-18 提交):RL 训练 coding agent 需要大量带可靠验证器的任务;既有方法依赖 issue/commit 等开发痕迹,任务面受限。CodeMidas 把源码本身当作唯一输入,把既有代码库里已实现的功能转成可执行 RL 环境:agent 探索已实现功能 → 形成行为规约 → 以原代码执行为锚构造测试 → 执行检查 + 重复 rollout 验证过滤。产出 5,545 任务 / 3,185 开源仓库 / 23 语言 / 15 技术域;用 GRPO 训 MiMo-V2.5:issue 修复 DeepSWE +11.7%、整程序构造 ProgramBench +17%、终端任务 Terminal-Bench v2.1 +8.5%,五基准全涨;消融确认高质量任务越多越好;轨迹分析显示训后 agent 更多探索代码库、自验证更多样。对 coding-agent-harness 是"环境供给"的量产答案——与 SoL-Pi/SIFT/Spotlights 链(#106–#107)拼上最后一块:那三条解决'循环与评估',CodeMidas 解决'练什么';'源码即任务源'对自建项目零成本适用——自己仓库里每个已实现函数都能变成带验证器的训练/回归环境。

  • 来源: arxiv.org/abs/2609.22068v1
  • 信号: 命名系统 CodeMidas · 源码为唯一输入 · 5,545 任务/3,185 仓库/23 语言 · DeepSWE +11.7% / ProgramBench +17% · agent 全程建环境
  • 关键词: coding-agent-harness · agent-evaluation · Coding Agent Verification

5. GameLogicBench — tick 级状态断言评 coding agent:72 个 Godot 游戏逻辑任务、每仿真 tick 查规则、变异体拒绝保"测行为不测实现",最强组合也只有 52.78%(arXiv:2609.21562)

GameLogicBench(arxiv.org/abs/2609.21562,09-18 提交):游戏开发里 agent 必须实现"玩着才暴露"的规则——游戏可以在运行中违反规则、最后却停在合法状态;现有基准重放固定样例、给视频打分或让另一个模型当裁判,都无法全执行过程验证。GameLogicBench:72 个 Godot 玩法逻辑任务,自动评估器在每个仿真 tick 检查规则;403 个手工场景 × 种子参数变化 = 1,451 测试用例;为防"测的是实现选择",评估器必须接受同一任务的不同正确实现、同时拒绝摘掉一项能力的变异体。20 组模型×脚手架组合里最好成绩 52.78%;Claude Code 脚手架下全部 12 个模型随任务从孤立机制→多系统交互→仓库级特性扩展而持续掉分;多数失败提交能跑、只是行为实现错了。对 agent-evaluation 是"执行证据"评测的新粒度——与 #108 Canny ledger(append-only 记录 + replay 裁决)、TDD survey(今日 #8)同框:'每个 tick 断言'是 Canny'每步留证'的极端形式;'变异体拒绝'设计可直接抄进自建评测,防止评估器退化成实现风格检查。

  • 来源: arxiv.org/abs/2609.21562v1
  • 信号: 命名系统 GameLogicBench · 72 任务/1,451 用例 · tick 级断言 · 变异体拒绝 · SOTA 组合仅 52.78% · 规模扩展全模型掉分
  • 关键词: agent-evaluation · Coding Agent Verification · DeepSWE Benchmark

6. LEGIT — agent 市场的凭据协议:基准分不可比也不可验,把"可测能力"绑进证书、连接认证/声誉/任务分配(arXiv:2609.21325)

LEGIT(arxiv.org/abs/2609.21325,09-18 提交):agent 市场正在成形——能力各异的自主 agent 替买家完成专门任务,但买家没法判断哪个 agent 对自己的任务最合适:上报的基准分难以跨任务/软件/预算验证或比较。LEGIT 提出 credentialing 协议:认证把可测量的能力绑定到凭据上,连接认证、声誉与市场分配机制,让"这个 agent 能干什么"从自报变成可核验的结构。对 agent-skill-security 是 skill 供应链治理(SkillSpector #107 扫描+签名、Plugin4Shell #108 修复跟踪)的下一层:不只是"这个 skill 有没有毒",而是"这个 agent/凭据配不配拿到这个任务"——与 APort Vault(今日 #1)连读构成完整链:市场准入靠 LEGIT 式凭据,任务执行靠 OAP 式事前检查;agent 经济的两道闸门都在走向'可验证结构'而非'信誉叙事';自建 agent 若要对外接活,凭据化能力清单是可预见的接入要求。

  • 来源: arxiv.org/abs/2609.21325v1
  • 信号: 命名系统 LEGIT · 认证绑定可测能力 → 凭据 · 认证+声誉+分配三连接 · agent 市场信任基建
  • 关键词: agent-skill-security · Agent Safety · Forge Guardrails

7. Value-Sensitive Delegation — 73,093 条真实用户帖里的 agent 价值观画像:21 项价值归 6 组,Reviewability 与 Bounded Reach 被单列成一等需求(arXiv:2609.22067)

OpenClaw 用户价值研究(arxiv.org/abs/2609.22067,09-18 提交):用户越来越多地把工作委派给自主 agent,但评测几乎只测任务完成,不测用户在意的价值。用 Value Sensitive Design + LLM 辅助分析 73,093 条关于 OpenClaw 的第一人称 Reddit 帖,逐帖标注人类价值、agent 面向、价值实现程度与用户结局:21 项价值归为 6 组——Autonomous / Dependable / Affordable Operation、Bounded Reach(可达边界)、Reviewability(可审查性)、Equitable Access;并分析价值实现与用户结局的关联。对 agent-evaluation 是"用户要什么"的实证底座——Bounded Reach 与 Reviewability 被用户单列,正好是本周工程侧的两个热点(#108 Casbin Gateway 的边界强制、Canny/Chief-of-Staff 的可审查账本)的民意侧印证:工程界在造的边界与账本,正是用户帖子里的最高频诉求;自建 agent 的需求清单可以直接引用这 6 组价值做 checklist。

  • 来源: arxiv.org/abs/2609.22067v1
  • 信号: 命名研究 VSD × OpenClaw · 73,093 帖 · 21 价值 → 6 组 · Bounded Reach / Reviewability 一等化 · 价值实现↔结局关联
  • 关键词: agent-evaluation · Agent Memory · Coding Agent 编排模式

8. TDD × LLM 综述 — 测试正在参与 LLM/agent 的每个决策:定行为、导构造、选候选、约束变换、供证据,与经典 TDD 在五轴上系统性不同(arXiv:2609.12012)

Test-Driven Approaches to SE with LLMs 综述(arxiv.org/abs/2609.12012,09-10 提交):测试不再只是人写完代码后跑的验收——它们规定预期行为、引导程序构造与修复、在候选间选择、约束变换、为软件分析提供执行证据。这篇 scoping survey 按研究问题组织,系统梳理这些用法与经典 TDD 的差异轴:测试顺序(先测/后测/交错)、oracle 可得性、可编辑产物(测试本身也会被 agent 改)、执行的角色。对 Coding Agent Verification 是把本周散点(Canny 的执行证据、GameLogicBench 的 tick 断言、CodeMidas 的以原代码执行为锚生成测试)收进一张地图的骨架——"测试是 agent 的控制面而非验收面"是自建 harness 的架构级决策依据:先把'测试在 loop 里的五类角色'想清楚,再决定评测基建投在哪;survey 本身适合当 04-Projects 的设计参考读物。

  • 来源: arxiv.org/abs/2609.12012v1
  • 信号: scoping survey · 测试五角色(定行为/导构造/选候选/约束变换/供证据)· 与 TDD 的四轴差异 · 测试本身可被 agent 编辑
  • 关键词: Coding Agent Verification · coding-agent-harness · test-driven-development

9. Trail of Bits — "够用就好"的 AI 审计实践:6 个月 agent 辅助助我们在 Miden zkVM 审计里找到真问题——代码评审开始前,agent 先造定制工具与形式模型(Trail of Bits 官方博客)

Auditing in the age of (good enough) AI(blog.trailofbits.com,09-18,HN 5p):顶级审计所公开 agent 用法:在代码评审开始之前,用 agent 构建定制工具与形式化模型,六个月的 agent 辅助工作流帮助团队在 Miden zkVM 审计中发现真实问题。定位清醒——标题的"good enough"指的是模型能力刚好够做工程放大器,价值来自把 agent 塞进审计管线的前置环节(工具与模型构造)而非替代专家判断。对 Coding Agent Verification 是与今日 #3 的对照实验——#3 显示普通开发者人工审查 AI 代码靠不住,ToB 的答案是专业方把 agent 用在'造验证工具'上而不是'直接产码'上:同一个模型能力,放在评估侧就是杠杆、放在产出侧就是风险;自建项目的 codex/claude 用法应该向'让 agent 写 checker、fuzzer、不变式'倾斜。

  • 来源: blog.trailofbits.com
  • 信号: 审计所一手实践 · agent 造定制工具+形式模型 · Miden zkVM 真实发现 · "前置环节"用法 · HN 5p
  • 关键词: Coding Agent Verification · Agent Safety · agent-evaluation

10. Foremerge — 并行 coding agent 的"意图冲突"先于"代码冲突"被捕获:Git 之上的开源协调协议(Show HN 31p)

Foremerge(github.com/naw103/foremerge,HN 31p):多 agent 并行写码的真实痛点不是 merge conflict,而是两个 agent 在不知道彼此的情况下朝冲突的意图干活,等代码冲突暴露时返工已经翻倍。Foremerge 定位"catch intent conflicts before code conflicts"——在 Git 之上加一层协调协议,让并行 agent 的意图先对撞、代码后合并。对 coding-agent-harness 与 Coding Agent 编排模式 是 #108 Chief-of-Staff(协调/验证会话分离)之后的第二块拼图——Chief-of-Staff 管单机多会话的上下文隔离,Foremerge 管多 agent 并行的意图去重:两者共同承认'agent 间默认不共享头脑';自建多 agent 并发前先把意图注册/对账做进工作流,成本远低于事后返工;与 Stochastic Deputy(#108,租户身份不进模型上下文)合看:协调信息放结构层,不放模型上下文。

  • 来源: github.com/naw103/foremerge
  • 信号: 意图冲突 < 代码冲突 · Git 之上协调层 · 开源协议 · Show HN 31p
  • 关键词: coding-agent-harness · Coding Agent 编排模式 · Multi-Agent Communication Patterns

11. Jev/oko — System One 评分模型当代码搜索引擎:不写文本只打分,162 会话实测 Codex +18%、OpenCode +15%、Claude Code +31%,token 少 20-42%(tyrpien.com 实测)

Oko 代码搜索 × Jev(tyrpien.com/blog/oko-agent-search,09-21,HN 4p):Jev 是 TypeSafe AI 的"System One"模型——不生成文本,只返回标签/评分+概率,单次约 0.1 秒、$42/十亿输入 token,便宜到可以每次搜索都调。作者周末把它指向 code search:Oko(开源)对候选做相关性重排序,一次 Oko 搜索替代多轮 grep + 文件读取;162 个基准会话实测 Codex 快 18%、OpenCode 15%、Claude Code 31%,token 少 20-42%。关键细节:速度只有在教会 agent"何时停止搜索"之后才出现。对 CodeGraph 是检索层的新档位——与 #108 Canny(TypeSafe Jev 做 judge 建议层)连成一条线:同一个评分模型先当验证裁判、再当搜索重排器——'System One 小模型做 agent 循环里的高频廉价决策'正在成为模式(对照 #107 CUA-S1 的 GUI 点击级小模型);自建 harness 里 grep-heavy 的探索环节有了一个可量化的替换候选,注意 162 会话是作者自建基准(待复现)。

  • 来源: tyrpien.com/blog/oko-agent-search
  • 信号: Jev 评分模型 0.1s/$42 每 10 亿 token · 162 会话 · CC +31%/token -20-42% · "教会停止搜索"是前提 · 自建基准待复现
  • 关键词: CodeGraph · coding-agent-harness · Coding Agent 成本优化

12. Scry — 给 agent 一张"互联网超立方体":MCP 连接器在 ~1,670 亿网络文档上跑程序,Reddit 272 亿评论/HN 4,570 万/Common Crawl 455 亿索引(开放 alpha,速率限价)

Scry(scry.io,HN 60p/26c,#213):定位"programmable internet research"的 MCP 连接器:agent 可以对约 1,670 亿行网络文档跑程序,而非逐条检索——Reddit 评论 272 亿 / 帖子 37.5 亿、HN 4,570 万、Common Crawl 索引 455 亿 / 页面 261 亿、Stack Exchange 8,350 万、播客 1.56 亿、OpenAlex 论文 5.12 亿等数十源;当前开放 alpha,吞吐约 +1.88M 行/分钟、周增 626 亿,HN 标题里的"congestion pricing"对应其速率限价模型(落地页口径为开放 alpha 限速,定价细节待文档核验)。对 Context Engineering 是外部检索基建的新量级——与 Agent-Reach(trending 常客,消费级 CLI)同空间不同层:Scry 把'agent 网络调研'从'搜几页'升级到'对全量语料跑聚合查询';对 SoL-Pi/SIFT/Spotlights 这类 auto-research 循环(#106–#107)意味着环境数据面可能整体换代—— research loop 的瓶颈正从'会找'移向'查询表达的写法'。

  • 来源: scry.io(开放 alpha)
  • 信号: MCP 连接器 · ~167B 行可查询 · Reddit 27.2B / CC 45.5B · 1.88M 行/分钟限价 · HN 60p
  • 关键词: Context Engineering · coding-agent-harness · Agent Memory

观察清单

主题 今日信号 强度
授权边界结构化 APort 事前检查 140→0 且照常付款 + Quiescence 撤权协议 + LEGIT 市场凭据,三道闸同日 🔥 强
评测基建 GameLogicBench tick 断言 + CodeMidas 环境量产 + TDD survey 地图 + ToB 审计实践 🔥 强
人的验证缺口 (Don't) Trust 100 人研究:开发者的代码审查不可靠(结果细节待全文) 中
System One 模型经济 Jev 0.1s/$42 每 10 亿 token:judge(#108 Canny)→ 搜索重排(oko)同模型两用 中
并行 agent 协调 Foremerge 意图冲突先于代码冲突;Stochastic Deputy 结构隔离连续呼应 中
web 级检索基建 Scry 167B 行 MCP;Agent-Reach 消费级对照 中
相邻域信号 Mini-AGI 持续学习原型(HN 247p,8GB VRAM batch-1 流式);GitLab 19.4 内建 agent governance;Claude Code 跨会话 IPC(JSON+Unix socket,r/ClaudeAI 未核) 弱