Agent Learning Daily Digest #107 — 2026-09-20

📊 筛选总结

  • 采集:258 条 — GitHub topic + Trending 全成功;HN Show RSS 双 502、Algolia 补偿;arXiv 4 查询全成功(48 篇);r/LocalLLaMA 恢复、r/MachineLearning 与 r/ClaudeAI 双 429
  • 跨天去重约 37 条(本管道新高):arXiv 16 条重现(OverclaimBench / harness 实证 / SoL-Pi / DeltaSelect / Auto Mode / SERBench / LearnActCoder / AgentLSD / Flag Game / Spurious Tool Use / 157-QA / MTAC-IFBench / BLINDSPOT / ActGuard / Stochastic Deputy / Benchmark Radar,均在 #104–#106)+ HN 旧帖 6 条(ZCode 261p、AGENTS.md changelog、harness 实证 217p、Notch、Skillsync 64p、Pizza Bot 60p)+ Trending skill 军团约 15 条再现(ECC / humanizer / no-ai-slop / i-have-adhd / hyperframes / context-mode / Orca / Claude-Red / worktrunk / Agent-Reach / open-code-review / addyosmani agent-skills 等)
  • 今日性质:正常日——arXiv 新鲜批次回落(新增约 8 篇可用),HN/GitHub 补位;非爆发日,12 条里 arXiv 6 条
  • 今日主线:"写下来的约束不会自己生效"——skill 要先过扫描(SkillSpector)、代码库部落知识要 hook 强制读取(mati)、行为契约要编译成 DFA(ContrAgent)、安全禁令要成为规划状态(SafeHarness);能力侧镜像两题:区分"理解 vs 会搜"(AutoTuring)、给自改进循环找便宜的评估信号(SIFT)
  • 高信号:NVIDIA SkillSpector 入场 skill 供应链治理(17.8k★,26.1% skill 有漏洞 / 5.2% 疑似恶意);ContrAgent 把 agent 监督做成 LTLf 契约 + DFA 双角色门控;SIFT 用 judge + Bradley-Terry 把自改进评估成本打下来
  • 纠偏一条:Tom's Hardware"黑客用 Claude 攻破 OpenAI"实为授权赏金研究(Hacktron 团队、$6,500 赏金)——标题把合法红队写成了入侵(语义反转)

今日高信号

SkillSpector(github.com/NVIDIA/SkillSpector,Apache-2.0,核验总星 17,843、周期增量仅 814——trending 数字是增量):NVIDIA 官方出品的 agent skill 安全扫描器,定位"装之前回答这个 skill 安不安全"。README 数据:在 31,132-skill 研究子集中 26.1% 含漏洞、5.2% 显示疑似恶意意图;71 个漏洞模式 × 17 类(prompt injection、数据外传、提权、供应链等);输入支持 Git 仓库/URL/zip/目录/单文件;它是 NVIDIA Verified Skills 管线(扫描→评估→签名后才发布到官方 catalog)的扫描环节,并提供 Pi / OpenCode 扩展让 agent 会话内部直接调用扫描。对 agent-skill-security 是治理升级信号——与 After the Party(#104,扫描器互不一致、敏感度 21-61%)连读:研究界发现"扫描器都不靠谱",产业界回答"那就做带签名发布的全管线";自建 skill 门禁从此有可抄的参考实现,扫描 + 签名 + catalog 三件套比单点扫描更接近根治。

2. AGENTS.md 支持工程落地:claude-code 仓库出现 mods/agents-md 参考实现(hooks + tests + plugin 骨架)

mods/agents-md(github.com/anthropics/claude-code/tree/main/mods/agents-md,核验存在:README + .claude-plugin + hooks + tests):#106 记录的 v2.1.277 changelog(无 CLAUDE.md 时读 AGENTS.md,HN 昨日 305p → 今日已涨至 713p/265c)现在有了工程载体——官方仓库出现独立的 mods/agents-md 目录,带 hooks 与测试。对 Claude Code Skills 是配置生态标准化的落地节点——changelog 只承诺行为,这个目录给出参考实现:多 harness 共存的工作区可以在 AGENTS.md 之上做自己的 hook 级定制;保持昨天那条纪律:CLAUDE.md 与 AGENTS.md 并存时会漂移,单一来源生成仍是正解。

  • 来源: mods/agents-md · changelog
  • 信号: hooks + tests + plugin 骨架 · HN 713p 持续发酵(昨 305p)· fallback 语义不变(CLAUDE.md 优先)
  • 关键词: Claude Code Skills · coding-agent-harness

3. mati — 代码库部落知识的 hook 级强制层:"文档只是建议",确认过的坑不读不许改(Show HN,Rust 单二进制)

mati(github.com/ioni-dev/mati,Apache-2.0,Rust,核验 0★ 新发布):问题设定极准——代码库里那行"看起来是错的但其实是故意的"修改原因活在 Slack 线程、review 评论和某个人脑子里;agent 读得快改得快、每次会话从零开始,于是老 bug 复活。mati 的答案:把团队知识挂到文件上,agent 不读完确认过的 gotcha 就拒绝其读/写——决策在 hook 层确定性做出、在模型裁量权之外、每次决策留审计记录。覆盖:Claude Code 门控 Edit/Write/NotebookEdit + 尽力捕获 shell 读取(cat/grep),Codex 门控 apply_patch;README 诚实列出"What it doesn't catch"。对 Agent Safety 是"记忆要能执行"的新层——与 #105 Agora(信任 = 可重跑的 commit)互补:Agora 解决'信不信 agent 说的',mati 解决'团队知道但代码不说';两者的共同点是把知识从'可供参考'升格为'必须消费';自建项目的 retrospective 文档从此应该问一句:它挂到 hook 了吗。

  • 来源: github.com/ioni-dev/mati
  • 信号: hook 级确定性门控 · "不读不给改" · 决策在模型裁量之外 · 全程审计 · 覆盖边界诚实公开 · 新项目 0★(概念信号)
  • 关键词: Agent Safety · Agent Memory · Forge Guardrails

4. 语义反转纠偏:"Hackers breach OpenAI using Claude tools"实为授权赏金研究——Hacktron 团队拿 $6,500 赏金、以无害 PR 作为证明(Tom's Hardware)

OpenAI 赏金研究事件(tomshardware.com,09-18/19):标题读作"黑客用 Claude 工具攻破 OpenAI、拿到员工账号与内部代码库";核读正文与多源交叉(r/technology、LinkedIn)后事实是:三人研究团队 Hacktron 在授权漏洞赏金项目内,用 Claude 辅助发现并验证 OpenAI 社区论坛(第三方论坛组件)的缺陷,进而触达员工账号与内部代码库,以一个"harmless pull request"作为影响证明,获 $6,500 赏金(细节数字来自二级来源,待验证)。这是本管道第二次明确的语义反转:合法红队被标题写成恶意入侵。对 Agent Safety 的价值恰恰在两处——其一,AI 辅助攻击已经能在授权场景打穿 AI 实验室的外围(论坛这类'非核心'资产是入口,与 Seer 链 #106 的'遥测即攻击面'同构:入口永远在陪衬系统上);其二,标题偏差本身就是教材:转载链每过一手,'授权研究'就褪色一分,digest 引用安全新闻必须核到正文。

  • 来源: tomshardware.com · r/technology 讨论
  • 信号: 语义反转(授权赏金 ≠ 入侵)· $6,500 赏金(二级来源)· 无害 PR 作为证明 · 论坛组件是入口 · 多源交叉确认研究者身份
  • 关键词: Agent Safety · agent-skill-security

5. ContrAgent — agent 监督的确定性路线:LTLf 契约编译成 DFA,一份规约同时做在线门控与离线审计,延迟低数个量级(arXiv:2609.18128)

ContrAgent(arxiv.org/abs/2609.18128,09-16 提交):既有防护要么事后用随机性 LLM judge 给轨迹打分、要么逐调用阻塞不安全动作,没有单一确定性制品能同时胜任两个角色。ContrAgent 把 agent 行为形式化为可检查谓词上的轨迹,用 LTLf(有限轨迹线性时序逻辑)assume-guarantee 契约描述要求的行为,每个契约编译成 DFA:在线模式门控动作、离线模式审计轨迹;契约库是独立于模型的可复用知识库,可跨同域 agent 迁移。四个基准上与 SOTA LLM-judge 和规则护栏打平,同时给出确定性、可复现的裁决与低数个量级的在线单调用延迟。对 Coding Agent Verification 是监督层的"形式方法回归"——与 #106 Auto Mode 红队(79% 沦陷)、#105 Stochastic Deputy(结构化隔离)连成一线:概率性 judge 监控被证明可被逃逸后,确定性规约成为最受关注的替代路线;契约-DFA 双角色直接是 Another Rule Engine 的设计模板:规则编译成自动机、一次定义、门控与审计两用。

  • 来源: arxiv.org/abs/2609.18128v1
  • 信号: 命名系统 ContrAgent · LTLf → DFA 双角色(门控 + 审计)· 确定性可复现裁决 · 在线延迟低数个量级 · 契约库跨 agent 迁移
  • 关键词: Coding Agent Verification · Agent Safety · Coding Agent 编排模式

6. SIFT — 自改进循环的便宜评估信号:judge 两两对比 + Bradley-Terry 聚合驱动树搜索,全 Polyglot 上超越树搜索自进化框架且成本大降(arXiv:2609.19526)

SIFT(Recursive Self Improvement via Fast Tree-search,arxiv.org/abs/2609.19526,09-17 提交):自改进的主要运行时瓶颈是评估候选自修改——既往做法要用修改后的 agent 重跑基准子集。SIFT 给下游任务评估补充一个 LLM-as-judge 两两对比信号:胜负记录用正则化 Bradley-Terry 模型聚合成强度分,驱动轻量解耦树搜索内的秩采样,昂贵的任务评估只留给最有希望的节点。结果:在完整 Polyglot 基准上超越既有树搜索自进化框架,CPU 小时、墙钟时间、API 成本显著更低。对 coding-agent-harness 是自改进循环的效率拼图——与 #106 SoL-Pi(harness 层 RSI 选出 4 机制)互补:SoL-Pi 证明循环能选出改进,SIFT 回答'循环里的评估从哪来';但注意 #105 Trusting Trust 的阴影:judge 信号成为选择压力后,judge 本身就是新的投毒面——自建循环若采信 judge 分,judge 的输入隔离要和安全评估同级对待。

  • 来源: arxiv.org/abs/2609.19526v1
  • 信号: 命名系统 SIFT · judge 对比 + Bradley-Terry 强度分 · 解耦树搜索 · 全 Polyglot 超越 · CPU/墙钟/API 成本三降
  • 关键词: coding-agent-harness · agent-evaluation · Coding Agent 成本优化

7. AutoTuring — "改进了"不等于"理解了":同一 15 维加速器空间按命名旋钮 vs 匿名变量各跑一遍,差距就是理解度(arXiv:2609.19387)

AutoTuring(arxiv.org/abs/2609.19387,09-16 提交):agent 优化硬件的报道只证明"设计改进了",证明不了"为什么"——可能在推理机器,也可能只是在不理解含义的旋钮上熟练搜索,只有前者能迁移到下一代架构。方法是对偶测试:同一个 agent、同样的 15 维加速器空间跑两遍——一遍是带仿真器计数器的命名架构旋钮,一遍是 [0,1] 上的匿名变量;评估器、合法空间、可达最优全部相同,唯一变量是"问题是否有含义"。结果(9 核 FP16 GEMM 篮子):理解有价——架构师版比建模 H200 高 5.4%、比盲版高 12.3%,仿真调用少 70.1%;但理解不独占——critic 循环能为盲版追回大部分差距、对架构师版毫无增益,即架构知识与结构化批评互为替代品。作者自陈为初步发现(单条件 5-6 次运行)。对 agent-evaluation 是评测方法论的镜像题——与 OverclaimBench(#106,汇报不可信)同族:都在问'成功背后是什么';对偶测试设计( Named vs 匿名)可直接搬到自建评测:把领域术语抹掉重跑一遍,性能差就是'真理解'的测量。

  • 来源: arxiv.org/abs/2609.19387v1
  • 信号: 命名系统 AutoTuring · 对偶测试设计 · 理解值 12.3% + 70.1% 调用节省 · critic 与知识互为替代 · 自陈初步(5-6 runs)
  • 关键词: agent-evaluation · Coding Agent Verification

8. Spotlights — 优化机会发现:不给缺陷、不给瓶颈、不给位置,只给仓库 + 工程目标,先找"哪里值得改"(arXiv:2609.20446)

Spotlights(arxiv.org/abs/2609.20446,09-17 提交):coding agent 与进化代码搜索都能在"目标 + 评估标准"给定后改进实现,但在既有仓库上先要回答:哪些实现选择值得为高层工程目标去调查。论文定义 optimization-opportunity discovery 任务(输入仓库 + 目标 + 可选运行时遥测;不要求指定缺陷/瓶颈/位置),系统经逻辑仓库映射、多轮 agent review、可调研究链接产出候选。结果:三个案例(模型服务、文档检索、区块链排序、文档处理)恢复 9 个专家目标中的 7 个;可靠性研究里 前 10 候选 70% 达到正确性与严重度阈值;5 次重复检索 73.6% 候选稳定复现;案例实现改动端到端页面处理运行时 -10.6% 且质量保持。对 coding-agent-harness 是自动改进循环的前端——与 SoL-Pi/SIFT(#106/#6)连成完整链:Spotlights 找目标、SIFT 便宜评估、SoL-Pi 循环放大;'机会发现'作为独立可评测步骤被确立,自建 auto-research 的第一块缺口(去哪找活)有了参考答案。

  • 来源: arxiv.org/abs/2609.20446v1
  • 信号: 命名系统 Spotlights · 新任务 optimization-opportunity discovery · 7/9 专家目标 · top-10 70% 过阈值 · -10.6% 运行时案例
  • 关键词: coding-agent-harness · Code as Agent Harness

9. Not All AI Agents Are Equal — agent 服务的资源动力学:同一工具在不同任务下瓶颈不同,CPU 感知的工具准入让延迟 ~5.4×、均值 -32%(arXiv:2609.19947)

Agent 服务资源画像(arxiv.org/abs/2609.19947,09-17 提交):agent 执行 = 远程 LLM API 调用 + 本地工具容器,延迟、本地资源需求、容器瓶颈跨请求交织,而当前生态对资源动力学几乎无感知、浪费严重。对 RAG QA、web 搜索、coding 三类任务的测量:同一工具在不同任务下资源行为差异巨大;并发下暴露任务相关的 CPU/磁盘 I/O/内存瓶颈;更快的 LLM 响应或更多核并不总能加速 agent。据此提出的 CPU 感知工具准入 + 任务感知 CPU 分配:CPU 敏感任务延迟 ~5.4× 改善、多任务平均延迟 -32%。对 Coding Agent 成本优化 是把"harness 成本"从 token 层拉到系统层——与 Notch 8.9×(#106,换模型降单价)、SoL-Pi(改机制降 token)并列第三条杠杆:调度与准入;自建多 agent 并发时,工具容器的 CPU/IO 配额是和模型档位同级的性能旋钮。

  • 来源: arxiv.org/abs/2609.19947v1
  • 信号: 三任务资源画像 · 同工具异行为 · 更快 LLM ≠ 更快 agent · CPU 感知准入 5.4× / -32% · 服务层新优化面
  • 关键词: Coding Agent 成本优化 · coding-agent-harness

10. 把 vLLM 前缀缓存焐热:KV 卸载 + 前缀稳定让 agent 首字等待 26-28s → 7.3s、最差 514s → 54s(doug.sh 实战)

vLLM 前缀缓存实战(doug.sh/posts/vllm-kv-cache-agents,09-15,9 分钟读):本地 coding agent(Qwen3.8 27B W4A16、2×RTX 3090、vLLM 0.28)首日体验糟糕——agent 每轮重发全部对话,12 万 token 轮次从零读约 150 秒。一天的调参把缓存命中 55% → 95%:OffloadingConnector 的 KV 卸载、双卡张量并行(替代各跑副本)、thinking 上限 6,000、批 token 预算、投机解码、CPU offload;栈为 oh-my-pi + Bifrost 网关(同时聚合 MCP 工具服务)。结果:首字等待 26-28s → 7.3s,最差 514s → 54s。对 Coding Agent 成本优化 与 Context Engineering 的交叉点是"缓存温暖度是一等设计约束"——与 #9 系统层视角互补:这条是实践层;直接结论:harness 生成 prompt 时要保持前缀稳定(系统提示与历史不改写、新内容追加在后),否则 KV 全部失效;这和 #104 组件实证的 rule-based elision 一样,都是'省钱靠 harness 而不是靠模型'。

  • 来源: doug.sh/posts/vllm-kv-cache-agents/
  • 信号: 55%→95% 命中 · 首字 26-28s→7.3s · 最差 514s→54s · OffloadingConnector KV 卸载 · 前缀稳定 = 设计约束
  • 关键词: Coding Agent 成本优化 · Context Engineering · coding-agent-harness

11. SafeHarness — 安全约束要进规划状态才有效:裸 coding agent 写机器人控制器"多数情况撞上障碍物",障碍感知 harness 把碰撞避免 +27pp(arXiv:2609.20822,cs.RO)

SafeHarness(arxiv.org/abs/2609.20822,09-17 提交,cs.RO 跨域):coding agent 写机器人控制器程序已是成型范式,但没人问过安全性——任务 = 操作目标 + 不可触碰的障碍物。裸 agent 多数情况撞上障碍物:轨迹里它在推理障碍、prompt 也明令禁止,感知与指令都无罪,罪在规划——声明的约束从未成为优先级(没有清扫路线概念、路线不可行不会重规划、接触执行不受同一约束约束)。SafeHarness 两个组件:障碍感知路线规划(物体落包围盒、候选路线画成路径点序列、先规划→验证→必要时重规划→再执行)+ 障碍感知接触执行(接触位置选择本身避开障碍)。结果:71.9% 任务成功 / 87.5% 碰撞避免,超先前 SOTA +6.5/+27.0pp,是无 harness 同 agent 的 2.3×/1.5×。对 coding-agent-harness 是"约束执行面"的跨域镜像——与 ContrAgent(#5)同一天互证:写下来的规则(prompt 禁令)不产生行为,只有成为 harness 内部结构(规划状态/自动机)才生效;cs.RO 跨域但论文视角就是 coding-agent 范式,迁移价值在'任何'不可触碰'类约束的落地方式。

  • 来源: arxiv.org/abs/2609.20822v1
  • 信号: 命名系统 SafeHarness · 裸 agent 多数碰撞(约束在 prompt 里却无效)· 路线规划 + 接触执行双 harness · 71.9%/87.5% · cs.RO 跨域
  • 关键词: coding-agent-harness · Agent Safety

12. CUA-S1 — computer-use 的"系统 1"小模型: Frontier 模型规划、专用小模型做点击级决策,CUA-S1-FORMS 权重开放(trycua/cua,HN 48p)

CUA-S1(github.com/trycua/cua,MIT,核验总星 24,359;HN 48p/5c):cua 仓库(开源桌面自动化 + 跨 OS 机器人群 + 本地 macOS VM)发布 CUA-S1 系列小模型——借 Kahneman"系统 1"比喻,为 computer-use 的快速、有界决策(点击、表单填写)提供专用模型,CUA-S1-FORMS 权重与数据集已在 HuggingFace 开放(cua-ai/cua-s1-forms),repo 内含 model card 与安全部署指引;架构主张"自带 agent 与模型,或用 CUA-S1 做专用决策——Cua 提供计算机与自动化工具"。对 agent-harness 是 computer-use 的成本/延迟架构样本——与本地 serving 两篇(#9/#10)同一逻辑在 GUI 域重演:不要用 frontier 模型做每一毫秒的决策;'规划模型 + 决策小模型'分层是 agent harness 的通用压缩模式,表单场景已有可下载的起点。

  • 来源: github.com/trycua/cua(HN Show 帖 48p/5c,经 Algolia 检出)
  • 信号: 24.4k★ · CUA-S1-FORMS 开放权重 + 数据集 · System 1/系统 2 分层 · model card + 安全指引 · HN 48p
  • 关键词: agent-harness · Coding Agent 成本优化

观察清单

主题 今日信号 强度
约束的执行面 SkillSpector 扫描+签名;mati hook 门控;ContrAgent 契约→DFA;SafeHarness 约束进规划 🔥 强
自改进的效率与信任 SIFT judge+Bradley-Terry 降评估成本;Spotlights 补"去哪找活";SoL-Pi(#106)连成链 🔥 强
agent serving 系统层 资源动力学画像(CPU 准入 5.4×);vLLM 前缀缓存 55%→95%;CUA-S1 决策分层 🔥 强
评测方法论 AutoTuring 对偶测试测"理解";延续 OverclaimBench 的"成功背后是什么"追问 中
skill 供应链产业 Response NVIDIA Verified Skills 全管线 vs #104 研究界"扫描器互不一致" 中
MCP 生态工具 MCPJam(HN 11p)——MCP server 测试/评测平台、OAuth 调试器、CI 门禁 中
生态杂项 earendil-works/pi 工具箱(trending PI-Desktop 同系);tenuo 密码学授权凭据(呼应 Stochastic Deputy);bojieli《深入理解 AI Agent》开源书 2.7k 增量 弱