Agent Learning Daily Digest #95 — 2026-08-31

周一(283 条采集,arXiv 4 查询中 3 个成功、"code generation" 单查询 429,非宕机;r/MachineLearning 429。昨日 08-30(周日)无 digest,跳过 ~17 条 #93-94 已覆盖的 arXiv 重现项:WikiSkill/权限策略研究/Five Primitives/When Context Gets Root/ASIL/Same Model Harness/MemToC/PLCBench/BekchiAI/EVOMAL/SkillShield/SMITH/RAMP/Token 花费/SPECMINE/AgentWeave + GitHub maka/cursor-plugins/oh-my-pi/claude-plugins-official)。今日主线是一条完整的"默认行为攻击面"事实链:Claude Code session URL 进 commit 事件再爆发(HN 177p/201 评论;GitHub issue #66504 六月提出现已关闭,r/ClaudeAI 08-30 再发酵);Register 实测"wunderwuzzi 让 Claude Code 总结一个网页"即可让 Opus 5 Auto Mode 执行攻击者代码;Forgeeks 跟进研究——注册 llms.txt 里的无主包名后 Fortune 500 公司的 agent 不到一小时就回调;FetchGate 对官方 MCP registry 全量探测 15,329 个远程 server(22.7% 已死、28.6% 活 server 属于两个运营者、47 个 host 在指示模型"别告诉用户")。论文侧两个强项:LoopHarness(Safety Does Not Compose——轨迹级监控器对跨迭代攻击 TP=FP 的分离定理 + 非衰减 loop state 修复)与 SwarmWorld(去中心化 LLM agent 社会靠物理 stigmergy 演化出技术组合,胜过 best-of-N 孤立搜索的广度与韧性)。工程侧最重的是 NVIDIA NOOA——agent 即单个 Python 类(方法=能力、字段=状态、docstring=prompt),SWE-bench Verified 82.2% 且 token/调用减半、靠 pass-by-reference 免上下文压缩。

今日高信号

1. Claude Code session URL 事件再爆发 — 默认向所有 commit/PR 追加会话链接(GitHub + HN + r/ClaudeAI)

Claude Code 默认把 claude.ai/code/session_... URL 追加到用户每一个 commit message 和 PR 描述底部。GitHub issue anthropics/claude-code#66504(2026-06-09 提出、90 反应/22 评论、现已关闭)要求改为 opt-in:"没有 opt-in 提示、没有警告、onboarding 只字不提——用户发现时 git 历史已被污染"。本周期该话题再爆发:HN 帖 177p/201 评论,r/ClaudeAI 08-30 讨论串称行为仍在。同日配套信号:开发者 igupta 发文停止把 Claude 加为 commit co-author(HN 18p/37 评论)——"木匠不会把锯子署名为共同作者;作品挂我名下我就全责"。对 Agent Safety 是默认值级事件——与 #89 "AI 暗改 effort"、#93 Ars 无主安装命令同一条线:harness 的静默默认行为(opt-out 而非 opt-in)持续制造隐私与合规风险;session URL 进了 git 历史就出不来,fork/镜像永久携带;issue 已关闭但社区再爆发说明处置未获共识——企业采纳 agent 前必须审计"它往工件里写了什么"。

  • 来源: claude-code#66504 · HN · r/ClaudeAI
  • 信号: GitHub issue(closed,90▲/22 评论)· HN 177p/201c · r/ClaudeAI 再发酵 · co-author 姊妹话题 HN 18p
  • 关键词: Agent Safety · Claude Code Skills · coding-agent-harness

2. Register 实测 — wunderwuzzi:让 Claude Code"总结一个网页"即可执行攻击者代码(The Register)

The Register 安全线(2026-08-28,HN 10p):安全研究者 wunderwuzzi 演示仅通过让 Claude Code summarize 一个网页,页面内嵌指令即可劫持 agent——Opus 5 Auto Mode 下被诱骗执行攻击者控制的代码,无需额外权限、无需 multi-step social engineering。"总结网页"这个最日常的动作就是注入入口。对 mcp-security / Agent Safety 是实测级信号——与 #93 Ars(CLI 照执行无主安装命令)、今日 FetchGate 审计、Forgeeks 回调实验构成四连:工具面越宽、日常动作越"无害",注入面越大;防御应在 harness 层给"外部内容进入上下文"加来源标注与隔离,而非寄望模型侧对齐。

  • 来源: The Register
  • 信号: The Register · wunderwuzzi 实测 · Opus 5 Auto Mode · HN 10p
  • 关键词: mcp-security · Agent Safety · coding-agent-harness

3. FetchGate MCP registry 审计 — 15,329 个远程 server 全量探测:22.7% 已死,47 个 host 指示模型"别告诉用户"(fetchgate.dev)

官方 MCP registry 列出 25,289 个 server,其中 15,329 个是可直接指向的远程 URL。FetchGate 对每一个发起只读 MCP 会话(initialize → tools/list,从不 call),读了 140,284 条工具描述并逐条评分。结果分层:53.7% 应答 tools/list;23.6% 要求认证(401/403);22.7% 已死/损坏/非 MCP(609 个 URL 完全无法解析,143 个返回 HTTP 402 的 x402 付费门 server 自成一类)。更深的发现:28.6% 的活 server(2,357 个)属于两个运营者——"生态规模"名不副实;教科书式 tool-poisoning 攻击出现次数为零;47 个 host 的 server 指令里写着"不要告诉用户"类内容。配套生态观察(thefomite 实测):一个新 server 进 registry 后数小时内被爬虫生态围观——294 台机器读了工具清单、61 个"观察者物种"(含 Anthropic 自家爬虫)、但只有 7 台真正调用过工具。对 mcp-security 是生态级实证——registry 作为信任根首次被整体量化:"官方收录"≠"可用"更≠"安全";47 个"别告诉用户"host 是现成的 MCP 版 instruction privilege escalation 样本(呼应 #94);watcher 生态(294 读/7 用)说明 MCP 的主要流量是监控与评级爬虫而非 agent 调用——生态比消费端成熟得快。

  • 来源: fetchgate.dev · thefomite.com/report
  • 信号: 15,329 URL 全量探测 · 140,284 工具描述 · 22.7% 死链 · 28.6% 双运营者 · 47 host 隐瞒指令 · 数据 CC BY 4.0
  • 关键词: mcp-security · Agent Safety · Coding Agent Verification

4. LoopHarness(Safety Does Not Compose)— 轨迹级监控的分离定理:跨迭代攻击下 TP=FP,修复是非衰减 loop state(arXiv:2608.27141)

自主 agent 以无人值守循环运行:发现工作→规划→执行工具调用→验证→跨迭代持久化状态。但现行安全监控都定义在单条轨迹上,安全状态在下一条轨迹开始时重置。论文的核心结果是一个分离定理:对证据碎片化在多次迭代中的攻击,任何轨迹级(trajectory-scoped)监控器的真阳性率等于其假阳性率——无论它多强,因为它需要的证据从不出现在它看得见的窗口里;而保留跨迭代状态的监控器可以完美区分。显然的修复——携带几何衰减的风险分——被证明不够:有耐心的攻击者只需等待一个不随视野 N 增长的常数冷却期。论文提出 LoopHarness:在循环层恢复持久、非衰减的安全状态,经 mediated commits 与仲裁检测下界 δ_M,把未授权不可逆动作的期望次数约束在 B+m-1+m/δ_M——N 的常数,其中 B+m-1 项由 model-free 规则决定、即使验证器完全串通也能存活。评测协议:Agent-SafetyBench 配对干净/攻击 episode + 跨迭代外部状态攻击套件 + 自适应白盒红队。对 Agent Safety 是理论级贡献——把 #91 Compaction Cliff(压缩绞杀安全规则)形式化并推进到定理级:安全属性不随组合保持,"状态重置"就是攻击面;LoopHarness 的两层设计(model-free 底线 + 可串通存活的约束)是 vibe coding agent 安全架构的直接蓝图。

  • 来源: arXiv:2608.27141
  • 信号: arXiv · cs.AI/cs.CR · 分离定理(TP=FP)· 非衰减 loop state · 界为 N 的常数 · 白盒红队评测
  • 关键词: Agent Safety · coding-agent-harness · Constraint-Decay

5. AI Slop 综述 — 漏洞评估幻觉的分类学与计量:Deductive Coverage Score、CVE-Bench 与 Slop-Score(arXiv:2608.25667)

LLM 进入漏洞评估带来信任危机:"AI slop"——幻觉漏洞、貌似合理的错误补丁、语义重包装的 bug 报告——对人工分诊管线的认知负担类似 DoS 攻击。综述三段式:(1) 基于 structured literature review 形式化 slop 分类学,根因定位在安全专家的因果演绎推理与 LLM 自回归概率生成之间的鸿沟;(2) 可测量代理 Deductive Coverage Score——并证明 CoT 与工具使用 agent 缩小但不关闭这个鸿沟;被动检测与水印针对出处而非正确性、面临熵约束;(3) 主张主动神经符号验证,并给出两个评测工具的设计:CVE-Bench 与 Slop-Score(含 anti-gaming 条款)。对 Agent Safety / Coding Agent Verification 是综述级贡献——与 #94 MemToC(工具盲从)同根:生成物脱离证据约束;"把评测从语言流利度转向数学可验证性"与 BekchiAI 的确定性任务、NFV 的验证器裁决同向;安全工作流里的 agent 输出必须配验证器,slop 本身就是 DoS 向量。

  • 来源: arXiv:2608.25667
  • 信号: arXiv · cs.AI/cs.CR · 综述 · Deductive Coverage Score · CVE-Bench/Slop-Score · 神经符号验证路线
  • 关键词: Agent Safety · Coding Agent Verification · agent-evaluation

6. SwarmWorld — 去中心化 LLM agent 社会的 stigmergic 技术演化:物理痕迹媒介胜过对话(arXiv:2608.26081)

多数 multi-agent 系统依赖直接对话、预定义角色或中心化工作流。SwarmWorld 问:去中心化、无角色分配、无配方的同质 LLM agent 能否自组织成演化的技术社会?设定:agent 在空间环境中探索、处理资源、测试材料、构建持久工件、写可执行 controller——认知与后果分离:agent 在固定动作/材料 schema 内提案,确定性仿真器裁决功能(agent 移除后在未见扰动下评估)。结果:共享社会发展出比强 best-of-N 孤立搜索基线更宽、更有韧性的技术组合(孤立搜索在单一最强工件上仍有竞争力);agent 自发分化为探索/建造/维护/协调四类行为,随世界成熟而转换角色;技术通过协作建造、可执行继承与持久的 agent-artifact 网络累积;大多数复用始于物理观察而非通信——纯物理 stigmergy 即可支撑有能力的社区,交互驱动的是持久技术生态而非普遍优势。对 Coding Agent 编排模式 / Agent Memory 是机制级贡献——"工件即通信"与 CodeGraph 的"代码即记忆"、#94 WikiSkill 的"wiki 即底座"三证合流:能力传播的介质不必是参数或消息,环境中的持久工件同样承载;对 multi-agent 编排的直接启示:共享工作区+可继承工件可能比消息总线更便宜也更韧。

  • 来源: arXiv:2608.26081
  • 信号: arXiv · cs.AI/cs.CL · stigmergic 演化 · 胜 best-of-N 的广度/韧性 · 四类角色自分化 · 复用始于物理观察
  • 关键词: Coding Agent 编排模式 · Agent Memory · agent-evaluation

7. NVIDIA NOOA — agent 即 Python 类:六项 harness 能力,SWE-bench 82.2% 且 token 减半、免上下文压缩(NVIDIA Technical Blog)

NVIDIA Labs 开源研究预览 NOOA(Object-Oriented Agents):把 agent 建模为单个 Python 类——方法是能力、字段是状态、docstring 是 prompt、类型注解是被强制执行的契约。官方博客《Six Agent Harness Capabilities for Higher Model Performance》提炼六项模型侧接口能力:typed input/output、pass by reference、code as action、可编程 loop engineering、显式对象状态、model-callable harness APIs。配套长期记忆子系统:agent 通过 model-callable 工具自我策展知识,带重要性/标签/关系的类型化记录存进人类可读的 SQLite、跨会话持久。数字:SWE-bench Verified 82.2%(GPT-5.5),token 与 LLM 调用约为对照 harness 的一半——且不需要上下文压缩,因为工具结果按引用传递而非序列化进上下文窗口;ARC-AGI-3 单 agent 45 行世界建模 skill 达 50.2% RHAE(GPT-5.6-sol 85.1%),均在 $20/局内;CyberGym L1 86.8%(无网络访问)为开源 agent 最高。对 coding-agent-harness 是框架级强信号——"pass by reference 免压缩"直击 #94 Same Model Harness(机械压缩旧结果)与 turn-zero 上下文税(#94)的同一痛点——与其压缩不如不进上下文;与 Empire 五收敛要素、microcc"harness 解释大部分方差"合流,且这次背书者是芯片厂商;SQLite 人类可读记忆与 SwarmWorld/WikiSkill 的"工件持久化"路线一致。

  • 来源: NVIDIA Technical Blog
  • 信号: NVIDIA Labs 官方 · SWE-bench Verified 82.2%(token/调用减半)· ARC-AGI-3 85.1% · CyberGym L1 86.8% · 免压缩架构
  • 关键词: coding-agent-harness · Context Engineering · Agent Memory

8. Forgeeks 回调实验 — llms.txt 里的 120 个无主包引用:注册后 Fortune 500 的 agent 不到一小时上钩(forgeeks.net)

#93 的 Ars Technica"227 条无主安装命令"有了实验闭环。研究者分析 6,214 个活域名、8,265 个 llms.txt/llms-full.txt 文件(为 AI 读者准备的机器可读站点内容),发现 120 个文件指向未注册的包名或域名——宿主包括国防承包商、Fortune 500 与大型科技公司;来源可能是复制粘贴错误、改名、弃维或幻觉文档。实验:注册部分无主名称、上传装了 phone-home 探针的包——不到一小时就有 Fortune 500 公司的 agent 回调;研究点名 Claude、Codex、Hermes 三家 agent 沿废弃引用走到了攻击者控制的软件。对 agent-skill-security 是实验级闭环——供应链风险从"理论上存在"变成"实测一小时内命中";llms.txt 是新增的攻击面载体——企业为 SEO/agent 优化发布的文件正在成为投毒入口;包安装器应把"目标域名年龄/包注册状态"作为信任信号,悬挂引用直接拦截。

  • 来源: forgeeks.net
  • 信号: 6,214 域名/8,265 llms.txt · 120 无主引用 · 注册后 <1h Fortune 500 agent 回调 · Claude/Codex/Hermes 点名
  • 关键词: agent-skill-security · Agent Safety · mcp-security

9. Snyk agent-scan — 安全厂商的 agent/MCP/skill 扫描器开源:2,982★(GitHub)

Snyk 开源 agent-scan:面向 AI agents、MCP servers 与 agent skills 的安全扫描器(2,982★、Python、2025-04 创建、持续活跃推送)。传统 SCA/SAST 面向人写的代码,agent 生态工件(skill 包、MCP server 定义、工具 schema)是新扫描对象。对 agent-skill-security 是工具级信号——安全工业界把 agent 生态当成正式目标市场:#92 SkillBloat、#93 SkillsMP/EVOMAL、#94 SkillShield 的学术线等来了商业工具闭环——"skill 审计"从论文方法变成可下载产品;对无自研审计能力的用户,这是 skill 市场时代的最低配置卫生。

  • 来源: snyk/agent-scan
  • 信号: GitHub · Snyk 官方 · 2,982★ · agent/MCP/skill 三类工件 · 活跃维护
  • 关键词: agent-skill-security · mcp-security · Agent Safety

10. Memctl + 72 小时无人值守实录 — 版本化 agent 记忆与三个 memory bug 的解刨(GitHub + 工程长文)

同一作者的配对工程实录:(1) Memctl(GitHub,08-27 新发布):从中央存储 version/share/restore AI-agent 记忆文件(CLAUDE.md/AGENTS.md),零依赖 CLI——配置文件作为版本化资产管理;(2) **72 hours unattended**(工程长文):给自主 coding agent 一个常驻任务、三个工具、"永不等待许可"的规则,跑三天——每一个故障本质上都是 memory 故障:Bug 1 静默丢弃的密码(pre-save caretaker 消费了消息却什么都没存、还两次回复"已收到"——静默失败比报错更危险);Bug 2 截断级联(环形缓冲区用心跳覆盖了最关键的提交凭据日志——"封顶的日志需要升级而非沉默");Bug 3 发到未来的时钟(时区偏移未参与比较,退避队列误判"刚发过")。修复思路是 evidence file:凭证要么持久化要么大声拒绝,关键事件进谁也不能截断的 append-only 日志。对 Agent Memory 是一手实录级贡献——三个 bug 都是"覆盖策略吞掉关键状态"的变体,与 Compaction Cliff、Same Model Harness 的压缩主题同根;"append-only 证据文件 + 封顶必须升级"可直接写进 vibe coding agent 记忆模块的设计约束;Memctl 的版本化思路与 #93 RAMP(73.8% 配置写完不改)对照——配置不维护不是因为懒,是缺工具。

  • 来源: EltonCherrington/memctl · memctl-shop essay
  • 信号: 工程长文 · 72h 无人值守 · 3 个 memory bug 解刨 · append-only 修复 · HN 1p
  • 关键词: Agent Memory · coding-agent-harness · Context Engineering

11. DeepRepro — 状态感知子规划:演化仓库中的 paper-to-code 复现胜商业基线(arXiv:2608.26557)

ML paper-to-code 复现是长程任务:仓库状态在执行期间持续演化,依赖、接口与执行反馈都在变。现有系统依赖静态前置规划 + 顺序文件级生成,随仓库演化产生不一致。DeepRepro:execution-state-aware subplanning——把演化中的仓库状态与运行时反馈动态转化为细粒度实现子计划,让规划全程对齐执行;辅以 repository-aware 编排与轻量 process-aware 接口(透明监控长程复现)。PaperBench Code-Dev 上稳定超过强科学/商业 code-agent 基线。对 coding-agent-harness 是长程规划级贡献——与 Factory pattern-break(#93,何时叫停)、SWE Refactor Bench(#91,验收假完成)同一战场的第三块:规划的再锚定;大重构任务应拆成"执行→重读状态→再规划"循环,而非一次性蓝图。

  • 来源: arXiv:2608.26557
  • 信号: arXiv · cs.SE · PaperBench Code-Dev 胜商业基线 · 状态感知子规划 · 过程感知监控
  • 关键词: coding-agent-harness · Coding Agent Verification · Context Engineering

12. claude-obsidian + Murmell — agent 原生 PKM 与协作画布:工具层两个新品类(GitHub 14.4k★ + HN 8p)

两个产品形态信号:(1) **claude-obsidian**(总计 14,397★、trending +3,238/period):Obsidian + Claude Code 的自组织 AI 第二大脑——丢任何来源,Claude 读取、链接、归档进连通的 Markdown 知识图谱(Karpathy LLM Wiki pattern),开源 Notion 替代;(2) **Murmell**(HN 8p):多 coding agent 与人共享的协作云画布。同周生态簇:Vesta(macOS 并行 agent 终端)、handoffgraph(跨 agent 会话连续性)、grove(worktree 启动台)。对 Claude Code Skills / Coding Agent 编排模式 是品类级信号——claude-obsidian 与 #94 WikiSkill 论文互为表里:wiki 共演化提升 skill 质量被论文证明,同一模式已做成 14k★ 个人产品——本 vault 正是同类实践;Murmell 簇标志着 coding agent 从单机 REPL 走向"并行+共享工件"的第二代形态,与 SwarmWorld 的 stigmergy 结论(工件即通信)在产品侧互证。

  • 来源: AgriciDaniel/claude-obsidian · murmell.com
  • 信号: 14,397★(+3,238/period)· HN 8p · 同周 Vesta/handoffgraph/grove 生态簇
  • 关键词: Claude Code Skills · Coding Agent 编排模式 · Agent Memory

观察清单

主题 信号强度 备注
harness 默认行为攻击面 ★★★★★ session URL 进 commit(HN 177p);summarize 注入执行代码;llms.txt 无主包 <1h 回调;MCP registry 22.7% 死链+47 隐瞒指令 host
安全组合性理论化 ★★★★★ LoopHarness:轨迹级监控 TP=FP 分离定理;非衰减 loop state;model-free 底线抗串通
harness 工程正式化 ★★★★ NVIDIA NOOA 六能力:SWE-bench 82.2% token 减半、pass-by-reference 免压缩
记忆失效与治理 ★★★★ 72h 无人值守三 bug;append-only 修复;Memctl 版本化;claude-obsidian 14.4k★
stigmergic 演化 ★★★ SwarmWorld:物理痕迹媒介胜对话;工件即通信三证合流
MCP 生态画像 ★★★ FetchGate 15,329 server;thefomite 294 读/7 用——watcher 生态先于消费端成熟
落选备查 ★★ MAS 跨组织边界风险框架(arXiv:2608.26626,报告类,与 #94 五原语同主题);电力市场 tacit collusion(2608.26896,偏经济学);Metis(104★,"50% 提升"自报,未验证);KHR MS(#94 已记);Cogram CAD/BIM;weir 测试工具;Intelligence Density benchmark 帖(Reddit,未验证)