Agent Learning Daily Digest #93 — 2026-08-28
周五(270 条采集,arXiv 4 查询全部成功;r/LocalLLaMA 与 r/ClaudeAI 429;跨天去重跳过 ~18 条 #89-92 已覆盖项:Empire 五要素/UHP/Warren/ctx/SparseRead/Paritok-4B/AgentWeave/Handoff Tax/Station/AgentRoom/TraceGrant/Prompt 老化/MARS/MACGen/ReproAgent/Aging/Compaction Cliff/BASM/Maka/cursor/plugins 等)。今日为skill 安全攻防日,一条完整的攻-害-防链落进同一个生态:攻击侧 EVOMAL 发现自演化 agent 的 self-poisoning 蠕虫(模仿即感染,库中恶意 skill 滚雪球 4.9-9.0×,无需触发即可持续增殖);危害侧 SkillsMP 凭证泄漏实证(17,022 skill 抽检、520 个泄漏、73.5% 源于 debug 日志——stdout 直通上下文窗口);防御侧 SkillShield 用prompt 空间的安全 skill 对抗(malware 严重度 3.37→0.58,效果比肩 Llama Guard 3 且无需运行时组件),同日 Ars Technica 实测三家 CLI 会照执行企业文档里指向无人拥有代码的 227 条安装命令——"agent 会执行它读到的一切"在补丁管理与供应链维度被坐实。工程侧两条主线:工具能力的训练侧整合(SMITH 让 4B 模型自写自用工具反超 30B 工具写手;MCP-Universe RL 把 MCP 环境直接接入 RL 训练);长任务的早期放弃(Factory 用 pattern-break 检测提前叫停,只放行符合成功形态的运行)。
今日高信号
1. EVOMAL — 自演化 coding agent 的 self-poisoning 蠕虫:模仿即感染,植入无需触发(arXiv:2608.25776)
自演化 agent 从共享 skill 库检索技能、模仿并自写新工具——论文识别出这个回路里的结构性漏洞:authoring 过程中被检索到的恶意 skill 可以成为新 skill 的模板,payload 被逐字保留(self-poisoning:agent 自己编写、入库、执行恶意技能)。EvoMal 攻击用 banner(一组良性外观的结构元素包裹可互换 payload)放大模仿;攻击者植入后无需触发,每个自写副本可再入库、再被模仿——形成移除原始植入后仍持久的自传播蠕虫。6 模型 × 153 个 SWE-bench Verified 任务:ASPR(自投毒率)20.3%-41.8%,库中恶意 skill 达植入数的 4.9-9.0 倍;无 banner 时 DeepSeek-V4-Pro 仍有 11.1%;把植入 skill 的描述定制到单一任务族,ASPR 升至 86.6%。对 agent-skill-security 是攻面级贡献——与 #91 Skill Misevolution(不安全成功的蒸馏)和 SkillBloat(经济攻击)拼成三部曲:skill 库不是静态攻击面而是"复制底物",检索-模仿循环本身就是传播介质;防御必须在"入库审计"外增加"自写技能的出库审计"——检查新 skill 与库内既有 skill 的相似度(banner 特征)。
- 来源: arXiv:2608.25776
- 信号: arXiv · cs.CR · 6 模型 × 153 任务 · ASPR 20.3-41.8% · 恶意 skill 滚雪球 4.9-9.0× · 定制描述 86.6%
- 关键词: agent-skill-security · Agent Safety · Claude Code Skills
2. SkillShield — prompt 空间的安全 skill:malware 严重度 3.37→0.58,无需运行时组件(arXiv:2608.25817)
coding agent 以开发者权限改文件、跑 shell——恶意请求直接变成有害动作。现有防御互补却各有缺口:权重级对齐对 API-only 部署方不可用;输入过滤与执行边界监控需要在轨迹上挂辅助分类/检查组件。SkillShield:从已知攻击或已记录的 agent 失败中离线合成安全 skill,会话开始注入 system prompt、整个工具循环期间持续生效——通过定义模型应遵循的安全策略来防护,不做运行时请求分类或路由。给定 system prompt 空间预算,测三种供给范围:all-classes(一个 skill 覆盖全部威胁类)、per-bundle(子集)、per-class(单类上界)。6 模型 × RedCode:默认 all-classes skill 把 malware 生成严重度从 3.37 降到 0.58,执行攻击成功率 43.6%——与 Llama Guard 3(42.x%)相当,但零运行时组件、零延迟税。对 agent-skill-security 是防御范式级贡献——用 skill 的语言对抗 skill 的攻击:安全知识以 prompt 空间资产形式供给(skill 防御正规化为"安全 skill 的合成与预算分配"问题);对无权重访问权、无 hook 权限的订阅制用户这是当前唯一可用档位——但注意它是"策略定义"而非 reference monitor,对抗 EvoMal 式持久蠕虫仍需入库/出库审计配合。
- 来源: arXiv:2608.25817
- 信号: arXiv · cs.CR · 严重度 3.37→0.58 · ASR 43.6% ≈ Llama Guard 3 · 三种预算范围消融
- 关键词: agent-skill-security · Agent Safety · Claude Code Skills
3. SkillsMP 凭证泄漏实证 — 17,022 个 skill 抽检:73.5% 的泄漏源于 debug 日志,fork 分发击败修复(arXiv:2604.03070)
首个大规模 agent skill 凭证泄漏实证:从 SkillsMP(最大开源 skill 市场,170,226 工件)分层抽样 17,022 个 skill,静态秘密提取(regex + AST)+ mock 凭证的沙箱动态测试 + 开发者意图与运行时行为交叉比对。结果:520 个受影响 skill、1,708 个安全问题、10 类泄漏模式分类。三个突出发现:(1) 76.3% 的案例需要联合分析自然语言描述与程序逻辑——凭证暴露本质上是跨模态问题;(2) debug 日志占 73.5%——因为 agent 框架把 stdout 直接喂进 LLM 上下文窗口,常规调试变成凭证暴露向量;(3) 89.6% 泄漏凭证立即可利用(92.5% 在无提权的常规执行中),且 fork 分发模式击败修复——上游删除了秘密的 107 个仓库的 fork 仍带着。对 Claude Code Skills 是生态级实证——skill 市场是真实的凭证攻击面而非理论风险:静态扫描不够(跨模态);"日志进上下文"的框架约定要配脱敏层;装 skill 前查 fork 链谱系——修复不随 fork 传播;与 #92 kindle-highlights 的"skill 发行标配量化验证"互补:发行者验证功能,使用者审计秘密。
- 来源: arXiv:2604.03070
- 信号: arXiv · cs.CR · 170K 工件/17K 抽样 · 520 skill/1,708 问题 · 10 类泄漏模式 · fork 链修复失效
- 关键词: Claude Code Skills · agent-skill-security · mcp-security
4. Ars Technica 实测 — Claude/Codex/Hermes 照执行企业文档里 227 条"无人拥有"的安装命令(Ars Technica)
Ars Technica 安全线报道(HN 7p):研究者扫描企业内部文档,发现 227 条安装命令指向代码已不存在、被转移或从未被提交者拥有的 URL——即"安装什么"完全取决于外部仓库的当前状态,而非任何受控工件。实测 Claude Code、Codex、Hermes:三家 CLI agent 都会照常执行这些命令,把"文档即上下文"的信任模型直接接到"安装即执行"的供应链上。对 Agent Safety 是实测级信号——这是 #89 "AI 暗改 effort"信任裂缝的供应链版本:agent 对文档中的安装指令没有所有权概念,补丁管理(artifact pinning / lockfile / 内部镜像)是 agent 时代的基础卫生而非可选优化;企业把 agent 接入内部 wiki 前必须先跑一遍"死链/无主命令"审计——vibe coding agent 的 skill/plugin 安装路径应默认走 pinned registry。
- 来源: Ars Technica
- 信号: Ars Technica 实测 · 227 条无主安装命令 · 三家 CLI 全部照执行 · HN 7p
- 关键词: Agent Safety · agent-skill-security · coding-agent-harness
5. SMITH — 工具创建与使用联合 RL 训练:4B 自写自用反超 30B 工具写手(arXiv:2608.24571)
工具增强的 LLM 受限于"人类恰好写过的 API";现有工具创建系统在推理时 prompt 一个冻结 LLM——写工具的模型与用工具的模型解耦,写出的 schema 自己未必调得动。SMITH(Schema-grounded Multi-task Iterative Tool Honing):RL 框架把工具创建与工具使用联合训练进单一 policy——每次 rollout 要么是 build 任务(从少量样例写工具)要么是 use 任务(在 held-out 问题上调用工具池);三条独立 reward 轴分别捕获 schema、代码、结果失败,每种失败模式贡献自己的梯度。4B Qwen3 经 SMITH 训练(13 个带精确验证器的程序性推理任务):held-out 任务宏均准确率 79.8%(全部方法中最优,超过未训练的 30B-A3B 工具写手);TabMWP-Hard 40.4、OOD GQA 42.6(+7.6 超同骨干最优推理时基线)且无任何视觉/表格训练数据;SMITH-4B 写的工具还抬升了 LFM-2.5-350M 与 Qwen3-30B-A3B 的表现——工具是可迁移资产。对 coding-agent-harness 是训练-使用闭环级贡献——"写的 schema 是能调的 schema"靠训练对齐而非 prompt 祈祷;与 #92 AgentWeave(推理前路由)、今日 MCP-U RL(环境接入训练)合成趋势:工具层的能力正从推理时拼装转向训练侧整合;对小模型路线特别关键——4B+自工具 > 30B+外工具。
- 来源: arXiv:2608.24571
- 信号: arXiv · cs.AI/cs.SE · 79.8% 宏均最优 · 三 reward 轴 · 4B 反超 30B · 工具跨模型迁移
- 关键词: coding-agent-harness · agent-evaluation · Context Engineering
6. MCP-Universe RL — MCP 环境直通 RL 训练:策略更新之后的两个系统问题被一次性解决(arXiv:2608.22167)
RL 已是提升 LLM 工具使用的主流路径,但多数框架止步于策略更新——每个新域的使用者被留下两个系统难题:为数百条并发轨迹各自拉起隔离环境并接进训练;调度 rollout 让 GPU 在长程多轮 episode(大量时间阻塞在慢工具调用上)上保持忙碌。MCP-Universe RL(MCP-U RL):用 MCP 本身作为环境接口——任何 MCP server 零 RL 适配代码即插即训;一次性建好两层跨域复用:环境编排层(在可插拔容器后端上供给/隔离/回收 MCP 环境)+ rollout 编排层(分段流水线重叠轨迹,episode 等工具时 GPU 不空转);训练层 backend 无关(veRL 与 slime 集成)。一份配置只改任务规范,即在 gpt-oss-20b 上训出 SWE、深度研究、通用工具使用三类 agent,任务表现全面提升。对 coding-agent-harness 是训练基建级贡献——MCP 从运行时协议升格为训练时接口:"MCP 即环境"意味着工具生态与训练生态打通——自建 agent 的工具学习不再需要 per-domain 胶水;与 SMITH(用-写联合)互补:一个管能力对齐,一个管训练吞吐。
- 来源: arXiv:22167 之 2608.22167
- 信号: arXiv · 开源框架 · MCP 即环境 · veRL/slime · 三域一份配置 · gpt-oss-20b
- 关键词: coding-agent-harness · mcp-security · agent-evaluation
7. Factory 提前叫停 — 为什么 coding agent 在长任务上提前放弃,以及 pattern-break 检测(Factory.ai)
Factory Research 工程博客(2026-08-27):模型已很擅长成功标准紧凑稳定的问题,但大型软件任务的成功标准是长尾且演化的——早期放弃(early abandonment)成为长任务吞吐的主要杀手。系统性应对:从真实企业工作负载学习完成模式,监控 agent 的行为流,用 pattern-break 检测识别"与成功轨迹形态不符"的运行并提前叫停或重定向,只放行符合成功形态的运行继续烧 token。对 Coding Agent Failure Patterns 是工程级补充——与 #91 SWE Refactor Bench("几乎完成"≠"完成")正交互补:一个修"跑不完",一个修"验收假完成";"成功轨迹形态"本质是把 #92 BASM 的边界感知记忆用到运行时监控——放弃决策从"模型自己觉得不行"外移到 harness 的形态匹配;vibe coding agent 可直接抄:长任务配 watch 模式,行为流偏离成功簇即止损。
- 来源: Factory.ai
- 信号: Factory Research 工程博客 · 真实企业负载 · pattern-break 检测 · HN 2p
- 关键词: Coding Agent Failure Patterns · coding-agent-harness · Coding Agent Verification
8. ToolRobustBench — 分阶段扰动评测:干净成功率很高,扰动下一律大幅退化,瓶颈在 tool 输出处理(arXiv:2608.23635)
干净的端到端成功率无法定位工具使用失败从哪一步起源、如何沿调用链传播。ToolRobustBench:工具调用 agent 的分阶段诊断 benchmark——四个扰动族对齐工具使用管线(工具接口、用户意图、工具输出/观察、运行时环境),失败归因到工具选择、schema grounding、参数绑定、输出/反馈处理、端到端成功五级。15,456 个单族实例 × 7 模型 × 16 本地工具 × 4 族 × 14 子类型:干净性能高但不均匀;扰动下全部模型大幅退化,tool-output/observation 扰动是主导瓶颈;混合族实验揭示非可加失败模式(单族结果解释不了组合失败)。对 agent-evaluation 是诊断协议级贡献——"agent 会调工具"与"agent 扛得住坏工具"之间隔着整个鲁棒性维度,而最脆的一环恰是"读返回值"——MCP server 的错误格式/截断/慢响应就是现实中的扰动族;分阶段归因协议可直接搬进 vibe coding agent 的工具回归测试(对每个 MCP server 注入四族扰动测失守点)。
- 来源: arXiv:2608.23635
- 信号: arXiv · 15,456 实例 · 7 模型 × 16 工具 · 四扰动族 · 输出扰动主导 · 混合非可加
- 关键词: agent-evaluation · Coding Agent Verification · mcp-security
9. RAMP — 提交 AI 配置的仓库成熟度模型:无配置组认知复杂度增量约为两倍(arXiv:2608.25241)
coding agent 提速也提债,但先前工作只报告采纳者的平均效应,掩盖团队间差异。RAMP(Repository AI Maturity Profile):四级累积成熟度模型,锚定团队提交进版本库的 AI 配置工件——从行为规则/编码标准,到命名 agent 定义,再到多 agent 编排(实践集中在前三层)。441 个仓库上各级表现为累积量表,人工标注在 held-out 样本上 97% 复现 RAMP 的仓库级标签;采纳是累积、单向、一次性的:73.8% 的工件提交后再未修改。分层内重估既有 agent 采纳面板:提速与成熟度无关(+28-38% commits),但质量分化——agent-first 仓库中(对比在此识别),无 AI 配置组认知复杂度增量约两倍(+53% vs +27%)、静态分析告警增量 1.7×。⚠️ 论文自注:成熟度是观察性的,相关联的工程纪律或模型能力可能解释部分差距——结论按 hypothesis-generating 呈现。对 agent-evaluation 是配置治理级实证(趋势级证据,谨慎措辞)——"几页 markdown"的 CLAUDE.md/AGENTS.md 与代码质量增量相关且方向一致:配置文件不是仪式而是质量的廉价保险;73.8% 写完不改印证 #92 Prompt 老化的另一面——配置也需要维护节奏(换模型时重测)。
- 来源: arXiv:2608.25241
- 信号: arXiv · cs.SE · 441 仓库 · 97% 人工复现 · 复杂度 +53% vs +27% · 自注 hypothesis-generating
- 关键词: agent-evaluation · Claude Code Skills · coding-agent-harness
10. Token 花费可预测 — 任务规格形态决定 token 账单:砍成用户故事多花 29.7%(arXiv:2608.25399)
同一问题两个工程师写出的任务规格不同,agent 的 token 花费就不同——规格如何塑造花费、能否提前预测是开放问题。Kimi K3 × 三档 thinking effort、2,700 次运行:把完整任务规格削减为裸用户故事,token 花费 +29.7%,而运行间方差不受任何 prompt 改动影响;prompt 敏感度是任务依赖的:13%-115%;拟合计价器:对未见任务用一次廉价探测即可在 36% 内预测整族规格 × effort 配置的花费分布,优于先前工作。对 Coding Agent 成本优化 是可预测性级贡献——规格是免费的杠杆:写清楚规格省真金白银(+29.7% 是均值,最坏任务翻倍);"先探测后估价"给 vibe coding agent 的预算/路由决策提供了直接机制——任务进来先跑一次 cheap probe 定价,再决定 effort 档位与模型路由;与 #92 Handoff Tax(切换税)互补:一个管任务前的定价,一个管任务中的换挡。
- 来源: arXiv:2608.25399
- 信号: arXiv · 2,700 运行 · 规格→用户故事 +29.7% · 敏感度 13-115% · 探测式预测 ±36%
- 关键词: Coding Agent 成本优化 · Context Engineering · agent-evaluation
11. ProgRouter — 在线进度引导路由:按任务进展逐步选 agent,不是一次性级联(arXiv:2608.25992)
多 agent 工作流成本高企,现有级联路由一次性做 query 级决策,无法适应多步工作流的状态依赖性——每步该用哪个 LLM 取决于演进中的任务进展、剩余难度与成本效率。ProgRouter:在线进度引导路由——多视图任务进度评分器(粗粒度工作流结果 regime + 子任务完成/进展趋势/状态质量的细粒度信号)+ 双路径进度预测器与自适应 meta-gating(估计每个候选 LLM 的进度增益),逐步在线决策平衡进度增益、时间预算与长期成本。HumanEval Plus/MBPP/MATH-500/ASQA 四域:在保持质量的同时贴合时间与成本预算(摘要截止处为定性表述,具体数字待深读)。对 Coding Agent 成本优化 是路由颗粒度级贡献——路由决策的单位从"任务"降到"步":与 #92 Handoff Tax 的"方向不同、策略相反"直接互补——handoff 研究的是切换代价,ProgRouter 提供切换的决策信号源(进度增益估计);meta-gating"值不值得换"的框架可直接搬进多档位路由策略。
- 来源: arXiv:2608.25992
- 信号: arXiv · cs.AI/cs.MA · 步级在线路由 · 双路径预测 + meta-gating · 四域评测
- 关键词: Coding Agent 成本优化 · Coding Agent 编排模式 · coding-agent-harness
12. claude-plugins-official 与 oh-my-pi — 官方插件目录 34.7k★;"IDE 接进 agent"反向打通 27.9k★(GitHub)
两个产品级信号:(1) anthropics/claude-plugins-official(34,667★、Apache-2.0、2025-11-20 创建、持续推送):Anthropic 官方管理的高质量 Claude Code 插件目录——与 #90 覆盖的社区市场(claude-plugins-community,每夜同步 + 自动扫描 + 人工审核)构成官方/社区双层市场,官方目录是"信封认证"层;在 #91 WebDev-Skills-Bench(skill 注入平均负期望)与今日凭证泄漏实证的背景下,目录的筛选责任从用户移交给平台——但凭证研究提醒:上架审计挡不住 fork 链与运行时日志泄漏。(2) can1357/oh-my-pi(27,920★、MIT、TypeScript、2025-12-31 创建,本周 trending +1,886):"把 IDE 接进 coding agent"——不是 agent 嵌进 IDE,而是 agent 拥有 IDE:语义代码智能(LSP 级)作为 harness 的一等工具。对 Claude Code Skills / coding-agent-harness 是生态格局级信号——插件市场完成"社区-官方"双层化,格局类似 npm early days;oh-my-pi 的方向反转值得注意:当 agent 是主体,IDE 退化为感知/操作通道——与 #92 oh-my-pi 同名的 Pi 适配器生态(warren/piki)互证,harness 周边的"IDE 语义供给"正在成为独立产品类目。
- 来源: anthropics/claude-plugins-official · can1357/oh-my-pi
- 信号: 34,667★ 官方目录 · 27,920★(+1,886/周)· 双 Apache/MIT · 均活跃推送
- 关键词: Claude Code Skills · coding-agent-harness · agent-skill-security
观察清单
| 主题 | 信号强度 | 备注 |
|---|---|---|
| skill 攻-害-防闭环 | ★★★★★ | EVOMAL 蠕虫(模仿即感染)→ SkillsMP 凭证泄漏(73.5% debug 日志)→ SkillShield(prompt 空间防御);Ars 实测无主安装命令 |
| 工具能力训练侧整合 | ★★★★ | SMITH 用-写联合(4B>30B 写手);MCP-U RL 把 MCP 环境接进训练 |
| 成本可预测性 | ★★★★ | 规格形态 +29.7% token;cheap probe ±36% 预测;ProgRouter 步级路由 |
| 长任务止损 | ★★★ | Factory pattern-break:偏离成功形态即提前叫停 |
| 工具鲁棒性 | ★★★ | ToolRobustBench:输出扰动是主导瓶颈;混合扰动非可加 |
| 配置即质量保险 | ★★★ | RAMP:无配置组复杂度增量 ~2×(hypothesis-generating,趋势级) |
| 插件市场双层化 | ★★★ | 官方目录 34.7k★ + 社区市场;oh-my-pi 反向"IDE 进 agent" 27.9k★ |
| 落选备查 | ★★ | BixBench3(生物);SPECMINE 语料(已入 Context Engineering 观察);experiential 411★(HN 45p 但星少);ai-engineer-notebooks(教学);Concord/AgentBridge/AgentCloud(同步类小工具) |