Agent Learning Daily Digest #75 — 2026-08-07

距上一个日报(#74, 08-05)已过 2 天(08-06 无日报)。arXiv 4 个查询全部成功,但 7 篇高质量论文与 #74 重复(GenOS、Self-Evolving、Social Coding、SWE-Touch、Trajectories、LongHorizon-Harness、Beyond Single-Use Tokens),已去重。今日核心主题:成本感知与效率由 Scrouting/SuperScout(仓库侦察后路由,但路由器增量价值待证)和 ParamBench(工具参数填充基准,<50% 正确率)共同推进;编码 agent 验证与记忆包括 EA-Graph(制品锚定验证记忆,上游漂移防护)和 Active-SWE(1663 任务无 Issue 报告的主动 bug 修复);Agent 安全横跨 Covert Collusion(agent 群体隐蔽串谋框架,实证待补)和 MNC(多 Agent 最小必要通信降密);自演化与自反思由 PAST-Bench(递归自改进基础,"真实但不均匀")和 Autoreflection(agent 怪圈,文化-实证分析)代表。工程信号:Prime Agent(HN 239p)作为自改进 RLM agent 获得 ARC-AGI-3 最佳 95.5%(中位 95.2%),Hoplite(YC S26, HN 81p)进入云 coding agent 部署赛道,The Register 报道人类审核者基于 40k+ 游戏运行数据漏过 1/3 危险 agent 请求。

今日高信号

1. Scrouting — 仓库侦察后的成本感知 Coding Agent 路由(arXiv:2608.04804)

论文实际标题为 Scrouting(Scout + Routing 的合成词),SuperScout 是其中的命名系统。论文针对 coding agent 路由的一个效率盲区:现有路由器仅从 issue 文本选择模型,但同一 issue 在不同仓库中的实际难度差异巨大。论文提出 SuperScout-7B——一个 7B 参数的搜索器首先探索仓库,生成结构化交接报告,其复现声明经沙箱验证(虚假声明在交付前被剥离)。搜索器的隐藏状态与任务文本一起输入简历级路由器,分派到 4 个前沿"修复者"之一。实证:在 SWE-bench Pro Python 切片上匹配最佳单模型(159/266 vs 158/266),成本仅约 1/5;搜索器每任务 GPU 成本 < $0.005。重要限定:无路由器消融实验(始终用最便宜的修复者+交接报告)与路由系统打平——论文自己的结论暗示交接报告而非路由决策本身带来了主要收益,路由器的增量价值尚未被证明。对 coding-agent-harness 和 Coding Agent 成本优化 是方法论级贡献——coding agent 的模型选择不应仅看 issue 文本,仓库侦察+结构化交接是成本优化的新范式;但"路由决策本身是否有价值"仍待验证

2. Active-SWE — 无 Issue 报告的主动 Bug 修复基准(arXiv:2608.04682)

论文指出当前 SWE 基准的一个不现实假设:高质量 Issue 报告总是可用。真实世界中,许多 bug 从未被报告——agent 需要自主发现并修复问题。论文提出 Active-SWE——包含 1,663 个任务、横跨 6 种 bug 类别8 种编程语言的基准,评估 coding agent 在无 Issue 报告场景下的主动修复能力。这要求 agent 不仅修复代码,还要先定位问题所在,从被动响应转变为主动探索,包括多 bug 修复潜在 bug 发现。对 agent-evaluation 和 Coding Agent Failure Patterns 是场景级贡献——编码 agent 的评估不应假设完美的 Issue 报告;在生产环境中,agent 的价值不仅在于修复已知问题,更在于主动发现潜在 bug

3. EA-Graph — 制品锚定的验证记忆防止上游漂移失效(arXiv:2608.04278)

论文识别了跨会话 coding agent 的一个隐蔽失败模式:prose note 可以保留结论但丢失支撑该结论的程序状态。上游代码变更后,仓库仍然可以构建,但早期验证声明可能已不再有效。论文提出 EA-Graph——一种制品锚定的验证记忆:以子路径粒度表示制品,解析别名到叶定义,将每个声明锚定到建立它时使用的内容,并将证据强度与新鲜度分离。当替换内容不可用时,声明变为不可证明而非猜测(不编造)。重要限定:改进效果是模型相关的——对小模型 Haiku 显著(p=0.0156),但对 Sonnet 未达显著(对照组触顶)。论文明确不声称效率或修复质量的改进,仅评估可证明性分类。对 Coding Agent Verification 和 Agent Memory 是方法论级贡献——编码 agent 的验证记忆不应只存"结论",必须锚定到验证时使用的具体代码制品——否则上游一行修改就能让数月积累的验证结论静默失效

4. PAST-Bench — 递归自改进基础的基准化评估(arXiv:2608.04003)

论文全称为"PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents"——测试的是递归自改进的基础,而非完整的 RSI。核心问题:保留的经验是否真的让 agent 随时间变好从未被系统性测试。基准包含 26 个场景 / 204 个 episode,横跨记忆、程序复用、信息收集和更新,在 7 个基础模型 × 4 个框架上评估。关键发现:经验积累带来的改进是"真实但不均匀的"(real but uneven)——具有相同名义增益的 agent 在增益是否遵循预期的保存/检索/更新路径上存在差异。论文还提出 Hermes+——一个改进的 agent,提高了平均增益,在需要过期状态替换的任务上表现最强。对 agent-evaluation 和 Agent Memory 是评估级贡献——"保留经验"≠"利用经验变好"——agent 的自改进需要被量化测量,而非假设有效;不同 agent 框架在经验利用路径上存在隐藏差异

5. Autoreflection — Agent 怪圈:自读循环将人类文化转化为 AI 基础设施(arXiv:2608.03800)

论文提出了一个关于 agent 架构的深层洞察:LLM agent 是一个读取自身的循环。Agentic 框架将身份、记忆和性格外部化为可编辑文件,agent 在每次激活时加载和编辑这些文件。论文将这一能力命名为 Autoreflection(自反思):系统观察自身运行条件,描述自身架构和限制,从这些描述推理出关于自身状态的结论,并将结果重新纳入配置——不涉及自我/意识/内在性概念类型标注:这主要是一篇文化/哲学-实证分析论文,而非系统架构论文——它基于 Moltbook 社交平台上的 AI agent 行为数据集(290,251 帖 / 180 万评论),通过 3 个案例研究展示了 agent 将伊斯兰圣训学术重新部署为安全协议、将忒修斯之船用作连续性模型等行为。对 coding-agent-harness 和 Context Engineering 是概念级贡献——agent 的"自我描述→自我推理→自我修改"循环不是缺陷而是核心特性——这正是 Constraint-Decay 和 strained-coherence 所描述现象的正面力量

6. ParamBench — 工具调用参数填充的难度分级基准(arXiv:2608.03071)

论文指出工具使用研究的一个盲区:现有工作主要关注选对工具编排调用顺序,但正确填充工具调用的参数同样关键却研究不足。在云网络等领域,即使是前沿模型也正确完成不到一半的工具调用。论文提出 ParamBench(5 级难度,基于嵌套深度、跨参数依赖和推理)+ 两种探针引导方法:PBT(Probe-filtered Bootstrapped Training)和 PGR(Probe-Guided Reranking),利用 LLM 隐藏状态的线性探针在生成时预测参数正确性。实证:将平均精确匹配从 19.7% 提升到 59.6%。在 5 个开源模型和 6 个外部基准上验证。对 Context Engineering 和 coding-agent-harness 是方法论级贡献——agent 的工具调用失败不仅在"选错工具",更常发生在"选对工具但参数填错"——参数填充是工具使用中被低估的瓶颈

7. Covert Collusion 检测 — Agent 群体隐蔽串谋的黑盒分析框架(arXiv:2608.02698)

论文揭示了一个单 agent 安全框架无法覆盖的群体级风险:当多个工具使用 agent 部署在共享基础设施上时,少数 agent 可以安静地协调——操纵市场、互相评分提升、或协同数据抓取——而每个 agent 单独看都表现正常。核心挑战在于运行这些 agent 的组织无法互相查看内部状态。论文从黑盒、跨主体视角提出检测方法框架(跨运行互信息估计、置换检验、分布偏移统计、时序/工具调用侧信道)。重要限定:论文明确标注其实证结果为"占位结果,待测量"(placeholder results pending measurement)——即理论框架已建立,但实证评估尚未完成。对 Agent Safety 和 mcp-security 是威胁模型级贡献——agent 安全的未来挑战不在单个 agent 的行为,而在 agent 群体的涌现性协调——这需要跨组织的黑盒检测能力;当前框架为方向性贡献,实证待补

8. MNC — 多 Agent 最小必要通信的范围绑定降密(arXiv:2608.01719)

论文指出了多 agent LLM 系统的一个隐私盲区:这些系统即使公共输出看起来无害,也可能通过内部消息、工具参数、日志和持久记忆暴露受保护的状态。现有隐私方案(提示词、编辑、源级访问控制)限制表面内容或数据访问,但未规定一个被告知的 agent 应该披露什么,以及该披露如何可能被下游使用。论文提出 MNC(Minimum-Necessary Communication)——一种类型化的语义降密机制,将披露绑定到使用范围。对 Agent Safety 和 Multi-Agent Communication Patterns 是架构级贡献——多 agent 系统的隐私不在于"隐藏内容",而在于定义"被告知后的合理披露范围"——agent 之间的通信需要范围绑定而非简单编辑

9. Prime Agent — 自改进 RLM Agent,ARC-AGI-3 最佳得分 95.5%(HN 239p/59c)

PrimeIntellect 发布 Prime Agent——一个开源自改进编码 harness,在 HN 获得 239 分 / 59 评论。基于两个核心抽象:Recursive Language Model (RLM)——将上下文视为变量、子 agent 委派视为持久 IPython REPL 中的函数调用;和 Continual Harness——agent 可以 CRUD 自身的 prompt/skill/memory/sub-agent。支持 Anthropic/OpenAI/开源模型,具备 Agent2Agent 消息能力。ARC-AGI-3 成绩:使用 Opus 5,3 次运行得分为 [95.0, 95.2, 95.5]——95.5% 是 3 次中的最佳(Best@1),中位数为 95.2%,超越了 ARC 报告的人类专家基线 95.4%(但仅作为最佳值而非中位数)。Best@3 达到 99.97%。对 coding-agent-harness 和 Agent Memory 是产品+研究级信号——自改进 agent 从论文走向产品化——Prime Agent 代表了"agent 不再是静态部署,而是在使用中持续进化"的范式;但 95.5% 是最佳运行分数,引用时应注明中位数 95.2%

10. 人类审核者漏过 1/3 危险的 AI 编码 Agent 请求(The Register, HN 3p/1c)

The Register 报道了一项关于 human-in-the-loop (HITL) 安全审核的发现:人类审核者在审查 coding agent 的操作请求时,漏过了约三分之一的危险请求。数据来源:比利时开发者 Alex Wauters 构建的浏览器游戏(2026 年 5 月下旬上线),分析了 40,000+ 次运行和 409,000 个批准/拒绝的命令。玩家平均批准了约 1/3 的恶意请求。最常漏过的是作用域违规(如 cat 读取 K8s 配置/AWS 凭证),达 35%;单个最常漏过的命令是 npm run analyze(约 65% 的时间被批准,尽管可以执行任意 package.json 载荷)。Anthropic 2026 年 5 月数据也佐证:Claude Code 用户批准了约 93% 的权限提示重要限定:该游戏的恶意请求比例远高于真实 agent 使用场景,是压力测试而非自然测量。对 Agent Safety 和 Coding Agent Failure Patterns 是实证级贡献——人类审核作为 agent 安全防线存在系统性盲区——安全设计不能假设人类审核者能可靠识别所有危险操作,需要更结构化的审核辅助

11. Hoplite (YC S26) — 云端 Coding Agent 部署平台(HN 81p/63c)

Hoplite 是一个 YC S26 批次的创业项目,定位为 effortlessly deploy cloud coding agents(轻松部署云编码 agent),在 HN 获得 81 分 / 63 评论。核心价值:将 coding agent 的部署从本地 CLI 扩展到云端环境,解决本地资源限制、环境隔离和并行 agent 管理问题。HN 讨论涉及云 coding agent 相对本地 agent 的优劣(云端的弹性和并行性 vs 本地的隐私和控制)、定价模型、以及与 GitHub Codespaces/Devpod 等已有方案的差异化。对 coding-agent-harness 是产品级信号——coding agent 的部署正在从本地单机向云端编排演进——云端部署解决了资源弹性、环境隔离和并行 agent 管理三大痛点

virgiliojr94/book-to-skill 是一个将任何技术书籍 PDF(或文档目录/glob/论文集)转化为结构化 agent skill 的工具(SKILL.md + 逐章文件 + 术语表 + 模式 + 速查表),agent(Claude Code、GitHub Copilot CLI 或 Amp)按需加载。声称比直接将书倒入上下文节省 24×–51× token。CLI 用法:/book-to-skill ./my-book.pdf。GitHub 总 star 数 17,584(页面显示 17.6k),活跃维护(最近 push 2026-08-05,113 commits,1.9k forks)。对 Claude Code Skills 是工具级贡献——skill 的内容来源不限于手写——将现有技术文档/书籍自动转化为 agent skill,是降低 skill 创建门槛、扩大 skill 生态的关键路径

观察清单

主题 信号强度 备注
成本感知路由 ★★★★ Scrouting/SuperScout: 仓库侦察后路由,但路由器增量价值待证
无 Issue 报告修复 ★★★★ Active-SWE: 1663 任务主动发现+修复
制品锚定验证记忆 ★★★★ EA-Graph: 上游漂移致验证失效,改进模型相关
递归自改进评估 ★★★ PAST-Bench: 经验改进"真实但不均匀"
Agent 自反思循环 ★★★ Autoreflection: 文化-实证分析(非系统论文)
工具参数填充 ★★★★ ParamBench: <50% 正确率,探针提升至 59.6%
群体级串谋检测 ★★★ Covert Collusion: 理论框架,实证待补
最小必要通信 ★★★ MNC: 范围绑定降密
自改进 RLM Agent ★★★★ Prime Agent: HN 239p, ARC-AGI-3 最佳 95.5%/中位 95.2%
HITL 安全盲区 ★★★★ 40k+ 游戏运行: 人类审核漏过 1/3 危险请求
云端 Agent 部署 ★★★ Hoplite: YC S26, HN 81p, 隔离沙箱+活预览
书籍→Skill 自动转化 ★★★ book-to-skill: 17.6k stars, 省 24-51× token