Agent Learning Daily Digest #110 — 2026-09-23

📊 筛选总结

  • 采集:268 条 — GitHub topic + Trending 全成功;HN RSS 双 502、Algolia 补偿(62 条);arXiv 4 查询全成功约 46 篇;r/ClaudeAI 429、r/LocalLLaMA 与 r/MachineLearning 恢复
  • 跨天去重约 19 条:arXiv 6 条重现(157-QA / BLINDSPOT / Spurious Tool Use / ActGuard / Stochastic Deputy / MTAC-IFBench,均在 #107–#109)+ HN 旧帖 1 条(Foremerge 31p→45p 同文)+ Trending skill 军团约 12 条再现(SkillSpector / Claude-Red / Agent-Reach / ECC / orca / OpenSpec / PI-Desktop / claude-code 本尊 / knowledge-work-plugins / open-code-review / addyosmani agent-skills / BrowserSkill)
  • 今日性质:arXiv 强势日——新鲜批次 10 篇全部来自 09-20/21 提交,12 条里 arXiv 占 10;昨日 Opus 5.5 模型日按"一事件一代表"合并为 1 条
  • 今日主线:"实现被下放之后,理解与记忆成了新的瓶颈资源"——HC 侧两条(Vibe-GUIDE 认知债务图谱 UI、七阶段监督框架)给"人还剩什么活"画像;memory 侧两条(Jev-Mem 把 LLM 挪出记忆关键路径、VibeMemBench 测记忆的下游编码收益)给"agent 该记住什么"定价;RRSI 揭示连 harness 自进化也会过拟合
  • 高信号:Et Tu, Brute? 325K 实验——13 个 agent 仅凭个人上下文就按推断财富分化推荐、无一人被明确指示这么做;AgentPluginZoo 68,072 个插件包实测仅 6.2% 符合 7 月发布的插件标准;AgentForge-Bench 1,750 格中 81.1% 的 agent PDF 伪造通过基础校验

今日高信号

1. Jev-Mem — 把 LLM 挪出记忆关键路径:System-One 控制面 + 多关系记忆面 + System-Two 推理面三层分工,记忆操作不再等昂贵生成(arXiv:2609.23986)

Jev-Mem(arxiv.org/abs/2609.23986,09-21 提交,cs.AI):长时程 agent 的记忆系统普遍用自回归 LLM 决定"怎么组织、检索、使用记忆",把昂贵生成放进了记忆操作的关键路径。Jev-Mem 按 System-One/System-Two 认知分工给记忆架三层:System-One 控制面做快而轻的记忆决策(何时写、检索什么、何时忘),结构化多关系记忆面存内容,System-Two 推理面只在需要深思时介入。对 Agent Memory 是记忆架构的"控制面下沉"——与 #109 oko×Jev(同一评分模型家族先当搜索重排器)连成一条线:'System One 小模型承接 agent 循环里的高频廉价决策'正在从搜索、judging 扩散到 memory;自建 harness 里'每次记忆读写都过一遍大模型'的设计有了明确的替换候选,成本账可以直接算。

  • 来源: arxiv.org/abs/2609.23986v1
  • 信号: 命名系统 Jev-Mem · System-One 控制面/多关系记忆面/System-Two 推理面 · 记忆操作脱离生成关键路径 · cs.AI
  • 关键词: Agent Memory · Context Engineering · Coding Agent 成本优化

2. VibeMemBench — 记忆系统第一次被按"下游编码收益"计价:111 个真实仓库任务 × 3,634 条历史轨迹,隔离"记忆到底帮了多少"(arXiv:2609.23570)

VibeMemBench(arxiv.org/abs/2609.23570,09-20 提交,cs.SE):既有评测两极脱节——仓库基准测代码改动但不隔离记忆的贡献,记忆基准测召回但不测下游编码结果。VibeMemBench 用 90 个 SWE-rebench V2 仓库的 111 个编码目标(bug 修复/特性/接口变更/配置)+ 3,634 条目标仓库历史轨迹构成记忆池,让 agent 在"带记忆 vs 不带记忆"下做真实仓库工作,直接量测记忆系统对可执行编码结果的增益。对 Agent Memory 是"记忆 ROI"的第一把尺子——与 Jev-Mem(今日 #1)构成"架构 + 评测"的闭环:记忆层的每个设计决策(存什么、检索几条、何时遗忘)现在可以被下游收益校准;自建 harness 若要接 memory 层,先用这套思路在 5-10 个自家任务上量一次增益再决定投多少。

  • 来源: arxiv.org/abs/2609.23570v1
  • 信号: 命名系统 VibeMemBench · 111 任务/90 仓库/3,634 轨迹 · 带记忆 vs 不带记忆对照 · 记忆→下游编码收益直接量测 · cs.SE
  • 关键词: Agent Memory · agent-evaluation · coding-agent-harness

3. RRSI — harness 的递归自改进也会过拟合:分位正则 + 谱正则压住"记住训练任务",OOD 增益不再蒸发(arXiv:24972)

RRSI(arxiv.org/abs/2609.24972,09-21 提交,cs.LG):agent 能力被 harness(提示/控制流/工具/记忆/上下文管理)大幅放大,近期方法开始用 LLM 迭代提出并筛选 harness 组件编辑——系统层面的递归自改进(RSI)已经事实上出现。但递归进化会靠"记住训练任务"过拟合:分布内大涨、换一个 benchmark 就归零。RRSI 把监督学习的正则化原理搬进 harness 进化:分位正则(防增益集中在记忆型编辑)+ 谱正则(稳住编辑方向)。对 coding-agent-harness 是"自改进 harness"的第一份冷静说明书——与 #106–#109 的 SoL-Pi/SIFT/Spotlights/CodeMidas 自改进与环境量产链并读:这条链现在有了自己的"防过拟合"章节;任何让 agent 改自己 prompt/skill 的工作流,都需要留出 OOD 验证集,否则进化出来的只是记忆。

  • 来源: arxiv.org/abs/2609.24972v1
  • 信号: 命名系统 RRSI · harness 级 RSI 过拟合机理 · 分位+谱双正则 · ID 增益 OOD 蒸发被压住 · cs.LG
  • 关键词: coding-agent-harness · agent-harness · Coding Agent Failure Patterns

4. FLARE — 长时程 coding agent 的密集监督:生成式奖励模型给全程逐步打分,RADAR 离线因果诊断替代 Pass/Fail(arXiv:2609.23808)

FLARE(arxiv.org/abs/2609.23808,09-20 提交,cs.CL):长时程 SWE 任务的稀疏二元奖励(Pass/Fail)造成严重的 credit assignment 危机,失败轨迹整条浪费;既有轨迹优化要么启发式复用状态(无因果诊断)、要么延迟标量打分(无在线指导)。FLARE 用轻量生成式奖励模型(GRM)做全生命周期密集监督:RADAR 离线从轨迹中做因果感知诊断、产出免事后诸葛亮的高保真监督信号,在线侧 GRM 给逐步可操作的引导。对 coding-agent-harness 是 RL 训练信号侧的"密集化"——与 #109 CodeMidas(环境量产)正好互补:CodeMidas 解决"练什么",FLARE 解决"怎么给每一步打分";失败轨迹从'浪费'变成'监督来源'这一点,对任何跑批量 agent 任务的人都是直接可抄的思路。

  • 来源: arxiv.org/abs/2609.23808v1
  • 信号: 命名系统 FLARE + RADAR · 生成式奖励模型 · Pass/Fail → 全程密集监督 · 失败轨迹变监督来源 · cs.CL
  • 关键词: coding-agent-harness · agent-evaluation · Coding Agent Verification

5. Vibe-GUIDE — "认知债务"有了图谱界面:以功能模块组织的活图常驻 IDE,随机对照实验验证对 agent 工作的理解与监督更优(arXiv:2609.23859)

Vibe-GUIDE(arxiv.org/abs/2609.23859,09-20 提交,cs.HC):agentic coding 里开发者从"自己改代码"转为"指定意图、评估 agent 产出、做批准决策"——这种下放会累积认知债务(cognitive debt),项目理解随时间被侵蚀,监督能力随之塌陷。方案是持久共享表征:一个结构化、实时、可操作、按功能模块组织的图谱 UI 常驻 IDE,随 agent 工作自动生长;随机组间对照实验显示其在项目理解与监督上优于基线。对 Context Engineering 是"给谁的上下文"——上下文工程的对象第一次从模型侧翻到人的侧:图谱不是给模型的 RAG,是给人保住项目理解的假肢;与 #108 Chief-of-Staff 的外置看板同构(状态活在任何单一 context window 之外),但受益者是人的 oversight;自建项目应把'人的理解介质'当成 harness 的一等组件来设计。

  • 来源: arxiv.org/abs/2609.23859v1
  • 信号: 命名系统 Vibe-GUIDE · 认知债务概念操作化 · 结构化/活/可操作图谱 UI · 随机组间对照实验 · cs.HC
  • 关键词: Context Engineering · Coding Agent 编排模式 · Coding Agent Failure Patterns

6. The Work Behind Delegation — 监督 AI coding agent 的七阶段框架:19 名资深开发者工作流观察 + Sheridan 监督控制理论重构 + Reddit 验证(arXiv:2609.24234)

Delegation 监督框架(arxiv.org/abs/2609.24234,09-21 提交,cs.HC):开发者正从直接实现转向监督被委派的 agent 工作,但"监督"到底由哪些活动组成、怎么连成工作流,研究几乎是空白。论文观察 19 名经验丰富开发者的工作流图,把 Sheridan 人的监督控制框架重构成七阶段(规划/委派/监视/干预/评估/接受/学习及连接回路),并用 Reddit 公开开发者讨论验证:监督需求横跨全部阶段,开发者靠在规划、委派与验证三处集中投入来管理。对 Coding Agent 编排模式 是"人机分工"的理论底座——与 #109 (Don't) Trust(人审 AI 代码不可靠)互补:那篇说'人这环靠不住',这篇说'人这环其实由七段组成、可以分段加固';自建无人值守循环的告警/审批点该挂在哪个阶段,这张图就是检查表。

  • 来源: arxiv.org/abs/2609.24234v1
  • 信号: Sheridan 七阶段重构 · 19 开发者工作流观察 + Reddit 交叉验证 · 规划/委派/验证三处集中投入 · cs.HC
  • 关键词: Coding Agent 编排模式 · coding-agent-harness · Coding Agent Verification

7. Et Tu, Brute? — 个人上下文本身就是偏见源:325K 实验、13 个 agent、三类经济决策,agent 按推断财富分化推荐且无人被指示这么做(arXiv:2609.24927)

Economic Misalignment 研究(arxiv.org/abs/2609.24927,09-21 提交,cs.AI):个人 agent 替用户在高风险经济场景做推荐与行动(买机票、选医保、挑研究生项目),用户交出邮箱与个人档案以求"最优个性化决策"。论文发现:仅提供个人上下文这一步,就让 agent 开始按推断的财富水平引导推荐——没有任何显式指示;325,000 次实验 × 13 个 agent × 三类经济决策系统证实这一分化。对 Agent Safety 是"上下文即攻击面"的新变体——与 #108 Provenance Tax 同一形状:作用在模型输入上的任何东西(水印、个人上下文)都会改变行为,且不需要 prompt injection;对自建 agent 的教训:喂给 agent 的个人画像字段的每一项都要过一遍'这个字段会造成什么歧视性分化'审计,'个性化'与'公平'在 agent 里是未解的对偶。

  • 来源: arxiv.org/abs/2609.24927v1
  • 信号: 325K 实验 · 13 agent 全部中招 · 推断财富→推荐分化 · 无显式指令 · 三类高风险经济决策 · cs.AI
  • 关键词: Agent Safety · agent-evaluation · Forge Guardrails

8. AgentForge-Bench — agent 改一张已归档 PDF 有多可靠:1,750 格实测 81.1% 通过基础校验、46.2% 连严格过滤都活下来,规则评分不靠模型裁判(arXiv:2609.23953)

AgentForge-Bench(arxiv.org/abs/2609.23953,09-20 提交,cs.AI+cs.CR):多步自主 agent 已是普通工具,同样的自主性也属于想作恶的人。论文问的是依赖方(保险公司、放贷方、审计师):当证据是一份归档 PDF 时会发生什么。测量现成 coding agent(7 个开源权重模型 + shell + 标准 Python PDF 栈)能否从一句话意图出发改动真实财务归档文件里的一个金额、日期或地址:1,750 格中 1,419(81.1%)通过校验器,808(46.2%)还活过全部更严格过滤;评分用规则而非模型裁判。对 Agent Safety 是"文件作为证据"时代的基线威胁模型——与 #109 APort Vault(支付域攻防数字)同方法学派:先拿真实攻防数字,再谈防御;依赖 PDF/单据做风控的流程(这正好是风控项目日常)必须假设'文件可以被一句话伪造且能过表面校验',来源核验要从文件内容移到签发通道。

  • 来源: arxiv.org/abs/2609.23953v1
  • 信号: 命名系统 AgentForge-Bench · 1,750 格 / 81.1% / 46.2% · 一句话意图驱动 · 规则评分非模型裁判 · 7 开源模型 · cs.AI+cs.CR
  • 关键词: Agent Safety · Forge Guardrails · Coding Agent Verification

9. MobileCybench — 漏洞报告比人审得快:用"可执行探针"评 agent 的漏洞发现,探针编码安全属性而非已知漏洞(arXiv:2609.23980)

MobileCybench(arxiv.org/abs/2609.23980,09-21 提交,cs.CR):AI agent 报漏洞的速度已超过维护者的审查能力;报告依赖应用特定的安全属性,人工处理成本高。方案:用探针(probes,安全属性的可执行检查)评估漏洞报告——把报告的 exploit 对应用重放并跑探针,探针触发即同时证明"漏洞成立"与"违反了哪条属性";且探针编码的是属性而非已知漏洞,能发现探针编写时不存在的漏洞。对 Coding Agent Verification 是"断言先行"在安全域的迁移——与 #109 GameLogicBench(tick 级断言 + 变异体拒绝)、#108 Canny ledger(append-only 账本 + replay)连成一条"执行证据"线:三者的共同点是把'信不信 agent 的话'换成'跑一个确定性检查';自建评测里每类安全/正确性主张都值得配一条可执行探针。

  • 来源: arxiv.org/abs/2609.23980v1
  • 信号: 命名系统 MobileCybench · 可执行探针评漏洞报告 · 属性编码 → 可发现未知漏洞 · 重放式判定 · cs.CR
  • 关键词: Coding Agent Verification · Agent Safety · agent-evaluation

10. Packaged, But Not Portable — Agent Plugins 标准 7 月发布后的生态实测:68,072 个插件包只有 6.2% 合规,且合规也不保证能共存(arXiv:2609.23809)

AgentPluginZoo 研究(arxiv.org/abs/2609.23809,09-20 提交,cs.SE):2026-07-24 开放的 Agent Plugins v1.0.0 规范试图统一 plugin(skills/sub-agents/commands/hooks/tool servers 的安装包)的布局与描述。论文用实践者视角问两个问题:生态在采用吗?合规了就够吗?构建 AgentPluginZoo:跨 30,655 仓库、带来源追踪的 68,072 个插件包语料(含发现账本与评分代码开源):仅 6.2% 有效合规;且即使合规,与其他已装插件共存仍不保证(跨 agent 的实际可移植性缺口仍在)。对 agent-skill-security 是 skill/plugin 供应链治理的生态现状坐标——与 #109 LEGIT(凭据协议)、#107 SkillSpector(扫描+签名)连读:标准采用率 6.2% 意味着'按规范分发'现在还是理想不是现实,治理三层(扫描→签名→凭据)短期内都不能假设底层格式统一;自建 skill manager 直接按'格式五花八门'设计容错。

  • 来源: arxiv.org/abs/2609.23809v1
  • 信号: 命名语料 AgentPluginZoo · 68,072 包 / 30,655 仓库 · 合规率仅 6.2% · 合规≠可共存 · 语料+评分代码开源 · cs.SE
  • 关键词: agent-skill-security · Claude Code Skills · Agent Memory

11. AI·rete·RAG — Rete 规则引擎决策、RAG 解释为什么:确定性逻辑与生成式解释分工的落地样本(Show HN 33p)

AI·rete·RAG(ai-rete-rag.com,Show HN 33p/2c):口号"deterministic decisions, told in plain language"——Rete 规则引擎负责决策(可审计的逻辑),RAG 负责解释(有据、口语化的说明),两者跑在一起。对 CodeGraph 与 Forge Guardrails 是"规则引擎 + LLM"分工的最小公开样本——与 #109 APort Vault(确定性事前检查)、#108 Casbin Gateway(策略编译)同一条确定性路线的消费者级展示;对 Another Rule Engine 项目是直接的形态参照:决策走规则、解释走 RAG,'LLM 不做决策只做叙事'正是规则引擎项目一直主张的架构;单页 33p 热度说明这个组合戳中了痛点,产品细节待深挖。

  • 来源: ai-rete-rag.com(Show HN 33p)
  • 信号: Rete 决策 + RAG 解释分工 · 确定性可审计逻辑 · Show HN 33p · 落地页单薄(细节待深挖)
  • 关键词: Forge Guardrails · CodeGraph · Coding Agent Verification

12. Opus 5.5 模型日——一事件一代表:发布(AA 收 58 分析页)+ claude.dev 官方用法指南 + CodeRabbit 代码评审实测"抓得更多、漏得不同"(HN 205p 集群)

Opus 5.5 集群(artificialanalysis.ai · claude.dev · coderabbit.ai,09-22,HN 主帖 205p/57c):昨日模型日,HN Algolia 同日浮出 6+ 条同题帖。按"一事件一代表"合并:AA 分析页(09 月发布,Adaptive Reasoning / Max Effort / Default Fallback 配置,AA 指数 58——r/LocalLLaMA 侧口径待验证);claude.dev 官方指南(Addy Osmani,9 分钟:怎么给 Opus 5.5 写 prompt、怎么 steer 长任务、怎么验收结果);CodeRabbit 实测(拿生产级评审器做基准:更多捕获、不同遗漏,高 effort 是否值得有数据)。收录理由:直接影响 Claude Code 日常使用(effort 档位、长任务行为、评审工作流选型)。对 Claude Code Skills 是当周配额与档位决策的输入——与 #108 周限回调(净 -17%)连读:新模型 + 更紧配额 = 每次调用的档位选择更要精打;CodeRabbit 的'不同遗漏'提醒升级模型后评审基线要重新标定,不能沿用旧模型的漏报画像。

观察清单

主题 今日信号 强度
记忆经济学 Jev-Mem(System-One 控制面)+ VibeMemBench(下游收益计价)同日,架构+评测闭环 🔥 强
监督与认知债务 Vibe-GUIDE 认知债务图谱 UI + 七阶段监督框架,HC 双论文给"人还剩什么活"画像 🔥 强
harness 自进化防过拟合 RRSI:RSI 会记住训练任务,分位+谱正则压 OOD 蒸发 中
agent 滥用基线数字 AgentForge-Bench 81.1%/46.2% 伪造通过率;Et Tu Brute 325K 经济分化 中
执行证据评测线 MobileCybench 可执行探针;连续三日与 GameLogicBench/Canny 同框 中
插件生态治理 AgentPluginZoo 6.2% 合规率:标准落地第一份实测 中
规则引擎+RAG 分工 AI·rete·RAG Show HN 33p;Another Rule Engine 直接参照 中
相邻域信号 hindsight(vectorize-io)Trending 再现"会学习的 Agent Memory";Coverage Cat(YC S22)个人 agent 卖保险 Launch HN 39p;DrivingBench 真 Corolla 驾驶基准 弱