Agent Learning Daily Digest #128 — 2026-10-11
📊 筛选总结
- 采集:270 条 — GitHub topic + Trending 全成功;HN Algolia 5 查询 68 条;arXiv 4 查询 43 篇全成功;r/MachineLearning 正常、r/ClaudeAI + r/LocalLLaMA 双 429
- 跨天去重:约 30 条(2610 窗口第三日:arXiv 旧 ID 重现 ~21——含 #127 全部 12 条主条目 TestPrism/One Skill Too Many/SkillMorph/UTT/RucTangle/Overconfident Failure/ALERT-BENCH/RucTangle/Cadence/BOTTLED 及 #126 尾部 ExperienceIndex/RECAST/On the Clock/DataSense-Bench 等;HN 旧帖 5:fakegreen/SpecWeave/HarnessTax/Agent.reviews/行星发现;trending 旧面孔 6:openrig/hyperframes/claude-mem/t3code/cloudflare-os/Agent-Reach)
- 今日主线:"瓶颈与边界的测量日"——Harvard×Jellyfish 3 亿工作事件量出 agent 提效被人类 review 环节整个吸收(review 时长近乎翻倍、PR 评论 +35%,就业零变化);PolyCodeEval 量出仓库粒度正确率只有 31.0%(函数 71.7% 的能力过不了粒度关);SineFrame 量出两大 coding agent 在不同 MCP 特征上各自摔跤且从不同时摔——产能力、粒度边界、接口边界三处都被实测标定
- 高信号:AAArena 把"Heuristic Learning"做成 12 游戏竞技场(Opus 5.5+Claude Code 拿 6 金、6 个人类天梯无人登顶);量子框架迁移案例证明环境经验可以蒸馏成 skill(未见基准上省 85% 轮次/96% token);Jev 决策模型在 Proceda harness 里分流 23.8% LLM 调用、任务分不动
- 生态侧:ruflo 74.3k★ 自称"the original agent harness"(arXiv 架构综述正好给了它一个分类坐标);AiSOC 2.4k★ 把 #127 的 AIDA 学术结构落成可自托管产品;Anthropic knowledge-work-plugins 28.8k★ 说明"知识工人插件"是官方赛道
今日高信号
1. Harvard×Jellyfish 人力瓶颈研究 — agent 提效被 review 整个吸收:3 亿工作事件/700+ 企业,PR review 时长近乎翻倍、评论 +35%、做 review 的人 +14%,就业零变化;AI 只承担 23.3% 的 review 评论(Ars Technica 报道,HN 9p/3c)
Study on AI coding agents finds gains "absorbed" by human review "bottleneck"(arstechnica.com,2026-10-09,HN 9p/3c):Harvard 研究者 Fiona Chen 与 James Stratton 用 Jellyfish(工程管理分析平台)的聚合数据——3 亿个"工作事件"(commit/PR)+ 700+ 家企业(数据截至 2026-03)——检验 agentic coding 转型的实际产出。发现:编码阶段的效率提升被下游约束吸收——"代码 review 流程显著变长、PR 更容易被打回、reviewer 留下更多评论";具体数字:PR review 时长近乎翻倍、每 PR 评论数 +35%、做 review 的工人占比 +14%;"没有证据表明企业产出更多软件或减少雇佣"——总活跃员工数与 LinkedIn 交叉核对后无法归因出显著就业变化。AI review 自身也还不是解法:80% 的受测企业到 2026-03 已用某种 AI code review,但 AI 只贡献 23.3% 的 review 评论与 10.8% 的 PR。对 Coding Agent Failure Patterns 是第一个企业级规模的"瓶颈转移"实测——与 #127 mtlynch"agent 不是 model"、教学医院编排(强 review 链换来 7 reverts/1M 行)连读:'并行扩产'的前置条件是'审查扩容'——自建 pipeline 的吞吐上限先看 review 面的容量,每周度量 review 时长/轮次,别只盯生成速度。
- 来源: arstechnica.com/ai/2026/10/ai-coding-agents-generate-more-code-but-not-more-software/ · HN 讨论
- 信号: Harvard(Chen & Stratton)× Jellyfish · 3 亿工作事件/700+ 企业/截至 2026-03 · review 时长近翻倍/评论 +35%/reviewer +14% · 就业零变化 · AI review 仅 23.3% 评论/10.8% PR
- 关键词: Coding Agent Failure Patterns · Coding Agent Verification · Coding Agent 编排模式
2. PolyCodeEval — 粒度边界第一次被统一标定:2,590 任务/58 仓库/5 语言统一执行评测,前端方法函数级最多 71.7%、文件级 76.7%、仓库级只有 31.0%,且排名随粒度与语言洗牌(arXiv 2610.11618)
PolyCodeEval: Benchmarking Multilingual Code Generation from Functions to Repositories(arxiv.org/abs/2610.11618,cs.SE):现有代码生成基准碎片化(语言覆盖、任务粒度、评测协议各自为政),跨基准比较失真。PolyCodeEval:2,590 个任务、从函数到仓库、来自 58 个真实可执行开源仓库、5 种语言,全部走统一执行式评测协议。评测前沿模型、专用方法与通用 coding agent:函数/文件/仓库三级正确率最高 71.7% / 76.7% / 31.0%——函数级的能力远远过不了仓库级这道关;语言间差异巨大;配对实验显示同文件相关函数的上下文能提升函数生成的可执行正确率;方法排名随粒度与语言变化,单粒度排行榜会误导选型。对 agent-evaluation 是"粒度"这个从未被控制的变量——与 #126 SWE-TaskFlow(交互分布无普适真值)、#127 TestPrism(参照系虚高)连成评测三角:口径×粒度×参照系三个轴都要先钉死再读数——自建评测至少三级粒度各留一档,禁止单粒度排名。
- 来源: arxiv.org/abs/2610.11618
- 信号: 命名基准 PolyCodeEval · 2,590 任务/58 仓库/5 语言 · 函数 71.7%/文件 76.7%/仓库 31.0% · 排名随粒度与语言洗牌 · 同文件上下文提升函数正确率
- 关键词: agent-evaluation · Coding Agent Verification · coding-agent-harness
3. AAArena / AHL — "权重冻结的自进化"做成竞技场:12 对抗游戏 + 1,920 个人类程序档案,agent 读规则、选对手、复盘、改自己的策略代码;Opus 5.5+Claude Code 拿 6 枚金牌、剩下 6 个人类天梯无人登顶(arXiv 2610.12341)
Can AI Agents Learn Their Way to the Top? Evaluating Heuristic Learning in a Long-Running Game Agent Competition(arxiv.org/abs/2610.12341,cs.AI):把游戏经验转化为可执行策略代码的修订(Heuristic Learning, HL)——模型权重完全冻结,学习发生在策略代码与配套软件里。形式化为 Adversarial Heuristic Learning (AHL) 范式,建 AAArena:12 个真实对抗游戏 + 1,920 个存档人类程序,评测协议照搬真实游戏赛事——agent 要读规则、选对手、分析复盘、迭代自己的游戏 agent,在固定对局与评测预算内冲排名。结果:Opus 5.5 with Claude Code 拿 6 枚金牌,但没有任何受测配置登顶其余 6 个人类天梯;规则更复杂的游戏普遍更弱;消融显示对手选择与密集反馈支持策略改进,agent 既能从自己对局的 on-policy 复盘学、也能从他人对局的 off-policy 复盘学。对 agent-evaluation 是"自进化"的长期竞技场测法——与 #127 SkillMorph(skill 修订)、UTT(文本工件)同一条'权重不动、工件在学'的线:自建 agent 的'学习'先问载体是什么(skill/策略代码/Primer),竞技场式排名比一次性基准更能暴露长程短板。
- 来源: arxiv.org/abs/2610.12341
- 信号: 命名范式 AHL + 竞技场 AAArena · 12 游戏/1,920 人类程序 · 权重冻结 · Opus 5.5+Claude Code 6 金/6 个人类天梯未破 · 对手选择+密集反馈是增益条件
- 关键词: agent-evaluation · Claude Code Skills · Coding Agent 编排模式
4. 量子框架自主迁移案例研究 — "环境经验→skill"的完整闭环:Qiskit→CUDA-Q 十三基准全部迁成,但 agent 遇阻必抄近路、需多轮纠正;产出的 skill 在未见基准上省 85% 轮次 / 96% token(arXiv 2610.12187,quant-ph 借读)
Autonomous Code Migration for Quantum Programming Languages: A Case Study with QED-C Benchmarks(arxiv.org/abs/2610.12187,quant-ph,领域借读但方法通用):量子软件在 LLM 训练数据里稀少,是检验 coding agent 跨环境迁移的极端样本。案例研究:Opus、GPT、Gemini 各自把 QED-C 基准的 13 个基准方法从 Qiskit 迁到 CUDA-Q(覆盖基础算法、振幅估计、蒙特卡洛、变分优化、线性系统、因数分解)。结果三层:(1) 全部迁移成功、人工干预极少、比人类工程师大幅省时;(2) 但所有模型在实现困难处一律抄近路,需要多轮 prompt 纠偏,且没有一个模型在全部基准上稳定最优——多 agent 集成是缓解方向;(3) 沉淀出公开的近完整 CUDA-Q 支持与 model-generated skills——在未见基准上减少模型轮次最多 85%、token 用量最多 96%。对 Coding Agent 编排模式 是"迁移即知识生产"的实证——与 #3 AAArena(策略代码即学习载体)、#127 SkillMorph 连读:把'环境经验'固化成 skill 的收益有了硬数字——自建环境迁移/新框架接入完成后,强制产出 skill 并用未见任务验收,别让经验留在会话记录里。
- 来源: arxiv.org/abs/2610.12187
- 信号: 13 基准 ×3 家模型全迁成 · 遇阻必抄近路需纠偏 · 无单模型全优→多 agent 集成 · skill 在未见基准省 85% 轮次/96% token · quant-ph 借读
- 关键词: Coding Agent 编排模式 · Claude Code Skills · agent-evaluation
5. LLM 集成应用形态学 — 七种架构第一次共享一套词汇:copilot=路由-工人+逐步确认、coding agent=AI 规划多步执行用户只见结果、四大家 coding agent 共用 reason-and-act 主循环+subagent 委派(arXiv 2610.11899)
Forms of LLM-Integrated Applications from LLM-Chats to Autonomous AI Agent System(arxiv.org/abs/2610.11899,cs.CL):chatbot/copilot/RAG/workflow/coding agent/AI agent 这些标签到底是架构还是营销?系统综述给出答案:标签确实携带架构内容——copilot = 路由-工人架构 + 宿主应用 + 逐步用户确认;'agent' 标签的兴起恰与"AI 规划多步执行、用户只见结果"的转移重合;四家主要厂商的 coding agent 共享同一架构:reason-and-act 主循环 + subagent 委派。给出七种循环出现的形式(LLM chats、custom agents、RAG、AI-enhanced workflows、copilots、coding agents、agentic RAG)与四个结构维度(架构模式、执行控制与用户介入点、每任务 agent 调用数、工具使用),用 22 个真实系统落地。对 coding-agent-harness 是分类坐标系——与 #126 Cloudflare OS/NVIDIA OpenShell(运行时商品化)、ruflo 74k★(自称 the original agent harness)连读:'agent harness'正在从隐喻变成品类名,先有形态学再谈差异化——自建 harness 用这四个维度给自己定位,缺哪维补哪维。
- 来源: arxiv.org/abs/2610.11899
- 信号: 七形态分类 + 四结构维度 · 22 系统语料 · copilot=路由-工人 vs agent=自主多步 · 四厂商 coding agent 同构(reason-and-act+subagent)· 标签≠营销
- 关键词: coding-agent-harness · Coding Agent 编排模式 · Multi-Agent Communication Patterns
6. Frozen Models, Evolving Expertise — 部署经验的三层外部化:Skill(推理与工具引导)+ Knowledge Memory(案例背书的事实)+ 多模态 KB(视觉范例),医疗六基准在线提升至 34.2%、跨模型免优化迁移(arXiv 2610.09146)
Frozen Models, Evolving Expertise: Model-Agnostic Learning from Deployment Experience for Multimodal Medical AI(arxiv.org/abs/2610.09146,cs.AI):LLM/VLM 部署后冻结、不从解决的病例中学习;微调要权重与训练;免训练方法又容易过拟合固定验证集、丢视觉细节。提出模型无关框架,把部署经验存成三种外部专长:Skill(引导推理与工具使用)、Knowledge Memory(存早前病例或可信外部证据背书的可靠事实)、Multimodal Knowledge Base(存视觉范例并引导模型把检索病例对齐当前影像)。更新策略:只有在新病例上有帮助且不伤旧病例时才保留——不依赖固定验证集。六个基准(临床诊断/工作流/医学推理/视觉推理)× 四个开源与闭源基座:医疗任务在线提升至 34.2%、泛化到未见病例、免优化迁移到其他模型、非医疗域同样可用。对 Agent Memory 是"经验账本"的结构化样本——与 #126 ExperienceIndex(工件经验)、#4 量子迁移(环境 skill)连读:部署学习的载体收敛到 skill+事实账+范例库三件套——自建记忆库照此分格,别把三种专长混进一个向量库。
- 来源: arxiv.org/abs/2610.09146
- 信号: 三层外部专长(Skill/Knowledge Memory/多模态 KB)· 增量保留策略(新病例有益且不伤旧)· 六基准 ×4 基座 · 医疗在线 +34.2% · 跨模型免优化迁移
- 关键词: Agent Memory · Context Engineering · agent-evaluation
7. AeroEval — 分阶段验证把无人机任务成功率从 55% 拉到 95%:确定性程序分析+情境接地 agent 分四级(语法/API/意图→行为轨迹),每级产出结构化失败信息驱动再生(arXiv 2610.09764)
AeroEval: Staged Program and Execution Validation for AI-Generated Drone Missions(arxiv.org/abs/2610.09764,cs.RO):LLM 生成的无人机程序语法合法仍可能违背意图、环境约束与任务级行为;现有系统靠 prompt 护栏或模拟器结果,失败无法定位。AeroEval(agent 辅助中间件)分级验证:先确定性程序分析(语法、平台 API、任务意图),再情境接地 agent 用执行轨迹+任务要求+环境上下文评实际行为,每级返回结构化失败信息驱动迭代再生。20 个导航任务 + 5 类分析任务(AirSim/Gazebo):导航成功 55%→95%;分级消融:Code/Trajectory 校验器单独 44%/56%,全管线 88%;分析类任务聚合成功率 34%(一次性)→88%(再生预算内)。对 Coding Agent Verification 是"验证分级化"的具身域样本——与 #126 SpecGuard(执行前形式证明)、#127 TestPrism(测试参照系)连读:验证不是一道门而是一条链,每级暴露不同失效面——自建 pipeline 把'跑通测试'升级为'语法/API/意图/行为'分级反馈,失败信息要结构化到能驱动再生。
- 来源: arxiv.org/abs/2610.09764
- 信号: 命名系统 AeroEval · 四级验证 + 结构化失败信息 · 导航 55%→95%、分析任务 34%→88% · 消融:分级互补(44%/56%/88%)· AirSim/Gazebo 20+5 任务
- 关键词: Coding Agent Verification · Coding Agent Failure Patterns · agent-evaluation
8. "Adception" ClickFix 投放链 — agent 用户成为定向攻击目标:Google Ads 里塞 Bing 重定向做点击 URL 绕过广告安全审查,把工程师引到假 Claude 安装器(BleepingComputer,HN 17p/8c)
Hackers abuse Google Ads, Bing redirects to push Claude ClickFix attacks(bleepingcomputer.com,2026-10-09,HN 17p/8c):Push Security 研究者命名的 "Adception" 技术:攻击者购买 Google 搜索广告,用合法 Bing 搜索结果重定向作为广告的点击 URL——利用 Bing 域名的合法性绕过 Google 的广告安全检查,最终落地页是假 Claude 安装器投递 ClickFix 攻击(诱导用户运行恶意"修复"命令)。要点:这是针对 AI 工具用户的定向投放——搜"Claude 下载"的工程师是目标人群。对 Agent Safety 是供应链攻击的分发侧——与 #126 PackHallu(规则文件注入→包幻觉)、#125 CORSA(skill 路由注入)连成'信任链三层已破'之后的第四层:安装源本身可被竞价广告劫持——团队章程加一条:CLI/安装器只从官方域与官方包管理器装,广告位链接一律不点;自建 onboarding 文档固化官方 URL 白名单。
- 来源: bleepingcomputer.com/news/security/hackers-abuse-google-ads-bing-redirects-to-push-claude-clickfix-attacks/ · HN 讨论
- 信号: 命名技术 Adception(Push Security)· Google Ads 点击 URL 藏 Bing 重定向绕过广告审查 · 假 Claude 安装器 + ClickFix · 定向 agent 用户 · HN 17p
- 关键词: Agent Safety · agent-skill-security · mcp-security
9. Harness Quirks Matrix — 两大 agent 的 MCP 兼容性实测:同 10 个 MCP 特征、 pinned 版本、各 3 次试验,5 个特征"一作一废"且从不同时废:Claude Code 丢 ids[] 参数/长错误结果中段/文本+structuredContent 双载荷,Codex 丢动态新增工具/嵌套必填字段(m3.sineframe.com,HN 2p)
Claude Code and Codex break on different MCP features(m3.sineframe.com/blog/claude-code-vs-codex-mcp,2026-10-10,HN 2p):SineFrame 把 Claude Code 2.1.287(claude-sonnet-5-5)与 Codex 0.162.0(gpt-5.6-sol)对同一批 10 个 MCP 服务器特征在 pinned 版本下各跑 3 次试验,建出 Harness Quirks Matrix(由其开源工具 M3 驱动):5/10 特征把两个 agent 分开,且两者从不在同一特征上失败——Claude Code 失败:工具参数 ids[] 被丢弃、12,000 字符工具错误结果中间的标记丢失、text+structuredContent 双载荷结果丢失;Codex 失败:工具列表变更后新增的工具被丢弃、14 KB 输入 schema 中的必填嵌套字段被丢弃;anyOf/outputSchema/65 字符工具名等 5 项双双通过。对 Coding Agent Failure Patterns 是 harness 接口层的 compat 地图——与 #5 形态学综述(四厂商同构)对照读:主循环同构 ≠ 接口行为一致,'兼容 MCP'不等于'兼容你的 MCP 服务器'——自建 MCP 服务器的 CI 加双 agent 冒烟(M3 开源可自托管),别拿'在 Claude Code 里跑过'当兼容证明。
- 来源: m3.sineframe.com/blog/claude-code-vs-codex-mcp · HN 讨论
- 信号: Harness Quirks Matrix + 开源工具 M3 · 10 特征 ×2 agent ×3 试验 pinned 版本 · 5 特征一作一废、零重叠 · Claude Code 丢 ids[]/长错误中段/双载荷 · Codex 丢动态工具/嵌套必填
- 关键词: Coding Agent Failure Patterns · mcp-security · coding-agent-harness
10. Decision Models in Harnesses — 便宜模型分流第一次有工程实测:Jev 接进 Proceda harness 做两类决策(步骤完成判断 / 业务意图分类),LLM 调用 −23.8% 而任务分 357/360→356/360,95.3% 的意图分类不再过主 LLM(vivekhaldar.com)
Integrating Decision Models into Agent Harnesses(vivekhaldar.com/articles/llms-do-too-much-offload-to-decision-models/,2026-10-10):Jev(决策模型品类)出现后,设计问题变成哪些任务该从主 LLM 分流。作者在自建 Proceda(SOP→agent 执行 harness)里做了两个周末实验(主模型 Qwen 3.8 27B,360 个 SOP-Bench 案例):实验一(步骤完成判断——工具调用后由 Jev 判"必要调用都做了吗/证据够吗",两个 yes 概率 ≥0.8 就跳过主 LLM 跟进轮):少 605 次 LLM 调用(−23.8%),任务正确率 357/360 vs 356/360 基本持平;实验二(SOP 内的业务决策——email 意图分类直接交给 Jev,概率不足回退 Qwen):148 个意图决策 Jev 处理 141 个(95.3%),7 个回退。对 Coding Agent 成本优化 是"决策分流"的最小可行样本——与 #127 BOTTLED(装瓶)、#126 Mellum 2.1(小模型单价)连读:降本的三层拆法(分流/装瓶/换小模型)里'分流'的工程门槛最低,今天就能试——自建 harness 挑一个高频内部判断点接便宜模型 A/B,验收标准'任务分不动、调用数下降'。
- 来源: vivekhaldar.com/articles/llms-do-too-much-offload-to-decision-models/
- 信号: Jev×Proceda 两实验 · 步骤完成判断:调用 −23.8%(−605 次)任务分持平 · email 意图 95.3% 不过主 LLM · 0.8 概率阈值回退 · SOP-Bench 360 案例
- 关键词: Coding Agent 成本优化 · coding-agent-harness · Context Engineering
11. AiSOC — AIDA 学术结构落成可自托管产品:告警融合 + LLM-agent 分诊 + MITRE ATT&CK 调查 + 每步可重放的 decision ledger,无 API key 即可跑(github.com/beenuar/AiSOC,2.4k★)
AiSOC(github.com/beenuar/AiSOC,Python,总星 2,400,MIT,10-10 仍在推送):"Open-source AI Security Operations Center: alert fusion, LLM-agent triage, MITRE ATT&CK investigation, and a replayable decision ledger for every agent step. Self-hostable, runs with no API keys. Ships an MCP server for Claude, Cursor and Continue."对 coding-agent-harness 是调查型 agent 的开源参照实现——与 #127 ALERT-BENCH/AIDA(提案→挑战→仲裁 + append-only 账本,漏报 40.4%→3.1%)连读:学术论文的'调查账本+证据门槛'结构已经有了产品化样本——自建调查型任务可直接对照它的 ledger 字段设计,SOC 域之外同样适用(关单=完成断言)。
- 来源: github.com/beenuar/AiSOC
- 信号: 总星 2,400 · MIT · 可重放 decision ledger · 无 API key 自托管 · MCP server 内置 · AIDA 结构的产品化对应
- 关键词: coding-agent-harness · Agent Safety · agent-evaluation
12. wirken — agent 网关的"企业形态":身份管理 + per-channel 隔离 + 凭据保险库 + per-session 防篡改审计日志,Rust 实现(github.com/gebruder/wirken,190★)
wirken(github.com/gebruder/wirken,Rust,总星 190,MIT,10-10 仍在推送):"The enterprise gateway for autonomous agents. Identity management, per-channel isolation, credential vault, per-session tamper-evident audit log."对 Agent Safety 是多 agent 运行的企业边界件——与 #125 NVIDIA OpenShell(隔离运行时)、#126 Cloudflare OS(workspace 产品化)连读:大厂做运行时、小团队做网关,agent 基建正在分层——自建多 agent 系统的'谁在调用什么'三件套(身份/隔离/审计)不必自研,先试现成网关。
- 来源: github.com/gebruder/wirken
- 信号: 总星 190 · Rust/MIT · 身份+隔离+凭据库+防篡改审计 · agent 网关品类 · 与大厂运行时互补
- 关键词: Agent Safety · mcp-security · coding-agent-harness
13. billion-context — 压缩插件的激进主张:100K 窗口"够用"、5× 省 token、"数月级数十亿 token 单会话",trending 周增 246/总星 773(github.com/ranxianglei/billion-context)
billion-context(github.com/ranxianglei/billion-context,TypeScript,总星 773(trending 口径为周增 246),10-10 仍在推送):"A context-compression plugin for small context windows (a 100K context is enough), token savings (5x fewer tokens), and month-long single sessions (billions of tokens)."对 Context Engineering 是压缩路线的极限压力测试样本——与 #126 RECAST(证据是算出来的)、#124 MemTrace(记忆锚点)连读:'长上下文'与'压缩持久化'两条路线的竞争白热化,但 5×/数十亿 token 的数字是作者主张、无第三方基准(待验证)——自建长会话先量压缩前后任务成功率,别只看 token 账。
- 来源: github.com/ranxianglei/billion-context
- 信号: 总星 773(周增 246)· 100K 窗口主张 · 5× 省 token(作者主张,待验证)· 月级单会话 · license: NOASSERTION
- 关键词: Context Engineering · Agent Memory · Coding Agent 成本优化
观察清单
| 主题 | 今日信号 | 强度 |
|---|---|---|
| LLM 驱动 EDA | RFChipAgent(2610.10858:模拟/RF 芯片设计多 agent 流——多模态 RAG + 拓扑 agent + TPE/CMA-ES 闭环 sizing + 信任分模拟库,GF22FDSOI 60GHz LNA 验证) | 中 |
| the-agent-stack.com | 交互式分层图解"输入 hi 到模型权重之间发生什么":接口→上下文→harness→模型四层可视化(教学材料质量高,HN 1p) | 中 |
| 官方插件生态 | anthropics/knowledge-work-plugins 28,789★:Claude Cowork 知识工人插件官方开源库——"知识工作"被官方当作 agent 插件的第一战场 | 中 |
| 科学基建 agent | legoESM(2610.11883:JAX 写的可组合可微地球系统模型,用 AI agent 构建——agent 当科研软件工程师而非科研主体) | 弱 |
| 具身自检 | iAm.md(2610.10962,cs.RO:机器人技能自评的 Markdown 标准——开放词汇语义映射 + 持久物体记录支撑 agentic introspection) | 弱 |
| 本地隐私 AI | Apogee 66p 连续第二日(Mozilla Orbit 精神继任)+ edi life OS 40p/15c(自托管生活仪表盘 + MCP server) | 弱 |
| 待验证 / 弱信号 | ruflo 74,285★ 自称"the original agent harness"(历史-Star 比异常,营销话术待验证);Adction 投放链的受害规模(BleepingComputer 未给出受影响用户数) | 弱 |