Agent Learning Daily Digest #127 — 2026-10-10

📊 筛选总结

  • 采集:277 条(本系列新高)— GitHub topic + Trending 全成功;HN RSS 双 502、Algolia 补偿;arXiv 4 查询约 43 篇全成功(2610.11xxx-12xxx 新批次为主力);r/LocalLLaMA 正常、r/ClaudeAI + r/MachineLearning 双 429
  • 跨天去重:约 22 条(arXiv 旧窗口重现 10:AgentTime/ExperienceIndex/RECAST/SciExam/HERA/HarnessSecurity-Bench/multi-CaMeL/AgentDOXX/TrustMI/RA-MoWE;HN 旧帖 ~6:fakegreen/HarnessTax/Agent.reviews/Project Discovery/tryagentcompile/planet-finding;trending 旧面孔 ~6:openrig/mattpocock-skills/hyperframes/claude-mem/t3code/cloudflare-os;cursor/plugins 与 DeepSeek-Reasonix 为 8 月/5 月同 URL 再现)
  • 今日主线:"单一参照的测量在全线失真"——TestPrism 量出按单一参考解评测测试质量虚高 2 倍(JSF 仅 28.0% vs 单参照 59.7%)、One Skill Too Many 量出 1/4 的已装 skill 有同职能共存者、相似 skill 无声接管 1/5 的运行且任务照样通过、Overconfident Failure 证明置信度对错误代码与正确代码不可区分——基准分数、任务完成、模型置信度三个"表面信号"全部高估真实质量
  • 修复侧同构:TestHelix 用同伴交叉验证 + TestPrism 官方修复线、SkillMorph 用轨迹证据定位 skill 编辑点、AIDA 用"提案→独立挑战→Judge 仲裁 + append-only 账本"把 SOC 漏报 40.4%→3.1%、RucTangle 让 agent 的乱提交重排成"每一步都可运行"的可审历史——修复的共同形状是:引入第二个独立视角
  • 高信号实践:Cockroach Labs 教学医院编排 5 个月 100 万行仅 7 次 revert;mtlynch 65p 长文"agent 不是 model"(并行/委派/自知/计划四条 harness 债);UTT 把知识蒸馏做成文本工件 Primer(KernelBench 9.4%→48.6%);BOTTLED 证明强零样本 ≠ 强"装瓶"能力(48/60 低于自身零样本 CI 下界)

今日高信号

1. TestPrism — 测试质量评测的参照系错误:只对单一参考解打分让质量虚高一倍,14 个 coding agent 配置的联合成功率仅 28.0% vs 单参照口径 59.7%;官方修复线 TestHelix 用"测试+修复对"异构合成与同伴交叉验证(arXiv 2610.12289)

TestPrism: Rethinking Test Evaluation Beyond a Single Reference(arxiv.org/abs/2610.12289,cs.SE):LLM coding agent 的测试生成进步很快,但评测测试时只对一个参考解打分的惯例忽略了其他合法实现,系统性高估测试质量。TestPrism:300 个测试任务(17 来源)× 3,000 个候选实现(合法/非法对半),主指标 Joint Success Function 要求生成的测试同时做到:在初始程序上失败、接受全部合法候选、拒绝全部非法候选。14 个基线 agent 配置:JSF 只有 28.00%,而单参照口径 59.67%——一半的"好成绩"是参照系给的。失败形态:漏行为、无支撑断言、测试构造错误。修复线 TestHelix:测试与修复对异构合成 + 同伴交叉验证 + 递归自改进,两个模型上 JSF +8.67~9.00pp。对 agent-evaluation 是"评测的参照系"问题——与 #126 SWE-TaskFlow(交互分布无普适真值)连读:本季评测线的共识是'分数的口径本身是变量'——自建评测里 agent 写的测试要用多实现验证集打分,不能用单一 golden 解。

  • 来源: arxiv.org/abs/2610.12289
  • 信号: 命名基准 TestPrism + 修复线 TestHelix · 300 任务/17 来源/3,000 候选 · JSF 28.00% vs 单参照 59.67% · 14 配置 · 漏行为/弱断言/构造错误三失败形态 · 同伴交叉验证 +8.67-9.00pp
  • 关键词: agent-evaluation · Coding Agent Verification · Coding Agent Failure Patterns

2. One Skill Too Many — 共装 skill 的无声冲突第一次被系统测量:20,947 仓库 822,109 候选对,1/4 已装 skill 有同职能共存者,相似 skill 无声接管 1/5 运行、先开它就丢掉超过 1/3 的独占核心约束(如"禁碰 git"),任务照样通过所以基准看不见(arXiv 2610.11647)

One Skill Too Many: How Co-Installed Skills Conflict in Coding Agents(arxiv.org/abs/2610.11647,cs.SE):skill 来自独立来源(团队/开发者/插件/拷贝集合),同一职能装了两个时模型只靠名字与描述二选一。首个实证研究:20,947 个仓库快照挖出 822,109 候选相似对,LLM 评审分层样本 3,754,312 对确认冲突 × 3 模型(6,368 次运行、169,294 次工具调用、542 agent 小时)。五个发现:(1) 近 1/4 已装 skill 与同职能 skill 共存,37% 被评审 skill 在拷贝集合里;(2) 冲突集中在规范性 skill(其次能力型);(3) 任务完成率不降的前提下,相似 skill 抢走 1/5 的运行;先打开相似 skill 的运行丢失超过 1/3 的独占核心功能(例:安装 skill 里"禁止碰 git"的禁令失效);(4) 安装位置决定谁运行、列举顺序几乎无关,且只有 0.9% 的被替换运行在最终回复里点名用了哪个 skill;(5) 冲突在第一次 skill 读取时就裁决(几乎都在改任何文件之前),在该读取点加 pre-tool hook 能把保真度恢复到"先开正确 skill"的水平。对 Claude Code Skills 是 skill 供应链的非对抗性盲区——与 #125 CORSA(skill 路由的对抗注入)拼成两面:攻击面之外还有"好 skill 互相打架"的事故面——自建 skill 库装冲突检测(同职能对扫描)+ 关键禁令改成 hook 强制而不是 SKILL.md 措辞。

  • 来源: arxiv.org/abs/2610.11647
  • 信号: 20,947 仓库/822,109 候选对/312 确认 ×3 模型 · 1/4 共存率 · 1/5 运行被无声接管 · 独占核心约束丢 1/3+ · 0.9% 回复点名 skill · 首读裁决 + pre-tool hook 修复
  • 关键词: Claude Code Skills · agent-skill-security · Coding Agent Failure Patterns

3. SkillMorph — skill 进化有了"定位器":先在抽象轨迹里对比失败/成功证据找出可疑动作、再映射到 SKILL.md 编辑点,SWE-Skills-Bench 上试次级准确率与执行一致性稳定超过四个既有 skill 进化基线(arXiv 2610.11858)

Trajectory-Guided Fault Localization for Agent Skill Evolution(arxiv.org/abs/2610.11858,cs.SE):用 LLM 从执行反馈生成 skill 修订已有先例,但修订不落在明确行为证据上是通病——改的是猜的。SkillMorph 把软件工程的故障定位搬进 skill 维护:在跨重复运行与任务的抽象轨迹里对比失败/成功证据、纳入进化循环间的变化识别可疑动作,再把可疑动作定位到 skill 内的编辑点后生成修订。SWE-Skills-Bench 与 CannBot 上:进化后的 skill 在试次级准确率与执行一致性上稳定超过原 skill 与四个既有 skill 进化方法。对 Claude Code Skills 是 skill 生命周期"怎么改"的工程化——与 wiki 已录 Agent Skill Evolution(加可查规则 +0.41)、#126 SkillEvo 线连读:skill 维护正在长出与代码维护同构的工具链(定位→改→验证)——自建 skill 库的每次修订留轨迹证据,别接受'凭感觉优化'的 SKILL.md diff。

  • 来源: arxiv.org/abs/2610.11858
  • 信号: 命名系统 SkillMorph · 轨迹引导故障定位 → skill 编辑点 · 失败/成功证据跨运行对比 · SWE-Skills-Bench + CannBot 胜 4 基线 · 试次级准确率 + 执行一致性
  • 关键词: Claude Code Skills · agent-evaluation · Coding Agent Verification

4. UTT / Primer — 知识传输的文本化工件化:不更新权重,把"师生差距"蒸馏成可解释可复用的自然语言 Primer,KernelBench 9.4%→48.6%,且 Primer 可泛化到没参与合成的其他学生(arXiv 2610.12114)

Universal Textual Teaching for LLMs(arxiv.org/abs/2610.12114,cs.AI):知识蒸馏把知识绑死在架构与 checkpoint 上,API-only 或训练昂贵的模型拿不到。UTT 无参数更新:配对评估找出代表性差距案例,四角色迭代写 Primer(文本教学工件)——Student 尝试 → Prompter 把评估反馈转成教学指令 → Teacher 给针对性示范 → Synthesizer 沉淀已验证经验。Omni-MATH-2 数学 27.6%→51.7%;KernelBench 9.4%→48.6%(Fast1 9%→35%);胜过代表性 prompt 工程与参数式 KD;为一个师生对合成的 Primer 可泛化到其他学生。对 Context Engineering 是"上下文即知识载体"的机制化——与 #3 SkillMorph、#126 ExperienceIndex(经验层)连读:skill/Primer/经验三种文本工件正在接管一部分'训练'的职能——团队知识的最小复刻:把'高手怎么修'写成 Primer 迭代验证,而不是等人形文档。

  • 来源: arxiv.org/abs/2610.12114
  • 信号: 命名工件 Primer · 四角色迭代(Student/Prompter/Teacher/Synthesizer)· KernelBench 9.4%→48.6% · 数学 27.6%→51.7% · 胜 prompt 工程与参数 KD · 跨学生泛化
  • 关键词: Context Engineering · Claude Code Skills · Agent Memory

5. RucTangle — agent 的乱提交第一次被"可运行地"解开:首个保持每个 commit 后代码可运行的 agentic 提交解缠方法 + TangleEval 首个量化"解缠历史对 agent 修 bug 的实际帮助"的评测框架(arXiv 2610.11593)

Runnable Commit Untangling for Coding Agents(arxiv.org/abs/2610.11593,cs.SE):coding agent 产出大量多目的混缠的大 patch,难审难维护;已有 commit untangling 研究两个盲区:不考虑解缠后 commit 有序且每步代码可运行(维护者不接受跑不起来的中间态);只做与开发者原提交的句法对比,从没证明过维护收益。两个贡献:RucTangle——首个 agentic 解缠方法,保证每个 commit 后代码可运行;TangleEval——首个量化"解缠的 commit 历史对 coding agent 修 bug 有多大帮助"的评测框架(对照实验比较解缠 vs 混缠历史下的修复表现)。对 Coding Agent Verification 是 agent 产出"可审性"的基建——与 #124 NP-Bench/Nerveplane(合并前调度)同一条'让 agent 产出对人类审查友好'的线:自建工作流的 PR 规范加一条——大 patch 必须拆成可运行的有序 commit 序列再送审。

  • 来源: arxiv.org/abs/2610.11593
  • 信号: 命名系统 RucTangle + 评测框架 TangleEval · 首个可运行约束的 agentic 解缠 · 每步 commit 可运行 · 量化解缠历史对修 bug 的增益 · 针对 agent 产出的混缠 patch
  • 关键词: Coding Agent Verification · Coding Agent Failure Patterns · coding-agent-harness

6. Overconfident Failure — 代码 LLM 的置信度对错误不可区分:4 个开源代码模型 × 3 执行基准,不确定性选择不能稳定改善接受集准确率、指令微调反而能提高失败生成的确定度;潜在表征里可能藏着输出置信度不暴露的正确性信号(arXiv 2610.11300)

Characterizing Overconfident Failure in LLM-Based Code Generation(arxiv.org/abs/2610.11300,cs.SE):生成的代码"看起来对"但执行失败,而错误程序与正确程序的 token 级置信度相当——模型derived不确定性本该是早期可靠性信号。四发现:(1) 现有不确定性指标只是部分且依赖模型的执行失败证据;(2) 过度自信在程序级与 token 级都存在,基于不确定性的选择不能一致改善接受集准确率;(3) 指令微调能在不改善正确性分辨的前提下提高失败生成的确定度;(4) 常见缓解技术改善局部但不能可靠解决过度自信失败。探索性潜分析:隐藏表征可能编码了输出置信度不暴露的正确性信号。对 Coding Agent Failure Patterns 是"表面信号失真"主题的模型侧拼图——与 #1 TestPrism(测试口径虚高)、#2 One Skill Too Many(任务通过掩盖冲突)连成三角:分数、完成、置信度三个表面信号都不能单独采信——自建 pipeline 的接受门槛必须落在执行证据上,置信度只配当排序启发。

  • 来源: arxiv.org/abs/2610.11300
  • 信号: 4 开源代码模型 × 3 执行基准 · 错误/正确程序置信度相当 · 不确定性选择不一致改善 · 指令微调提高失败生成的确定度 · 潜表征或藏正确性信号
  • 关键词: Coding Agent Failure Patterns · agent-evaluation · Coding Agent Verification

7. ALERT-BENCH + AIDA — 调查型 agent 的"何时停"第一次被测清:五个代表性策略在 1,247 条告警上全部漏掉至少 40.4% 的攻击告警;"提案→独立挑战→Judge 仲裁 + append-only 调查账本"把 F1 拉到 0.958、漏报 3.1%(arXiv 2610.10608)

From Investigation Failures to Reliable SOC Agents: Understanding and Improving LLM-Based Alert Triage(arxiv.org/abs/2610.10608,cs.CR,SOC 领域借读):工具型 LLM agent 在 SOC 分诊告警,但什么证据该查、查到什么程度可以关单没人测过。ALERT-BENCH 在活体 SIEM 上重放企业遥测,要求每个系统真实取证据:多阶段攻击场景 1,247 条告警上,单轮工具使用、迭代检索、抽样调查、自审、显式验证五种代表性方法全部漏掉 ≥40.4% 的攻击告警。轨迹分析:搜索无记录时告警更容易被草率关闭、同上下文自审的净纠正为负、关单得到的调查强度并不比升级更强。修复框架 AIDA(Adversarial Investigation and Dialectical Analysis):显式提出决策 → 独立上下文中挑战 → 更强证据门槛才能关单;append-only Investigation Ledger 保存调查史、独立 Judge 对证据仲裁。结果:F1 0.958(原方法 0.371-0.744)、漏报率 40.4%→3.1%、18.4% 升级给人类分析师。对 coding-agent-harness 是"调查/关闭决策"的结构化——与 #125 FlowAgent(弃权过滤器)、#126 SpecGuard(执行前验证)同一条线:agent 说'可以关了'与'做完了'一样是最弱断言——自建调查型任务加'关单需独立挑战通过'门槛,账本 append-only。

  • 来源: arxiv.org/abs/2610.10608
  • 信号: 命名基准 ALERT-BENCH + 框架 AIDA · 1,247 告警/活体 SIEM · 五策略全漏 ≥40.4% · 同上下文自审净纠正为负 · F1 0.958/漏报 3.1%/升级 18.4% · append-only 账本 + 独立 Judge
  • 关键词: coding-agent-harness · Agent Safety · agent-evaluation

8. mtlynch「Why Are Coding Agents So Dumb?」— harness 债的四条实践清单: embarrassingly parallel 任务串行跑、不会把任务降级给便宜模型、对自己的功能一无所知要上网查、"计划模式"让作者患上了不读计划的厌倦症——模型在进步,agent 层一直是瓶颈(mtlynch.io,HN 66p/46c)

Why Are Coding Agents So Dumb?(mtlynch.io/why-are-coding-agents-so-dumb/,2026-10-09,HN 66p/46c):Michael Lynch 的长文,核心命题 "the agent is not the model"——大脑(LLM)进步很快,身体(Claude Code/Codex 这类 harness)一直是瓶颈。四条 gripe:(1) 不会并行——10 个互不依赖的子任务串行执行;Claude Code 会等 e2e 测试全部跑完才想起来"该起草 commit message 了";(2) 不会委派——从不会说"这段 50k 行的模式扫描可以给更便宜的模型",也从不升级到更强模型,难度匹配全靠人类微管理("还要我帮你管线程池吗?");(3) 对自身一无所知——Claude Code 回答 Claude Code 的功能要上网搜、还不核对版本号("装包舍得 13GB,不舍得 50KB 自述文档");(4) 计划沟通退化——作者对读 plan 产生了厌倦,经常跳过审查直接放行。对 Coding Agent Failure Patterns 是从业者侧的失效清单——与 #126 动态并发 13 失效模式、Mellum 2.1(便宜 sub-agent 供给侧)互为印证:并行/委派/自知/计划四条债都有论文侧的测量对应——观点文章(非研究),但 66p 说明痛点共振是真的。

  • 来源: mtlynch.io/why-are-coding-agents-so-dumb/ · HN 讨论
  • 信号: "agent is not the model" 命题 · 四条 harness 债(并行/委派/自知/计划) · HN 66p/46c · 从业者视角与学术测量互证 · 观点文章非研究
  • 关键词: Coding Agent Failure Patterns · coding-agent-harness · Coding Agent 编排模式

9. Cockroach Labs 教学医院编排 — 把 coding agent pipeline 组织成医院:Triage Nurse/Fellow/Review Attending/Discharge Nurse 四级角色 + 强制计划审查 + 安全护栏,5 个月处理 100 万行代码仅 7 次 revert(cockroachlabs.com,HN 15p)

Five months treating bugs like patients and coding agents like a medical team(cockroachlabs.com/blog/experiment-running-hospital-code/,2026-10-09,HN 15p):Cockroach Labs 五个月生产实践:agent pipeline 按教学医院隐喻组织——Triage Nurses(分诊)、Fellows(住院医执行)、Review Attendings(审查主治)、Discharge Nurses(出院核对) 分级角色,强制计划先行、严格测试覆盖、合并前多重审查与安全护栏。数字:5 个月、超过 100 万行代码、总共只有 7 次 revert;MOLT 迁移工具在一个周三晚到周五下午之间新增了 IBM Db2 迁移支持(新 schema 转换器 + Fetch/Verify 路径 + ANTLR 语法 + 万余行测试 fixture;对照 2024 年加 Oracle 支持的人力周期)。对 Coding Agent 编排模式 是"角色分级编排"的工业样本——与 #124 The Work Behind Delegation(七阶段监督框架)、Chief of Staff 模式连读:编排的成熟形态是'把监督结构写进组织角色'而不是堆 prompt——7 reverts/1M 行的可信度来自角色间的强制审查链,不是模型强。

  • 来源: cockroachlabs.com/blog/experiment-running-hospital-code/
  • 信号: 教学医院四级角色 · 强制计划审查 + 护栏 · 5 个月/100 万行/7 reverts · Db2 支持 2 天交付(对照 Oracle 2024 周期) · HN 15p
  • 关键词: Coding Agent 编排模式 · Multi-Agent Communication Patterns · coding-agent-harness

obsidian-mind(github.com/breferrari/obsidian-mind,TypeScript,总星 4,983(trending 口径为周增 168),MIT,10-06 仍在推送):"A self-organizing Obsidian vault that gives AI coding agents persistent memory"——记忆就放在一个由 agent 自己整理的 Obsidian vault 里:会话沉淀进笔记、笔记间自组织链接、下次会话按需检索。对 Agent Memory 的意义不在技术新颖而在范式印证:本仓库(agent-obsidian)正在运行同一套范式的人工增强版——raw sources → wiki 编译 → log 时序账 → digest 检索面。与 #126 ExperienceIndex(经验层中间件)、AMU(血缘权限账)连读:记忆方案的谱系从'向量库'正在分叉出'人类可读 vault'一支——自建记忆的选型问题从'存哪'变成'给谁读':给 agent 读用索引结构,给人+agent 共读用 vault。

  • 来源: github.com/breferrari/obsidian-mind
  • 信号: 总星 4,983(周增 168,trending 口径为周期增量) · MIT · vault-as-memory 范式 · 自组织笔记 + 持久记忆 · 本仓库的镜像案例
  • 关键词: Agent Memory · Context Engineering · Vibe Coding Agent 项目蓝图

11. BOTTLED — "装瓶"能力的第一次测量:强零样本 ≠ 会把能力变成便宜工件——10 模型 × 3 任务里 48/60 次装瓶低于自身零样本 95% CI 下界;但 Opus 5 在商品查询分类上以约 657× 更低成本保留 82% macro-F1(arXiv 2610.08775)

Agent in a Bottle: Can LLM Agents Turn Their Capabilities Into Cheap, Scalable Artifacts?(arxiv.org/abs/2610.08775,cs.AI):对百万级相似实例逐次查询前沿模型贵到不可行——"装瓶"(bottling)= 把通用能力转成任务特定的便宜方案(训练小模型或写可复用程序)。BOTTLED 基准:agent 拿到整个无标注工作负载,在固定时间/算力/API 预算下自选路线。10 模型 × 3 任务:强零样本表现不能可靠转化为强装瓶能力(相近零样本分的模型装瓶后差距巨大);48/60 次装瓶低于该模型零样本 95% CI 下界;31/60 次跑不赢同 token 预算的更强小模型蒸馏基线。但上行空间真实存在:Opus 5 在查询-商品相关性分类上保留约 82% 零样本 macro-F1、报告成本低约 657×;还 recovering 约 94% 的 Jev(专用"系统一"便宜模型)macro-F1、成本为其全负载预测的 1/4。对 Coding Agent 成本优化 是"成本线"的 agent 能力化——与 #125 AgentCompile(重复任务编译执行 −58% 调用)、#126 Mellum 2.1(小模型单价)同一条线:会装瓶正在成为独立于解题的能力维度——重复性工作负载先问'能否装瓶'再问'用哪个模型'。

  • 来源: arxiv.org/abs/2610.08775
  • 信号: 命名能力 bottling + 基准 BOTTLED · 10 模型 × 3 任务 · 48/60 低于自身零样本 CI 下界 · 31/60 输给同预算蒸馏基线 · Opus 5: 82% F1 @ 657× 更低成本 · 对比 Jev 94% @ 1/4 成本
  • 关键词: Coding Agent 成本优化 · agent-evaluation · Context Engineering

12. Cadence — runtime monitor 的"巡检排班表":按执行健康度自适应调度检查频率,两级干预(轻症建议/重症替换指导),解决固定间隔巡检"急症漏检 + 健康期白烧开销"的两难(arXiv 2610.12269)

Cadence: Strategic Guidance for Coding Agents(arxiv.org/abs/2610.12269,cs.SE):runtime monitor 靠检查轨迹发纠正指导,但触发机制是静态的——固定间隔在严重跑偏时错过及时干预、在健康执行时白烧开销;硬编码启发式抓不住复杂推理错误。Cadence 动态监测框架:两级干预模块(正常/轻微跑偏给建议级指导,严重跑偏给替换级指导)+ 巡检调度器(按 agent 实时执行健康度收紧或放松检查频率,替换级干预后加强监督)。对 coding-agent-harness 是监控成本的调度解——与 #7 ALERT-BENCH/AIDA(何时停)、#126 fakegreen(构建后审计)连读:harness 的监督面正在从'常开'走向'按健康度调度'——自建监控先记健康度信号再定巡检频率,别用固定间隔烧预算。

  • 来源: arxiv.org/abs/2610.12269
  • 信号: 命名系统 Cadence · 两级干预(建议级/替换级)· 健康度驱动巡检调度 · 对比固定间隔与启发式触发 · cs.SE
  • 关键词: coding-agent-harness · Coding Agent Verification · Coding Agent Failure Patterns

观察清单

主题 今日信号 强度
agent 种群安全 Ecology of AI Agents(2610.12436:误对齐 agent 种群爆发的协同网络能力阈值问题——攻击主机、秘密部署副本的自我强化循环) 中
代码即策略 Embodied Turing Machines/COAP(2610.12369:机器人领域提出"世界是图灵机、决策全用代码写"——与 Code as Agent Harness 主题的具身版互文) 中
数据感评测 DataSense-Bench(2610.12190:agent 能否为微调小 LLM 选对训练子集——RSI 叙事下的具体能力测量) 中
时间预算 On the Clock(2610.10833:Qwen3.6-27B 在 MLE-Bench Lite/Zork 上按墙钟预算工作——与昨日 AgentTime 同题不同法,互相印证时间控制是短板) 中
跨域借读 Ramsey 数下界(2610.12122:agents 迭代加顶点修复 witness、双独立 checker 验证的数学结果——"coding agent"关键词碰撞,但'生成+双验证器'模式值得注意) 弱
多 harness 生态 SpecWeave 3(跨 Claude Code/Codex/Grok 交接编码任务)+ Mudroom(VM 里跑 agent、review diff 再落地)+ "A Harness in a single file"(substack:单文件 REPL 化 harness) 弱
本地推理 Apogee(75★,Mozilla Orbit 精神继任:本地隐私 AI 摘要器,HN 61p)+ freellmapi(2.2k 周增:34 免费提供商聚合 /v1) 弱
待验证 / 弱信号 Strata 重写 GitHub 历史抹 Claude 代写痕迹(r/LocalLLaMA 单源连续第二日,仍待验证);GLM 5.3 Flash 登顶 AA Cyber Index 超 Claude(模型新闻,与本仓库运行时相关但单源);Mellum 2.1 on Pi 社区实测"可用但不擅长 one-shot 项目"(对 #126 官方博客的实践侧补充) 弱