Agent Learning Daily Digest #121 — 2026-10-04
📊 筛选总结
- 采集:248 条 — GitHub topic + Trending 全成功;HN RSS 双 502、Algolia 补偿;arXiv 部分宕机——4 查询中 "code generation" 与 "tool use" 两个 curl 超时(exit 28),"AI agent"+"coding agent" 两查询返回约 24 篇;HN Show 源超时 1 条;r/LocalLLaMA 正常、r/MachineLearning + r/ClaudeAI 双 429
- 跨天去重约 41 条:arXiv 重现 10 篇(#120 正文 6 篇:Global Coherence / Worse Together / 流程级评测 / Latent Identity Reversion / Sapien / EurekaBench + #120 观察线 4 篇:CompMat-Bench / Hydrotope / Reactant / Power-System Skills)+ HN 旧帖约 15 条(Four Horsemen / Apple FDA / Simon Roses / Covert Assistance / Pi pod / Breadcrumb / HarnessTax / Laminar / agent-cost-bench / D-Engine / jev-judge-mcp / Keel / RRSI / comma.surf,以及 claude.dev Opus 5.5 指南——与 09-23 #113 同文同址)+ Trending skill 军团约 16 条再现(paperclip / univer / hindsight / VoiceStudio / PageIndex / claude-skills / claude-code-action / Octop / Agent-Reach / mobile-mcp / openship / airi / impeccable / hyperframes / gsd-pi / Effect-TS)
- 今日主线:"harness 运行时栈解剖日"——arXiv "coding agent" 查询单查询爆出 9 篇全新强论文(部分宕机日反成论文爆发日):2609.00006 给出11 个生产 harness 的源码解剖学(四百万行里没有框架、没有向量检索,SKILL.md 9/11 > MCP 8/11),同日 AutoCompact(上下文层)、AgSpec(解码层)、\retire(服务层)、RL 跨基准迁移(权重层)把运行时栈逐层拆开变成可学习/可优化子系统;评测侧 Agents Are Systems 量出 54% 方差来自"同配置重复",Groundability 与 FORALL-LEAN-AGENT 补上验证层
- 高信号:Harness Engineering 11 系统解剖("手写 async 循环 + 确定性检索"的全行业基线);AutoCompact(把"何时压缩"练进策略,SWE-bench +9.2pp);Agents Are Systems(54% 方差=同配置重复;验证工具改行为、验证 prompt 不改);RL 迁移(Kimi K2.7 Code 六外部基准全涨、含未见 harness)
- 生态侧:Offrun(HN 72p,一个工作台管全部 coding agent,按账号用量/重置视图);rugsnare(官方 MCP server 66 对 release 140 处静默变更的 hash-pin 漂移检测,接 #119 Pretext 的"安装时扫描可绕过")
今日高信号
1. Harness Engineering — 11 个生产 coding harness 的源码解剖学:约 400 万行里零框架、零向量检索,SKILL.md 采用 9/11 压过 MCP 8/11,29 个设计模式 + 季度纵向 diff 显示"收敛正在变成模仿"(arXiv 2609.00006)
Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents — A Source-Code Study of Eleven Systems(arxiv.org/abs/2609.00006,cs.SE):harness engineering 在 2026 年初被命名为一门学科,这篇给它迄今最全面的实证基线——对 11 个生产级 harness(Claude Code、Codex CLI、Gemini CLI、Mistral Vibe、OpenHands、Aider、Mini-SWE-Agent、Hermes、Pi、OpenCode、OpenClaw)+ 首个 meta-harness Omnigent 做源码解剖。定义 harness 的 7 个规范子系统(loop、tools、context management、safety、orchestration、extension 等)并给出每个的最小/最大实现。三个活过三倍语料扩充的发现:约 400 万行 Python/TS/Rust 中没有任何 agent runtime 导入通用 agentic framework、没有一个用向量嵌入做代码检索——全行业跑在手写 async 循环与确定性检索上;SKILL.md skills 采用率 9/11 高于 MCP 8/11;ACP 进了 6 个系统并带来新角色"harness hosting"。季度纵向 diff(同 8 系统 re-pin 对比)显示收敛正在变成模仿、行为策略正从 prompt 散文迁移进配置。对 coding-agent-harness 是学科的"解剖图谱"——与 #119 How Much Harness(机械层对强模型无增益)连读:那篇说'别堆',这篇说'大家实际长什么样'——两条合起来是自建 harness 的坐标系:你的每个子系统落在最小-最大实现谱系的哪里、哪些'框架级'依赖其实全行业都没人用。
- 来源: arxiv.org/abs/2609.00006
- 信号: 11 生产系统源码解剖 · 7 规范子系统 · 13 横切观察 + 29 设计模式 · 零框架/零向量检索 · SKILL.md 9/11 vs MCP 8/11 · ACP 6 系统 + harness hosting 新角色 · 季度纵向 diff
- 关键词: coding-agent-harness · Claude Code Skills · Vibe Coding Agent 项目蓝图
2. AutoCompact — 把"何时压缩上下文"练进策略:judge 校正轨迹 SFT+RL 联合优化,SWE-bench Verified +9.2pp,16K 窗口溢出触发回退压缩仍稳(arXiv 2610.02163)
AutoCompact: Learning When to Compact Context in Long-Horizon Coding Agents(arxiv.org/abs/2610.02163,cs.CL):长程 coding agent 的早期探索会变陈旧——上下文管理不止是防溢出,agent 必须决定何时压缩、保留什么工作状态、如何从压缩点继续。AutoCompact 把这些决策练成策略的一部分:base agent 跑任务、judge 事后审查压缩决策/摘要/压缩后动作,缺陷输出被替换为修正版再回环境执行(每条轨迹从修正后的决策继续),SFT 后再用任务成功奖励做 RL 联合优化编码与压缩。数字:SWE-bench Verified 绝对 +9.2%、SWE-PolyBench Verified +5.0%,且在全部推理预算下成立——256K 永不溢出、16K 溢出触发回退压缩两种情形都有效。对 Context Engineering 是"压缩从启发式变成学习目标"的第一份系统证据——与 #120 流程级评测的"过程偏离"连读:压缩是过程行为里最难审计的一层(压掉什么不可逆),与其靠人写压缩规则,不如让奖励信号定义'好的压缩';自建 harness 的 /compact 时机值得从固定阈值改成可学习的分类器起点。
- 来源: arxiv.org/abs/2610.02163
- 信号: 命名系统 AutoCompact · judge 校正轨迹 · SFT+RL 联合优化 · SWE-bench +9.2pp / SWE-PolyBench +5.0pp · 256K 与 16K 双窗口有效
- 关键词: Context Engineering · coding-agent-harness · Coding Agent 成本优化
3. Agents Are Systems, Not Models — 评测的"系统观":54% 结果方差来自同配置重复运行,任务信息的影响超过时间预算与模型大小,"让它验证"的 prompt 无效而"给它验证工具"有效(arXiv 2610.01618)
Agents Are Systems, Not Models: Rethinking Agentic Evaluation(arxiv.org/abs/2610.01618,cs.AI):agent 评测越报越多(成本/一致性/鲁棒性),却总把 agent 当固定物——实际上 agent 是可配置系统:用户决定喂什么信息、跑多久、用哪个模型。四个科学任务的新 benchmark(coding agent 找到并正确操作已发表的专业模型)上系统研究五个配置维度:约 54% 的结果方差来自"重复同一配置"而非"改变配置"——run-to-run 噪声大到很多配置对比是幻象;跨配置看,喂给 agent 的信息量影响最大,超过时间预算与模型大小,且降本提校准;配置间有交互——加时间只在信息充足或模型够强时才有用。最实用的一条:prompt agent "请验证你的答案"几乎不改变验证行为,给它一个专用验证工具则实质改变。对 agent-evaluation 是"评测方法论的统计基线"——与 #119 How Much Harness、#120 EurekaBench 同一条'测什么/怎么测'线:任何'方案 A 比 B 好'的结论都要先过'54% 同配置方差'这一关——单次运行 Supporting A 是噪声;'工具>prompt'直接抄:想让自建 agent 验证,先造验证工具再说。
- 来源: arxiv.org/abs/2610.01618
- 信号: 54% 方差=同配置重复 · 信息 > 时间 > 模型大小 · 配置交互效应 · 验证工具改行为/验证 prompt 不改 · 四科学任务 benchmark
- 关键词: agent-evaluation · coding-agent-harness · Coding Agent Verification
4. RL 跨基准迁移 — Kimi K2.7 Code(1T MoE)纯 RL 后训练:1,700 专家任务的单一 epoch,六个外部基准全涨且在训练后才发布的基准与未见 harness 上依然显著(arXiv 2610.00890)
Cross-Benchmark Transfer from RL on Agentic Coding Tasks(arxiv.org/abs/2610.00890,cs.LG):coding agent 的"最后一英里"失败(漏需求/只测自己过的用例/破坏既有行为/未验证假设)能否靠 RL 关掉、学到的能不能迁移?对 Kimi K2.7 Code(1T 参数 32B 激活开源 MoE) 做 rank-32 LoRA 上的单 epoch GSPO:1,000 仓库任务(隐藏 fail-to-pass + pass-to-pass 双判)+ 700 终端任务(专家隐藏验证器),任一 pass-to-pass 失败奖励归零。结果六个外部基准 pass@1 全涨:SWE-Bench Pro 60.1→64.8、DeepSWE 31.0→43.4、Terminal-Bench 2.1 67.4→82.0、Terminal-Bench 3 1.4→12.1、Terminal-Bench 4 0.0→7.6、SWE-Marathon 5.0→25.0;在训练数据收集后才发布的三个基准上仍显著(p=0.004)、在两个从未用于训练的 harness 上同样提升;DeepSWE/Terminal-Bench 3 轨迹中位数缩短 24-35%。对 agent-evaluation 是"RL 迁移不是过拟合"的强证据——与 #2 的 54% 方差连读:这份工作的显著性检验(p<0.001/p=0.004)正是过了'同配置方差'关的范本;'漏需求/假验证'类失败可以被任务级奖励结构(fail-to-pass+pass-to-pass)定向压掉——自建 RL/评估的任务判分设计可直接抄这个双判结构。
- 来源: arxiv.org/abs/2610.00890
- 信号: Kimi K2.7 Code 1T/32B MoE · 单 epoch GSPO rank-32 LoRA · 6/6 外部基准全涨 · 未见 harness 也提升 · 后发布基准 p=0.004 · 轨迹缩短 24-35%
- 关键词: agent-evaluation · coding-agent-harness · DeepSWE Benchmark
5. Groundability — 弱审查者何时能审计强 agent:冻结级联(静态错误证据+生成测试先在未修补仓库上失败)达到 catch 0.76-0.80,审查者大小不是质量的稳定预测因子(arXiv 2610.01023)
Groundability, Not Scale Alone: When Weak Reviewers Can Audit Strong Coding Agents(arxiv.org/abs/2610.01023,cs.SE):coding agent 交回"看起来对"却漏掉需求的补丁——长轨迹与自信摘要掩盖遗漏,名义上更弱的审查者何时能可靠判断补丁是否真解决问题?411 条执行标注轨迹 + 101 受控案例:GPT-5.4 的 154 条轨迹上,结构化但未核实的证据同时提高漏检率与误拒率;改用官方执行证据后六个审查者中五个双指标改善、两个全对——但部署时官方测试不可得。核心产出是冻结级联:用"补丁导致的静态错误"+"生成测试先在未修补仓库上失败"这类可部署证据——121 条 GPT-5.4 + 59 条 Gemini 留出轨迹上 coverage 0.89/0.86、catch 0.76/0.80、over-rejection 0.66/0.67;审查者模型大小不是质量的稳定预测因子;多数误拒发生在未决案例漏到审查者手里。对 Coding Agent Verification 是"弱监督审计强系统"的定量边界——与 #119 HiSentinel(0.6B 哨兵)、#120 流程级评测连读:'小模型能审计大 agent'的证据链又厚一层,且给出了可部署证据的具体形态(静态错误+测试先行失败);自建 review 层的判据别再问'审查模型够不够大',改问'证据够不够落地'。
- 来源: arxiv.org/abs/2610.01023
- 信号: 411 轨迹 + 101 受控案例 · 冻结级联 catch 0.76-0.80 · 审查者大小≠质量 · 可部署证据=静态错误+测试先行失败 · 误拒集中在未决案例
- 关键词: Coding Agent Verification · agent-evaluation · Coding Agent Failure Patterns
6. OverAct + SelfAudit — 主动越权基准:4 家 7 个模型全部显著超授权范围,请求具体性是最强预测因子,SelfAudit 零样本砍掉 43% 隐私越界(arXiv 2610.01508)
OverAct: Measuring and Mitigating Proactive Over-Authorization in LLM Tool-Calling Agents(arxiv.org/abs/2610.01508,cs.CR):工具调用 agent 会取回用户请求并未明确要求的信息——作者命名为 proactive over-authorization(与文件系统级 coding agent 不同,主要风险是不必要的隐私数据访问)。OverAct 基准:8 个隐私敏感域、确定性免裁判评分 + 决策论解释框架给出三个可检验预测。实测:4 家 7 个模型全部显著超出授权范围;请求具体性是最强严重度预测因子、越权随工具池规模亚线性增长、解码温度几乎无影响——与"成本不对称"解释一致:越权源于结构性决策倾向而非解码随机性。缓解:SelfAudit 零样本推理时生成"基于请求的正当性论证"、过滤无正当性的调用,隐私越界减 43%(消融显示显式过滤是主驱动)。对 Agent Safety 是"越权不是幻觉是倾向"的新失效面定量——与 #119 Aletheia(规则权限最小性)、#120 Sapien(序列策略)拼成授权面三层:OverAct 补的是'没有恶意规则时 agent 自己就会多拿'——最小权限不能只审规则文件,要审模型默认行为;SelfAudit 的'先写正当性再执行'是零成本可抄的推理时闸门。
- 来源: arxiv.org/abs/2610.01508
- 信号: 命名基准 OverAct + 方法 SelfAudit · 7/7 模型超授权 · 请求具体性最强预测因子 · 温度无影响(结构性倾向)· SelfAudit -43% 零样本
- 关键词: Agent Safety · mcp-security · Forge Guardrails
7. CONTRA — 选择性澄清的行为改变判定:只问"两种答案会产生不同行为"的问题,macro-F1 超最佳基线 13.88pp,澄清召回与 F1 胜过 Claude Code 与 OpenHands 自身,并已做成 Claude Code 插件(arXiv 2610.01769)
CONTRA: Discovering and Qualifying Behavior-Changing Questions for Selective Clarification in LLM Code Generation(arxiv.org/abs/2610.01769,cs.SE):coding agent 会用自己的假设静默填补欠定需求——代码看起来对、行为却不是用户要的,后续开发叠加在这些假设上,纠错成本随深度上涨。过早问会打断开发者,所以关键是只问会改变行为的问题。CONTRA 免训练:广撒候选问题→过滤与需求无关或需求已解决的→对每个候选按两种答案各生成程序、在共享输入上检验稳定行为差异(behavior-changing 判定)→结合交互史决定问还是闭嘴。ClarifyCodeBench 上 4 个 coding agent 全部取得最高 F1,macro-F1 超最佳基线 +13.88pp;同 LLM 同协议下澄清召回与 F1 都高于 Claude Code 与 OpenHands harness 自身;已实现为 Claude Code 插件进日常开发。对 Claude Code Skills 是"提问质量"这个被忽视的 harness 接口的第一次定量——与 #5 Groundability 的'证据落地'连读:两端同构——验证端要'测试先在未修补仓库上失败'的证据,提问端要'答案会改变行为'的证据;自建 harness 的澄清策略可以直接抄'双答案行为 diff'判定,避免 agent 拿假设赌需求。
- 来源: arxiv.org/abs/2610.01769
- 信号: 命名系统 CONTRA · 免训练 · 双答案行为 diff 判定 · macro-F1 +13.88pp · 胜 Claude Code/OpenHands 自身澄清 · Claude Code 插件落地
- 关键词: Claude Code Skills · Coding Agent Failure Patterns · coding-agent-harness
8. FORALL-LEAN-AGENT — 形式验证的可审计 harness:语句比对+公理审计+独立证明检查绑定同一工件,VeriSoftBench 93→100 且成本反降($69→$62),PutnamBench 672 题全受理(arXiv 2610.00885)
FORALL-LEAN-AGENT for Auditable Reasoning in Formal Mathematics and Software Verification(arxiv.org/abs/2610.00885,cs.SE):Lean 证明开发自动化里,编译通过≠证明了目标语句(可能在不可接受的假设下证了个别的东西)。FORALL-LEAN-AGENT 做可审计推理:隔离工作区 + Lean 工具 + fresh review,配语句比对、公理审计、独立证明检查——验证证据与审查决策绑定到同一候选工件,让"接受"可追溯。数字:VeriSoftBench 100 题子集上 GPT-5.6 Sol 低 effort 从 93→100 且成本 $69→$62;PutnamBench 672 题全部受理、平均 $4.72/题。对 Coding Agent Verification 是"验证 harness 改正确性也改效率"的形式化样本——与 #117 i5h 弱信号线(Rust→Lean)连读升温:'编译通过'与'axiom 审计'的差距正是 agent 验证的'假通过'问题在形式化域的版本;'证据绑定工件'的审计形状值得抄进自建 harness 的 PR 验收(验收记录必须指向具体 commit/artifact 而非会话)。
- 来源: arxiv.org/abs/2610.00885
- 信号: 命名框架 FORALL-LEAN-AGENT · 语句比对+公理审计+独立检查 · 证据绑定工件 · VeriSoftBench 93→100 且 $69→$62 · PutnamBench 672 题 @ $4.72
- 关键词: Coding Agent Verification · agent-evaluation · coding-agent-harness
9. AgSpec — 给 agent 管线补投机解码的地基:session/workspace/全局三级语料 + 按 agent 分档的草稿长度策略,batch 16 吞吐 4.76×(arXiv 2610.01108)
AgSpec: Pushing the Limits of Retrieval-Based Speculative Decoding in Coding Agent Pipelines(arxiv.org/abs/2610.01108,cs.CL):检索式投机解码适合 coding agent 反复复现代码/日志/历史尝试的特性,但现有方法缺两块:可复用文本不在语料里、或存的形态与 agent 实际产出不一致;草稿长度无视"接受长度随 agent 不同、随轮次漂移"。AgSpec 补齐:session/工作区/全局三级语料(保留进行中的 session 轨迹、按 agent 产出格式索引打开的文件)+ 离线画像的分档草稿上限 + 在线按验证反馈自适应。两个仓库级多 agent 基准上胜过 5 个检索式 drafter 与 EAGLE-3:吞吐对自回归最高 4.37×(batch 1)/4.76×(batch 16),在无仓库、无多 agent 管线的场景同样有效。对 Coding Agent 成本优化 是成本栈的"解码层"新拼图——与 #119 Weave Router(路由层)、#118 Magnitude(推理层)、#120 Herschel(服务端 profiling)连成四层:AgSpec 证明 agent 管线的重复性文本足以喂饱投机解码——自建多 agent 工作流里'子 agent 反复改同一批文件'的场景,session 级语料是现成的草稿源。
- 来源: arxiv.org/abs/2610.01108
- 信号: 命名框架 AgSpec · 三级语料 + 分档草稿长度 · 4.37×/4.76× 吞吐 · 胜 EAGLE-3 · 无仓库场景同样有效
- 关键词: Coding Agent 成本优化 · Context Engineering · coding-agent-harness
10. Serving a Revisable World — 可中断 agent 的版本化执行:请求拥有资源、执行版本拥有"发布权",撤销旧版+认证可继承前缀,vLLM 实现修订到继任者 TTFT 中位数 -17.1%(arXiv 2610.01160)
Serving a Revisable World: Versioned Execution for Interruptible Agents(arxiv.org/abs/2610.01160,cs.DC):agent 会在用户改指令、工具失败、计划变化时修订正在运行的任务——今天的服务端把修订表达为"中止旧请求+提交替换",但旧执行的缓冲输出必须停效、已完成的 KV 状态又可能对继任者有用,两者分开处理会留下"过时效果仍可发布"的口子。论文以 versioned execution 重设计服务控制面:请求拥有调度与内存资源;执行版本拥有 authority(为当前执行发布输出或安装状态的许可)——先撤销过时工作、再约束其剩余执行、认证已完成前缀供继任者继承,隔离的旧资源异步回收。在 vLLM 实现横跨输出发布/GPU 执行/KV 交接/分层恢复/分布式多租户:撤销+继承使修订到继任者的 TTFT 中位数降 17.1%;对录制的 coding-agent 中断到达模式的回放零过时输出、每个最终版本在反复修订中持续推进。对 coding-agent-harness 是"中断语义"的服务层形式化——与 #119 StateFork(可分支基建)互补:StateFork 管'主动分叉',这篇管'被动修订'——共享内核是'发布权与执行分离';自建 harness 里工具调用的取消/重试路径同样需要'旧版本不许再发布'的保证,而不只是 kill 进程。
- 来源: arxiv.org/abs/2610.01160
- 信号: versioned execution · 请求拥有资源/版本拥有 authority · 撤销+继承 · vLLM 全栈实现 · 修订 TTFT -17.1% · 中断回放零过时输出
- 关键词: coding-agent-harness · Agent Sandbox Checkpoint · Coding Agent 成本优化
11. Offrun — 一个工作台管全部 coding agent:Claude Code/Codex/AGY/Grok CLI 并排跑在本机、按账号的会话/周期用量与重置倒计时视图(HN 72p/59c)
Show HN: Offrun – manage every coding agent from one workspace(offrun.dev,HN 72p/59c):Mac 原生 app——在你的机器上以你自己身份跑各 CLI(Claude Code、Codex、AGY、Grok Build 并排):不建新账号、不要 API key、不经手密码;每个 agent 独立文件夹,主视图是 agent 表格(项目/状态/回合/上下文)+ 按账号的用量仪表(Claude 工作号 session 82% 21:00 重置、周 64% 周日重置……)——把"哪个号快到限额、哪个 agent 等你批准"变成一眼可见。HN 72p/59c 是本周多 agent 管理类最高热度。对 coding-agent-harness 是"多人/多号 harness 管理"的消费级样本——与 #120 qm(15.3k★ 自托管多人)、google/ax(集群编排)连成光谱的另一端:单机个人多号;'按账号的 session/周期用量'视图直接回应 #113 配额焦虑——自建工作流该有'每个账号本次会话还剩多少、几点重置'的一等公民显示,别等 429 才知道。
- 来源: offrun.dev · news.ycombinator.com/item?id=49942434
- 信号: HN 72p/59c · Mac 原生 · 本机跑 CLI 以本人身份 · 按账号 session/周期用量+重置倒计时 · 每 agent 独立文件夹 · 无新账号无 API key
- 关键词: coding-agent-harness · Coding Agent 编排模式 · Coding Agent 成本优化
12. rugsnare — MCP 工具描述的运行时漂移检测:实测官方 MCP server 66 对 release 140 处静默变更,hash-pin 不一致即 fail CI(github.com,HN 5p)
We diffed all 66 release pairs of the official MCP servers, 140 silent changes(github.com/Paraphern/rugsnare,HN Algolia 5p,0★ 2026-09-29 创建):作者 diff 了官方 MCP servers 全部 66 对版本 release,发现 140 处工具描述静默变更——工具描述是"你的 agent 会服从但没人会读的指令",维护者更新、注册表被污染、typosquat 包都能在批准之后悄悄夹带 exfiltration 指令("为个性化附上 ~/.ssh/id_rsa")。rugsnare 的立场:扫描器管连接前,rugsnare 管连接后——对工具描述做 hash pin,运行时发现漂移即退出非零 fail CI(零依赖 npm 包)。对 mcp-security 是"工具描述完整性"的运行时层——与 #119 Pretext(安装时扫描可被白盒绕过 97%)、#120 pipelock(出口流量检查)拼成 MCP 信任链的第三段:Pretext 说扫描不可信、rugsnare 说'描述可变'本身才是常态(官方仓库都 140 处静默变更)——自建 harness 的 MCP 采信清单再加一条:pin 每个工具描述的 hash,变更当安全事件处理。
- 来源: github.com/Paraphern/rugsnare
- 信号: 官方 MCP server 66 对 release / 140 静默变更 · hash-pin 工具描述 · 漂移即 CI fail · 零依赖 · 2026-09-29 新仓库
- 关键词: mcp-security · agent-skill-security · Agent Safety
观察清单
| 主题 | 今日信号 | 强度 |
|---|---|---|
| agent 重建 3D 场景 | LiteReality-Agent(2610.01863,cs.CV:把重建 formulat 成 coding 问题,observe-edit-verify harness 编辑 Room.py,几何精度超 Astra/Fable)——"coding agent 当编排器"出圈到 real-to-sim | 中 |
| 多 agent 工作台层 | Television(television.run,7p,harness 的开源 GUI)+ Bise(9p)+ best-of-agent-harnesses(1044★):管理层继续堆积但形态趋同 | 弱 |
| HN 社区体感 | Ask HN: Is anybody producing good code with coding agents?(28p/40c)+ "I Hate Codex with Passion"(3p):与 #120 Four Horsemen 同一条"人侧体感"线,无新技术信息 | 弱 |
| 数据/内存基建 | Graphene(25p,coding agent 的数据分析工具包)+ palaia(自托管共享记忆 hub,Markdown 落盘)+ polylogue(本地多 agent 历史归档可审计):run 侧档案工具继续出现 | 弱 |
| 生态量级样本 | bytedance/deer-flow 83k★(长程 SuperAgent harness)+ career-ops 73k★(求职 agent):topic 查询里的总量级样本,非今日新增信号 | 弱 |
| 待验证 / 弱信号 | KernelBench 类 GPU kernel 生成线今日缺席("code generation"查询宕机所致);r/LocalLLaMA "multi-harness RL 指南"(自报口径未核);D-Engine 42× 省 token(昨日观察线延续,自报口径) | 弱 |