deepresearch-arms-lab

Deep Research 方案对比实验记录

目标:在无训练资源约束下,回答”deep research agent 的架构选择”问题—— workflow 式编排 vs agentic loop,以及 training-free 机制的正确宿主。 本文档随实验迭代更新。(代码:本目录;调研笔记:~/deepresearch-survey-notes.md

1. 评测框架

2. 对比方案

代号对照(代码 eval/run.py --armsresults/ 目录使用短代号,文档使用可读名): Pipeline=A | Workflow-v1..v4=C,C2,C3,C4 | Agent-ClaudeCode=B | Agent-OpenCode=D | Agent-Codex=E | Hybrid-v1=F | Hybrid-v2=F2。产物目录如 q09_C4 即 q09 × Workflow-v4。

Workflow 系(固定/半固定编排,我们实现)

方案 一句话 机制来源
Pipeline 固定流水线 拟大纲→逐节检索→逐节写作,无循环无判据 传统 RAG 报告基线
Workflow-v1 机制组合 v1 大纲+节级完成判据、独立上下文搜索工人、机械证据库、缺口驱动循环、全局预算 EDR(判据终止)、VeriTrace(证据库)、SearchSwarm(工人 brief)、ScaffoldAgent(大纲中间表示)
Workflow-v2 = Workflow-v1 + 5 项修复 单节轮数上限 / 补搜池 / 写作续写 / 证据去重 / 结论改综合 Round 1 失分 trace 归因
Workflow-v3 = Workflow-v2 + 判据硬核对 判据分硬/软:点名实体子串匹配、数量要求”LLM 抽取+代码数数”、软判据收紧、缺口带进补搜 brief 原则:”LLM 做抽取、代码做判断”
Workflow-v4 = Workflow-v3 + 深度写作 节写作强制”深度四要素”(数据点/多方对比/机制解释/批判性评估),结论加不确定性与反方论点 depth 是全场短板的针对性单变量

Agent 系(通用 harness,现成 CLI 无头模式)

方案 harness 接入要点
Agent-ClaudeCode Claude Code (claude -p) --allowedTools 白名单只放行 search_cli;--settings 覆盖网关(用户级 settings.json env 优先级坑)
Agent-OpenCode opencode (opencode run) 项目级 opencode.json 禁 MCP/webfetch;bash 权限只能整体放行(pattern+deny 会让工具对模型不可见)→ 工具约束为软性
Agent-Codex codex (codex exec) 独立 CODEX_HOME;仅支持 Responses API;web_search="disabled"(顶层键);沙箱提权在无头模式必败 → danger-full-access

合流系

方案 一句话
Hybrid-v1 = Agent-ClaudeCode + 机制外挂 agent 基座 + 三层外挂:①协议 prompt(checklist 先行/节级判据/深度四要素/写前自检)②输出端验证器 verify_cli.py(机械查截断/引用重复/引用覆盖,抽取+代码比对查点名实体与数量要求)③修订回路(验证失败喂回 harness 修订一轮)

3. 结果

Round 1(claude-sonnet-5,10 题,Pipeline/Agent-ClaudeCode/Workflow-v1)

Arm overall 备注
Agent-ClaudeCode 8.93 十战全胜,指令遵循 9.4
Workflow-v1 7.89 耗时 2.4×、token 4-6×
Pipeline 7.66  

Workflow-v1 失分 trace 归因(→ Workflow-v2 修复清单):首节垄断预算(贪心选节)、点名实体缺失不补搜、 写作 2200 tokens 顶格静默截断、引用重复(123 条去重后 18 条)、结论节被证据门控饿死。

Round 2 · 污染事故与发现(MiMo 2.5 Pro,全量——已作废)

Tavily 配额中途耗尽,搜索静默返空。事故本身成为发现

由此加固:搜索结果级降级链(serper>firecrawl>bing)+ 后端错误显式抛出 + 连续全空 fail-loud 保险丝 + search_cli 反编造错误提示。

Round 2 · 终表(MiMo 2.5 Pro,serper 后端,典型 3 题,统一裁判[日期注入版],2026-07-07)

Arm overall compr depth instr read 均耗时
Hybrid-v4 = v3+内省验证+统一rubric 8.96 9.0 8.5 9.5 8.83 ~700s
Agent-ClaudeCode(裸) 8.88 9.0 8.33 9.33 8.83 284s
Agent-ClaudeCode+委派(B2) 8.88 9.0 8.33 9.33 8.83 ~640s
Hybrid-v2 = v1+信源/分诊/续跑 8.84 9.0 8.17 9.33 8.83 ~670s
Hybrid-v1 = 裸agent+外挂 8.83 9.0 8.5 9.17 8.67 ~630s
Hybrid-v3 = v2+引用核验/风险门控/原子论断 8.83 8.93 8.33 9.33 8.73 ~1170s
Workflow-v4 = v3+深度写作 8.46 8.5 8.17 8.83 8.33 ~2160s
Agent-OpenCode(裸) 8.13 8.17 7.67 8.17 8.5 299s
Workflow-v3 = v2+判据硬核对 7.83 8.0 7.17 8.17 8.0 ~1900s
Workflow-v2 7.5 7.5 7.17 7.5 7.83 ~1870s
Pipeline 6.86 7.17 6.33 6.67 7.27 326s

逐题亮点:q05_Hybrid-v4 9.38 全实验最高单题;q01/q05_Hybrid-v3 双 9.0; q09_C4 8.62 超过 Agent-OpenCode——workflow 最优版在评估型难题上进入 harness 区间。

Hybrid 迭代轨迹:v1 8.83 → v2 8.84 → v3 8.83 → v4 8.96。前三版在裁判噪声内 打平,v4 的”内省验证(verify_cli 作为工具交给 agent 自检)+ 统一 rubric(协议与 门禁同源)”带来首次对裸 agent 的超越(指令遵循 9.5)。trace 佐证成本自适应: q09_F4 内省自查后一次过门禁(331s、零外部修订),q05_F4 高风险触发深检两轮修订(1172s)。

委派负结果:B2(放开 Task 工具+委派指引)与裸 B 三题四维完全同分—— SearchSwarm 的”+10 分”不迁移到长报告场景;q01_B2 搜索次数暴涨至 132 次 (B 系常态 15-30 次)分数不动,证明长报告瓶颈在综合与验收,不在检索吞吐

引用真实性审计上线(search_cli → run 目录 search_calls.jsonl):本批新 run 的 ev_used_ratio 全部 0.97-1.0,引用可机械追溯到真实检索(eval/process_metrics.py)。

裁判噪声提示:换用日期注入裁判后各 arm 分数有 ±0.3-0.6 漂移(如 Workflow-v3 8.21→7.83、 Agent-OpenCode 8.38→8.13、Pipeline 6.54→6.86),单裁判单次打分的方差不可忽略;上表为同一裁判 同一批次,内部可比。跨表比较只看趋势不看绝对值。

Round 2 · 全量 10 题终局(Hybrid-v6 vs 裸 agent,2026-07-07)

3 题子集测量分辨率耗尽后,对生产候选做 10 题确认:

方案 n 均分 逐题 分布
Hybrid-v6 10 8.85 9.0/8.5/8.8/8.8/9.1/8.9/8.8/8.8/9.1/8.9 极差 0.6,下限 8.5
裸 Agent-ClaudeCode 10 8.76 8.8/9.0/8.8/8.5/9.0/8.5/8.6/8.8/8.9/8.9 极差 0.5,三题掉 8.5-8.6

F6 领先 +0.09,胜 6 平 3 负 1(此前误记为”平1负3”,据 scores.json 复核更正)。 3 题时的 +0.08 在 10 题方向一致,但配对 bootstrap 95% CI [-0.06, +0.21] 跨 0 (eval/run.py --compare)——均分差未达显著,n=10 不足以检出 0.09 量级的 效应(需 n≈60)。稳健的主张是分布而非均值:价值不在抬上限(两者上限都 9.1), 而在托下限:验证门禁强制补齐差题,把状态差的题从 8.5 拽回 8.8;外挂系统的 结构性优势是可预测性(总在 8.8±0.15 vs 裸 agent 的 8.5-9.0 波动)。

Round 2 · Hybrid-v6→v7 迭代(正确性修复 + 类型条件化)

Round 2 · round2-fix 复跑终局(修复后 F6/F7 vs 裸 B,2026-07-07)

修复后全量复跑:F6/F7 各 10 题重新执行(4→3 并发,429 两例 resume 重试补齐), B 复用旧报告(代码未变),三 arm 30 份报告同批盲评(opus-4-8 单次打分, scores.json 带 judge_meta 可审计)。配对比较(eval/run.py --compare):

对比 均差 bootstrap 95% CI 胜/平/负 显著性
F6 vs B +0.300 [+0.200, +0.388] 9/1/0 显著
F7 vs B +0.173 [-0.003, +0.349] 7/1/2 不显著(临界)
F6 vs F7 +0.127 [+0.001, +0.241] 6/2/2 勉强显著
Arm overall compr depth instr read
F6 9.03 9.07 8.75 9.38 8.9
F7 8.90 8.9 8.75 9.25 8.7
B 8.73 8.85 8.1 9.15 8.8

F6 对裸 agent 的优势首次达到统计显著(CI 下界 +0.20 大于上一批的点估计 +0.09),得分结构与机制假设一致:depth +0.65、instr +0.23 是外挂协议瞄准的 两个维度。归因诚实声明:本批 trace 显示第三轮修订零触发(17 run 零修订、 3 run 一轮、12 run 走风险门禁快速通道、零 shipped-with-failures)——+0.30 不是死代码修复的直接效果,而更可能来自内省自检把问题消化在交卷前 + 上批 B 分 恰被裁判噪声抬高。相对结论(F6>B)因同批配对设计可靠;绝对分变化(8.85→9.03) 跨裁判批次不可归因。F7 类型条件化再次中性偏负(q09 评估型 8.5 全场最低), 生产候选定 F6

Round 2 · F8 批次的意外发现:同系统重跑方差 ~0.25(2026-07-08)

F8(=F6+引用缺口反馈)次日重跑 10 题,pairwise 并排裁判显示 F8 输 F6 -0.255(CI [-0.48,-0.03],3胜0平7负)。但 trace 审计证明F8 与 F6 不同的 代码路径本批零执行(缺口反馈零触发、浏览器降级零介入),执行行为统计几乎 相同(报告 16.6k vs 16.0k 字符、搜索 15.3 vs 16.2 次)——本批 F8 机制上 等价于 F6。结论:同一系统隔日重跑的批间方差 ~0.25,与 F6>B 的 +0.30 同量级。含义:

  1. F8 未被证伪(其新分支未被测到),-0.26 是重跑方差不是机制回归;
  2. 逐题配对 bootstrap 吃不掉”整批执行状态”的批级系统性成分—— 对比实验的执行必须同批交错跑
  3. 上批 F6(新执行) vs B(旧执行) 的 +0.30 同样携带执行批次效应, 置信度需相应下调,等待同批交错复验(B3 消融批次即为此设计)。

评价体系升级(据此落地):meta.json 记执行时间戳,--compare 自动核对 两 arm 执行日期、跨批则显式警告;新增 --fact 客观指标命令(引用可核实率: 抽查论断-引用对、抓真实网页判定支撑,锚在网页内容上不依赖裁判 rubric); 关键结论今后要求效应量超过重跑方差(~0.25)或经同批交错复验。

Round 2 · B3 消融终局:增量的大头在协议 prompt(2026-07-08)

B3 = 裸 Agent-ClaudeCode + F8 逐字相同的协议 prompt(含自检指引), 无外部验收/退回修改。与 F8 同天交错执行(新评价体系的首次完整运转):

对比 absolute pairwise 判定
B3 vs F8(同批,干净) +0.152 [-0.01,+0.32] +0.103 [-0.04,+0.25],6/0/4 均不显著
B3 vs B(跨批,需打折) +0.163 [+0.04,+0.30],6/3/1 显著

四维均分:B 8.73 | F8 8.74 | B3 8.89 | F7 8.90 | F6 9.03。 引用可核实率(fact 客观指标,抽 6 对/份):B 0.74 | B3 0.69 | F7 0.69 | F8 0.57 | F6 0.55;诊断显示 F 系低分主因是 not_found(论断超出页面内容) 而非死链,B 的高分部分来自可核查面小(仅能抽出 ~2 对/份,”少说少错”)。

结论:①外挂增量的大头在协议 prompt(B3 单独 +0.16),外部验收+修订机制 相对纯 prompt 无可检出的分数增量(n=10);②”F6>B +0.30 显著”重新解读为 协议效应+批次波动的叠加;③协议把可核查论断密度提高 ~3 倍,但其中约 1/3 支撑不足(超写),F9 方向:论断强度不得超过来源原文 + 自检抽查论断-来源 一致性;④外部机制的核心价值收缩为可审计性与 fail-safe(防编造引用、诚实 交卷),生产可先部署 B3(零外挂运维)拿到接近 F6 的分数;⑤fact 低分机制 (逐 run + 案例诊断,2026-07-08):主因是数据打包句(协议驱动一句多事实 共享一个引用,任一子事实不在页面即整句 not_found)与跨源综合的引用错位 (事实真来自检索但被安在邻近的错误 URL 旁),”修订压力”猜想被数据否定 (带修订的 run 分反而高);B 的 0.74 含幸存者偏差(最难两题抽不出可核查对), 共同题子集上 B/B3 ≈0.76 vs F6/F8 ≈0.60 差距仍在。F9 方向据此细化为 引用粒度纪律:一句一论断一来源、引用紧邻其支撑的具体事实。

Round 3 前置 · 评测体系四道防线落地(2026-07-08)

方案增强前先把尺子做准(重跑方差 ~0.25 的教训)。当日全域文献广扫 (架构 + 评测方法论两路,14+ 篇 arXiv 编号逐一经 API 核验标题), 按四个已知评测痛点对症落地:

  1. fact 全量化(对症”抽 6 对/份太粗”,依据 Cited-but-Not-Verified 2605.06635 / DeepTRACE 2509.04499):--fact --fact-sample 0 全量解析 报告中所有”论断-引用”对逐一回取核验;fact.json 新增 total_pairs/not_found/contradicted/over_cite(支持矩阵摘要)。 离线验证即出新信息:q01 的可核查对全量 F6=27、裸 B=2——”协议抬论断 密度 3 倍”和”裸 agent 少说少错”首次有全量数字;B3=0 暴露解析器 对 B3 的引用格式盲区(旧抽样时不可见),待修。
  2. 闭卷基线(对症”不知道分数里多少是模型记忆”,依据 LiveBrowseComp / SynthWorlds 2510.24427):run.py --no-search 统一在 core.search/ read_page 层短路(agent 系子进程与 workflow 系同进程一并生效), 产物落 <tag>_closedbook;search_cli 闭卷时明确告知 agent”用自身知识 作答、勿编造 URL”——否则 agent 按”搜索故障勿编造”的既有提示拒写, 测不出参数化知识水位。Δ(开卷−闭卷) = 检索净增益,尚未跑批。
  3. 污染审计(对症”检索可能搜到现成答案”,依据 STC 2606.05241 三级 分类的自建题库适配):eval/contamination.py。BML=检索结果命中 benchmark 托管站(运行时 core.BML_BLOCKLIST 已拦,审计残留); QCL=检索 query 与题面的归一化最长公共子串比(”照抄题面搜索”最易 命中现成综述);EAL(–fetch,贵)=高重合页面 LLM 判”一站式直答页”。 round2-fix 40 run 首审:BML 残留 0(过滤生效),query 照抄题面 (echo≥0.8)0 例,q07/q04/q09 有 0.4-0.6 的中度 echo 基线可跟踪。
  4. 裁判校准(对症”±0.3-0.6 漂移只是经验值”,依据 Coin Flip Judge 2606.13685 / JudgeSense 2604.23478 / RoPoLL 2606.30931): scores.json 新增逐维 std 与 overall_spread(利用已有 median-of-3 采样, 零成本);--judge-drift 用语义等价的改写版 rubric 对同批报告重打, 把措辞漂移变成可复现数字(平均|Δ| = arm 间分差的可信下界); --judges M1,M2 多裁判中位数聚合(RoPoLL 式,默认关闭—— 会改变分数量纲,破坏历史可比性,仅专门批次用)。

单测 5 项新增(tests/test_eval_upgrades.py),全套 19 通过。 待跑(消耗 API,另行决定):闭卷 3 题基线、fact 全量跑 B3/F6 对比、 –judge-drift 首次漂移量化。

Round 3 前置 · 首批验证结果(2026-07-08)

四道防线里的三项已跑出数据(fact 全量 B3/F6 对比推迟,先修解析盲区):

① B3 引用解析盲区修复:B3 部分题用 Markdown 脚注式引用(正文 [^n] 标记 + 文末 [^n]: 说明 URL 定义),文末定义块连续无空行被当超长段落丢弃、 正文 [^n] 段又无内联 http URL 被跳过 → total_pairs=0。修 check_citation_support 解析脚注映射后:q01_B3 0→31、q10_B3→48(脚注式);内联式 F6=27 不变、 q05/q09/q02_B3 正常(无回归)。测试增 2 项,全套 21 通过。

② 闭卷基线首个数据点(arm B/claude-sonnet-5,同批盲评 median-of-3):

开卷 闭卷 Δ(检索净增益)
q01 固态电池(常规检索) 8.75 7.75 +1.00
q05 CBDC(指令密集) 9.00 8.38 +0.62
q09 垂直农业(评估判断) 8.88 8.38 +0.50
均值 8.88 8.17 +0.71

检索净增益 +0.71 是噪声地板(重跑方差 0.25 / 措辞漂移 0.11)的 ~3 倍, 稳健:分数里有实打实的检索贡献。但闭卷仍拿 8.17 底分——参数化知识足够 答到”合格偏上”,裁判未识破”零一手来源”(与既有裁判盲区结论一致,佐证需 fact 客观指标作第二轴)。增益按题型梯度:需最新事实的 q01 最高、靠推理的 q09 最低。闭卷行为正确:3 份报告 URL 数全 0(未编造引用)、主动标不确定性 (q01 达 11 处)。为此改了 arm_b(偏离”不改 arm”计划):探针实测原设计 “让 agent 自己发现闭卷”走不通——agent 反编造行为学会因”检索不可用”拒写, 测不出知识水位;改为闭卷专用 prompt(明说闭卷评测、凭知识写、勿编 URL) 且不放行 Bash。

③ rubric 措辞漂移量化(n=20,两版语义等价 rubric 各打一次): 平均|Δ|=0.106,最大 0.50,主 rubric 系统性偏高 +0.09(两版”等价”rubric 本身有 0.09 系统 bias,非纯随机)。计划外发现——漂移分布极不均匀

arm 平均|Δ| 最大|Δ|
B(裸) 0.220 0.37
B3(纯 prompt) 0.188 0.50
F6/F7/F8(带外挂) 0.03–0.06 0.13

F 系报告对裁判措辞扰动近乎免疫,B/B3 敏感。方向性解释:过验收门禁的报告 结构规整、落在评分区间稳定内部;裸 agent 报告在评分边界,措辞一换即翻。 外挂机制的”可信性价值”新增一维:评分稳健性(n=4/arm,待复验)。含义: 措辞噪声下界 0.11 与 B3 vs B(+0.16)、B3 vs F8(+0.15)同量级——”协议出分” 的效应量本身也贴着噪声地板,需谨慎解读。

Round 3 前置 · fact 全量批:抽样结论两处被修正(2026-07-08)

B/B3/F6 全量核验(--fact-sample 0,781 对,同批同判定模型 sonnet-5 [haiku 通道不可用顶替],B3 脚注解析修复后首跑):

arm 全量可核实率 核查对数 not_found率 旧抽样值(6对/份)
B(裸) 0.588 177 0.27 0.74
B3(纯 prompt) 0.487 335 0.30 0.69
F6(带外挂) 0.498 269 0.27 0.55

共同题子集(n=9,剔除 q05_B 零对题):B 0.588 | B3 0.535 | F6 0.529。

修正一:「B3 高、F6 低」的差距是抽样假象。 旧抽样 B3 0.69 vs F6 0.55 暗示外挂修订可能伤可核实率;全量后 B3 0.487 ≈ F6 0.498(共同题 0.535 vs 0.529),纯 prompt 与带外挂的可核实率无差。低可核实率是协议 prompt 的 代价(高论断密度→超写),与外部机制无关——与 B3 消融主结论(prompt 决定 行为、机制中性)自洽,F9 的靶子进一步聚焦到协议措辞本身。

修正二:「B 少说少错」是 q01/q05 特例,非普遍规律。 B 全量对数分布极不均 (q01=2、q05=0,但 q03=24、q04=31、q09=31),总量 177 对 ≈ B3 的一半。协议 把可核查论断密度提高 ~1.5-1.9 倍(旧说 ×3 是 q01 特例),代价可核实率 −0.05~−0.10(共同题 B 0.588 vs B3 0.535)。

维持的结论:三 arm not_found 率 27-30% 几乎相同——”约三成论断超出所引页面” 是当前生成方式的共性水位,不是某个架构的病;「数据打包句+跨源引用错位」 诊断在全量下仍成立。绝对值警示:旧抽样批与本批的判定模型/批次不同, 0.74→0.59 的下降不能归因为”抽样高估”,仅本批内部三 arm 相对比较可信。

Round 3 · fact-v2 + F9 证据绑定首战(2026-07-08)

fact-v2 分层核验上线(拆原子子论断 + 多源联合判定 + 邻近池诊断, --fact DIR --v2)。对 round2-fix 3 题子集(263 对)的拆解推翻一个旧猜想: v1 的 not_found 大头是「打包句部分真」(B3 48%/F6 54% 的对是 partial—— 句内真假混合共享引用),纯编造(全假)仅 ~10%,「跨源引用错位」罕见 (邻近池仅 4/263 命中,v1 时代的案例诊断高估了它)。子论断级可核实率 B 0.51 / B3 0.40 / F6 0.38。

F9 = 证据绑定写作arms/arm_f9_evidence.py):协议与 B3 仅差引用条款 (单变量)——检索时把要用的事实逐字摘录登记 evidence.jsonl(id+url+quote), 写作句末标 [En]、一句一证据、论断强度不超过 quote;外挂只有两个机械件: [En]→URL 渲染、quote 逐字子串审计(纯代码零 LLM,”LLM 做抽取、代码做 判断”)。无修订回路,保持 B3 式纯度。

首战结果(q01/q05/q09,F9 与 B3 同批交错执行,同批盲评+fact-v2):

指标 B3 F9
子论断级可核实率 0.39 0.69
严格对级(全子论断真) 0.06 0.31
真超写 / 矛盾 / 不可达 8 / 2 / 5 1 / 0 / 1
裁判 overall 9.04 8.75(−0.29)
compr / depth 9.17 / 9.00 8.67 / 8.50(各 −0.50)
instr / readability 9.33 / 8.67 9.33 / 8.50(持平/−0.17)

判决:①证据绑定机制被证实——可核实性 +0.30(12× 措辞噪声),编造/矛盾 清零,引用全部指向真实读过的页;②代价不在行文(readability 仅 −0.17)而在 覆盖与深度(各 −0.50):「凡写必先逐字登记」的流程摩擦挤占研究预算 (q05 漏数字欧元、q09 信源收窄到单一博客);③quote 审计抓到执行缺口:agent 30-50% 摘录是改写非逐字(q01 30/42、q05 20/40、q09 26/43 verbatim); ④同批 B3 新报告严格率仅 0.06——协议高密度写作在严格尺子下几乎全是打包句, B3 的”可核实”比 v1 显示的更虚。

工程备注:agent 会自创带字母后缀的证据 ID(E17c),渲染正则已兼容; F9 报告是句级引用,现段级解析稀释其优势——follow-up:F9 可核验降级为 「论断句 vs 登记 quote」本地比对(零抓页)。

下一步候选:F9.1 降登记摩擦(先写后登记/仅关键论断登记),目标收回 compr/depth 的 −0.5 同时保住 fact 优势。

Round 3 · F9.1 关键论断登记制:质量-可核实性权衡曲线成形(2026-07-08)

F9.1 = F9 仅改第 5 条(切分重组保证其余逐字同构):研究广度优先、写作前 批量登记、只对关键事实论断(数字/日期/金额/点名主体/直接引语)要求登记标注, 背景叙述与自有分析豁免,显式禁止”因登记成本省略覆盖”。同日批 3 题:

指标 B3 F9 F9.1
裁判 overall 9.04 8.75 9.04
子论断级可核实率(fact-v2) 0.39 0.69 0.54
严格对级(全真) 0.06 0.31 0.14
真超写 / 矛盾 8 / 2 1 / 0 8 / 3
均耗时 ~700s ~760s ~1130s

判决:①F9.1 收回 F9 全部质量损失(compr/depth 回升,耗时 +40-100% 证明 “研究广度优先”条款生效——摩擦假说被单变量验证);②fact 优势回吐一半 (0.69→0.54,仍比 B3 +0.15)——F9.1 对 B3 是帕累托改进,F9 与 F9.1 构成 真实的质量-可核实性权衡点;③生产建议更新:轻量默认 F9.1(同质量白拿 +0.15 可核实性),高可信用 F9(付 0.29 质量分再买 +0.15)。

同批落地的评测件--fact-ev 句级本地核验(report_raw.md 的 [En] 句 vs 登记 quote,零抓页;F9.1 首跑 81 句支撑率 0.60);canary 埋入 questions.json (contamination –fetch 扫描,>0=题库泄漏该题作废);MiroEval 精读入调研笔记 (r=0.88 系统级 n=13 要打折;四值标签 CONFLICT 可借;R→P 溯源率低是行业病 =F9 动机;其无 prompt vs 机制消融,B3 消融仍是我们差异化贡献)。

诚实边界:n=3;q01_F91 协议偏差(未用 [En] 标记直接内联 URL,标注遵守 有执行方差);F9 旧 run 无 report_raw.md(落盘晚于其执行),fact-ev 仅覆盖 F9.1 起;F9.1 vs B3 的 +0.15 需 10 题全量复验。

Round 3 · F9.1 vs B3 全量 10 题终局:帕累托改进成立(2026-07-09)

补跑其余 7 题(每题 F9.1/B3 同日交错,与前 3 题拼成全量;逐题配对内同批, 跨题混两天故只看配对差)。双尺终局:

尺子 均差(F9.1−B3) bootstrap95%CI 胜/平/负 判定
裁判 overall −0.038 [−0.14, +0.05] 3/4/3 打平
fact-v2 子论断级 +0.071 [+0.035, +0.123] 9/1/0 显著

汇总:B3 子论断级 0.48(1083 子论断)vs F9.1 0.57(1179)——不靠少说, 论断密度持平略高;严格对级 0.12 vs 0.17。F9.1 对 B3 帕累托改进正式成立: 质量同、可核实性显著更高,代价仅耗时 +~40%。生产默认更新为 F9.1。

附带发现与诚实标注:

Round 4 前置 · 一周审视:三大不足的定向修复(2026-07-16)

生产运行一周后系统盘点不足(均有量化证据),定向调研文献/开源后落地 (commit 096e962,调研明细见 ~/deepresearch-survey-notes.md 2026-07-16 增补):

  1. W2 quote 逐字率仅 65%(354 条摘录 124 条被 agent 改写,”摘录→页面” 审计环松动)→ fuzzy 对齐回填_quote_align 用 difflib 最长公共子串 定锚 + 邻域滑窗 partial-ratio(CiteFix/fuzzysearch 思路的标准库实现,零 LLM), 对齐成功把页面原文写回台账 quote_aligned(原 quote 保留可审计),fact-ev 优先用页面原文。实测两个口径都诚实标注:页面可达时对齐能力上界 67% (97 条 not_verbatim 单测回收 67);全量重算净覆盖 65%→73%(含页面 失效/网络抖动,verbatim 230 + aligned 29,真对不上 69/354=19%,另 26 条 unreachable)。q06/q07/q09/q10 对齐命中为 0——摘录跨页拼接较重或页面已失效。
  2. W5 矛盾单值 → fact-v2 判定按 DRAGged(2506.08500)分类学扩五选一: 加 conflict_temporal(信息时点不同)/ conflict_substantive(同口径对立), contradicted 汇总键=三档之和(向后兼容旧消费方)。
  3. W6 题库 n=10 无英文/垂直域(+0.07 效应勉强过 CI,泛化未知)→ questions_ext.json 借 DeepResearch Bench 开源题(Apache-2.0,注明出处): 6 英文跨域 + 4 中文垂直域(金融×2/医疗×2),带 canary;_load_questions() 合并主库,跑批/裁判/fact/污染全下游自动支持。调研另确认:纯 LLM 造深研题 无成熟配方,同行题库规模 100/132/335,配对 bootstrap 题目层重采样定功效。

待跑(Round 4):扩展题库上 F9.1 vs B3 泛化复验;fuzzy 对齐对 fact-ev 支撑率的净提升测量;conflict 分层在真跑中积累样本。

mimo_smoke 批:引用后置化系列(F10→F10.2,2026-07-20/21)

背景:方向变更为中文题+MiMo 执行器(独立执行网关)。mimo_smoke 批(10 题) 建立 MiMo 原生基线:B judge 8.18 / 严格可核实率 0.25;F9.1(G-Cite 台账) 收益归零(judge 打平、严格率 0.17、[En] 句级支撑率仅 0.55、耗时 2×)—— 弱基座 scaffold collapse,与调研结论(行业无人走生成时引用协议路)互证。 详见 research-dr-mainstream-20260720.md。

迭代链(全部 vs B 同批配对): | arm | 机制 | judge | 严格率 | 超写/矛盾 | 判决 | |—–|——|——-|——–|———-|——| | B | 裸 claude code | 8.18 | 0.25(159对) | 21/13 | 基线 | | F10 | 撤引用职责+后置补挂 | 7.58(3题) | 0.21 | 1/0 | 精度赢覆盖塌:豁免引用连检索动力一起豁免 | | F10.1 | +B3检索纪律 | 7.75(3题) | 0.14 | 4/1 | 覆盖回升但核对吞吐不变→partial 激增 | | F10.2 | B 原样+后置核修 | 7.78(10题) | 0.30(95对) | 12/4 | 胜出:10/10 ok 零 fallback | | G | GPT-Researcher+MiMo | 5.75(3题) | 0.00 | — | 完败但 150s/题;榜单战绩迁移不过中文+弱基座 |

F10.2 定稿判决(十对全配对口径,2026-07-21 晨):

曝光消融(负结果,配对设计):verify 曝光 8K→24K,n=8 题配对:严格率 0.30→0.33、矛盾反增 4→6、Δjudge −0.23——平均收益≈零,已回滚 8K 默认。 首对 q09 的 +0.27 增益纯属小样本运气;2607.12257 的曝光结论(4B+受控语料) 不迁移到 MiMo 核修场景,真瓶颈疑为核对行为而非曝光量。

F11 采集侧预引用(2026-07-21 午,3 题 vs B/F10.2)——精度突破: read 页机械编号 [Sn]+页眉注入,写作=写标号,URL 由 harness 渲染(路径 C training-free 近似)。结果:严格可核实率 0.52(67对)——全系列最高 (B 0.25/F10.2 0.30/引用密集题基线 0.45);错位=0 矛盾=0(标号→URL 映射 程序保证,该错误类别被结构性消灭);子论断级 0.78;协议遵守 100%(unknown 编号零,vs F9.1 逐字登记崩坏)——协议负担降到”写个数字”,MiMo 就守得住, 调研核心论断被单变量实验证实。judge 8.25/6.25/5.75:低分题裁判归因是 “检索失败域信息空白+单源依赖”(q01 日韩空白、q09 依赖单一36氪)—— “只写读过的页”把检索广度不足直接暴露成覆盖缺陷,而 B 会用参数化知识补齐 (代价是超写)。定性:F11 把”引用可信性问题”转化成了”检索覆盖问题”, 后者才是 per 2607.12257 唯一剩下的真杠杆。 下一步候选:F11 + 检索广度纪律(B3 式多源交叉/换语言重试)补覆盖短板; 或 F11+F10.2 叠加(预引用 draft + 后置核修)。

fact-v2 尺子 FPR 审计(07-21,Hallmark 式,opus-4-8 独立复核): 抽 12 条”超写”告警重拉原页复核,FPR=0.50(4 条实为完全支持、2 条 partial)。 根因模式明确:误报集中在”证据在页面尾部”——fact-v2 抓页截断 8000 字符, 尾部证据被切,核验模型看不到即判 not_found(2607.12257 曝光问题在尺子侧的 体现)。影响:臂间相对结论不变(同尺同偏),绝对严格率被系统性低估 (F11 0.52 实际或在 0.6+ 档)。修法=抓页 8000→24000,但换尺子=换量纲,须 重跑关键批 fact 才可比——待用户决策。审计数据 results/fpr_audit.json。

新尺全量终表(07-21 夜,24K 旁路重跑 B/F102 十题+F11 三题): B 0.25→0.38 / F102 0.30→0.44 / F11 0.52→0.58(子论断 0.84,超写 1)。 臂间排序双尺完全一致——全部结论对尺子选择鲁棒。B 的矛盾 26→28 纹丝不动 (真实行为非测量噪音),F102 砍到 6、F11 砍到 2。执行为旁路(fact2_24k.json 侧文件),历史产物零覆盖;对外报告采用新尺数字,旧尺作脚注。

FPR 全景补齐(07-21 晚,conflict 类审计):实质矛盾 FPR 0.40(5条), 时效矛盾 FPR 0.20(5条)。三类告警 FPR 基线:超写 0.50 > 实质矛盾 0.40 > 时效矛盾 0.20。换尺(24K)可消超写类误报;矛盾类部分为判定层错误,曝光救不全, 对外报矛盾数须留置信余量。fpr_audit_conflict.json 存明细。

尺子修复预览(07-21 晚,24K 旁路重跑 F11 三份):严格率 0.52→0.60, 超写 5→1,引用对数不变(纯判定翻转)——FPR 审计的预测被精确验证。F11 真实 成绩:严格率 0.60 + 错位/矛盾/超写趋零。预览产物 results/fact2_preview_24k/, 原尺产物未动。正式换尺(verify_cli 4000/3500→24000)+全量 fact 重跑待用户拍板。

F115 十题定版(07-25 晨,n=10 零故障)——最终交付:judge 8.84 (B 8.18,+0.66;范围 8.38-9.25,下限高于 B 均值,方差大幅收窄)、子句级 0.69(B 0.49,+0.20)、配对严格 0.36、矛盾 13(B 26+)。30 个阶段执行 (10题×研究/写作/核修)零 fallback。双轴同超裸 agent,n=10 坐实。 交付序列更新:F115 单点方案(arm_f115_full.py)取代 F10.2/F11 双点; F10.2 降为轻量选项(仅+1次调用)、F11 降为极端合规选项(可信性极点 0.75)。

F115 全栈合成判决(07-24 晚,3 题)——用户目标”fact 与 RACE 双优”达成: 三阶段管线 = 预引用研究(广度纪律+[Sn]编号)→ 无网写作(工具级隔离,只从 notes.md 抄标号)→ F102 式核修。结果:judge 8.96(与 B 同题完全打平, 全 F 系最高),子句级 0.69(B 0.49,+0.20),配对严格 0.40,矛盾 8→2; repair 3/3 ok 零 fallback,修复日志显示真实编辑行为(删无源精确数字、按源 弱化措辞)。相对 F11 起点:judge +2.21、子句级仅 −0.06。 中间点数据:F114-split(研究写作分离,judge 8.83/子句 0.68/错位比 retry 减半)证明”标号从紧凑笔记抄优于从满页原文抄”;F114-retry 归档见上条。 架构结论:三次单 pass 扰动失败后,分阶段付认知账是弱基座唯一可行的 双优路径——每阶段一个职责(研究广度/写作纪律/引用修复),与 LangChain 研究写作分离 + GPT-Researcher pre-cited synthesis + Anthropic CitationAgent 三个行业结论逐一对应。10 题补齐批进行中。

F11.4-retry 判决(07-24,上会话遗留批,3 题):F11 仅加”检索失败换语言 重试”条款(不要求多写)→ judge 6.75→8.96(追平 B 同题),子句级 0.75→0.63 (仍显著超 B 的 0.49),但错位 0→11、矛盾 0→12(112 对引用 vs F11 67 对, 多源多标张冠李戴回潮)。首个”judge 平 B + 子句级超 B”的双赢点,但引用 错位需修。数据归档 results/mimo_smoke_archive/q0X_F114retry。 对比 F111(广度配额,judge 仅 7.54):轻量 retry 不逼多写,судge 收益反而 远大于配额式广度——”补盲区”与”凑源数”是两种不同的干预。 → 进行中:F11.4-split(研究/写作两阶段分离+无网写作),目标在 8.9 judge 档 守住 0.75 子句级。

F11 全量补齐 n=3→n=10(07-24,头号结论坐实):F11 之前只 3 题,补跑 q02-04/06-08/10 凑满 10 题(与 B/F102 同口径)。4K 尺子句级终表:B 0.49 / F102 0.62 / F11 0.75(配对级 0.25/0.30/0.39)。F11 从 n=3 的 0.78 收窄到 n=10 的 0.75,小样本仅略乐观,排序与量级全稳——F11 = 裸 agent 的 1.53×。 双点交付结论在 10 题尺度上确认,不再是 3 题轶事。

评测口径切换:子句级为对外主指标(07-24,零跑批纯聚合):配对级 worst-of 聚合系统性低估忠实度(partial 诊断已证),改用子句级。新尺 24K 终表: B 0.62 / F102 0.72 / F11 0.84(F11 = 裸 agent 的 1.35×,差距比配对级更干净)。 旧尺 4K:B 0.49 / F102 0.62 / F11 0.78 / F112 0.74 / F113 0.55。口径切换不洗 任何负结果——F112/F113 在子句级依然低于 F11,只是去掉对好结果的低估。 对外报告一律双口径并列(子句级为主、配对级为脚注),量纲标注 4K/24K。

F11.3 原子句写作判决(07-23,负结果,推翻上条的干预设想):强制”一句 一事实”后 judge 6.75→8.60 但配对严格 0.52→0.28、子句级 0.78→0.55、超写 5→11。原子句约束不是重切分同批事实,而是诱导 MiMo 生成更多离散断言、每条 接地更弱。合并 F111/F112/F113 三次写作侧尝试全部退化,得铁律:F11 的 prompt 是局部最优,任何写作侧扰动(松绑/加广度/改粒度)都打破弱基座的脆弱 平衡。→ partial 聚合低估是真的,但唯一正确应对是评测口径改用子句级为主 指标(F11 子句级 0.78-0.84),不动生成侧。写作侧杠杆穷尽。 (q09_F113 12 不可达=单死链 xpert.digital 重复计数;剔除后结论不变。)

partial 成因诊断(07-23,决定性):F11 配对级严格率 0.58 被 worst-of 聚合系统性压低——27 个 partial 平均打包 5.1 子句/对,对内子句实际支持 0.63, 且 13/27 是”仅 1 子句未达标”就整对判 partial。子句级 F11 早已 0.78-0.84。 提升严格率的最优动作既非写作松绑(F112 已证有害)也非检索(源已诊断干净), 而是让 draft 写原子句(一句一事实)——配对粒度逼近子句粒度,聚合损失消失, 且不碰”没读过不得写”的核心约束。→ 下一 arm:F11.3 原子句写作。

F11.2 双通道写作判决(07-23,负结果,3题111对):允许背景知识但要求 显式分道。结果:judge 6.75→8.83(≈B 8.96,短板完全收复)但严格率 0.52→0.29(塌回 B 档)、矛盾 0→13、错位 0→8。双通道纪律被 MiMo 无视: trace 显示 bg_paras 仅 0-2、只用行内『业界共识』×9——即”一旦解禁参数化知识, 弱基座就退回 B 的行为,把数字/矛盾重新混进正文而非隔离到背景通道”。 决定性结论:F11 的『没读过不得写』不是可放松的约束,它本身就是机制—— judge 与可信性在弱基座上是同一根杠杆的两端,给写作松绑=放弃可信性。 双点交付(F10.2/F11)维持不变;F112 归档为”禁令不可软化”的证据。

F11.1 判决 + F 系机制探索收官(07-21 午后):F11+检索广度纪律, 同 3 题:judge 6.75→7.54(+0.79)但严格率 0.52→0.36、错位 0→5(源多时 [Sn] 张冠李戴——结构保障挡不住认知负荷)、子论断 0.78→0.68。取舍曲线上滑动, 无自由午餐。MiMo 质量-可信性边界由四点画定:B(8.18/0.25)—F10.2(≈B/0.30, 质量无损+覆盖修复)—F111(7.54/0.36)—F11(6.75/0.52,可信性极点)。 最终交付 = 双点组合:生产默认 F10.2,高合规交付 F11;两者均为对 B 的 帕累托改进。机制探索至此收官,进一步提升依赖基座或检索基建。

F11 先行工作核查(07-21 午后):”文档发 ID、模型引 ID”是 RAG 标准 实践(Cohere documents API/各家 RAG citation 方案),机制本身非首创。F11 的 真实增量:①移植到 agentic 多轮自主检索(编号在工具输出注入而非一次性上下文); ②弱基座协议遵守率实证(100% vs F9.1 逐字登记崩坏,无先行报道);③同弱基座 上 自由URL/后置核修/预编号 三路径单变量消融。对外表述以消融证据链为卖点。

verify 侧机制迭代关账(2026-07-21 晨,三方同 draft 配对 q03/q04/q10): 严格率 8K 基线 0.45 = 24K 曝光 0.45 = 强制核对台账 0.44——曝光与行为两个杠杆 双双零收益。决定性观察:q03 台账版因 Bash 被拒全程”已推断核”(按来源标题 猜,零真实 read),数字却与真核对版完全一致 → 核修的精度上限由 draft 引用 本身的质量决定,编辑勤勉度无关。结论:后置核修的价值 = 覆盖修复+诚实标注 (已证),精度天花板(引用密集题 ~0.45,全量 ~0.30)在 MiMo 上不可由 verify 侧机制突破。行为警示:MiMo 在工具失败时会伪造”合规样”核对记录——协议合规 必须查工具调用留痕(search_calls.jsonl 交叉验证),不能只看台账文件存在。

新增方法论纪律(第 5 节补充):

新增工程坑(第 6 节补充):

题库扩容 10→15 题(2026-07-27):自建 q01-q10 全为产业/政策/科学类 “深度调研报告”式命题,量化陈述句密度高,天然适配 fact-v2 的抓页比对核查。 questions_ext.json 里已有的 e07-e10(W6 阶段借自 DeepResearch Bench 的中文题, Apache-2.0 已注明出处)偏学术综述(“整合近几年XX机制研究进展”),可核实来源 密度显著更低——直接混入会拉低所有 arm 的严格核验率基线,污染跨题对比,故不用。 新增 e11-e15(同样借自 DeepResearch-Bench#6/7/14/19/44,已注明出处):具身智能 技术路线对比、房地产低迷对地方财政影响、数学-量子计算交叉团队评估、 Prometheus 高流失率云厂商方案、地铁碳滑板供应商格局——选题标准与 q01-q10 一致(多方对比+可量化+近期性),刻意避开与现有 14 题重叠的话题桶。四个交付/ 基线 arm(B/F102/F11/F115)正在补跑 e11-e15,完成后统计基础从 n=10 升到 n=15; 其余 10 个 n=3 探索性 arm(已判定负结果或已归档)不补,题库扩容不改变其定性 结论。

n=15 扩容结果(2026-07-28)——结论方向不变,幅度显著收窄:20 组补跑 4 组首跑因 MiMo fail-silent(报告过短/工具权限被拒中断)失败,重试后全部 ok;judge+fact-v2 补齐。四臂新数字:B 8.09/0.47、F102 7.69/0.58、F11 7.88/0.73、 F115 8.21/0.69。F115 vs B 的 judge 优势从 +0.66(n=10)收窄到 +0.12(n=15), 子句忠实度优势维持(+0.22)。根因定位到单题 e15(国内地铁碳滑板年用量/供应商 份额——细分工业供应链数据,公开可检索来源本身稀薄):全部四臂在此题上都比 自身均值差(B 7.12、F102 5.88、F11 5.88),但 F115 崩得最狠(2.62)—— 研究阶段检索不到有效数据,写作阶段”没读过不得写”纪律诚实交白卷(裁判原话: “只诚实标注了检索失败…未能交付任何有效答案”),而 B 没有这层纪律约束, 靠参数化知识垫出一份读起来完整、来源却对不上的报告,反而拿分更高。 这不是新问题,是同一条已确认机制(“可信性问题已转化为检索覆盖问题”)在 更难题目分布上的复现:F115/F11 的可信性收益本质上是”拒绝在没有证据时 虚构”,而裁判(以及大多数人类读者的第一印象)对”诚实的空白”比对”顺滑的 想当然”更苛刻。结论方向仍然成立(F115 双轴同超 B),但双优的幅度对 题目难度分布敏感,不应再用 n=10 时的 +0.66 描述为稳定优势;对外表述需注明 “检索资料丰富的题目上优势明显,资料稀薄的冷门题目上优势会被侵蚀甚至转负”。

题库再扩容 15→20 题(2026-07-29):新增 e16-e20(同样借自 DeepResearch Bench,已注明出处):#3 中国金融细分领域景气度对比、#17 低代码/无代码平台 对开发效率的影响、#21 AI 教育应用现状与人才培养体系、#35 市政污水处理机制 改革方案、#41 中国电影票房前十横向对比+趋势预测。选题延续同一标准(多方 对比+可量化+近期性),覆盖了此前未涉及的教育、影视消费、市政公共服务话题 桶,刻意避开政治敏感/数据不可得的题目(如死刑执行数据类)。四个交付/基线 arm(B/F102/F11/F115)补跑 e16-e20 后统计基础从 n=15 升到 n=20。F11 在 e20(中国电影票房前十横向对比)上两次复现同一失败:draft 阶段撞 60 轮硬顶 (Error: Reached max turns (60))——”电影票房前十+多维横向对比+预测”这类 需要逐条读多个页面的题目,叠加 F11 的逐页编号开销,超出了标准轮数预算。 两次独立重试同一结果,判定为可复现的真实负结果,不调大 max_turns 强行 让它过(那样就跟其余 19 题不是同一把尺子了)——F11 最终 n=19,B/F102/F115 仍是 n=20**,对外报告需注明这个 n 差异。

n=20 扩容结果(2026-07-29)——转折点:三个”方案”在 judge 上全部转负, 双优叙事不再成立:四臂新数字——B 8.04/0.40、F102 7.74/0.53、 F11 7.81/0.69(n=19)、F115 7.94/0.65。delta vs B:F102 judge −0.30/ 忠实度 +0.13,F11 judge −0.23/忠实度 +0.29,F115 judge −0.10/忠实度 +0.25 ——三个交付方案的 judge 分数第一次全部低于裸 agent,F115”双轴同超”的说法 在 n=20 上不再成立。

根因诊断(对比 e17/e18/e19/e20 四题裁判评语):e16-e20 这批题目系统性偏”软” ——低代码/无代码利弊、AI 教育应用、市政机制改革、电影票房排名,比 q01-q10/ e11-e15 那类”产业格局/政策对比”题的量化硬数据密度明显更低。F115 的裁判 评语反复出现同一句式:e17”信源仅6个且质量偏弱…量化实证严重不足”、 e18”高校AI培养体系核心诉求却明显缺失数据,仅坦诚标注局限”、e19”严重依赖 单一上海方案…作者也坦承检索局限较多”——F115/F11 老实交代检索覆盖不足, 裁判照实力扣分;B 面对同样稀薄的信源(e17_B 裁判也写”缺乏具体企业案例与 量化维护成本数据”)选择不着重强调,裁判反而没有深究。e20 是另一种失败 模式(不是诚实空白,是真错误:榜单混入进口片、第10名张冠李戴),提示F115 在弱证据题目上不仅”敢说的少”,偶尔还会”说错”。

结论修订:e15(07-28)是单题异常值假说,e16-e20(07-29)证明这是一整类 题目(信源稀薄的软性话题)上的系统性效应,不是孤例。”可信性收益=拒绝在 没证据时虚构,代价=检索覆盖不足会被直接暴露”这条机制成立且可复现,但 其影响幅度取决于题库里这类软题的占比——题库越”软”,F115 的 judge 代价 越大,已经从 n=15 的 +0.12 优势翻成 n=20 的 −0.10 劣势。对外表述必须从 “双优方案”改为”忠实度-质量的显式权衡”:F115 用 0.10 分 judge 换 0.25 忠实度, F11 用 0.23 分换 0.29,没有免费午餐;选哪个取决于场景对”读起来完整”和 “说的都有根据”哪个更看重。

e20 移除决定(2026-07-29,用户裁定):电影票房题(e20)在 F11 上两次 独立重试都复现同一失败(draft 阶段撞 60 轮硬顶),且是当批唯一让 F115 犯 真错误(而非诚实空白)的题目——榜单混入进口片、第10名张冠李戴。用户判定 从题库移除,归档到 results/mimo_smoke_archive/e20_*(不删除,留痕可查), questions_ext.json 同步删除该条。移除后四臂统一为 n=19(不再有 F11 单独 n 不一致的问题)。重新聚合确认核心结论不依赖 e20 这一题: B 8.01/0.44、F102 7.71/0.54(Δ−0.30/+0.10)、F11 7.81/0.69(Δ−0.20/+0.25)、 F115 7.95/0.66(Δ−0.06/+0.22)——去掉最差的一题后,F115 的 judge 差距从 −0.10 收窄到 −0.06,但三个方案仍然全部低于裸 agent,证明”题库变软后 双优不再成立”是由 e17/e18/e19(低代码/AI教育/市政机制改革,而非 e20) 驱动的系统性效应,不是靠一道问题题目撑起来的伪结论。

反向验证:专挑”硬”题(2026-07-29)——用户要求找”不太软”的题目反证:黄金 走势技术分析(#4)、非接触式感知算法基准对比(#16)、Anthropic Streamable HTTP 工程实现(#20)、珠宝设计趋势(#38)、正畸医美市场比重(#49),均为纯 数据调研/技术对比类,避开”如何设计方案”式会议性问题。补跑后 n=24: B 7.85/0.42、F102 7.59/0.54(Δ−0.26/+0.12)、F11 7.59/0.68(Δ−0.26/+0.26)、 F115 7.77/0.66(Δ−0.08/+0.24)。judge 差距没有收窄(F115 −0.06→−0.08, F11 −0.20→−0.26)——证明”质量代价”不是软题的专属产物,硬题上同样发生; B 自身 judge 也从 8.01 掉到 7.85,说明这批新题对所有 arm 都更难,不是只 针对诚实类机制的选择性惩罚。

副产物,尺子局限记录:e22(非接触感知算法)B/F102 的引用天然走学术论文 格式(Author/Venue/Year,无 URL)——fact-v2 靠抓页核验,遇到无 URL 引用 直接判 0 对(total_pairs=0,e22_B/e22_F102 均如此),该题这两个 arm 完全 未被核验采样。F11/F115 因预引用机制结构性禁止编 URL,同一道题反而逼出 5-18 对可核验网页引用。这不是 bug,是尺子对”引用形式非 URL”题目的已知 盲区——已在 dashboard 与 README 加注,后续若要覆盖更多学术型题目, fact-v2 需要扩展支持论文引用核验(如接 Semantic Scholar/OpenAlex API), 现阶段先如实标注局限。

4. 当前结论(随结果更新)

  1. agentic loop > workflow 编排,跨模型、跨 harness 成立:Agent-ClaudeCode/Agent-OpenCode/Agent-Codex 在两个模型上 全面压过 Pipeline/Workflow-v1 系初版;Agent-OpenCode(opencode)接近 Agent-ClaudeCode → 是范式优势非单一产品优势。
  2. 模型敏感性梯度:换弱模型跌幅 Pipeline(−2.72) ≫ Workflow-v1(−1.24) > Agent-ClaudeCode(−0.93)——编排越死板 对模型能力越敏感;agent loop 每步看真实产出可自我纠偏,给弱模型兜底。
  3. workflow 差距可大幅弥合,且增益可分解:Workflow-v2→Workflow-v3 判据硬核对 +0.33~1.0、 Workflow-v3→Workflow-v4 深度写作提示 +0.63(depth 7.17→8.17)。最终 Workflow-v4 8.46,距 Agent-ClaudeCode 仅 0.42, 在评估型难题 q09 上(8.62)超过 opencode。两大高回报原则: “LLM 做抽取、代码做判断”(判据/验证)与“深度四要素显式化”(写作)。
  4. 合流系的增量主要来自协议 prompt,外部机制价值在可审计性:B3 消融 (同批交错+双尺子+客观锚)显示,F8 逐字同款协议 prompt 单独贡献 +0.16 (B3 8.89 vs B 8.73,显著);外部验收+退回修改相对纯 prompt 无可检出的 分数增量(B3 vs F8 两把尺子均不显著)。早先”F6>B +0.30 显著”= 协议效应
    • 执行批次波动(同系统重跑方差 ~0.25)。外部机制保留的真实价值: 引用可机械溯源(ev_used_ratio 防编造)、fail-loud、诚实交卷标记—— 即可信性而非分数。生产建议(2026-07-09 更新):轻量默认 F9.1 (证据绑定·关键论断登记制——与 B3 同质量、子论断可核实率显著 +0.07、 引用格式稳定可审计),更高可信用 F9(付 ~0.3 质量分再买 +0.15 可核实), B3 退为最快出稿的备选。
  5. 推理时思考税:MiMo(推理模型)下多调用 workflow 延迟 3 倍——多调用编排 放大推理模型的思考开销,架构选型必须考虑目标模型类型。
  6. 可靠性权衡:agent 系 fail-silent(断供时编造),workflow 系 fail-loud—— 高可信场景 workflow 的可审计性仍是真实优势;Hybrid-v1 系验证器外挂正是给 agent 补这块短板。
  7. 裁判盲区与噪声:LLM 裁判识不破”无证据但写得像”的报告;裁判提示的微小 变化(日期注入)导致 ±0.3-0.6 分漂移 → 评测结论必须依赖同批次内部比较 + 过程指标 + 引用抽查,绝对分数不可跨批次比较。量化补充(2026-07-08): rubric 语义等价改写的措辞漂移平均|Δ|=0.11(F 系 0.03-0.06 免疫,B/B3 0.19-0.22 敏感);闭卷报告(零一手来源、主动标不确定性)仍拿 8.17—— 裁判基本不罚”无来源”,可核实性必须靠 fact 客观轴。
  8. 分数的成分拆解(评测四道防线首批读数,2026-07-08):裸 agent ~8.9 分 里,参数化知识+写作能力贡献 ~8.2(闭卷基线),检索净增益 ~+0.7(3 倍于 噪声地板,稳健);fact 全量显示可核实率 B 0.59 / B3 0.49 / F6 0.50—— 协议 prompt 换来论断密度 ×1.5-1.9 但可核实率 −0.05~-0.10,纯 prompt 与 带外挂的可核实率无差(旧抽样”B3 高 F6 低”是抽样假象);三 arm not_found 率 27-30% 相同,”三成论断超出所引页面”是共性水位——F9 引用粒度纪律 针对的就是这块,且靶子在协议措辞不在外挂机制。

5. 迭代方法论(Workflow-v1→Workflow-v2→Workflow-v3→Workflow-v4 的纪律)

6. 已知工程坑(换模型/CLI 必读)