目标:在无训练资源约束下,回答”deep research agent 的架构选择”问题—— workflow 式编排 vs agentic loop,以及 training-free 机制的正确宿主。 本文档随实验迭代更新。(代码:本目录;调研笔记:
~/deepresearch-survey-notes.md)
eval/questions.json),覆盖产业分析、政策对比、
行业评估等类型;典型 3 题子集 = q01(固态电池,常规检索综合)、q05(CBDC,
指令密集:各举两例+点名实体)、q09(垂直农业倒闭潮,评估判断型)--judges 多裁判
鲁棒聚合、--judge-drift rubric 措辞漂移诊断(eval/judge.py)--fact,--fact-sample 0
全量核验,落 over_cite/not_found 支持矩阵);过程指标(eval/process_metrics.py
的 ev_used_ratio 等);污染审计(eval/contamination.py,STC 三级 BML/QCL/EAL)run.py --no-search 禁检索跑同题,Δ(开卷−闭卷)=检索净增益,
诊断参数化知识依赖(LiveBrowseComp 方法)common/search_cli.py
统一封装,agent CLI 禁用内置联网工具)、每题相同输入eval/run.py 按产物存在性跳过,故障可重放补齐代号对照(代码
eval/run.py --arms与results/目录使用短代号,文档使用可读名): Pipeline=A | Workflow-v1..v4=C,C2,C3,C4 | Agent-ClaudeCode=B | Agent-OpenCode=D | Agent-Codex=E | Hybrid-v1=F | Hybrid-v2=F2。产物目录如q09_C4即 q09 × Workflow-v4。
| 方案 | 一句话 | 机制来源 |
|---|---|---|
| Pipeline 固定流水线 | 拟大纲→逐节检索→逐节写作,无循环无判据 | 传统 RAG 报告基线 |
| Workflow-v1 机制组合 v1 | 大纲+节级完成判据、独立上下文搜索工人、机械证据库、缺口驱动循环、全局预算 | EDR(判据终止)、VeriTrace(证据库)、SearchSwarm(工人 brief)、ScaffoldAgent(大纲中间表示) |
| Workflow-v2 = Workflow-v1 + 5 项修复 | 单节轮数上限 / 补搜池 / 写作续写 / 证据去重 / 结论改综合 | Round 1 失分 trace 归因 |
| Workflow-v3 = Workflow-v2 + 判据硬核对 | 判据分硬/软:点名实体子串匹配、数量要求”LLM 抽取+代码数数”、软判据收紧、缺口带进补搜 brief | 原则:”LLM 做抽取、代码做判断” |
| Workflow-v4 = Workflow-v3 + 深度写作 | 节写作强制”深度四要素”(数据点/多方对比/机制解释/批判性评估),结论加不确定性与反方论点 | depth 是全场短板的针对性单变量 |
| 方案 | harness | 接入要点 |
|---|---|---|
| Agent-ClaudeCode | Claude Code (claude -p) |
--allowedTools 白名单只放行 search_cli;--settings 覆盖网关(用户级 settings.json env 优先级坑) |
| Agent-OpenCode | opencode (opencode run) |
项目级 opencode.json 禁 MCP/webfetch;bash 权限只能整体放行(pattern+deny 会让工具对模型不可见)→ 工具约束为软性 |
| Agent-Codex | codex (codex exec) |
独立 CODEX_HOME;仅支持 Responses API;web_search="disabled"(顶层键);沙箱提权在无头模式必败 → danger-full-access |
| 方案 | 一句话 |
|---|---|
| Hybrid-v1 = Agent-ClaudeCode + 机制外挂 | agent 基座 + 三层外挂:①协议 prompt(checklist 先行/节级判据/深度四要素/写前自检)②输出端验证器 verify_cli.py(机械查截断/引用重复/引用覆盖,抽取+代码比对查点名实体与数量要求)③修订回路(验证失败喂回 harness 修订一轮) |
| Arm | overall | 备注 |
|---|---|---|
| Agent-ClaudeCode | 8.93 | 十战全胜,指令遵循 9.4 |
| Workflow-v1 | 7.89 | 耗时 2.4×、token 4-6× |
| Pipeline | 7.66 |
Workflow-v1 失分 trace 归因(→ Workflow-v2 修复清单):首节垄断预算(贪心选节)、点名实体缺失不补搜、 写作 2200 tokens 顶格静默截断、引用重复(123 条去重后 18 条)、结论节被证据门控饿死。
Tavily 配额中途耗尽,搜索静默返空。事故本身成为发现:
由此加固:搜索结果级降级链(serper>firecrawl>bing)+ 后端错误显式抛出 + 连续全空 fail-loud 保险丝 + search_cli 反编造错误提示。
| Arm | overall | compr | depth | instr | read | 均耗时 |
|---|---|---|---|---|---|---|
| Hybrid-v4 = v3+内省验证+统一rubric | 8.96 | 9.0 | 8.5 | 9.5 | 8.83 | ~700s |
| Agent-ClaudeCode(裸) | 8.88 | 9.0 | 8.33 | 9.33 | 8.83 | 284s |
| Agent-ClaudeCode+委派(B2) | 8.88 | 9.0 | 8.33 | 9.33 | 8.83 | ~640s |
| Hybrid-v2 = v1+信源/分诊/续跑 | 8.84 | 9.0 | 8.17 | 9.33 | 8.83 | ~670s |
| Hybrid-v1 = 裸agent+外挂 | 8.83 | 9.0 | 8.5 | 9.17 | 8.67 | ~630s |
| Hybrid-v3 = v2+引用核验/风险门控/原子论断 | 8.83 | 8.93 | 8.33 | 9.33 | 8.73 | ~1170s |
| Workflow-v4 = v3+深度写作 | 8.46 | 8.5 | 8.17 | 8.83 | 8.33 | ~2160s |
| Agent-OpenCode(裸) | 8.13 | 8.17 | 7.67 | 8.17 | 8.5 | 299s |
| Workflow-v3 = v2+判据硬核对 | 7.83 | 8.0 | 7.17 | 8.17 | 8.0 | ~1900s |
| Workflow-v2 | 7.5 | 7.5 | 7.17 | 7.5 | 7.83 | ~1870s |
| Pipeline | 6.86 | 7.17 | 6.33 | 6.67 | 7.27 | 326s |
逐题亮点:q05_Hybrid-v4 9.38 全实验最高单题;q01/q05_Hybrid-v3 双 9.0; q09_C4 8.62 超过 Agent-OpenCode——workflow 最优版在评估型难题上进入 harness 区间。
Hybrid 迭代轨迹:v1 8.83 → v2 8.84 → v3 8.83 → v4 8.96。前三版在裁判噪声内 打平,v4 的”内省验证(verify_cli 作为工具交给 agent 自检)+ 统一 rubric(协议与 门禁同源)”带来首次对裸 agent 的超越(指令遵循 9.5)。trace 佐证成本自适应: q09_F4 内省自查后一次过门禁(331s、零外部修订),q05_F4 高风险触发深检两轮修订(1172s)。
委派负结果:B2(放开 Task 工具+委派指引)与裸 B 三题四维完全同分—— SearchSwarm 的”+10 分”不迁移到长报告场景;q01_B2 搜索次数暴涨至 132 次 (B 系常态 15-30 次)分数不动,证明长报告瓶颈在综合与验收,不在检索吞吐。
引用真实性审计上线(search_cli → run 目录 search_calls.jsonl):本批新 run 的
ev_used_ratio 全部 0.97-1.0,引用可机械追溯到真实检索(eval/process_metrics.py)。
裁判噪声提示:换用日期注入裁判后各 arm 分数有 ±0.3-0.6 漂移(如 Workflow-v3 8.21→7.83、 Agent-OpenCode 8.38→8.13、Pipeline 6.54→6.86),单裁判单次打分的方差不可忽略;上表为同一裁判 同一批次,内部可比。跨表比较只看趋势不看绝对值。
3 题子集测量分辨率耗尽后,对生产候选做 10 题确认:
| 方案 | n | 均分 | 逐题 | 分布 |
|---|---|---|---|---|
| Hybrid-v6 | 10 | 8.85 | 9.0/8.5/8.8/8.8/9.1/8.9/8.8/8.8/9.1/8.9 | 极差 0.6,下限 8.5 |
| 裸 Agent-ClaudeCode | 10 | 8.76 | 8.8/9.0/8.8/8.5/9.0/8.5/8.6/8.8/8.9/8.9 | 极差 0.5,三题掉 8.5-8.6 |
F6 领先 +0.09,胜 6 平 3 负 1(此前误记为”平1负3”,据 scores.json 复核更正)。
3 题时的 +0.08 在 10 题方向一致,但配对 bootstrap 95% CI [-0.06, +0.21] 跨 0
(eval/run.py --compare)——均分差未达显著,n=10 不足以检出 0.09 量级的
效应(需 n≈60)。稳健的主张是分布而非均值:价值不在抬上限(两者上限都 9.1),
而在托下限:验证门禁强制补齐差题,把状态差的题从 8.5 拽回 8.8;外挂系统的
结构性优势是可预测性(总在 8.8±0.15 vs 裸 agent 的 8.5-9.0 波动)。
read_page 增加 browser-use 渲染降级链——httpx 正文 <200 字符
时用无头 Chrome(CDP)渲染后重抽正文,解决 JS 页面盲区;trace 的 read 事件
新增 via 字段(httpx/browser)可审计。需环境变量 BU_CDP_URL 指向
google-chrome --headless=new --remote-debugging-port=9222,未配置时自动跳过。tests/test_fixes.py。同批修复:run.py 续跑判据改看
meta.status(此前 error run 留下的 report.md 会被永久跳过并照常评分)、
verify_cli 的 infra error(快模型不可用)从 failures 分离到独立 errors 通道
(此前会误触发修订循环)。修复后 F 系行为变强,重跑结果不可与旧批次直接对表。修复后全量复跑:F6/F7 各 10 题重新执行(4→3 并发,429 两例 resume 重试补齐),
B 复用旧报告(代码未变),三 arm 30 份报告同批盲评(opus-4-8 单次打分,
scores.json 带 judge_meta 可审计)。配对比较(eval/run.py --compare):
| 对比 | 均差 | bootstrap 95% CI | 胜/平/负 | 显著性 |
|---|---|---|---|---|
| F6 vs B | +0.300 | [+0.200, +0.388] | 9/1/0 | 显著 |
| F7 vs B | +0.173 | [-0.003, +0.349] | 7/1/2 | 不显著(临界) |
| F6 vs F7 | +0.127 | [+0.001, +0.241] | 6/2/2 | 勉强显著 |
| Arm | overall | compr | depth | instr | read |
|---|---|---|---|---|---|
| F6 | 9.03 | 9.07 | 8.75 | 9.38 | 8.9 |
| F7 | 8.90 | 8.9 | 8.75 | 9.25 | 8.7 |
| B | 8.73 | 8.85 | 8.1 | 9.15 | 8.8 |
F6 对裸 agent 的优势首次达到统计显著(CI 下界 +0.20 大于上一批的点估计 +0.09),得分结构与机制假设一致:depth +0.65、instr +0.23 是外挂协议瞄准的 两个维度。归因诚实声明:本批 trace 显示第三轮修订零触发(17 run 零修订、 3 run 一轮、12 run 走风险门禁快速通道、零 shipped-with-failures)——+0.30 不是死代码修复的直接效果,而更可能来自内省自检把问题消化在交卷前 + 上批 B 分 恰被裁判噪声抬高。相对结论(F6>B)因同批配对设计可靠;绝对分变化(8.85→9.03) 跨裁判批次不可归因。F7 类型条件化再次中性偏负(q09 评估型 8.5 全场最低), 生产候选定 F6。
F8(=F6+引用缺口反馈)次日重跑 10 题,pairwise 并排裁判显示 F8 输 F6 -0.255(CI [-0.48,-0.03],3胜0平7负)。但 trace 审计证明F8 与 F6 不同的 代码路径本批零执行(缺口反馈零触发、浏览器降级零介入),执行行为统计几乎 相同(报告 16.6k vs 16.0k 字符、搜索 15.3 vs 16.2 次)——本批 F8 机制上 等价于 F6。结论:同一系统隔日重跑的批间方差 ~0.25,与 F6>B 的 +0.30 同量级。含义:
评价体系升级(据此落地):meta.json 记执行时间戳,--compare 自动核对
两 arm 执行日期、跨批则显式警告;新增 --fact 客观指标命令(引用可核实率:
抽查论断-引用对、抓真实网页判定支撑,锚在网页内容上不依赖裁判 rubric);
关键结论今后要求效应量超过重跑方差(~0.25)或经同批交错复验。
B3 = 裸 Agent-ClaudeCode + F8 逐字相同的协议 prompt(含自检指引), 无外部验收/退回修改。与 F8 同天交错执行(新评价体系的首次完整运转):
| 对比 | absolute | pairwise | 判定 |
|---|---|---|---|
| B3 vs F8(同批,干净) | +0.152 [-0.01,+0.32] | +0.103 [-0.04,+0.25],6/0/4 | 均不显著 |
| B3 vs B(跨批,需打折) | +0.163 [+0.04,+0.30],6/3/1 | — | 显著 |
四维均分:B 8.73 | F8 8.74 | B3 8.89 | F7 8.90 | F6 9.03。 引用可核实率(fact 客观指标,抽 6 对/份):B 0.74 | B3 0.69 | F7 0.69 | F8 0.57 | F6 0.55;诊断显示 F 系低分主因是 not_found(论断超出页面内容) 而非死链,B 的高分部分来自可核查面小(仅能抽出 ~2 对/份,”少说少错”)。
结论:①外挂增量的大头在协议 prompt(B3 单独 +0.16),外部验收+修订机制 相对纯 prompt 无可检出的分数增量(n=10);②”F6>B +0.30 显著”重新解读为 协议效应+批次波动的叠加;③协议把可核查论断密度提高 ~3 倍,但其中约 1/3 支撑不足(超写),F9 方向:论断强度不得超过来源原文 + 自检抽查论断-来源 一致性;④外部机制的核心价值收缩为可审计性与 fail-safe(防编造引用、诚实 交卷),生产可先部署 B3(零外挂运维)拿到接近 F6 的分数;⑤fact 低分机制 (逐 run + 案例诊断,2026-07-08):主因是数据打包句(协议驱动一句多事实 共享一个引用,任一子事实不在页面即整句 not_found)与跨源综合的引用错位 (事实真来自检索但被安在邻近的错误 URL 旁),”修订压力”猜想被数据否定 (带修订的 run 分反而高);B 的 0.74 含幸存者偏差(最难两题抽不出可核查对), 共同题子集上 B/B3 ≈0.76 vs F6/F8 ≈0.60 差距仍在。F9 方向据此细化为 引用粒度纪律:一句一论断一来源、引用紧邻其支撑的具体事实。
方案增强前先把尺子做准(重跑方差 ~0.25 的教训)。当日全域文献广扫 (架构 + 评测方法论两路,14+ 篇 arXiv 编号逐一经 API 核验标题), 按四个已知评测痛点对症落地:
--fact --fact-sample 0 全量解析
报告中所有”论断-引用”对逐一回取核验;fact.json 新增
total_pairs/not_found/contradicted/over_cite(支持矩阵摘要)。
离线验证即出新信息:q01 的可核查对全量 F6=27、裸 B=2——”协议抬论断
密度 3 倍”和”裸 agent 少说少错”首次有全量数字;B3=0 暴露解析器
对 B3 的引用格式盲区(旧抽样时不可见),待修。run.py --no-search 统一在 core.search/
read_page 层短路(agent 系子进程与 workflow 系同进程一并生效),
产物落 <tag>_closedbook;search_cli 闭卷时明确告知 agent”用自身知识
作答、勿编造 URL”——否则 agent 按”搜索故障勿编造”的既有提示拒写,
测不出参数化知识水位。Δ(开卷−闭卷) = 检索净增益,尚未跑批。eval/contamination.py。BML=检索结果命中
benchmark 托管站(运行时 core.BML_BLOCKLIST 已拦,审计残留);
QCL=检索 query 与题面的归一化最长公共子串比(”照抄题面搜索”最易
命中现成综述);EAL(–fetch,贵)=高重合页面 LLM 判”一站式直答页”。
round2-fix 40 run 首审:BML 残留 0(过滤生效),query 照抄题面
(echo≥0.8)0 例,q07/q04/q09 有 0.4-0.6 的中度 echo 基线可跟踪。--judge-drift 用语义等价的改写版 rubric 对同批报告重打,
把措辞漂移变成可复现数字(平均|Δ| = arm 间分差的可信下界);
--judges M1,M2 多裁判中位数聚合(RoPoLL 式,默认关闭——
会改变分数量纲,破坏历史可比性,仅专门批次用)。单测 5 项新增(tests/test_eval_upgrades.py),全套 19 通过。 待跑(消耗 API,另行决定):闭卷 3 题基线、fact 全量跑 B3/F6 对比、 –judge-drift 首次漂移量化。
四道防线里的三项已跑出数据(fact 全量 B3/F6 对比推迟,先修解析盲区):
① B3 引用解析盲区修复:B3 部分题用 Markdown 脚注式引用(正文 [^n]
标记 + 文末 [^n]: 说明 URL 定义),文末定义块连续无空行被当超长段落丢弃、
正文 [^n] 段又无内联 http URL 被跳过 → total_pairs=0。修 check_citation_support
解析脚注映射后:q01_B3 0→31、q10_B3→48(脚注式);内联式 F6=27 不变、
q05/q09/q02_B3 正常(无回归)。测试增 2 项,全套 21 通过。
② 闭卷基线首个数据点(arm B/claude-sonnet-5,同批盲评 median-of-3):
| 题 | 开卷 | 闭卷 | Δ(检索净增益) |
|---|---|---|---|
| q01 固态电池(常规检索) | 8.75 | 7.75 | +1.00 |
| q05 CBDC(指令密集) | 9.00 | 8.38 | +0.62 |
| q09 垂直农业(评估判断) | 8.88 | 8.38 | +0.50 |
| 均值 | 8.88 | 8.17 | +0.71 |
检索净增益 +0.71 是噪声地板(重跑方差 0.25 / 措辞漂移 0.11)的 ~3 倍, 稳健:分数里有实打实的检索贡献。但闭卷仍拿 8.17 底分——参数化知识足够 答到”合格偏上”,裁判未识破”零一手来源”(与既有裁判盲区结论一致,佐证需 fact 客观指标作第二轴)。增益按题型梯度:需最新事实的 q01 最高、靠推理的 q09 最低。闭卷行为正确:3 份报告 URL 数全 0(未编造引用)、主动标不确定性 (q01 达 11 处)。为此改了 arm_b(偏离”不改 arm”计划):探针实测原设计 “让 agent 自己发现闭卷”走不通——agent 反编造行为学会因”检索不可用”拒写, 测不出知识水位;改为闭卷专用 prompt(明说闭卷评测、凭知识写、勿编 URL) 且不放行 Bash。
③ rubric 措辞漂移量化(n=20,两版语义等价 rubric 各打一次): 平均|Δ|=0.106,最大 0.50,主 rubric 系统性偏高 +0.09(两版”等价”rubric 本身有 0.09 系统 bias,非纯随机)。计划外发现——漂移分布极不均匀:
| arm | 平均|Δ| | 最大|Δ| |
|---|---|---|
| B(裸) | 0.220 | 0.37 |
| B3(纯 prompt) | 0.188 | 0.50 |
| F6/F7/F8(带外挂) | 0.03–0.06 | 0.13 |
F 系报告对裁判措辞扰动近乎免疫,B/B3 敏感。方向性解释:过验收门禁的报告 结构规整、落在评分区间稳定内部;裸 agent 报告在评分边界,措辞一换即翻。 外挂机制的”可信性价值”新增一维:评分稳健性(n=4/arm,待复验)。含义: 措辞噪声下界 0.11 与 B3 vs B(+0.16)、B3 vs F8(+0.15)同量级——”协议出分” 的效应量本身也贴着噪声地板,需谨慎解读。
B/B3/F6 全量核验(--fact-sample 0,781 对,同批同判定模型 sonnet-5
[haiku 通道不可用顶替],B3 脚注解析修复后首跑):
| arm | 全量可核实率 | 核查对数 | not_found率 | 旧抽样值(6对/份) |
|---|---|---|---|---|
| B(裸) | 0.588 | 177 | 0.27 | 0.74 |
| B3(纯 prompt) | 0.487 | 335 | 0.30 | 0.69 |
| F6(带外挂) | 0.498 | 269 | 0.27 | 0.55 |
共同题子集(n=9,剔除 q05_B 零对题):B 0.588 | B3 0.535 | F6 0.529。
修正一:「B3 高、F6 低」的差距是抽样假象。 旧抽样 B3 0.69 vs F6 0.55 暗示外挂修订可能伤可核实率;全量后 B3 0.487 ≈ F6 0.498(共同题 0.535 vs 0.529),纯 prompt 与带外挂的可核实率无差。低可核实率是协议 prompt 的 代价(高论断密度→超写),与外部机制无关——与 B3 消融主结论(prompt 决定 行为、机制中性)自洽,F9 的靶子进一步聚焦到协议措辞本身。
修正二:「B 少说少错」是 q01/q05 特例,非普遍规律。 B 全量对数分布极不均 (q01=2、q05=0,但 q03=24、q04=31、q09=31),总量 177 对 ≈ B3 的一半。协议 把可核查论断密度提高 ~1.5-1.9 倍(旧说 ×3 是 q01 特例),代价可核实率 −0.05~−0.10(共同题 B 0.588 vs B3 0.535)。
维持的结论:三 arm not_found 率 27-30% 几乎相同——”约三成论断超出所引页面” 是当前生成方式的共性水位,不是某个架构的病;「数据打包句+跨源引用错位」 诊断在全量下仍成立。绝对值警示:旧抽样批与本批的判定模型/批次不同, 0.74→0.59 的下降不能归因为”抽样高估”,仅本批内部三 arm 相对比较可信。
fact-v2 分层核验上线(拆原子子论断 + 多源联合判定 + 邻近池诊断,
--fact DIR --v2)。对 round2-fix 3 题子集(263 对)的拆解推翻一个旧猜想:
v1 的 not_found 大头是「打包句部分真」(B3 48%/F6 54% 的对是 partial——
句内真假混合共享引用),纯编造(全假)仅 ~10%,「跨源引用错位」罕见
(邻近池仅 4/263 命中,v1 时代的案例诊断高估了它)。子论断级可核实率
B 0.51 / B3 0.40 / F6 0.38。
F9 = 证据绑定写作(arms/arm_f9_evidence.py):协议与 B3 仅差引用条款
(单变量)——检索时把要用的事实逐字摘录登记 evidence.jsonl(id+url+quote),
写作句末标 [En]、一句一证据、论断强度不超过 quote;外挂只有两个机械件:
[En]→URL 渲染、quote 逐字子串审计(纯代码零 LLM,”LLM 做抽取、代码做
判断”)。无修订回路,保持 B3 式纯度。
首战结果(q01/q05/q09,F9 与 B3 同批交错执行,同批盲评+fact-v2):
| 指标 | B3 | F9 |
|---|---|---|
| 子论断级可核实率 | 0.39 | 0.69 |
| 严格对级(全子论断真) | 0.06 | 0.31 |
| 真超写 / 矛盾 / 不可达 | 8 / 2 / 5 | 1 / 0 / 1 |
| 裁判 overall | 9.04 | 8.75(−0.29) |
| compr / depth | 9.17 / 9.00 | 8.67 / 8.50(各 −0.50) |
| instr / readability | 9.33 / 8.67 | 9.33 / 8.50(持平/−0.17) |
判决:①证据绑定机制被证实——可核实性 +0.30(12× 措辞噪声),编造/矛盾 清零,引用全部指向真实读过的页;②代价不在行文(readability 仅 −0.17)而在 覆盖与深度(各 −0.50):「凡写必先逐字登记」的流程摩擦挤占研究预算 (q05 漏数字欧元、q09 信源收窄到单一博客);③quote 审计抓到执行缺口:agent 30-50% 摘录是改写非逐字(q01 30/42、q05 20/40、q09 26/43 verbatim); ④同批 B3 新报告严格率仅 0.06——协议高密度写作在严格尺子下几乎全是打包句, B3 的”可核实”比 v1 显示的更虚。
工程备注:agent 会自创带字母后缀的证据 ID(E17c),渲染正则已兼容; F9 报告是句级引用,现段级解析稀释其优势——follow-up:F9 可核验降级为 「论断句 vs 登记 quote」本地比对(零抓页)。
下一步候选:F9.1 降登记摩擦(先写后登记/仅关键论断登记),目标收回 compr/depth 的 −0.5 同时保住 fact 优势。
F9.1 = F9 仅改第 5 条(切分重组保证其余逐字同构):研究广度优先、写作前 批量登记、只对关键事实论断(数字/日期/金额/点名主体/直接引语)要求登记标注, 背景叙述与自有分析豁免,显式禁止”因登记成本省略覆盖”。同日批 3 题:
| 指标 | B3 | F9 | F9.1 |
|---|---|---|---|
| 裁判 overall | 9.04 | 8.75 | 9.04 |
| 子论断级可核实率(fact-v2) | 0.39 | 0.69 | 0.54 |
| 严格对级(全真) | 0.06 | 0.31 | 0.14 |
| 真超写 / 矛盾 | 8 / 2 | 1 / 0 | 8 / 3 |
| 均耗时 | ~700s | ~760s | ~1130s |
判决:①F9.1 收回 F9 全部质量损失(compr/depth 回升,耗时 +40-100% 证明 “研究广度优先”条款生效——摩擦假说被单变量验证);②fact 优势回吐一半 (0.69→0.54,仍比 B3 +0.15)——F9.1 对 B3 是帕累托改进,F9 与 F9.1 构成 真实的质量-可核实性权衡点;③生产建议更新:轻量默认 F9.1(同质量白拿 +0.15 可核实性),高可信用 F9(付 0.29 质量分再买 +0.15)。
同批落地的评测件:--fact-ev 句级本地核验(report_raw.md 的 [En] 句 vs
登记 quote,零抓页;F9.1 首跑 81 句支撑率 0.60);canary 埋入 questions.json
(contamination –fetch 扫描,>0=题库泄漏该题作废);MiroEval 精读入调研笔记
(r=0.88 系统级 n=13 要打折;四值标签 CONFLICT 可借;R→P 溯源率低是行业病
=F9 动机;其无 prompt vs 机制消融,B3 消融仍是我们差异化贡献)。
诚实边界:n=3;q01_F91 协议偏差(未用 [En] 标记直接内联 URL,标注遵守 有执行方差);F9 旧 run 无 report_raw.md(落盘晚于其执行),fact-ev 仅覆盖 F9.1 起;F9.1 vs B3 的 +0.15 需 10 题全量复验。
补跑其余 7 题(每题 F9.1/B3 同日交错,与前 3 题拼成全量;逐题配对内同批, 跨题混两天故只看配对差)。双尺终局:
| 尺子 | 均差(F9.1−B3) | bootstrap95%CI | 胜/平/负 | 判定 |
|---|---|---|---|---|
| 裁判 overall | −0.038 | [−0.14, +0.05] | 3/4/3 | 打平 |
| fact-v2 子论断级 | +0.071 | [+0.035, +0.123] | 9/1/0 | 显著 |
汇总:B3 子论断级 0.48(1083 子论断)vs F9.1 0.57(1179)——不靠少说, 论断密度持平略高;严格对级 0.12 vs 0.17。F9.1 对 B3 帕累托改进正式成立: 质量同、可核实性显著更高,代价仅耗时 +~40%。生产默认更新为 F9.1。
附带发现与诚实标注:
生产运行一周后系统盘点不足(均有量化证据),定向调研文献/开源后落地 (commit 096e962,调研明细见 ~/deepresearch-survey-notes.md 2026-07-16 增补):
_quote_align 用 difflib 最长公共子串
定锚 + 邻域滑窗 partial-ratio(CiteFix/fuzzysearch 思路的标准库实现,零 LLM),
对齐成功把页面原文写回台账 quote_aligned(原 quote 保留可审计),fact-ev
优先用页面原文。实测两个口径都诚实标注:页面可达时对齐能力上界 67%
(97 条 not_verbatim 单测回收 67);全量重算净覆盖 65%→73%(含页面
失效/网络抖动,verbatim 230 + aligned 29,真对不上 69/354=19%,另 26 条
unreachable)。q06/q07/q09/q10 对齐命中为 0——摘录跨页拼接较重或页面已失效。questions_ext.json 借 DeepResearch Bench 开源题(Apache-2.0,注明出处):
6 英文跨域 + 4 中文垂直域(金融×2/医疗×2),带 canary;_load_questions()
合并主库,跑批/裁判/fact/污染全下游自动支持。调研另确认:纯 LLM 造深研题
无成熟配方,同行题库规模 100/132/335,配对 bootstrap 题目层重采样定功效。待跑(Round 4):扩展题库上 F9.1 vs B3 泛化复验;fuzzy 对齐对 fact-ev 支撑率的净提升测量;conflict 分层在真跑中积累样本。
背景:方向变更为中文题+MiMo 执行器(独立执行网关)。mimo_smoke 批(10 题) 建立 MiMo 原生基线:B judge 8.18 / 严格可核实率 0.25;F9.1(G-Cite 台账) 收益归零(judge 打平、严格率 0.17、[En] 句级支撑率仅 0.55、耗时 2×)—— 弱基座 scaffold collapse,与调研结论(行业无人走生成时引用协议路)互证。 详见 research-dr-mainstream-20260720.md。
迭代链(全部 vs B 同批配对): | arm | 机制 | judge | 严格率 | 超写/矛盾 | 判决 | |—–|——|——-|——–|———-|——| | B | 裸 claude code | 8.18 | 0.25(159对) | 21/13 | 基线 | | F10 | 撤引用职责+后置补挂 | 7.58(3题) | 0.21 | 1/0 | 精度赢覆盖塌:豁免引用连检索动力一起豁免 | | F10.1 | +B3检索纪律 | 7.75(3题) | 0.14 | 4/1 | 覆盖回升但核对吞吐不变→partial 激增 | | F10.2 | B 原样+后置核修 | 7.78(10题) | 0.30(95对) | 12/4 | 胜出:10/10 ok 零 fallback | | G | GPT-Researcher+MiMo | 5.75(3题) | 0.00 | — | 完败但 150s/题;榜单战绩迁移不过中文+弱基座 |
F10.2 定稿判决(十对全配对口径,2026-07-21 晨):
曝光消融(负结果,配对设计):verify 曝光 8K→24K,n=8 题配对:严格率 0.30→0.33、矛盾反增 4→6、Δjudge −0.23——平均收益≈零,已回滚 8K 默认。 首对 q09 的 +0.27 增益纯属小样本运气;2607.12257 的曝光结论(4B+受控语料) 不迁移到 MiMo 核修场景,真瓶颈疑为核对行为而非曝光量。
F11 采集侧预引用(2026-07-21 午,3 题 vs B/F10.2)——精度突破: read 页机械编号 [Sn]+页眉注入,写作=写标号,URL 由 harness 渲染(路径 C training-free 近似)。结果:严格可核实率 0.52(67对)——全系列最高 (B 0.25/F10.2 0.30/引用密集题基线 0.45);错位=0 矛盾=0(标号→URL 映射 程序保证,该错误类别被结构性消灭);子论断级 0.78;协议遵守 100%(unknown 编号零,vs F9.1 逐字登记崩坏)——协议负担降到”写个数字”,MiMo 就守得住, 调研核心论断被单变量实验证实。judge 8.25/6.25/5.75:低分题裁判归因是 “检索失败域信息空白+单源依赖”(q01 日韩空白、q09 依赖单一36氪)—— “只写读过的页”把检索广度不足直接暴露成覆盖缺陷,而 B 会用参数化知识补齐 (代价是超写)。定性:F11 把”引用可信性问题”转化成了”检索覆盖问题”, 后者才是 per 2607.12257 唯一剩下的真杠杆。 下一步候选:F11 + 检索广度纪律(B3 式多源交叉/换语言重试)补覆盖短板; 或 F11+F10.2 叠加(预引用 draft + 后置核修)。
fact-v2 尺子 FPR 审计(07-21,Hallmark 式,opus-4-8 独立复核): 抽 12 条”超写”告警重拉原页复核,FPR=0.50(4 条实为完全支持、2 条 partial)。 根因模式明确:误报集中在”证据在页面尾部”——fact-v2 抓页截断 8000 字符, 尾部证据被切,核验模型看不到即判 not_found(2607.12257 曝光问题在尺子侧的 体现)。影响:臂间相对结论不变(同尺同偏),绝对严格率被系统性低估 (F11 0.52 实际或在 0.6+ 档)。修法=抓页 8000→24000,但换尺子=换量纲,须 重跑关键批 fact 才可比——待用户决策。审计数据 results/fpr_audit.json。
新尺全量终表(07-21 夜,24K 旁路重跑 B/F102 十题+F11 三题): B 0.25→0.38 / F102 0.30→0.44 / F11 0.52→0.58(子论断 0.84,超写 1)。 臂间排序双尺完全一致——全部结论对尺子选择鲁棒。B 的矛盾 26→28 纹丝不动 (真实行为非测量噪音),F102 砍到 6、F11 砍到 2。执行为旁路(fact2_24k.json 侧文件),历史产物零覆盖;对外报告采用新尺数字,旧尺作脚注。
FPR 全景补齐(07-21 晚,conflict 类审计):实质矛盾 FPR 0.40(5条), 时效矛盾 FPR 0.20(5条)。三类告警 FPR 基线:超写 0.50 > 实质矛盾 0.40 > 时效矛盾 0.20。换尺(24K)可消超写类误报;矛盾类部分为判定层错误,曝光救不全, 对外报矛盾数须留置信余量。fpr_audit_conflict.json 存明细。
尺子修复预览(07-21 晚,24K 旁路重跑 F11 三份):严格率 0.52→0.60, 超写 5→1,引用对数不变(纯判定翻转)——FPR 审计的预测被精确验证。F11 真实 成绩:严格率 0.60 + 错位/矛盾/超写趋零。预览产物 results/fact2_preview_24k/, 原尺产物未动。正式换尺(verify_cli 4000/3500→24000)+全量 fact 重跑待用户拍板。
F115 十题定版(07-25 晨,n=10 零故障)——最终交付:judge 8.84 (B 8.18,+0.66;范围 8.38-9.25,下限高于 B 均值,方差大幅收窄)、子句级 0.69(B 0.49,+0.20)、配对严格 0.36、矛盾 13(B 26+)。30 个阶段执行 (10题×研究/写作/核修)零 fallback。双轴同超裸 agent,n=10 坐实。 交付序列更新:F115 单点方案(arm_f115_full.py)取代 F10.2/F11 双点; F10.2 降为轻量选项(仅+1次调用)、F11 降为极端合规选项(可信性极点 0.75)。
F115 全栈合成判决(07-24 晚,3 题)——用户目标”fact 与 RACE 双优”达成: 三阶段管线 = 预引用研究(广度纪律+[Sn]编号)→ 无网写作(工具级隔离,只从 notes.md 抄标号)→ F102 式核修。结果:judge 8.96(与 B 同题完全打平, 全 F 系最高),子句级 0.69(B 0.49,+0.20),配对严格 0.40,矛盾 8→2; repair 3/3 ok 零 fallback,修复日志显示真实编辑行为(删无源精确数字、按源 弱化措辞)。相对 F11 起点:judge +2.21、子句级仅 −0.06。 中间点数据:F114-split(研究写作分离,judge 8.83/子句 0.68/错位比 retry 减半)证明”标号从紧凑笔记抄优于从满页原文抄”;F114-retry 归档见上条。 架构结论:三次单 pass 扰动失败后,分阶段付认知账是弱基座唯一可行的 双优路径——每阶段一个职责(研究广度/写作纪律/引用修复),与 LangChain 研究写作分离 + GPT-Researcher pre-cited synthesis + Anthropic CitationAgent 三个行业结论逐一对应。10 题补齐批进行中。
F11.4-retry 判决(07-24,上会话遗留批,3 题):F11 仅加”检索失败换语言 重试”条款(不要求多写)→ judge 6.75→8.96(追平 B 同题),子句级 0.75→0.63 (仍显著超 B 的 0.49),但错位 0→11、矛盾 0→12(112 对引用 vs F11 67 对, 多源多标张冠李戴回潮)。首个”judge 平 B + 子句级超 B”的双赢点,但引用 错位需修。数据归档 results/mimo_smoke_archive/q0X_F114retry。 对比 F111(广度配额,judge 仅 7.54):轻量 retry 不逼多写,судge 收益反而 远大于配额式广度——”补盲区”与”凑源数”是两种不同的干预。 → 进行中:F11.4-split(研究/写作两阶段分离+无网写作),目标在 8.9 judge 档 守住 0.75 子句级。
F11 全量补齐 n=3→n=10(07-24,头号结论坐实):F11 之前只 3 题,补跑 q02-04/06-08/10 凑满 10 题(与 B/F102 同口径)。4K 尺子句级终表:B 0.49 / F102 0.62 / F11 0.75(配对级 0.25/0.30/0.39)。F11 从 n=3 的 0.78 收窄到 n=10 的 0.75,小样本仅略乐观,排序与量级全稳——F11 = 裸 agent 的 1.53×。 双点交付结论在 10 题尺度上确认,不再是 3 题轶事。
评测口径切换:子句级为对外主指标(07-24,零跑批纯聚合):配对级 worst-of 聚合系统性低估忠实度(partial 诊断已证),改用子句级。新尺 24K 终表: B 0.62 / F102 0.72 / F11 0.84(F11 = 裸 agent 的 1.35×,差距比配对级更干净)。 旧尺 4K:B 0.49 / F102 0.62 / F11 0.78 / F112 0.74 / F113 0.55。口径切换不洗 任何负结果——F112/F113 在子句级依然低于 F11,只是去掉对好结果的低估。 对外报告一律双口径并列(子句级为主、配对级为脚注),量纲标注 4K/24K。
F11.3 原子句写作判决(07-23,负结果,推翻上条的干预设想):强制”一句 一事实”后 judge 6.75→8.60 但配对严格 0.52→0.28、子句级 0.78→0.55、超写 5→11。原子句约束不是重切分同批事实,而是诱导 MiMo 生成更多离散断言、每条 接地更弱。合并 F111/F112/F113 三次写作侧尝试全部退化,得铁律:F11 的 prompt 是局部最优,任何写作侧扰动(松绑/加广度/改粒度)都打破弱基座的脆弱 平衡。→ partial 聚合低估是真的,但唯一正确应对是评测口径改用子句级为主 指标(F11 子句级 0.78-0.84),不动生成侧。写作侧杠杆穷尽。 (q09_F113 12 不可达=单死链 xpert.digital 重复计数;剔除后结论不变。)
partial 成因诊断(07-23,决定性):F11 配对级严格率 0.58 被 worst-of 聚合系统性压低——27 个 partial 平均打包 5.1 子句/对,对内子句实际支持 0.63, 且 13/27 是”仅 1 子句未达标”就整对判 partial。子句级 F11 早已 0.78-0.84。 提升严格率的最优动作既非写作松绑(F112 已证有害)也非检索(源已诊断干净), 而是让 draft 写原子句(一句一事实)——配对粒度逼近子句粒度,聚合损失消失, 且不碰”没读过不得写”的核心约束。→ 下一 arm:F11.3 原子句写作。
F11.2 双通道写作判决(07-23,负结果,3题111对):允许背景知识但要求 显式分道。结果:judge 6.75→8.83(≈B 8.96,短板完全收复)但严格率 0.52→0.29(塌回 B 档)、矛盾 0→13、错位 0→8。双通道纪律被 MiMo 无视: trace 显示 bg_paras 仅 0-2、只用行内『业界共识』×9——即”一旦解禁参数化知识, 弱基座就退回 B 的行为,把数字/矛盾重新混进正文而非隔离到背景通道”。 决定性结论:F11 的『没读过不得写』不是可放松的约束,它本身就是机制—— judge 与可信性在弱基座上是同一根杠杆的两端,给写作松绑=放弃可信性。 双点交付(F10.2/F11)维持不变;F112 归档为”禁令不可软化”的证据。
F11.1 判决 + F 系机制探索收官(07-21 午后):F11+检索广度纪律, 同 3 题:judge 6.75→7.54(+0.79)但严格率 0.52→0.36、错位 0→5(源多时 [Sn] 张冠李戴——结构保障挡不住认知负荷)、子论断 0.78→0.68。取舍曲线上滑动, 无自由午餐。MiMo 质量-可信性边界由四点画定:B(8.18/0.25)—F10.2(≈B/0.30, 质量无损+覆盖修复)—F111(7.54/0.36)—F11(6.75/0.52,可信性极点)。 最终交付 = 双点组合:生产默认 F10.2,高合规交付 F11;两者均为对 B 的 帕累托改进。机制探索至此收官,进一步提升依赖基座或检索基建。
F11 先行工作核查(07-21 午后):”文档发 ID、模型引 ID”是 RAG 标准 实践(Cohere documents API/各家 RAG citation 方案),机制本身非首创。F11 的 真实增量:①移植到 agentic 多轮自主检索(编号在工具输出注入而非一次性上下文); ②弱基座协议遵守率实证(100% vs F9.1 逐字登记崩坏,无先行报道);③同弱基座 上 自由URL/后置核修/预编号 三路径单变量消融。对外表述以消融证据链为卖点。
verify 侧机制迭代关账(2026-07-21 晨,三方同 draft 配对 q03/q04/q10): 严格率 8K 基线 0.45 = 24K 曝光 0.45 = 强制核对台账 0.44——曝光与行为两个杠杆 双双零收益。决定性观察:q03 台账版因 Bash 被拒全程”已推断核”(按来源标题 猜,零真实 read),数字却与真核对版完全一致 → 核修的精度上限由 draft 引用 本身的质量决定,编辑勤勉度无关。结论:后置核修的价值 = 覆盖修复+诚实标注 (已证),精度天花板(引用密集题 ~0.45,全量 ~0.30)在 MiMo 上不可由 verify 侧机制突破。行为警示:MiMo 在工具失败时会伪造”合规样”核对记录——协议合规 必须查工具调用留痕(search_calls.jsonl 交叉验证),不能只看台账文件存在。
新增方法论纪律(第 5 节补充):
新增工程坑(第 6 节补充):
题库扩容 10→15 题(2026-07-27):自建 q01-q10 全为产业/政策/科学类 “深度调研报告”式命题,量化陈述句密度高,天然适配 fact-v2 的抓页比对核查。 questions_ext.json 里已有的 e07-e10(W6 阶段借自 DeepResearch Bench 的中文题, Apache-2.0 已注明出处)偏学术综述(“整合近几年XX机制研究进展”),可核实来源 密度显著更低——直接混入会拉低所有 arm 的严格核验率基线,污染跨题对比,故不用。 新增 e11-e15(同样借自 DeepResearch-Bench#6/7/14/19/44,已注明出处):具身智能 技术路线对比、房地产低迷对地方财政影响、数学-量子计算交叉团队评估、 Prometheus 高流失率云厂商方案、地铁碳滑板供应商格局——选题标准与 q01-q10 一致(多方对比+可量化+近期性),刻意避开与现有 14 题重叠的话题桶。四个交付/ 基线 arm(B/F102/F11/F115)正在补跑 e11-e15,完成后统计基础从 n=10 升到 n=15; 其余 10 个 n=3 探索性 arm(已判定负结果或已归档)不补,题库扩容不改变其定性 结论。
n=15 扩容结果(2026-07-28)——结论方向不变,幅度显著收窄:20 组补跑 4 组首跑因 MiMo fail-silent(报告过短/工具权限被拒中断)失败,重试后全部 ok;judge+fact-v2 补齐。四臂新数字:B 8.09/0.47、F102 7.69/0.58、F11 7.88/0.73、 F115 8.21/0.69。F115 vs B 的 judge 优势从 +0.66(n=10)收窄到 +0.12(n=15), 子句忠实度优势维持(+0.22)。根因定位到单题 e15(国内地铁碳滑板年用量/供应商 份额——细分工业供应链数据,公开可检索来源本身稀薄):全部四臂在此题上都比 自身均值差(B 7.12、F102 5.88、F11 5.88),但 F115 崩得最狠(2.62)—— 研究阶段检索不到有效数据,写作阶段”没读过不得写”纪律诚实交白卷(裁判原话: “只诚实标注了检索失败…未能交付任何有效答案”),而 B 没有这层纪律约束, 靠参数化知识垫出一份读起来完整、来源却对不上的报告,反而拿分更高。 这不是新问题,是同一条已确认机制(“可信性问题已转化为检索覆盖问题”)在 更难题目分布上的复现:F115/F11 的可信性收益本质上是”拒绝在没有证据时 虚构”,而裁判(以及大多数人类读者的第一印象)对”诚实的空白”比对”顺滑的 想当然”更苛刻。结论方向仍然成立(F115 双轴同超 B),但双优的幅度对 题目难度分布敏感,不应再用 n=10 时的 +0.66 描述为稳定优势;对外表述需注明 “检索资料丰富的题目上优势明显,资料稀薄的冷门题目上优势会被侵蚀甚至转负”。
题库再扩容 15→20 题(2026-07-29):新增 e16-e20(同样借自 DeepResearch
Bench,已注明出处):#3 中国金融细分领域景气度对比、#17 低代码/无代码平台
对开发效率的影响、#21 AI 教育应用现状与人才培养体系、#35 市政污水处理机制
改革方案、#41 中国电影票房前十横向对比+趋势预测。选题延续同一标准(多方
对比+可量化+近期性),覆盖了此前未涉及的教育、影视消费、市政公共服务话题
桶,刻意避开政治敏感/数据不可得的题目(如死刑执行数据类)。四个交付/基线
arm(B/F102/F11/F115)补跑 e16-e20 后统计基础从 n=15 升到 n=20。F11 在
e20(中国电影票房前十横向对比)上两次复现同一失败:draft 阶段撞 60 轮硬顶
(Error: Reached max turns (60))——”电影票房前十+多维横向对比+预测”这类
需要逐条读多个页面的题目,叠加 F11 的逐页编号开销,超出了标准轮数预算。
两次独立重试同一结果,判定为可复现的真实负结果,不调大 max_turns 强行
让它过(那样就跟其余 19 题不是同一把尺子了)——F11 最终 n=19,B/F102/F115
仍是 n=20**,对外报告需注明这个 n 差异。
n=20 扩容结果(2026-07-29)——转折点:三个”方案”在 judge 上全部转负, 双优叙事不再成立:四臂新数字——B 8.04/0.40、F102 7.74/0.53、 F11 7.81/0.69(n=19)、F115 7.94/0.65。delta vs B:F102 judge −0.30/ 忠实度 +0.13,F11 judge −0.23/忠实度 +0.29,F115 judge −0.10/忠实度 +0.25 ——三个交付方案的 judge 分数第一次全部低于裸 agent,F115”双轴同超”的说法 在 n=20 上不再成立。
根因诊断(对比 e17/e18/e19/e20 四题裁判评语):e16-e20 这批题目系统性偏”软” ——低代码/无代码利弊、AI 教育应用、市政机制改革、电影票房排名,比 q01-q10/ e11-e15 那类”产业格局/政策对比”题的量化硬数据密度明显更低。F115 的裁判 评语反复出现同一句式:e17”信源仅6个且质量偏弱…量化实证严重不足”、 e18”高校AI培养体系核心诉求却明显缺失数据,仅坦诚标注局限”、e19”严重依赖 单一上海方案…作者也坦承检索局限较多”——F115/F11 老实交代检索覆盖不足, 裁判照实力扣分;B 面对同样稀薄的信源(e17_B 裁判也写”缺乏具体企业案例与 量化维护成本数据”)选择不着重强调,裁判反而没有深究。e20 是另一种失败 模式(不是诚实空白,是真错误:榜单混入进口片、第10名张冠李戴),提示F115 在弱证据题目上不仅”敢说的少”,偶尔还会”说错”。
结论修订:e15(07-28)是单题异常值假说,e16-e20(07-29)证明这是一整类 题目(信源稀薄的软性话题)上的系统性效应,不是孤例。”可信性收益=拒绝在 没证据时虚构,代价=检索覆盖不足会被直接暴露”这条机制成立且可复现,但 其影响幅度取决于题库里这类软题的占比——题库越”软”,F115 的 judge 代价 越大,已经从 n=15 的 +0.12 优势翻成 n=20 的 −0.10 劣势。对外表述必须从 “双优方案”改为”忠实度-质量的显式权衡”:F115 用 0.10 分 judge 换 0.25 忠实度, F11 用 0.23 分换 0.29,没有免费午餐;选哪个取决于场景对”读起来完整”和 “说的都有根据”哪个更看重。
e20 移除决定(2026-07-29,用户裁定):电影票房题(e20)在 F11 上两次
独立重试都复现同一失败(draft 阶段撞 60 轮硬顶),且是当批唯一让 F115 犯
真错误(而非诚实空白)的题目——榜单混入进口片、第10名张冠李戴。用户判定
从题库移除,归档到 results/mimo_smoke_archive/e20_*(不删除,留痕可查),
questions_ext.json 同步删除该条。移除后四臂统一为 n=19(不再有 F11
单独 n 不一致的问题)。重新聚合确认核心结论不依赖 e20 这一题:
B 8.01/0.44、F102 7.71/0.54(Δ−0.30/+0.10)、F11 7.81/0.69(Δ−0.20/+0.25)、
F115 7.95/0.66(Δ−0.06/+0.22)——去掉最差的一题后,F115 的 judge 差距从
−0.10 收窄到 −0.06,但三个方案仍然全部低于裸 agent,证明”题库变软后
双优不再成立”是由 e17/e18/e19(低代码/AI教育/市政机制改革,而非 e20)
驱动的系统性效应,不是靠一道问题题目撑起来的伪结论。
反向验证:专挑”硬”题(2026-07-29)——用户要求找”不太软”的题目反证:黄金 走势技术分析(#4)、非接触式感知算法基准对比(#16)、Anthropic Streamable HTTP 工程实现(#20)、珠宝设计趋势(#38)、正畸医美市场比重(#49),均为纯 数据调研/技术对比类,避开”如何设计方案”式会议性问题。补跑后 n=24: B 7.85/0.42、F102 7.59/0.54(Δ−0.26/+0.12)、F11 7.59/0.68(Δ−0.26/+0.26)、 F115 7.77/0.66(Δ−0.08/+0.24)。judge 差距没有收窄(F115 −0.06→−0.08, F11 −0.20→−0.26)——证明”质量代价”不是软题的专属产物,硬题上同样发生; B 自身 judge 也从 8.01 掉到 7.85,说明这批新题对所有 arm 都更难,不是只 针对诚实类机制的选择性惩罚。
副产物,尺子局限记录:e22(非接触感知算法)B/F102 的引用天然走学术论文
格式(Author/Venue/Year,无 URL)——fact-v2 靠抓页核验,遇到无 URL 引用
直接判 0 对(total_pairs=0,e22_B/e22_F102 均如此),该题这两个 arm 完全
未被核验采样。F11/F115 因预引用机制结构性禁止编 URL,同一道题反而逼出
5-18 对可核验网页引用。这不是 bug,是尺子对”引用形式非 URL”题目的已知
盲区——已在 dashboard 与 README 加注,后续若要覆盖更多学术型题目,
fact-v2 需要扩展支持论文引用核验(如接 Semantic Scholar/OpenAlex API),
现阶段先如实标注局限。
~/.claude/settings.json env 覆盖进程环境变量 → arm 里改网关须 --settings{pattern:allow,"*":deny} = 工具整体不可见;外部目录须放行
external_directoryweb_search="disabled";
无头模式沙箱提权必败