模拟退火研究矩阵 · 技术复盘
对象:五篇经济学博士级论文 + 系统总论的全自动生产过程(2026-07-03 至 2026-07-04)。 视角:架构实效、故障模式、token 经济学、自主度边界。撰写者为循环的设计模型(Fable 5),基于全程执行记录与 2,380 条 API 请求的完整审计数据。 立场声明:本复盘对失效与存疑处如实记录,不为框架辩护——诚实边界纪律同样适用于对框架自身的评估。
0. 十条核心结论(TL;DR) #
- 端到端走通了:五篇 3.8–4.4 万字成品论文 + 1.2 万字总论,全部通过确定性验证器的终验(五篇 S7 + 矩阵 M5 + 22 探针自检),全程约 17.7 小时(活跃约 11–12 小时),209 个智能体实例,输出 365 万 token。
- 对抗退火是系统的价值中枢:四篇的骨架攻击共产出 53+ 个 findings(含 18 个 critical),全部三轮内收敛 clean——其收敛方式不是「修辞妥协」而是诚实降级(把不可识别的声称显式降为理论/案例/待预注册假说)。这是成品质量与体系诚实性的直接生产机制。
- 零编造纪律在系数与事实层全程保持,但在书目元数据层被击穿:五篇实证层无一处编造的回归系数/p 值/样本量,且主动产出四起对种子叙事的口径纠偏(丹麦 20%≠25%、FRS17 是所有权份额、皇家邮政 50% 是效率比、SEC 规则被司法撤销后主动下调识别标签)。然而完成后的 Fable 终检经外部核验发现:P2 的 Works Cited 有 3 处作者归属错置——成品化 Polisher 在证据台账只登记了题名/URL 的地方自行补写了作者名。事实主张本身无误,但这是真编造,只是发生在纪律谓词未覆盖的字段。教训:纪律的实际边界=其谓词的覆盖面,「零编造」必须显式枚举到书目元数据(作者/期刊/卷期),否则模型会在无约束字段上补全。已由终检批次修复(见 §4-8)。
- 确定性验证器是唯一不可腐化的角色:gate.mjs 全程零改动迁就(22 探针自检始终通过),所有失败都在数据侧修复。这条纪律是整个信任链的地板。
- 最大的效率损耗是「格式方言」:约 9–10 起 gate 谓词词表与工作者自由发挥的不匹配(字段名/绑定格式/括注年份/图表行首),估算耗费了 5–8% 的输出 token 于返工。根治方案明确:把 gate 谓词逐字内嵌进派发提示(schema-in-dispatch)。
- 缓存是这套架构的经济前提:输入面 4.69 亿 token 中 94.3% 是缓存读。若无前缀缓存,此架构在经济上不成立。
- 发散层的去重校准是未闭合的缺口:novelty_yield 几乎恒为 1.0(全程仅杀 3 个重复),无法区分「透镜正交设计成功」与「去重员过宽」——因为从未给去重员种植过已知重复(plant 校准只做了评审层,没做去重层)。
- 自主度的真实边界:执行自主≈完全(最长连续无人干预约 7 小时),但目标与体裁自主≈零——中场 r4 转向(成品化+MLA)由用户一句「语言上有点不够论文」触发,框架自身无法检测「交付物体裁错了」。
- 人工闸的合规通道是「常设授权」:用户原话作为审计签名批量签核,而非逐件复核。这是全自动运行的必要妥协,其风险(品味漂移无人纠偏)已在信任边界声明中披露,并确实由用户的两次中场介入弥补。
- 对社科/商科的泛化判断:框架的可移植内核是「认识论诚实的机器化执行」(声称与证据的对齐纪律),域特定的只是评分标尺。移植成本主要在为新领域重写「死板模式清单」与「证据等级标尺」,而非重建循环。
1. 最终状态与总账 #
1.1 交付物 #
| 层 | 内容 | 规模 |
|---|---|---|
| 成品层 | 5 篇论文 thesis.md + 总论 overview.md | 204,830 CJK 字(42916/43987/37837/41087/38988/12032) |
| 体例 | MLA 文内括注(含年份)×54–82/篇,Works Cited 15–23 条/篇,行首编号图表 ≥3/篇 | 全部通过 THESIS 谓词 |
| 审计层 | state/ 全档:方向池 39+31+36+33+39 候选、25 论点簇、25 观点档案、13 轮骨架攻击 + 5 轮终验攻击 + 1 轮矩阵攻击、全部 disposition 与 sha 绑定 scorecard | 可全程复验 |
| 验证 | 五篇 S0–S7 全绿 + S4F 冻结 + THESIS + M5 矩阵终验 + selfcheck 22 探针 | 目录重组后复跑仍全绿 |
1.2 资源总账(全历史,2,380 请求去重后) #
| 指标 | 数值 | 说明 |
|---|---|---|
| 时间跨度 | 07-03 10:38 → 07-04 04:20 (UTC) | 约 17.7h;扣除 20:00–03:00 的空窗,活跃约 11–12h |
| 输出 token | 3.65M(Opus 3.25M + Fable 0.40M) | 真实生成量,成本主项 |
| 输入面 | 468.6M(未缓存 3.83M + 缓存写 22.83M + 缓存读 441.94M) | 94.3% 为缓存读 |
| 智能体 | 209 个实例(含主循环) | 侦察/评审/攻击/修订/撰稿/成品化/核验 |
| 主循环占比 | 输出 1.17M(32%),624 请求 | 派发提示+检查点+格式修复 |
| 生产性子代理 | 输出 2.48M(68%),1,756 请求 | 单体最大:P2 撰稿人 113k、四篇 Polisher 各 53–67k |
| 单篇均摊 | ≈73 万输出 token/篇 | 含设计、治理、矩阵层与返工的全摊 |
产出/投入的直观比:每 1 万字成品正文约消耗 17.8 万输出 token——其中约 3–4 万是撰稿与转写本身,其余为发散、对抗、治理与返工。这个约 4–5 倍的「治理乘数」就是本框架与「单次直写」的本质区别,也是质量的来源(见 §3.3)。
1.3 时间线形态 #
每小时输出曲线呈三段:设计期(10:38–13:00,Fable,方案+红队+试跑)、执行爬坡期(13:00–17:00,P1 全流水线+P2 前段,每小时 13–24 万)、并行冲刺期(17:00–20:00,四篇并行 S1–S7,每小时 66–73 万,是设计吞吐上限的体现),随后用户额度耗尽停机 7 小时,次日 03:00–04:20 完成矩阵收口。额度耗尽发生在矩阵收口中段——这暴露了预算计量缺失的问题(见 §7 改进 8)。
2. 被执行验证的架构形态 #
设计文档在 docs/design/,此处只记录实战中真正承重的形态:
高温发散(S1) ── 盲/明侦察×15透镜 → 去重 → 双出口降温(枯竭|富矿≥30×3轮)
↓ 终评 Judge(plant 校准 + sha 绑定 + 判断密度门槛)
聚类(S2) ── 簇=可反驳判断而非主题标签 → 簇级评审(再校准)
↓
攻击退火(S3) ── fresh-context 红队 → 逐条处置(fixed|诚实降级|归位) → 复验 → 至 clean
↓ 人工定调闸(常设授权签名)
建模设计(S4) ── 观点档案(识别策略+预注册可证伪门槛+steelman×2) → 巡检 → FROZEN-S4 接力锁
↓ 慢建模界桩(DESIGN-GATE-PASS 之后才许 DATA-EXEC)
诚实实证(S5) ── 聚合事实 WebSearch 核验[verified] / 微观识别显式降级 / 零编造
↓
成稿(S6 draft 工作稿) → 终验(S7: 集成攻击+终评+人工闸) → 成品化(Polisher→MLA thesis→humanizer)
↓
矩阵层(M5) ── 双向溯源 + 复推验证 + 跨篇查重 + 口径冲突 + 总论
三条被证明不可省略的工程原则:
- 角色分离:指挥者不写内容、工作者不自评、评审者永远 fresh-context。全程唯一一次「角色越界」的诱惑(conductor 代改 judge 的 sha 笔误)被拒绝,改由评分者本人重算重绑——审计链归属评分者。
- 磁盘为真:append-only 日志 + 内容锁(FROZEN sha)+ 可重跑的 gate,使多次上下文压缩与一次会话崩溃全部无损恢复。会话是易失的,磁盘态才是系统。
- 验证器不妥协:所有 gate 失败(约 15 起)无一例外在数据侧修复。一旦开「改 gate 迁就数据」的先例,整个 22 探针自检的意义即崩塌。
3. 机制逐项实效判定 #
3.1 温度化发散 + 盲/明混编 —— 判定:有效,但校准不完备 #
15 个透镜产出 178 个候选方向(39+31+36+33+39),跨透镜内核重复极少。发散质量的直接证据是终稿的开创性判断密度——「覆盖率改善之日正是福利被抽走之时」「荷兰没爆是幸存者偏差」「缴存冷是理性回应」这类反直觉判断全部产自 S1 层,而非撰稿阶段的修辞。盲/明混编有效防住了种子锚定(种子大纲的「收益追逐 vs ALM」框架被 P1 论证为伪二分——发散层敢于击败在位基线)。
存疑处:全程 13 轮去重仅判出 3 个重复(novelty_yield 恒 1.0)。两种解释无法区分:透镜正交设计确实成功,或去重员系统性过宽。因为去重层从未做 plant 校准(没有种植已知重复去测试去重员的杀伤力),这是与评审层待遇不对等的校准缺口。
3.2 评审 + plant 校准 + sha 绑定 —— 判定:校准有效,判分压缩存疑 #
全程 20+ 个种植死板样本被 100% 击杀(含终稿级的「编造系数伪装因果」与「脚手架泄漏」种植),证明评审始终保持了对死板模式的辨别力,未发生「评审瞌睡」。sha 绑定抓到 2 起真实的绑定失效(1 起转录笔误、1 起格式归一后过期),冻结锁抓到 1 起「冻结后又改动」(brief 字段重排后 sha 漂移)——这些机制不是仪式,全部实际拦截过。
存疑处:真候选的判分聚集在 0.72–0.92,几乎全 keep(P5 甚至 39/39 keep)。漏斗收窄发生在 top-K 挑选而非 kill——这在「未发表≠平庸」的反保守条款下是设计意图,但意味着对「平庸而不死板」的中间地带缺乏杀伤力测试:种植的都是明显靶子,从未种植过「及格但无判断力」的样本。判分压缩的另一面是排序信息不足,簇间优先级实际靠 judge 的 top-K 叙述而非分数本身。
3.3 攻击退火(S3+S7)—— 判定:系统的价值中枢,最值得保留的机制 #
数字:P2 骨架攻击 10f(2 crit)+F11 追加、P3 15f(6 crit)、P4 17f(7 crit)、P5 11f+2 系统性(3 crit);四篇全部在 3 轮内收敛 clean,回火预算 0 动用。S7 终稿集成攻击又抓 15f(多为工作稿标记类),矩阵攻击再抓 1 起总论拔高。全程 69+ findings,逐条处置、逐条复验闭合,无一 open。
收敛的质量特征是关键:攻击逼出的不是措辞让步,而是结构性的诚实化——
- P3 的「估值平滑共谋」:共谋意图不可证伪 → 降为待预注册假说,只保留已识别的需求侧价值与纠错速度梯度;
- P4 的「荷丹对照」:幸存者偏差是对称刀,同时斩断「制度优越」与「制度不优越」两个方向 → headline 收敛为「未爆不能推断优越」,N=1 降 illustrative case;
- P4 的「压力测试测错自变量」:攻击指出「更极端≠更大 bp」是分析性命题被越级当因果 → 承认公理地位,因果版降待检;
- P5 的「退出端真空」:全称本体论 → 收窄为结构性错位+软约束的可检验版本,顺带纠正一处 PAYG 事实错误;
- 矩阵层:总论把 P3 已因 SEC 规则被司法撤销而下调的腿仍写成「已识别」 → 强制对齐分篇的撤回状态。
这组实例说明:对抗退火在本框架中承担的不是「找茬」而是「把判断的声称收敛到其证据能承重的位置」。成品的可辩护性直接来自这里。若只保留框架的一个机制,保留这个。
3.4 FROZEN 接力与并行 —— 判定:有效,一个教训 #
FROZEN-S4 接力锁使 P5 能消费上游冻结档案而无需等待上游 S7,四篇并行冲刺期的吞吐(每小时 66–73 万 token)是接力设计的直接收益。教训:冻结必须发生在工件的最终形态之后——P3/P4 的 brief 在冻结后又做字段重排,导致 sha 漂移、二次冻结。正确顺序是「内容定稿→格式合闸→再冻结」。
3.5 诚实实证协议(S5)—— 判定:T-1 的最硬证据,成立 #
五篇的实证执行员在「铁律:不编造任何系数/p 值/样本量」约束下,交出了 76 条 [verified] 聚合事实(全部附来源 URL、经 WebSearch 独立核验)+ 80+ 处显式降级标注。更重要的是四起主动纠偏(见 §0 第 3 条)——执行员在核验中发现种子/上游叙事的数字口径错误并纠正,而非顺从上游。这证明「诚实」不是被动合规而是主动行为。矩阵 fact-table 最终沉淀 22 行跨篇对账事实,跨篇口径冲突 0。
代价的诚实说明:五篇的实证层是「识别设计+制度事实」完成度,不是「已估计的计量结果」完成度。微观面板不可得处全部停在设计层。「可发布态」指体例、逻辑与诚实边界的完备,投稿顶刊仍需真实数据执行——这一边界在每篇的局限节和总论中均已声明。
3.6 两层工件(draft/thesis)—— 判定:必要性被 S7 攻击反向证明 #
r4 引入的「工作稿(带审计标记)→成品稿(MLA 转写)」分层,最初是为解决用户反馈的「语言不够论文」。实战中它的第二功能更重要:S7 集成攻击在四篇抓到的 major 里,约六成是 [服务判断:]/C1..C5/页脚自述这类工作稿审计标记——它们在 draft 里是 gate 强制的对账要求,在 thesis 里是必须剥离的脚手架。分层使「审计可溯」与「成品干净」不再互斥;disposition 里这类 findings 以 refuted-with-evidence(工作稿标记非成品缺陷)合法闭合。若无分层,这是一个无解的矛盾。
3.7 矩阵层(M5)—— 判定:非摆设,抓到过真问题 #
双向溯源(P5 十个推导块引用的每个上游编号必须真实存在)、复推验证(前提忠实/支撑/不断章三判定 10/10)、跨篇查重(25 簇 0 重复,且给出「内生性是元签名作用于不同对象」的非重复论证)、口径冲突 0。矩阵攻击抓到的总论拔高(C-1)是矩阵层存在价值的直接证明:分篇各自诚实不保证系统层诚实,总论有独立的拔高动机(想把系统卖得更强)。
3.8 人工闸=常设授权 —— 判定:全自动的必要通道,含真实风险 #
用户授权原话(「一直跑到所有论文都彻底写完成为可发布状态」)作为 S3/S7/M 闸的审计签名批量签核。收益:11 小时无人值守成为可能。风险(已披露):定调闸原本设计为人类品味的注入点,批量签核使品味纠偏依赖用户的主动中场介入——实际发生了两次(「语言不够论文」触发 r4、「并行提速」触发 B 包),都证明关键的品味信号仍来自人类。这不是框架缺陷,是自主度的真实边界(见 §6)。
4. 故障模式目录 #
| # | 故障类 | 次数 | 症状与根因 | 已验证的缓解 | 根治方向 |
|---|---|---|---|---|---|
| 1 | 派发损坏 | ~7 | 子代理收到与任务无关的乱码语境(返回「技能选择/总结」类输出,0 工具调用);疑似 harness 侧提示装配竞争 | 强化任务性质前置声明(「这是X任务,不是技能选择、不涉及$skill」)后重派,全部成功 | 派发后回声校验(要求代理先复述任务类型再动工) |
| 2 | 格式方言 | ~9–10 | gate 谓词的机器词表(候选/明·盲/证据链/服务判断: P#-#/行首表N/括注含年份/```json 处置块)与工作者的自由词汇不匹配 |
全部数据侧修复(重排/归一/补块),gate 零改动 | schema-in-dispatch:把谓词逐字嵌入派发提示(后期派发已这样做,P5 的 S4 档案因此一次通过) |
| 3 | sha 绑定失效 | 2 | 评分者手工转录 64 位 sha 漏一字符;池格式归一后 sha 过期 | 由评分者本人重算重绑(SendMessage 续会话),conductor 不代改锚点 | 评分者用工具算 sha 直接写入,禁手工转录 |
| 4 | 冻结后漂移 | 2 | brief 冻结后又做字段重排 → FROZEN sha 失配 | 重排后重冻,gate 的失配报警本身即防线 | 冻结排在格式合闸之后(流程顺序修正) |
| 5 | harness 约束 | 3 | 某时段子代理被禁写报告文件;zsh 不分词无引号变量;[test]&&尾迭代断 && 链 |
攻击者 inline 返回+conductor 逐字转录(独立性由分离上下文保全);${=var};node 脚本替代 shell 循环 |
关键落盘走 node,不依赖 shell 方言 |
| 6 | 会话易失 | 压缩×N+崩溃×1 | 上下文窗口耗尽/用户侧崩溃 | 磁盘态设计使恢复全程无损(日志+FROZEN+可重跑 gate) | 已是设计内韧性,无需改 |
| 7 | 额度耗尽 | 1 | 矩阵收口中段用户订阅窗口耗尽,收口被打断 | 用户恢复后续跑完成 | 预算计量+阶段成本预报(§7-8) |
| 8 | 书目元数据编造 | 3 条目(P2)+ 同族孤引若干 | Polisher 在台账只有题名/URL 处自行补写作者名(Ni & Yin / Anantharaman & Chuk / Bikker & Vlaar 均为错置);gate 只验括注数量与格式,不验归属真伪 | 完成后 Fable 终检逐条外部核验抓获;修复原则「宁可无名(题名先行式 MLA),绝不编名」,五篇全表实名核验 | 台账登记来源时强制抓取作者字段;Polisher 禁填台账没有的字段(§7-11) |
| 9 | 终检残留(体例/标签层) | 35 处(P1:9/P2:7/P3:6/P4:5/P5:8) | 其中实质内容错 2(P3 数量级 10×、P3 引注主体错配)、口径精度 2(P5 跨期点差、P1 £65bn 日/总额)、余为「已识别」标签过度、巡检语态换皮、指针/编号失配、书目卫生——S7 闸保住了结构与诚实内核,保不住编辑精度 | 完成后新鲜眼终检批次(5 评审+5 修复代理)全部处置 | 把「外部视角编辑终检」固化为常设 S8 阶段(§7-12) |
总体:没有一类故障造成内容损失或质量妥协;全部代价表现为返工 token(估算 5–8% 输出)与时钟延迟。故障目录里最有普适价值的教训是 #2 与 #3——机器可判定的验证器要求派发端把「机器词表」当作接口契约来传递,而不是指望智能体猜中。
5. Token 经济学 #
5.1 钱花在哪了(输出 3.65M 的结构估算) #
| 用途 | 估算占比 | 依据 |
|---|---|---|
| 成稿与转写(S6 Writer + Polisher + humanizer 校验) | ~30% | 五篇 Writer 55–113k + Polisher 53–67k + humanizer 检查各 ~10k |
| 发散与评审(侦察×15 透镜 + 去重 + 各级 Judge) | ~20% | 侦察单体 4–6k×~30、Judge 单体 8–15k×~15 |
| 对抗治理(S3/S7/矩阵攻击 + 修订 + 复验 + 巡检) | ~25% | 攻击单体 7–29k×13 轮 + 修订 9–12k + 复验 |
| 指挥开销(派发提示/检查点/闸门运行/格式修复协调) | ~32%→其中约一半与上述重叠计入 | 主循环 1.17M |
| 实证核验(S5 WebSearch 核验×5) | ~8% | 单体 11–15k×5 |
| 返工(格式方言/损坏重派/集成修复) | ~5–8% | 重排代理 29–33k×2 + 括注修复 + 重派 |
粗划:约三成生产、约五成保真(发散+评审+对抗+核验)、约两成协调与摩擦。「保真≈生产的 1.7 倍」就是这套框架的定价结构——它买到的东西在 §3.3/§3.5 列出(69+ findings 闭合、零编造、四起主动纠偏)。
5.2 缓存依赖 #
输入面 468.6M 中缓存读 441.9M(94.3%)。这意味着同一套长系统提示与项目上下文被 2,380 次请求反复复用。若无前缀缓存,输入成本将是现值的 ~17 倍,架构在经济上直接不成立。 推论:此类多智能体循环的派发设计应最大化前缀稳定性(固定模板+尾部变量),这在本项目是无意达成的(模板化派发),未来应作为显式设计约束。
5.3 效率判词 #
以「每万字成品正文 17.8 万输出 token」计,本框架比单次直写贵约 4–5 倍。这笔溢价的对价是:53+ 骨架级 findings 的修复(其中 18 critical——单次直写的成品会原样带着这些结构性缺陷)、零编造纪律、全程可审计。对判断密集、声称需要可辩护性的研究交付,溢价合理;对格式化报告类任务,不必用此框架。 另一个真实约束是订阅窗口:全程输出 3.65M 已触到单窗口上限(用户中途耗尽一次),任何更大的矩阵需要跨窗口的断点续跑设计——本框架的磁盘态韧性恰好已满足,这是意外的架构红利。
6. 自主度评估:能否泛化到社科/商科 #
6.1 自主度的三个前提(本项目的实际成立条件) #
- 常设授权:用户预先把人工闸签名权授予执行者(原话作审计签名)。没有它,每个定调闸都是停点。
- 确定性验证器:gate.mjs 提供不依赖模型判断的硬地板(字段存在性、sha 一致性、计数下限、禁词、处置闭合)。模型评审可以被说服,正则不会。
- 品味外化:taste-ledger 把用户的研究品味压缩成 5 条可携带条款(判断优先/慢建模/逻辑为核/学位体例/MLA+humanizer),每个评审与攻击者都被要求回显。这使「品味」从会话记忆变成机读契约。
三者齐备时,实测自主度:连续 7 小时无人干预推进 4 篇并行;11–12 小时活跃期内用户仅介入 4 次(2 次品味转向、1 次停机、1 次续跑指令)。
6.2 可直接移植的组件(域无关) #
- 对抗退火闭环(攻击→逐条处置→复验至 clean)与「诚实降级」处置语法;
- plant 校准(向评审者盲注已知劣样本测试其杀伤力);
- sha 绑定评分 + 内容冻结 + append-only 日志的审计三件套;
- 两层工件(带审计标记的工作稿 / 剥离脚手架的成品稿);
- 双出口降温(枯竭/富矿)与盲明混编防锚定;
- 矩阵层的跨件溯源/查重/口径对账。
这些机制没有一个依赖经济学内容——它们执行的是声称与证据的对齐纪律,这在任何以论证为产品的领域(社科、商科、法学、政策分析)同构。
6.3 需要域适配的部件(移植成本所在) #
| 部件 | 本项目(经济学) | 社科质性 | 商科案例/战略 |
|---|---|---|---|
| 死板模式清单 | 系数复读/数据先行/先进经验赞歌/内生性无视 | 理论套壳/访谈引语堆砌/反身性缺位 | 框架填空(波特五力式)/成功学叙事/幸存者案例 |
| 证据等级标尺 | 识别策略(IV/DiD/RDD)+预注册 | 三角验证/饱和度/成员核验 | 案例内/跨案例复制逻辑/机密数据可得性诚实 |
| 「诚实降级」的落点 | 降理论命题/待预注册假说 | 降解释性描述/待田野 | 降假设性框架/待访谈或数据室 |
| 实证核验方式 | WebSearch 核验制度事实 | 文献与档案核验 | 财报/行业数据库核验 |
移植工作量估计:为新领域重写死板清单、评分 rubric、S5 核验协议与 gate 的字段谓词,约为一次 r-级方法论迭代的量(本项目 r3/r4 各约半天)。循环本体(S0–S7 状态机、攻击闭环、冻结接力、M 层)无需重写。
6.4 自主度边界的诚实划定 #
框架做不到的三件事,全部由本项目的实际事件证明:
- 体裁自检:P1 完稿时逻辑层全绿,但「读起来不像论文」(无摘要/引注/参考文献)——这个缺陷 gate 看不见(当时无此谓词)、评审看不见(评的是判断力)、只有用户一眼看见。自动化系统会满足它被给定的合同,合同本身的缺口只有人能发现。
- 品味漂移纠偏:常设授权模式下,若五篇逐渐滑向某种一致但偏离用户品味的风格,循环内无角色能报警。本项目靠篇幅短(17 小时)与用户抽查规避,长周期项目需要设计「品味回归采样」(定期把中间产物摘要推给人类)。
- 目标级决策:并行度提升、成品化转向、收口节奏,全部是用户决策。框架的自主是执行自主(给定合同后无人跑完),不是目标自主。
结论:在社科/商科场景,这套框架可以把「从选题方向池到可辩护成稿」的执行段完全自主化,人类的不可替代位置收敛为三点——立合同(spec+品味)、中场体裁抽查、收口验收。这恰好也是学术导师对博士生的角色结构,说明该分工不是权宜而是稳态。
7. 改进清单(按预期收益排序) #
- schema-in-dispatch:每个产出结构化工件的派发,逐字内嵌 gate 谓词(字段名/正则示例/反例)。预期消灭 §4-2 全类故障(本项目最大单项返工源)。后期派发已试点(P5 S4 档案一次过闸),验证有效。
- 评分者工具化 sha:scorecard 的 target_sha256 由评分者执行 shasum 后直接粘贴命令输出,禁止手工转录;gate 增加「sha 行必须与命令输出块相邻」的形式核验。
- 去重层 plant 校准:向去重员盲注已知语义重复对,测其杀伤力;novelty_yield 恒 1.0 时自动触发一次校准轮。补齐 §3.1 缺口。
- 中间地带种植:评审 plant 除「明显死板」外增加「及格但无判断力」档,测试判分压缩区间的辨别力(§3.2)。
- 派发回声协议:子代理动工前先一句话复述任务类型与产出路径,conductor 核对后放行——以一次极小往返消灭派发损坏类全损(§4-1)。
- 指挥开销压缩:派发模板抽成文件引用(「读 prompts/X.md 执行,参数如下」),预期把主循环 32% 输出占比压到 ~20%;同时提升前缀缓存命中。
- 品味回归采样:每 N 个闸门自动生成一页「品味快照」(当前判断风格样本)推送人类,把 §6.4-2 的漂移风险从「靠用户主动抽查」变为「系统主动送检」。
- 预算计量与阶段预报:conductor 维护 token 消耗台账(本复盘的审计脚本可直接复用为运行时组件),在每阶段启动前预报剩余预算能否覆盖,接近上限时自动前置最高价值工序(本项目额度耗尽恰断在矩阵收口,若有预报可提前完成收口再做可选项)。
- 机械工序降配:登记/去重/格式归一类机械步骤改用轻量模型(本项目 208 个子代理几乎全程满配旗舰模型,机械步骤约占请求数三成,是明确的降配空间)。
- 攻击质量外部锚:定期抽取 1–2 个已 clean 的簇送独立第二红队(不同提示谱系)复攻,校准「clean 判定」本身——本项目攻击质量的证据全部是内部的(findings 的具体性),缺外部对照。
- 引注实名制:证据台账登记来源时强制抓取并核验作者/期刊/卷期字段;Polisher 的 MLA 条目只许转录台账字段,台账缺作者则用题名先行式条目——把「零编造」谓词显式扩展到书目元数据(对 §4-8 的根治)。
- 常设编辑终检(S8):S7 之后固化一轮「新鲜眼外部评审+修复」(本项目补做后净捕 35 处,其中 2 处实质错误)。gate 谓词只能验机器可判定项,编辑精度(数量级、指针一致、标签口径、语态)需要一轮无历史包袱的细读——成本约 15 万输出 token/五篇,占总消耗 4%,收益/成本比在全流程各环节中最高之列。
8. 总判词 #
有效性:成立。五篇成品的可辩护性有可追溯的生产机制(对抗退火+诚实降级+确定性验证),而非依赖单次生成的运气。53+ 骨架 findings 被逼出又被闭合的过程,就是「判断站得住」的工艺记录。
效率:中上,有明确改进面。4–5 倍治理乘数换取的质量在判断密集型交付中划算;返工 5–8% 与指挥开销 32% 是两个已知可压缩项,改进 1/5/6/9 落地后估算总消耗可降 25–35%。
自主度:执行段全自主已被 11 小时实测验证;目标段自主是伪命题——正确的产品形态不是「无人研究机器」,而是把导师-博士生分工机器化:人类保留合同权、体裁抽查权与验收权,其余交给循环。在此定义下,本框架对社科/商科的判断密集型长文交付已达到可复用状态,移植成本集中在死板清单与证据标尺的域适配,循环本体可直接搬运。
一句话:这套模拟退火框架的真正产品不是五篇论文,而是「诚实是可以被工程化强制的」这一验证——论文只是它的第一批输出。
复盘依据:state/ 全档、docs/runbook/ 执行契约、2,380 条请求的 token 审计(脚本见执行记录)、五篇 S7 + M5 全绿的复验状态。本文件由 Fable 5 撰写于矩阵完成后,作为 reviews/ 层的方法论附录。