黑洞信息悖论推进至“定量完备性模量”:清华团队开源VeriLoop E2迈向可验证智能

随着前沿模型进入长链推理、工具调用、代码修复与科研任务,一个关键缺口随之显现:模型不断生成和修改候选,但“新状态是否真的更可靠”不能只由模型自己判断。

如果将“是否构成有效进展”的裁决权全部交给模型,代码补丁可能破坏回归测试,数学候选可能依赖未闭合前提,物理推导也可能越界外推。

针对这一结构性缺口,VeriLoop E2从“候选如何成为可持续状态”这一关键问题切入,把“探索权”和“提交权”拆开:模型负责提出和改路,外部证据负责决定什么可以留下。

该项目由清华大学深圳国际研究生院刘厚德教授和周超男董事长联合指导,王立博博士后担任团队实验室AI研究员,李海启、向安麟两位人工智能方向硕士研究生作为AI研究助理与核心研发成员参与研发。

VeriLoop E2:可验证任务能力、评测与部署

根据王立博提出的循证收敛递归(VeriLoop-Governed Recurrence,VGR),模型继续负责候选生成、路线探索、诊断与修订,但不拥有对自身结果的最终确认权;每个候选必须先外显为可检查制品,再由预先固定的外部验证合同依据受保护证据坐标进行裁决。只有当所有受保护项均不退化、且至少一项取得严格改善时,该候选才被提交并写入后续状态链,否则系统保留原有已验证状态并将失败证据反馈至下一轮递归。

同一套证据语义被用于组织后训练监督,使训练目标从“生成看似合理的答案”转向“提高产生可验证、可提交候选状态的概率”,从而把模型能力提升与外部证据约束统一到同一套状态演化机制中。

同时,VeriLoop Harness负责任务上下文装配、工具调用、验证器调度、状态持久化、失败回滚与证据绑定;VeriLoop E2则负责候选生成、问题重构、路线选择和验证失败后的策略调整。截至目前,系统已完成9项覆盖代码Agent、终端智能体、数学与科学推理的公开Benchmark评测。

九项评测覆盖仓库级软件工程、真实终端、长程代码修复、竞赛数学与高难度科学问答,形成对同一系统在不同可验证任务上的交叉检验。

△

Benchmark总览:9项代码Agent、终端、数学与科学推理评测

团队同步发布BF16至IQ1_M的官方GGUF量化版本,并以canonical BF16 GGUF为冻结参照测量PPL、KL divergence等保真指标。量化漂移不应直接解释为下游Benchmark分数等比例下降。

VGR:受保护证据约束下的状态提交与后训练

VGR的核心不是“让模型多想几步”,而是规定什么样的新状态有资格替换当前已经认证的状态。验证器对当前状态与候选状态分别返回由多个受保护义务组成的证据秩向量;候选只有在所有受保护项均不退化、且至少一项严格改善时才能提交,否则完整保留原状态。

其中,rt=(rt,1,…,rt,d)表示第t次递归迭代的受保护证据秩向量,r′t表示当前候选更新对应的证据秩向量;t为迭代索引,d为受保护证据维度总数,i和j为维度索引,rt,i与r′t,i分别表示更新前后第i维的证据秩;≻P表示严格Pareto支配关系。候选更新仅当全部受保护证据维度均不下降,且至少一个维度严格提升时,才满足严格Pareto改进条件。

因此,“总分更好”并不足以覆盖局部回归。例如当前证据秩为(0,1,1)时,候选(0,0,1)可以提交;候选(1,0,0)虽然总和更小,却必须拒绝,因为已经闭合的第一项义务发生了回归。这条规则保护的是已经通过的测试、已经闭合的引理和已经满足的物理约束,使不同义务之间不能互相抵消。

△

模型拥有探索权,外部证据拥有提交权

△

为什么“总错误更少”仍然可能被拒绝

VGR也被用于组织后训练监督:同一incumbent下,真实外部验证通过的严格进展候选作为正样本,无进展、局部回归或不可提交候选作为负样本;模型学习的是“更容易提出可提交候选”,而运行时最终裁决权仍在固定的外部验证合同。中间进展与最终完成也严格分开,只有证据秩归零并通过提交判定的制品才承担“任务完成”的监督语义。

在任务合同固定有效、证据秩为非负整数且验证流程正常执行的前提下,这一机制直接给出两项性质:已提交的受保护证据不回归;每次严格提交都至少降低一个证据坐标,因此严格提交次数有限。但它并不保证模型一定能找到解,也不能替代验证器本身的健全性。

黑洞信息问题:保留结论、证据链与边界

黑洞信息方向是一次VeriLoop E2与VeriLoop Harness协同完成的科研推理Demo。范围被严格收缩到未来零无穷I⁺上的自由spin-2渐近引力辐射重建:E2负责提出问题抽象、候选算子与证明路线,Harness负责解析推导、数值对照、可执行证书、回滚和Scope Guard;它不宣称解决完整黑洞信息悖论。

事件视界、能层、光子球等并非本次证据链直接证明的对象;真正进入验证的是“给定可访问观测代数,哪些自由度仍不可区分,以及这些不可区分性如何被结构化”。

核心结果可由下图概括:从固定粒子数N的螺旋度扇区连通性,推进到Fock空间的跨粒子数连接与红外记忆扇区;再把“完备/不完备”的二元判断提升为由相干传递Laplacian第二特征值控制的定量模量。在两模Stokes/su(2)归约下得到λ₂(L)=2λ²,且对任意N不发生粒子数退化;有限μ>0与严格μ→0被明确区分为不同的红外极限次序。

△

渐近引力子层析的三层结构:固定N、Fock空间与红外记忆扇区

△

扇区连通性:信息完备什么时候等价于“图连通”

△

定量完备性:第二特征值如何同时控制连通性与鲁棒性

下图汇总了冻结包中的6组可执行证书,当前6/6PASS;这表示内部证据链可重放,并不等同于外部同行评审已经完成。相互作用黑洞动力学、Hawking蒸发幺正性以及完整“初态→出射态”信息映射仍在本次证明范围之外。

△

黑洞信息方向Demo的证据闭环:6组可执行证书

Voder:把内部循证闭环工程化

当前VeriLoop Harness已作为Benchmark与科研Demo的底层执行和证据治理工具使用,面向开发者的编程智能体Voder已进入研发计划。后续重点是把任务合同、真实执行、外部Verifier、COMMIT/REJECT、回滚和可复现证据进一步标准化,并支持不同模型作为可替换proposer接入。

整套系统最终坚持同一条原则:模型拥有探索权,证据拥有提交权。模型可以扩大候选空间、延长推理链并更大胆地试错,但任何结果在进入“已知”之前,都要通过模型之外、事先固定且可重放的验证门。

模型负责把未知打开,证据负责决定什么可以留下。

标准权重版本:https://huggingface.co/tsinghua-sigs-robot-lab/VeriLoop-E2
GGUF量化版:https://huggingface.co/tsinghua-sigs-robot-lab/VeriLoop-E2-GGUF
技术报告:https://openreview.net/forum?id=P6FIQILHwX¬eId=P6FIQILHwX
评测证据:https://huggingface.co/datasets/tsinghua-sigs-robot-lab/VeriLoop-E2-Evaluation-Evidence
黑洞信息研究证据:https://github.com/brucewang123456789/GeniusTrail/tree/VeriLoop-E2/black%20hole%20information%20paradox

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

— 完 —

【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。

🎓 

我们会 (尽量) 及时回复你 :)

🌟 点亮星标 🌟

科技前沿进展每日见