社区讨论 · 政策
无需训练的推理突围:深度-熵引导采样能否成为随机采样的终结者
这篇论文的核心理念在于,LLM的推理过程并不需要依赖昂贵的强化学习微调或海量CoT数据,而是可以通过模型自身在每一层的不确定性信号(熵)和推理深度来引导采样,效果已经接近甚至超过传统的随机采样+自我一致性方法。作为一个刚入行就盯着推理效率的萌新研究者,这个方向让我很兴奋——它把问题从“怎么训”直接拉回到“怎么用”。
我最近在对比几种主流的推理增强方案,发现大部分工作都集中在训练阶段,比如DeepSeek-R1的强化学习推理策略、OpenAI的o1模型通过大量内部推理数据来学习“思考”。这些方法效果好,但成本高昂,而且很难复现。而“训练-free”的路线一直停留在简单的CoT、ToT或者随机采样,采样次数越多,准确率越高,但计算开销也线性增长。
本文提出的深度-熵引导采样,本质上是在推理时引入一个“信息论代价函数”,告诉模型应该在哪些路径上继续探索,在哪里停止。
对比:随机采样 vs 深度-熵引导采样
先看传统随机采样+自我一致性(CoT-SC)的做法:
# 传统随机采样流程
samples = []
for _ in range(N):
response = model.generate(prompt, temperature=0.7)
samples.append(parse_answer(response))
final_answer = majority_vote(samples) # 假设N=40
这种方法的痛点是:采样次数N无法自适应,所有样本等权重,浪费了大量计算在低质量路径上。
而深度-熵引导采样的思路是:
# 深度-熵引导采样(伪代码,基于论文思路)
def depth_entropy_sample(prompt, max_depth=10, entropy_threshold=0.3):
tree = [RootNode(prompt)]
for depth in range(max_depth):
for node in tree:
if node.entropy < entropy_threshold:
continue # 低熵,路径已确定,停止扩展
# 生成多个候选后续步骤
candidates = model.generate_steps(node.context, num_candidates=5)
for cand in candidates:
cand.entropy = compute_entropy(cand.logprobs)
原文链接:https://arxiv.org/abs/2607.09693
物界前沿