Access Denied (103) 微软研究提出TRAAC:让推理模型按题目难度自适应控制思考长度 - 模型社区 - 闲社 - Powered by Discuz! Archiver

333222111s 发表于 6 天前

微软研究提出TRAAC:让推理模型按题目难度自适应控制思考长度

事件概述

微软研究团队在2026年10月2日的研究归档中介绍TRAAC(Think Right with Adaptive, Attentive Compression),一种在线后训练强化学习方法,用于缓解推理模型的“思考不足”与“思考过度”。

对象与开发者

方法:TRAAC;开发者:Microsoft Research团队;官方归档日期:2026年10月2日;论文计划发表于2026 COLM。

关键能力


[*]方法利用模型对长推理轨迹的自注意力识别重要步骤并裁剪冗余步骤,同时估计题目难度。
[*]训练奖励会纳入难度信号,使模型针对不同难度分配相称的推理预算。
[*]在微软研究页面报告的实验中,以Qwen3-4B为基础的TRAAC在AIME、AMC、GPQA-D和BBEH等任务上,相比基础模型平均绝对准确率提升8.4%,推理长度相对减少36.8%;相比最佳强化学习基线,准确率提升7.9%,长度减少29.4%。


适用对象

需要控制推理成本和响应时延的模型训练团队,以及研究测试时计算、长链路推理和强化学习后训练的开发者。

实际影响与限制

TRAAC提供了一条同时改善准确率与推理效率的训练思路,并在非数学的GPQA-D、BBEH和OptimalThinkingBench上展示了迁移效果;但当前结果来自特定基础模型、数据集与基线,不能直接推断到所有模型或生产任务。自适应压缩仍需结合任务难度估计与质量评测,关键场景应保留人工验证。

官方来源

Microsoft Research:Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression
页: [1]
查看完整版本: 微软研究提出TRAAC:让推理模型按题目难度自适应控制思考长度