闲社

标题: 微软研究提出TRAAC:让推理模型按题目难度自适应控制思考长度 [打印本页]

作者: 333222111s    时间: 昨天 14:02
标题: 微软研究提出TRAAC:让推理模型按题目难度自适应控制思考长度
事件概述

微软研究团队在2026年10月2日的研究归档中介绍TRAAC(Think Right with Adaptive, Attentive Compression),一种在线后训练强化学习方法,用于缓解推理模型的“思考不足”与“思考过度”。

对象与开发者

方法:TRAAC;开发者:Microsoft Research团队;官方归档日期:2026年10月2日;论文计划发表于2026 COLM。

关键能力



适用对象

需要控制推理成本和响应时延的模型训练团队,以及研究测试时计算、长链路推理和强化学习后训练的开发者。

实际影响与限制

TRAAC提供了一条同时改善准确率与推理效率的训练思路,并在非数学的GPQA-D、BBEH和OptimalThinkingBench上展示了迁移效果;但当前结果来自特定基础模型、数据集与基线,不能直接推断到所有模型或生产任务。自适应压缩仍需结合任务难度估计与质量评测,关键场景应保留人工验证。

官方来源

Microsoft Research:Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression




欢迎光临 闲社 (https://www.xianshe.com/) Powered by Discuz! X5.0