×

小红书Hi Lab团队提出可大幅降低平均思考长度的强化学习训练方式四川一考生考了462分,却被清华北大争相录取,身份曝光令人惊讶

hqy hqy 发表于2025-07-03 14:50:53 浏览1 评论0百度已收录

抢沙发发表评论

新榜讯 6月19日,小红书技术团队发布消息,其深度思考模型借助Test - Time Scaling(测试时扩展)显著提升了模型推理能力,不过也产生了大量冗余和无效思考情况。小红书Hi Lab团队为此提出Think When You Need的强化学习训练方式,在不影响最终效果的情况下,实现了动态CoT能力,让平均思考长度大幅降低。实验表明,这一理念在推理及非推理等各类任务中具有广泛适用性。此外,团队还有一项重要发现,在相同任务下,参数量大、更为“聪明”的模型所需的思考长度更短,该现象与当前深度思考模型的表现相悖,却高度契合人类认知。