近日,中国电信人工智能研究院(TeleAI)发布了“复杂推理大模型”TeleAI-t1-preview。该模型使用强化学习训练方法,大幅提升了在数学推导、逻辑推理等复杂问题上的准确性。

在数学基准评测中,TeleAI-t1-preview表现出色。它在AIME 2024和MATH500两项评测中分别获得了60和93.8的高分,超越了OpenAI的o1-preview和GPT-4o等标杆模型。在研究生级别问答测试GPQA Diamond中,TeleAI-t1-preview的得分也超过了GPT-4o,并与Claude 3.5 Sonnet的性能水准相当。
TeleAI-t1-preview不仅能够给出正确答案,还能展示出思考和分析过程。这对于学生学习数学和理解问题背后的逻辑非常有帮助。例如,在面对三角函数的复杂等式关系时,TeleAI-t1-preview能够通过多次假设尝试和思路纠偏,将复杂等式转化为简化的方程式,并给出正确的推导过程。
在回答问题时,TeleAI-t1-preview还能够将形象思维与抽象思维结合,对所涉及的场景进行具象化思考,辅助理解题目。同时,它还能够严谨地进行古今单位换算,顺利解决古代数学问题。
此外,TeleAI-t1-preview在策略推理问题上也表现出色。它能够迅速理解游戏规则并完成破题,在解题过程中还能考虑到可能出现的特殊情况。

为了训练TeleAI-t1-preview,TeleAI引入了创新的训练策略。在数据准备阶段,收集和构建了一个以数学为核心、多学科为补充的高质量推理数据集。在Judge Model评估阶段,专门训练了一个评估模型,用于分析和评估模型长思考链路的正确性。在SFT监督微调阶段,使用MCTS构造高质量长推理数据,并结合准确率和解决方案长度选择最优路径。在强化学习阶段,构造了基于规则的奖励模型,以提供准确的奖励信号。
总的来说,TeleAI-t1-preview的发布是人工智能领域的一项重要成果。它在复杂推理问题上的出色表现,将为人们提供更智能、更高效的服务。TeleAI将继续在推理模型领域研究探索,让人工智能基于人类的“已知”,推导出期盼得到的“未知”。



