中国电信发布“复杂推理大模型”达竞赛级数学表现,评分超o1-preview

近日,中国电信人工智能研究院(TeleAI)发布了“复杂推理大模型”TeleAI-t1-preview。该模型使用强化学习训练方法,大幅提升了在数学推导、逻辑推理等复杂问题上的准确性。

在数学基准评测中,TeleAI-t1-preview表现出色。它在AIME 2024和MATH500两项评测中分别获得了60和93.8的高分,超越了OpenAI的o1-preview和GPT-4o等标杆模型。在研究生级别问答测试GPQA Diamond中,TeleAI-t1-preview的得分也超过了GPT-4o,并与Claude 3.5 Sonnet的性能水准相当。

TeleAI-t1-preview不仅能够给出正确答案,还能展示出思考和分析过程。这对于学生学习数学和理解问题背后的逻辑非常有帮助。例如,在面对三角函数的复杂等式关系时,TeleAI-t1-preview能够通过多次假设尝试和思路纠偏,将复杂等式转化为简化的方程式,并给出正确的推导过程。

在回答问题时,TeleAI-t1-preview还能够将形象思维与抽象思维结合,对所涉及的场景进行具象化思考,辅助理解题目。同时,它还能够严谨地进行古今单位换算,顺利解决古代数学问题。

此外,TeleAI-t1-preview在策略推理问题上也表现出色。它能够迅速理解游戏规则并完成破题,在解题过程中还能考虑到可能出现的特殊情况。

为了训练TeleAI-t1-preview,TeleAI引入了创新的训练策略。在数据准备阶段,收集和构建了一个以数学为核心、多学科为补充的高质量推理数据集。在Judge Model评估阶段,专门训练了一个评估模型,用于分析和评估模型长思考链路的正确性。在SFT监督微调阶段,使用MCTS构造高质量长推理数据,并结合准确率和解决方案长度选择最优路径。在强化学习阶段,构造了基于规则的奖励模型,以提供准确的奖励信号。

总的来说,TeleAI-t1-preview的发布是人工智能领域的一项重要成果。它在复杂推理问题上的出色表现,将为人们提供更智能、更高效的服务。TeleAI将继续在推理模型领域研究探索,让人工智能基于人类的“已知”,推导出期盼得到的“未知”。


微信扫描分享本文到朋友圈
扫码关注5G通信官方公众号,免费领取以下5G精品资料
  • 1、回复“YD5GAI”免费领取《中国移动:5G网络AI应用典型场景技术解决方案白皮书》
  • 2、回复“5G6G”免费领取《5G_6G毫米波测试技术白皮书-2022_03-21》
  • 3、回复“YD6G”免费领取《中国移动:6G至简无线接入网白皮书》
  • 4、回复“LTBPS”免费领取《《中国联通5G终端白皮书》》
  • 5、回复“ZGDX”免费领取《中国电信5GNTN技术白皮书》
  • 6、回复“TXSB”免费领取《通信设备安装工程施工工艺图解》
  • 7、回复“YDSL”免费领取《中国移动算力并网白皮书》
  • 8、回复“5GX3”免费领取《R1623501-g605G的系统架构1》
  • 本周热点本月热点

     

      最热通信招聘

      最新招聘信息

    最新技术文章

    最新论坛贴子