SuperCLUE:2024年中文大模型基准测评报告,端侧小模型表现惊艳
创始人
2025-02-04 19:21:22

自2022年11月30日ChatGPT发布以来,AI大模型在全球范围内掀起了有史以来规模最大的人工智能浪潮。国内外AI机构在过去2年有了实质性的突破。

具体可分为:准备期、跃进期、繁荣期和深化期。

总体趋势上,国内外第一梯队大模型在中文领域的通用能力差距正在扩大。2023年5月至今,国内外大模型能力持续发展。其中GPT系列模型为代表的海外最好模型经过了从GPT3.5、GPT4、GPT4-Turbo、GPT4o、o1的多个版本的迭代升级。

国内模型也经历了波澜壮阔的18个月的迭代周期,从2023年5月的30.12%的差距,缩小至2024年8月的1.29%。但随着o1的发布,差距再次拉大到15.05%。

代表性大模型基准表现趋势:

1、以DeepSeek-V3为代表的国产模型正极为接近GPT-4o-latest

在过去2年中,国产代表性模型持续迭代多个版本,DeepSeek-V3、Doubao-pro、GLM-4-Plus、Qwen2.5在中文任务上已经接近GPT-4o。其中DeepSeek-V3表现出色,在12月测评中有超过Claude3.5Sonnet的表现。

2、o1基于强化学习新范式的推理模型,突破80分拉大国内外顶尖模型差距

在12月SuperCLUE测评中,国内外主要头部大模型在SuperCLUE基准得分集中在60-70分。o1和o1-preview基于强化学习新范式的推理模型成为突破70分瓶颈的重要技术代表,尤其o1正式版突破了80分大关,展现出较大的领先优势。

相关内容

热门资讯

中国电信首个国产TPU集群一期... IT时报记者 郝俊慧 AI算力基础设施竞争正在换挡。 过去几年,大模型竞争围绕“算力规模”展开,谁拥...
喂料机供应商:产品类型与选型关... 在工业制造与物料处理领域,喂料机供应商所提供的设备类型与适配能力,往往直接影响生产线的连续性与配料精...
马斯克的“微信梦”迈出关键一步... (来源:X) 据X介绍, X Money不仅是社交媒体应用的内置数字钱包和支付渠道,底层配备一张虚拟...
荣耀:携手阿莱将电影工作流融入... 来源:环球网 【环球网科技综合报道】7月28日,荣耀在横店正式举办影像技术发布会,首度展示与全球电影...
150年来最强厄尔尼诺正在形成... 科学家表示,太平洋上持续增强的厄尔尼诺气候现象,有望成为150年来最强的一次。如果他们预测的可怕情况...