0开源依赖 任度大模型双网络架构实现数推分离
创始人
2024-11-14 21:01:18
0

IT时报记者 孙妍

在大模型技术发展浪潮中,Scaling Law(尺度定律)曾是业界遵循的重要法则。然而,知名科技媒体《The Information》报道称 OpenAI 下一代旗舰模型Orion训练效果或远不及预期,与 GPT-4 相比,Orion 性能提升也许微乎其微。这引发了业界对大模型技术发展路径的深度思考:Scaling Law是不是大模型的唯一方向?

基于Scaling Law的大模型落地面临重大瓶颈。一方面,大模型成本高昂且技术同质化严重。同时,如何让大模型有效学习客户数据并成为客户业务领域专家,是一个挑战。若将数据提供给大模型服务商进行训练,数据安全难以保障;若企业自行训练,不仅算力和人才成本高,而且微调模式还可能削弱大模型通用能力。另一方面,采用基于向量检索的模式难以保障输出结果的准确性。

11月14日,CSDN全球机器学习技术大会上,传神语联网网络科技股份有限公司董事长何恩培先生发表了《基于双网络架构数推分离大模型的探索与实践》主题演讲,并提出:大模型正在从Scaling Law时代进入“实时学习”时代,回答大模型沿着什么样的技术路径能满足客户应用落地、为技术探索开辟新的思路,引发了与会专家们的热烈讨论。

双网络架构实现数推分离 走出技术沙漠

在Scaling Law指引下,大模型厂商为提升模型能力,不断扩大预训练数据、训练算力并扩大模型参数规模。但其背后争议在于资源需求庞大,如GPT-4已使用约2万多张显卡,未来模型算力需求可能达数十万甚至上百万张显卡,引发对资源消耗的担忧,也带来过高的探索成本。

面对技术路线问题,何恩培认为,Scaling Law曾在过去为人工智能发展立下汗马功劳,但单纯依赖它进行集中式暴力训练已显露诸多弊端。大模型追求的是“聪明”,在实际场景中发挥作用,而非参数越来越大。因此,集中式预训练模式值得重新审视,实时学习和训练模式更具探索价值。

实际上,在大模型的三要素中,算法占主导地位,它决定训练数据规模和训练算力消耗,算法的同质化必然导致数据规模和训练算力的同质化,最终造成输出能力的趋同。

因此大模型在相同参数下,如果模型的算法和架构更先进,则需要的训练算力越小,训练数据也越少,且不影响模型的能力,甚至在部分指标上可以超越常规架构大参数的模型。相比之下这种采用高效算法和架构的小参数模型更适合商业落地,而且也可以满足通用场景的需求。

传神的任度大模型走了一条算法突破之路,以双网络架构实现数推分离,将推理网络与数据学习网络分离,走出了技术沙漠。

企业数据学习网络如同人类左脑,专注于数据的动态管理与迭代训练,持续为模型注入知识养分;推理网络则如同人类右脑,作为经大量数据预训练的基础网络,具备不错的推理和泛化能力。双网络协同工作显著降低了训练算力成本,有效避免微调训练造成的基座模型能力退化和泛化能力减弱等问题。数据学习网络可以让数据不出域,在企业现场学习历史数据和业务运营中的新数据,解除了企业对数据安全的担忧。

何恩培将数据训练过程类比于人类的知识学习,任度采用了数推分离技术架构,在预训练阶段仅需要适量训练数据,正如人类通过阅读几百本书就能获得一定的智慧。

同时,数推分离的双网络架构突破了常规大模型技术架构限制,上下文输入长度不受限,可将1亿字数据压缩到神经网络中实现深度知识理解。任度大模型可以大大降低训练和推理的硬件投入成本,实现极为接近实时的数据学习效果,哪怕企业只有极少量数据更新,也能快速上传并完成数据压缩。

在数推分离模式下,更新数据的网络压缩对推理网络影响微乎其微,能广泛适应各种场景,灵活处理各类数据操作,训练时间可缩短至分钟级。

全栈根原创 实现0开源依赖

任度大模型的数推分离双网络架构,最大的意义在于,从底层算法框架到上层应用都是全技术栈自主研发的成果,未使用任何开源代码和框架。

“我们自主研发了机器学习算法框架和模型架构,这使得我们的任何想法和创新都可以不受限制地去实践,让任度大模型具备实时学习客户数据的能力。在国内外,能做到这一点的企业为数不多。”何恩培强调。

任度大模型目前拥有2.1B和9B两个版本,其中多模态9B参数版本在全球评测中,已跻身全球大模型行业第一梯队。在多项国内外评测中,任度9B模型与百亿千亿参数大模型的对比中脱颖而出,以更少参数实现领先性能。同时,2.1B参数版本在2024年9月的MMLU评估中,综合评分超越了Gemma-7B、LLaMA2-34B等知名大模型,性参比更是超越了包括GPT-4o、Phi-3、Qwen2-7B、Llama3.1等国际顶尖大模型,以小参数实现了与百亿、千亿级别模型相媲美的性能。

任度大模型在训练与推理过程中的算力成本显著降低,仅为同等大型模型的1/5—1/10以及1/2—1/4。在所有评测中,性能参比(大模型能力分数/大模型参数)几乎全部处在前列,大部分是第一。

“双脑”大模型一体机 一小时成为专属业务专家

目前,双网络架构的数推分离大模型已应用在任度“双脑”大模型一体机中,即将投放市场,解决大模型落地痛点。

何恩培表示,数推分离的双脑模式,解决了企业数据离场训练、向量效果有限以及人才投入高等难题,实现本地实时学习,一小时就能成为专属业务专家。企业数据在本地训练,无需上传至公有云,保障了数据隐私安全。根原创和高性参比,解决了企业在应用大模型中的高硬件投入、高能耗以及技术安全和软件漏洞等顾虑。

预训练之后的模型如何实现少量数据实时学习和训练模式,是全球大模型领域都在苦苦探索的课题。任度大模型独辟蹊径,何恩培坦言:“我们侥幸走通了这条路。我们没有从主流大模型发展遇到的问题中寻找突破机会,而是从公司诞生起就走在这条路上,走了20多年,也曾感到孤独和不自信,但看到大家都向这个方向走来,才确信自己走的没错,直到我们大模型评测进入第一梯队,才知道我们的技术路线也不差。”

相关内容

热门资讯

建设老年智慧教育的上海范本——... 为引领老年人乐享数字化转型新生活,共享数字赋能教育发展经验成果,“银发e起学 引领e风尚”2024年...
美的集团申请空调器控制方法专利... 金融界2024年11月14日消息,国家知识产权局信息显示,美的集团股份有限公司申请一项名为“空调器的...
6G进展如何?离我们还有多远?... 6G通信技术的发展是当今全球瞩目的焦点之一。我国的6G技术进展到什么程度?它离我们普通人还有多远?在...
空客CEO:SpaceX不会通... 来源:环球市场播报 航空航天集团空中客车CEO纪尧姆·傅里周四表示,马斯克旗下的火箭转卫星项目Sp...
中国银行携手科创伙伴亮相第26... 央广网深圳11月14日消息(记者 荣冀晴)11月14日,以“科技引领发展 产业融合聚变”为主题的第二...
余杭塘栖三中2024年科技节科... 潮新闻客户端 通讯员 叶玉婷 文/摄 近日,杭州市余杭区塘栖镇第三中学成功举办了以 “点亮科学梦想,...
一文读懂美国关键和新兴技术战略 通信世界网消息(CWW)人工智能、量子信息等关键和新兴技术(简称“CETs”)已成为大国竞争的最前沿...
什么是装配式建筑4.0?中建海... 随着科技的飞速发展和环保意识的提升,建筑业正经历一场深刻的变革。装配式建筑4.0作为一种新型的建筑工...
小米,走入「高端化」的陷阱 当小米SU7开始以迅雷不及掩耳之势杀入到造车的赛道上,我们看到的是,雷军带领着小米走出了一条与其他的...
自主设计!支架式“无人机机场”... 极目新闻记者 高伟 通讯员 黄林 刘聪 “目前,公司‘机巡替代’示范区已部署22套无人机机场。”11...
民营经济“小”与“大”|专精特... 新华社天津11月14日电(记者郭方达)伴随着规律的电机运转声,一台数米长的“大家伙”缓缓走下产线,驶...
江南新材IPO:拥抱产业机遇 ... 本报记者 曹琦 在新技术革命与产业变革浪潮的强力推动下,新一代信息技术、高端装备制造、新能源汽车等战...
天融信与华为达成深度战略合作 北京商报讯 11月14日,网络安全行业领军企业天融信与华为签署合作备忘录,双方将携手在Harmony...
26兆瓦风力发电机成功整体充退... 记者从华中科技大学获悉,日前,该校国家脉冲强磁场科学中心李亮教授团队与合作者成功完成了18~22兆瓦...
全球车载显示屏 1/4是厦门造 文/本报记者 林露虹 通讯员 管轩 雷飏 图/本报记者 张奇辉 说起车载显示屏,许多市民不陌生。但鲜...
创意无限 长沙市岳麓区阳明小学... 湖南日报11月14日讯(全媒体记者 杨斯涵)科学点亮梦想,科技智造未来。11月14日,长沙市岳麓区阳...
第十五届中国航展新亮点:第二展... 【ITBEAR】广东珠海近日迎来了盛大的航空盛宴,第十五届中国航展在此隆重开幕。与往届不同的是,本届...
成都发布人工智能三大榜单,推出... 11月12日,2024人工智能产业CEO大会暨人工智能赋能新型工业化供需对接活动在成都举行。会上重磅...
小米15Ultra长这样 在上个月,小米正式发布了小米15系列,凭借着优秀的手感和不错的性能释放,在刚刚结束的“双十一”购物活...
宿州市信顺塑胶取得电工套管弯曲... 金融界2024年11月14日消息,国家知识产权局信息显示,宿州市信顺塑胶有限公司取得一项名为“一种电...