百度文心大模型 4.0 爆料：万卡训练史上最大参数，最快下周见

日期：2023-10-10 来源：IT之家评论：0

标签： AI 科技创新

　　财联社爆料称百度的文心大模型4.0正在加紧训练，已经接近可发布状态。今天，IT之家也扒到了更多关于文心4.0的消息，涉及了底层架构、基础设施、训练数据集、成本等关键信息。

　　先说核心结论：

　　1、昨天的爆料基本属实。目前了解到，文心大模型4.0实际上已经在小流量测试。

　　2、文心4.0参数量大于所有已公开发布参数的LLM，也是国内首次使用万卡集群训练的大模型。

　　3、推理成本相比文心3.5增加很多，据传大概是8-10倍。（大模型真的很费钱）

　　接下来我们看看爆料的细节。

　　万卡集群训练的史上最大参数模型？

　　根据IT之家拿到的消息，文心大模型4.0的参数规模要大于目前所有公开发布参数的LLM，这意味着文心大模型4.0的参数规模预计能突破万亿级别。

　　单看这个参数量，很多人会觉得还好，毕竟根据目前揭秘的信息，GPT-4的参数量已经在1.8万亿左右。但爆料人进一步表示，文心大模型4.0仍然是一个单一模型，并没有采用GPT和很多其他大语言模型使用的混合专家模型（MoE）。

　　之前“天才黑客”乔治・霍兹就爆料，GPT-4之所以采用混合模型，是因为无法让模型的参数规模超过2200亿。OpenAI希望模型变得更好，但如果仅仅是训练时间更长，效果已经递减。

　　所以，如果百度能实现单一模型上的突破，模型能力是否也会有明显的提升，这个只能等真正发布之后来看了。

　　这么大参数量的模型，对算力要求注定不会小。现在的消息是，文心4.0是在万卡AI集群上训练出来的，应该也算上是国内首次使用万卡规模集群进行训练的大语言模型。

　　万卡集群什么概念，国内目前只有华为、阿里透露已建成万卡AI集群，但我们都没看到基于它推出的具体模型。

　　这说明，万卡集群就不容易建了，如果用起来发挥最大化作用则更难了。据分析正是因为飞桨的深度联合，才能基于万卡集群训练起如此规模的模型。

　　成本激增，已低调面向公众小流量测试

　　不仅训练成本在增加，文心4.0的推理成本也被爆比3.5增加很多，IT之家还没拿到具体每千token的推理成本，但据传大概是此前的8-10倍，这还是在高利用率（MFU）的情况下。如果利用率更低，估计成本还会继续增加。

　　最后，根据内部员工的说法，百度实际上已经开始秘密小流量测试文心大模型4.0，有小部分文心一言用户在使用的已经是最新的模型版本，最快下周就会官方公布。

　　不少人认为这个说法比较靠谱，也可以从最近技术社区上的一些爆料上看出一点端倪。说不定，你现在在文心一言上提问，用的就是文心大模型4.0了。不知道生成的结果是否能跟GPT-4一战。

　　IT之家再次强调，以上并非官方确认的信息，大家自行判断其准确性。

声明：凡开云电子链接来源注明为其他媒体来源的信息，均为转载自其他媒体，并不代表本网站赞同其观点，也不代表本网站对其真实性负责。您若对该文章内容有任何疑问或质疑，请立即与开云客户(www.www.wykobounce.com)联系，本网站将迅速给您回应并做处理。
电话：021-39553798-8007

更多> 相关开云电子链接

0条 相关评论

推荐图文

加州大学科学家发明了	深圳又一制造业总部基
水下机器人在渔业中的	哈工程水下机器人再夺
里程碑！荆州市首台机	超维科技精彩亮相电力

推荐开云电子链接

点击排行

• AI 换脸也有正能量：研究发现观看自己的换脸教	• 男子在 AI 女友怂恿下意图刺杀英国女王，被判入
• 金融监管部门提示：谨防“AI 换脸”等新型诈骗	• AI 大模型数据标注“民工”月入不过 5000 元，
• 机器人、数字火炬手、智能超表面、可见光交互、	• 聊天机器人能成为心理治疗师吗？
• 将进化压缩到闪电般速度：AI在26秒内设计出独特	• 日本首相将公布生成式AI监管规则，旨在打击虚假
• BBC 阻止 OpenAI 抓取数据，但对人工智能用于新	• Meta在Facebook和Instagram等平台推出AI聊天机

恰佩克奖	机器人高峰论坛	机气林	ITES深圳工业展	机器人研究院	API数据	库卡机器人
中国传动网	索比光伏网	数控机床市场网	国家标准化委员会