第四百八十一章 参数不是一切(2/3)
“回应什么?等他的模型出来再说。”
……
消息是陆小雨从监控中心传来的。
她坐在监控台前,面前三块屏幕同时亮着,手指在键盘上飞快敲击,把加密情报一条一条解码。
Cerebras的收购协议、Neuralink的团队调动、X-Lab的新架构,全在她的屏幕上滚动。
她盯着那行“Cerebras”的logo。
那是一家做晶圆级芯片的公司,一块芯片比砧板还大,专门用来训练超大模型。
她想起李沫说过的话:
“参数堆到一定程度,算力需求是指数级增长的。堆参数不难,难的是让普通人用得起。”
她把情报打包,加密,发给陆远。
然后靠在椅背上,揉了揉眼睛,窗外的天还没亮。
第二天上午,智脑研究院会议室。
长桌两侧坐满了人,李沫站在投影幕前,面前是一杯凉透的咖啡,眼底有淡淡的青黑。
他昨晚没回去,熬了一夜,把Optimus-1泄露的架构图翻了个底朝天。
“果然,他们走的是稠密激活路线。1.2万亿参数,全部参与运算。”
李沫指着数据对比表,上面红蓝两条线,红线是Optimus-1,蓝线是智脑3.0。
红线在算力消耗那一栏猛地窜上去,像一根被拉直的弹簧,而蓝线平缓得像一条小河。
“单次推理的浮点运算量,是我们智脑3.0的37倍。”
会议室里安静了一瞬。
一个年轻工程师举起手,声音不大,但语气很急:
“李总,参数大了37倍,跑分肯定好看。媒体最喜欢看这种排行榜。跑分一出来,舆论又要被带偏。到时候咱们怎么说?说‘我们参数小但效率高’?媒体不听的。”
李沫冷笑,把另一组数据调出来。
那是功耗对比表,Optimus-1推理一次消耗的电量,换算成电费,旁边是一台家用空调开一整天的电费。
他把两个数字并排放在一起,红笔圈了一下。
“跑分?他用H100集群跑,一小时电费够一个家庭用一年。这种模型,生下来就是贵族,注定死在云端。普通人用不起,中小企业用不起,连大学实验室都用不起。除了发表论文、刷榜单,还有什么用?”
他把笔放下,看着那个年轻工程师,“我们不做贵族的玩具,我们做老百姓的工具。”
门被推开了。