零点看书

字: 大 中 小
关灯 护眼
零点看书 > 我的学习群里全是真大佬 > 第398章 好多老钱

第398章 好多老钱

第398章 好多老钱 (第2/2页)

而且海报厅都有记者在,因为有资本圈的大佬也在逛着这些展区。
  
  而企业展区,各家的展台一个赛一个的气派大屏幕上滚着sota(当前最佳性能)级别的demo,穿文化衫的员工见人就递宣传册。
  
  李东跟着水木的队伍听了一上午的报告。
  
  不得不说,有几场是真让他开了眼界。
  
  头一场主旨报告,是gpt那边的一位研究负责人讲的他们这两年悄悄押下重注的一条新路。
  
  过去几年,圈子里卷的都是pre-training(预训练)的规模。
  
  而他们换了打法,把算力杠杆翘到了inference(推理)端。
  
  简单的说就是给模型引入system2的慢思考机制,让它在吐出答案前先在隐空间里穷举推理树。
  
  这样一步一步生成思维链(cot),走入死胡同就触发回溯机制,直到把逻辑闭环彻底打通再输出结果。
  
  而这种深层推理的泛化能力,根本没法靠人力标注去微调,完全是靠rl(强化学习)结合自博弈硬生生刷出来的。
  
  专门挑选数学证明和代码生成这类具备明确客观真值(groundtruth)的任务,模型推导对了就给高维奖励信号,错了就切断反向传播。
  
  成千上万轮的ppo策略迭代下来,模型自己就涌现出了极为恐怖的试错与纠偏本能。
  
  台上直接甩出了一张test-timecompute(测试时算力)的对数曲线。
  
  同一套基座权重只要允许模型在推理阶段多消耗十倍的token进行内部演算,hard级别任务的准确率直接顺着曲线呈现指数级爬升。
  
  报告还没讲完,台下已经是一片低低的议论声。
  
  李东坐在水木的队伍中间,心里微微一动。
  
  数学,恰恰就是这世上提供最优验证奖励反馈的终极数据集。
  
  第二场的oral是来自普林斯顿和卡内基梅隆的一支联合团队,讲的是一种颠覆性的非transformer底层架构。
  
  他们拿状态空间模型做线性递归,时间复杂度从平方砍到线性,百万token一口气吞下去,显存都不怎麽涨。
  
  台下搞理论的当场就杠上了,两边谁也说服不了谁。
  
  至於最後一场,gemini那边一位研究员讲的是世界模型。
  
  他们不喂文本,直接喂视频,逼模型自己学会物理。
  
  练到最後,给模型一张图就能凭空生出一个三维世界。
  
  一上午听下来,李东心里大致也有了数
  
  国外这几家卡在scalinglaw最前沿的巨头,早就跳出了单纯堆积参数量和清洗语料的低效内卷区,一个个全在底层范式上变道。
  
  比的不再是谁的万卡集群规模更大,而是谁先在架构和推理机制上完成破局。
  
  这些学术直觉,确实敏锐到了极点。
  
  反观国内,多数厂家还在旧的红海路线里跟进。
  
  猛灌通用指令微调,卷参数规模,刷榜单的分数,卷b端落地商业化。
  
  报告也多半集中在分布式训练的通信优化或者显存切分等工程trick上。
  
  不过……
  
  当然也是不是全,也有一些国内团队搞出了一些不一样的东西。
  
  有两篇做长序列高效kvcache稀疏化的,还有一篇用大模型反向生成高质量合成数据做自我蒸馏的,思路一样惊艳,台下举手要论文源码的人一样很多。
  
  更有意思的是开源基座这条路。
  
  国外顶尖名校的博士生们如今跑消融实验,底层模型十有八九加载的都是华夏的开源权重,调用便宜,对齐做得好,魔改接口还很开放。
  
  这一条生态护城河上,反倒是国内走在了前列。
  
  ……
  
  
『加入书签,方便阅读』
热门推荐
逆剑狂神 近战狂兵 御鬼者传奇 风流杀神 英雄无敌之恶魔降临 近身兵王 神级插班生 都市绝品狂尊 娱乐帝国系统 大明流匪