洱海新闻

黄仁勋为何力挺梁文锋、杨植麟?

来源:洱海新闻 分类:科技
黄仁勋为何力挺梁文锋、杨植麟?

重塑大模型,争夺定价主导权。

信息来源:腾讯科技

执笔:李彪

编校:苏扬

7月27日晚些时候,Kimi K3的全部权重被上传到了Hugging Face平台。

十天之前Kimi K3面世时,中文社区的关注大多聚焦在跑分与“开源赶超闭源”的议题上——其头部基准接近了GPT-5.6 Sol和Claude Fable 5。但在技术从业者眼中,架构设计比跑分更为关键:把注意力机制替换为KDA混合线性方案,将残差连接调整为注意力残差形式,选用按模块调节的Muon优化器。

深度学习领域沿用十年的核心组件,在单个模型内部都得到了彻底革新。

3月17日,杨植麟在GTC大会上展出的《How We Scaled Kimi K2.5》演讲中持续四十分钟,期间他未曾提及任何关于芯片管制的议题。杨植麟阐述,对核心组件的调整源自于高质量数据的稀缺性构成了的“数据壁垒”。

他补充说明:“token效率不只是关乎效率,它同时在拓展智能的高度。”这种表述可以理解为:当数据资源达到瓶颈,模型从每个token中追加的学习成效,将直接决定智能水平还能提升多少。

算力的限制将中国企业限制在特定范围内,而数据壁垒则横亘在所有参与者面前。个人认为,这两个观点并不矛盾,数据壁垒决定了这条道路迟早会被涉足,而算力壁垒则左右着谁率先踏上、以及进展的速度。回顾过去四年,MLA、DSA、KDA,再加上将MoE极致稀疏化的技术路径,这些在时间线上高度密集的架构创新,几乎完全生长于算力壁垒所形成的环境之中。

此处插入一条课程推广信息:

报名「黑马 AI 时代资本战略精品课」,8月14日至16日,卫哲、朱啸虎、吴世春、冯卫东等资本界顶尖人物将现场授课,结合FA专业指导和黑马投资联盟资源支持,细致指导用户优化融资计划书、提升商业路演水平,精准传递企业资本核心价值,有效对接多家顶级投资集团。

享有早鸟报名优惠,诚邀符合条件的创始人同台探讨报名事宜。

扫码详询及报名

(页面底部可见详情)

01

束缚

自2022年10月起,美国将高性能AI芯片纳入对华出口管制名单。A100、H100、H20,这些细节无需赘述。

反过来看,算力壁垒或许能够阻挡芯片、设备、内存条入境,却无法阻止模型架构设计的创新传播。毕竟,注意力机制、优化算法、参数布局都不必申报海关。并且,算力壁垒越是高大,墙内拆解Transformer的力度就越大。

这一切始于推理阶段显存的使用情况。

推理中的显存消耗主要包含两个部分:一是分布式的模型权重,无论哪位使用者,都必须进行加载。二是独立记录的会话信息,Transformer每生成一个token,都需要回溯所有上下文信息,从中提取关联部分。为避免信息重复计算,传统方式下每个token、每一层级的Key与Value向量需要持续保存。这种保存机制即KV缓存,相当于会话中的记录本:上下文每推进一个环节,记事本就要添新页;并发会话越多,就需要额外准备一套完整记录。

以Llama 3.1-70B为例,单token大约占320KB。假设上下文长度为128K,一个会话将需要40GB显存;若上下文达到100万token,则需320GB。而英伟达的旗舰产品Rubin单卡显存仅288GB,即便是配备顶级显存的百万token会话,一张卡也难以承载全部。

与此形成对比的是,大模型在解码时采取逐字生成策略:每输出一个新token,就必须将权重和记事本完整复制到显存中。因此,记事本的复制也是一大难题,这需要高带宽内存的支持。

所以,对于按token收费的业务模式来说,收入上限受制于显存的两个关键指标:容量及带宽。

02

参数的双重管理

被算力限制所困的中国公司,首先着眼于训练与推理共用的算力资源:既然无法全部聘请专家同时工作,便让特定参数的专家轮流服务,这也促使MoE混合专家模型的产生。

MoE将庞大的网络拆分成许多子模块。每个token进入后,路由器只在其中挑选部分模块运作。DeepSeek是这条道路上的主要实践者,Kimi则进一步拓宽了这一方向。

2024年末,当时的DeepSeek V

相关推荐