洱海新闻

Kimi K3开放权重:技术报告能否回应Claude蒸馏质疑?

来源:洱海新闻 分类:科技
Kimi K3开放权重:技术报告能否回应Claude蒸馏质疑?

7月27日晚上,Kimi K3的开放日活动照常举办。月之暗面公布了Kimi K3模型的权重和技术报告,并且将三项关键的基础设施开源出来:MoonEP用以支持超大规模MoE通信,FlashKDA用于线性注意力机制,以及AgentEnv服务于长周期智能体强化学习。

过了一天,公众对于K3的讨论逐渐转向了更深层次的问题:这些开源的内容是否能够解释K3突然增强的能力?又能否帮助它洗清被指抄袭Claude的疑虑?

说到底,K3这次的开放属于权重的开放,并不是完全意义上的开源。但是,它拥有2.8万亿的总参数和大约1042亿的激活参数,就算是在开放权重模型中,它也是规模最大、能力最接近闭源旗舰的一个。

这份技术报告的发布时机非常恰当。Anthropic公司以及一些美国官员指责月之暗面大规模获取了Claude的输出,并将其能力用于Kimi模型的训练。中国商务部对此回应称,美方有关蒸馏和窃取知识产权的指控没有实际证据和法律依据,也不应该以此为由对中国AI企业进行调查和制裁。

争议的焦点并不是K3训练过程中是否使用了蒸馏技术,因为蒸馏本身就是大模型行业普遍采用的训练方法。真正的问题在于,K3是否以工业级别的方式蒸馏了Claude最新模型的大量数据。

现在,月之暗面首次比较系统地展示了K3的技术全貌:一个更大的混合专家模型,重新设计过的注意力和残差结构,百万Token的智能体强化学习,以及九个涵盖通用任务、智能体和编程任务的专业策略。

图片源自AI生成

K3为何这般迅速变强

Kimi K3采用了混合专家架构,总参数达到了2.8万亿。模型内部共有896个路由专家,每个Token会选择其中的16个,同时还调用两个共享专家,因此实际激活的参数大约是1042亿。

相比之下,Kimi K2的总参数为1.04万亿,激活参数为326亿。K3不仅将模型的总容量扩大了近2.7倍,单次计算调用的参数也增加了两倍以上。

规模的增加是解释K3能力提升的最直接因素,但月之暗面给出的答案不仅仅是继续增加参数数量。

K3以3比1的比例组合了Kimi Delta Attention和Gated MLA。简单来说,前者可以用相对较低的缓存成本来处理长上下文信息,而后者则定期执行全局信息交互,以此来平衡效率和能力。这种混合结构帮助K3将原生的上下文窗口扩展到了大约100万Token。

Attention Residuals解决了深层模型中的信息稀释问题。传统模型通常是逐层传递信息的,而K3则可以选择性地调用之前网络区块的表示,让早期的重要信息能更直接地影响后续计算。

Stable LatentMoE进一步扩大了专家空间,但每次计算只让少数专家参与进来。这样既能增加模型的知识容量,又不必让全部2.8万亿参数同时运行。月之暗面表示,K3相比K2实现了约2.5倍的整体扩展效率提升。

一位业内专家表示,这些技术并没有完全消除复杂性,而是将一部分复杂性转移到了更底层的AI基础设施上。更多的专家意味着跨卡调度的难度增加,KDA虽然减轻了长上下文的缓存压力,但引入了新的递归状态,Attention Residuals则增加了跨层信息保存和传递的难度,实际上使得AI基础设施层的压力更大。

因此,月之暗面也同步开放了MoonEP和FlashKDA。MoonEP用于平衡超大规模MoE中的专家负载,FlashKDA则帮助KDA在GPU上更高效地运行。这意味着K3的效率不仅体现在模型权重中,还很大程度依赖于Kernel、通信、缓存和集群调度的协同工作。

权重开放之后,这套系统已经开始接受外部的工程验证。例如,昇腾在7月28日宣布对K3进行了0day适配,涵盖了训练、推理、显存优化和MXFP4等数值格式。vLLM、SGLang和TokenSpeed也已经提供了运行支持。

不过,开放仅一天,大多数社区成员还处于调试阶段,尚未能够独立复现它的全部能力。

相关推荐