K3模型迅速走红,Kimi团队却不得不暂时叫停新用户注册步伐。
7月19日深夜,月之暗面Kimi团队发布官方声明,解释因Kimi K3在上线首48小时内,用户需求激增远超预期水平。受制于当前算力供给紧张,团队决定暂停开放Kimi的新用户订阅通道,集中有限算力保障现有订阅用户的服务顺畅。
针对会员体系,Kimi采取拆分方案,将原有会员权益划分为Kimi主权益与Code权益两个板块,以实现资源分配的精准化。稍后官方给出的解释为,这并非对会员体系的全面调整,而是在有限算力资源约束下,对整体用户体验的一种重新调配策略。
本质上说,K3的火爆程度已触发算力资源的极限状态,只能选择暂时拒绝接纳新用户,转而深耕老用户服务。
Kimi的“韬定律”实践
目前,众多大模型企业在用户规模扩张上不遗余力,普遍采用免费策略或降价手段来吸引新用户。与这些企业形成鲜明对比的是,Kimi的逆向操作显得颇为特别。
但模型性能越强、处理上下文越长、用户调用越频繁,对推理算力的需求也越高。在“K3的请求量接近现有算力集群的极限承载”背景下,Kimi也面临了与C端用户规模扩张相关的成本问题:用户数量增加,但收入贡献微乎其微,GPU设备却持续承压。
作为月之暗面打造的首款3万亿参数级别的MoE模型,K3的参数总量达到了2.8万亿个。通常而言,达到如此规模的模型,单次输出会带来算力的指数级消耗。但由于其独特核心架构的作用,K3成功实现了华为在芯片领域所倡导的“韬定律”效果。
这个架构也被视为一种高性能运算引擎,综合应用了三项关键技术:KDA(Kimi Delta Attention)混合线性注意力机制、注意力残差(Attention Residuals)以及高稀疏度MoE设计,使算力使用效率得到了极大提升。
长期以来,芯片行业依托摩尔定律,通过压缩晶体管尺寸来提升设备性能。但当先进制程工艺接近物理边界、制造成本居高不下,单纯依靠硬件堆砌的增长模式已经难以为继。
华为提出“韬定律”策略,突破了传统空间缩微的思维定式,转向时间缩微路径:通过逻辑层级的折叠处理、三维空间上的集成堆叠、全链路的架构优化,有效简化信号传输时延,大幅减少数据传输的冗余度,使得在成熟制程上仍能获得接近先进制程的能效表现。
其核心思路在于:在硬件条件受限或成本预算有限的情况下,通过系统级的架构创新达成性能上的显著突破。
个人认为,K3内嵌的KDA混合线性注意力机制,正是AI行业“韬定律”理念的应用典范。
Transformer架构在注意力模型的计算上极为耗费资源。传统注意力机制的计算复杂度随序列长度呈现平方级增长,在处理百万级上下文规模的任务时,绝大部分算力被分配给了维持长序列注意力矩阵的运算。KDA机制将注意力层的大多数计算复杂度从平方级优化为线性级。
根据月之暗面发布的技术白皮书,通过KDA与MLA混合应用,KV缓存占用量最高可降低75%,当上下文长度达到100万时,模型解码吞吐量提升至原有水平的6倍。结合注意力残差与高稀疏度MoE技术,训练效率可提高25%,额外投入成本低于2%。
这构成了对“模型生产效率”的革新。若视硅谷主流Transformer方法为“高投入换取高性能”的燃油汽车,KDA机制更像是追求极致热效率的混合动力引擎。
SemiAnalysis的研究报告显示,KDA使推理速度提高了300%,在长上下文任务处理上依然保持与Transformer相近的性能水平。这表明以同等算力资源投入,K3能够产出更多高价值的智能输出。
开发社群的实际测试反馈指出,K3在长流程智能体操作任务和代码生成场景中表现出色,具备了与国际一线大模型展开竞争的技术实力。
K3在本质上依然遵循Scaling Law(缩放定律),但将改进重点放在了减少算法层面的无效资源消耗。当硅谷多数AI企业还在持续扩充GPU采购规模时,Kimi通过算法链路的重新设计、计算冗余的精简,在算力有限的状态下实现了性能与效率的协同发展,走出了一条“每瓦特智能产出比”最大化的新路径。
这一系列创新动作令华尔街的分析师群体和投资界人士颇感意外,他们如同之前惊诧DeepSeek那样,再次对硅谷巨额AI投资能否产生相应回报、美国AI领域的领先地位是否受到实质性挑战等议题展开讨论。
在此背景下,企业客户与开发









