洱海新闻

没两辆劳斯莱斯幻影,别想部署开源大模型

来源:洱海新闻 分类:科技
没两辆劳斯莱斯幻影,别想部署开源大模型

自Kimi K3开源以来,“部署大模型”迅速成为网络热议的焦点。

全球性能排名第三,并且免费下载。这样的条件,谁能不心动的呢?

但根据网上流传的说法,若想独立完成K3的部署,设备费用大约需要3000万人民币。毕竟K3的总量达到2.8万亿参数,仅权重文件就占了1.4TB到1.5TB,实际显存需求更是超过2TB。

因此,Kimi官方建议,若要自行部署Kimi K3,至少需要一个包含64张加速卡的超节点。按当前主流B200型号计算,单卡价格约为40万人民币,64张显卡的总价就高达2560万。普通的居民楼根本无法承载这么重的设备,还得专门建造机房,再加上设备运作及配套液冷设备的电费。具体来说,假如你真下定决心要自行运行Kimi K3,前期投入相当于买了两辆劳斯莱斯幻影。

即便你神通广大,真的设法备齐所有设备,想要亲手部署Kimi K3也绝非易事。背后还有电费、散热、模型调优、运维这些额外开销,每一项都非常可观。

而且,除了K3,国产开源大模型还众多,比如DeepSeek V4-Pro、GLM-5.2、Qwen 3.8,它们都是千亿甚至万亿参数级别的选手。这些模型的部署成本又是多少呢?

开源大模型究竟有多大?

实际上,“普通人想自己跑大模型”并非最近才出现,只是因为K3太过火爆,才让各大媒体平台重新将这个话题推上热潮。

早在DeepSeek V3问世时,就已经有不少人探讨普通人如何部署大模型的问题。

2024年底,DeepSeek V3带着6710亿总参数、370亿激活参数的MoE架构开源,训练成本仅为557万美元,性能却能与Claude 3.5 Sonnet相媲美。

一时间,知乎、B站、公众号上,全是“手把手教你本地部署DeepSeek V3”的教程。

有人用RTX 4090硬抗,有人家里的电表因此跳闸,甚至不熟悉技术的七大姑八大姨都在询问“DeepSeek 是什么,怎么用”。

那场景,很像当年比特币行情启动时,人人都想用笔记本挖矿。

但热潮归热潮,真要完整运行V3,推荐配置是8张H100或A100。H100单卡官方标价3.65万美元,折合人民币约26万,A100稍便宜,单卡约10.8万人民币,8卡整机的费用也要80万往上。要知道,高配版的宝马X5、奔驰GLE、奥迪Q7,总价格也才70多万。

还有一些“RTX 4090本地部署”教程,讲的却是量化到极低精度的4位模型,不仅输出答案质量差,而且有严格的字数限制,超过几百字,模型立刻会崩溃。

普通人与千亿参数之间,远比教程里说的“5分钟搞定”要遥远得多。

到了2026年,情况变得更加复杂。

2026年4月24日发布的DeepSeek V4-Pro,总参数达到1.6万亿,采用MIT协议开源,权重文件在Hugging Face上免费获取。

即便使用FP8精度量化,权重文件大小也得1.6TB起。要完整装入显存,至少需要16张H200。H200单卡拥有141GB显存,16张合计2.2TB,扣除KV缓存和系统资源后,刚好满足需求。

H200英伟达官方定价为单卡2.7万美元,折合人民币约19万,但国内价格为23.5万,8卡整机报价188万,16张的总价就是376万。

再看2026年6月17日智谱开源的GLM-5.2,总参数大约为7530亿,激活参数更小。同样只需要8张H200就能运行。

最后是Qwen 3.8。2026年7月19日阿里发布预览版,总参数为2.4万亿,承诺即将开放权重。

要完整容纳2.4万亿参数,H200的141GB显存已显不足,需要用到B200,单卡192GB显存,需64张B200

相关推荐