2月24号早上,GitHub热榜被刷屏了

那天我像往常一样打开GitHub想看看有什么新东西,结果Trending榜上全是DeepSeek。点进去一看,FlashMLA,一个针对Hopper GPU优化的MLA解码内核,代码量不大但性能数字吓人:在H800上内存带宽直接干到3000GB/s以上。评论区已经炸了,有人贴出实测数据,有人在问怎么部署,还有人已经在跑benchmark了。 这次开源周一共持续了5天,每天放一个项目:FlashMLA、DeepEP、DeepGEMM、DualPipe加EPLB,收尾那天放出了DeepSeek-V3的完整权重文件。我印象最深的是DeepGEMM,FP8矩阵乘法库,在H800上算力密度超过1350 TFLOPS,这个数字什么概念?普通的开源实现能跑到一半就不错了。 当时我正好在折腾一个RAG项目,推理速度一直卡在瓶颈上,所以特别关注FlashMLA。我把仓库clone下来,按照README的说明编译,在H800上跑了几个测试。整个过程比我想象的顺利,编译没报错(这在开源项目里已经很难得了),跑起来之后吞吐量确实有明显提升。虽然我的场景只是小规模测试,但能感觉到这套东西是真有人在生产环境里用的,不是那种玩具代码。 这次开源周让我意识到一件事:DeepSeek不只是发了个模型,他们把整个训练和推理链路都摊开给你看了。FlashMLA解决的是解码阶段的瓶颈,DeepEP解决的是MoE模型在多卡之间通信的效率问题,DeepGEMM解决的是FP8矩阵乘法的性能问题。这三个合起来,基本覆盖了从训练到推理最核心的性能瓶颈。

自己跑一遍FlashMLA,五步搞定

我建议所有手里有H800或者A100的兄弟都去试试FlashMLA,配置过程不复杂,我拆成五步: 第一步,clone仓库。`git clone https://github.com/deepseek-ai/FlashMLA.git`,注意看一下README里的环境要求,需要CUDA 12.3以上和Hopper架构的GPU。如果你用的是A100(Ampere架构),别折腾了,这个内核是为Hopper专门调的,硬跑没有效果。 第二步,编译。在项目目录下执行`python setup.py install`,或者用他们提供的Docker镜像。我遇到过一次编译报错,原因是CUDA版本不对,换到12.8就过了。如果你也碰到类似问题,先查CUDA版本,别急着改代码。 第三步,跑自带的benchmark。执行`python benchmark/run_benchmark.py`,这个脚本会测试不同batch size下的内存带宽和算力。我跑出来的结果和README里标注的差不多,H800上内存带宽在3000GB/s左右。看到这个数字你就知道,DeepSeek在推理性能上确实下了功夫。 第四步,接进你自己的项目。FlashMLA本质是一个解码内核,你可以把它集成到vLLM或者SGLang这类推理框架里。具体做法是替换掉原来的attention实现,需要改的地方不多,但如果你对GPU编程不熟,建议先看一遍他们源码里的注释,写得还算清楚。 第五步,对比效果。改完之后跑同一个测试集,记录token生成速度和显存占用。我实测的结果是吞吐量提升了大约20%,显存占用还降了一些。为什么有效?因为FlashMLA把KV Cache的内存布局重新设计了,减少了显存碎片,同时用上了Hopper GPU的异步拷贝指令,让内存带宽跑满。

DeepGEMM和DeepEP,值不值得折腾

开源周第二天放出的DeepEP是MoE模型专用的通信库,解决的是多卡之间All-to-All通信的延迟问题。MoE模型有个特点:每个token只会激活一部分专家,但激活哪个专家是动态决定的,所以不同GPU之间需要频繁交换数据。DeepEP把这块的通信效率提上去了,在NVLink环境下延迟能降低30%以上。 第三天放出的DeepGEMM是FP8矩阵乘法库,这个更狠。它支持稠密和MoE两种模式,在H800上FP8算力密度达到1350 TFLOPS以上。我当时在跑一个微调任务,用的是FP8精度,换上DeepGEMM之后训练速度提升了大概15%。不过注意,DeepGEMM需要Hopper架构的GPU,而且对显存容量有要求,至少80GB,不然会OOM。 这两个项目值不值得折腾?我的判断是:如果你在做MoE模型的推理服务或者微调,DeepEP值得花时间集成,因为通信瓶颈在MoE场景里是绕不开的。DeepGEMM则更适合有高性能计算需求的团队,普通开发者可以先观望,等主流框架(比如vLLM)集成好了直接用就行。 我自己的做法是:DeepEP先不碰,因为我的场景是单卡推理,用不上多卡通信。DeepGEMM倒是试了试,在微调任务里确实有效果。但我也踩了个坑:FP8精度在部分层上会导致loss波动,需要设置混合精度策略。如果你也遇到这个问题,把embedding层和最后的输出层切回BF16就行了。

开源周真正改变的是什么:671B模型和557万美元

开源周收尾那天放出的DeepSeek-V3权重文件,才是真正的重头戏。671B总参数、37B激活参数,训练成本只有557万美元左右。这个数字对比一下:Meta训练Llama 3的405B版本花了数千万美元,OpenAI的GPT-4训练成本更是天文数字。DeepSeek用不到600万美元的成本训练出这个级别的模型,靠的就是他们开源的那套优化技术。 这意味着什么?对小团队来说,他们可以基于DeepSeek-V3做微调,不需要从零训练。DeepSeek-V3的license允许商用,这对创业公司是个巨大的利好。我认识一个做法律AI的团队,他们之前用的是GPT-4 API,一个月API费用就要几万块。现在他们自己部署了DeepSeek-V3,推理成本降了一个量级,而且数据不出域,合规问题也解决了。 如果你也想部署DeepSeek-V3,我的建议是:先用API跑通业务逻辑,再考虑自部署。DeepSeek的API价格比GPT-4便宜很多,输入0.5元/百万token,输出2元/百万token(大约是GPT-4价格的十分之一)。等业务稳定了,再评估自部署的成本。自部署的话,需要至少4张A100/H800(80GB),用vLLM框架加载FP8版本的权重,吞吐量还不错。 开源周还有一个容易被人忽略的点:EPLB(专家并行负载均衡)。MoE模型有个天生的问题,就是不同专家的负载不均衡,有些专家被频繁调用,有些专家闲着。EPLB通过动态调整专家的分配,让各GPU的负载更均衡。这个技术在训练和推理阶段都有用,如果你的团队在用MoE架构做东西,EPLB值得好好研究。

💬 你在用什么AI工具?

DeepSeek这次开源周确实给整个AI圈子上了一课:国产模型不只是能打,而且愿意把吃饭的家伙都亮出来。FlashMLA、DeepEP、DeepGEMM这些项目,在之前都是各家大厂的核心机密,DeepSeek直接开源了,而且代码质量很高,不是那种应付式的开源。 我身边已经有不少朋友在尝试把DeepSeek的开源项目集成到自己的系统里了,有做推理服务的,有做微调的,还有纯粹为了学习的。不管你是哪种,我都建议你去AI House排行榜(aibunkhouse.com/rankings/)看看,那里有真实用户对DeepSeek、GPT-4、Claude这些工具的投票和评价。看完你会发现,每个人用AI的方式都不一样,别人的经验能帮你少走很多弯路。 你在用什么AI工具?是DeepSeek、ChatGPT、Claude,还是别的什么?在评论区聊聊你的使用场景和感受,也别忘了去AI House排行榜给喜欢的工具投一票,让更多人看到真实的使用体验。

常见问题 / FAQ

2月24号早上,GitHub热榜被刷屏了

那天我像往常一样打开GitHub想看看有什么新东西,结果Trending榜上全是DeepSeek。点进去一看,FlashMLA,一个针对Hopper GPU优化的MLA解码内核,代码量不大但性能数字吓人:在H800上内存带宽直接干到3000GB/s以上。评论区已经炸了,有人贴出实测数据,有人在问怎么部署,还有人已经在跑benchmark了。 这次开源周一共持续了5天,每天放一个项目:Flas...

自己跑一遍FlashMLA,五步搞定

我建议所有手里有H800或者A100的兄弟都去试试FlashMLA,配置过程不复杂,我拆成五步: 第一步,clone仓库。`git clone https://github.com/deepseek-ai/FlashMLA.git`,注意看一下README里的环境要求,需要CUDA 12.3以上和Hopper架构的GPU。如果你用的是A100(Ampere架构),别折腾了,这个内核是为Hop...

DeepGEMM和DeepEP,值不值得折腾

开源周第二天放出的DeepEP是MoE模型专用的通信库,解决的是多卡之间All-to-All通信的延迟问题。MoE模型有个特点:每个token只会激活一部分专家,但激活哪个专家是动态决定的,所以不同GPU之间需要频繁交换数据。DeepEP把这块的通信效率提上去了,在NVLink环境下延迟能降低30%以上。 第三天放出的DeepGEMM是FP8矩阵乘法库,这个更狠。它支持稠密和MoE两种模式,...

开源周真正改变的是什么:671B模型和557万美元

开源周收尾那天放出的DeepSeek-V3权重文件,才是真正的重头戏。671B总参数、37B激活参数,训练成本只有557万美元左右。这个数字对比一下:Meta训练Llama 3的405B版本花了数千万美元,OpenAI的GPT-4训练成本更是天文数字。DeepSeek用不到600万美元的成本训练出这个级别的模型,靠的就是他们开源的那套优化技术。 这意味着什么?对小团队来说,他们可以基于Dee...

💬 你在用什么AI工具?

DeepSeek这次开源周确实给整个AI圈子上了一课:国产模型不只是能打,而且愿意把吃饭的家伙都亮出来。FlashMLA、DeepEP、DeepGEMM这些项目,在之前都是各家大厂的核心机密,DeepSeek直接开源了,而且代码质量很高,不是那种应付式的开源。 我身边已经有不少朋友在尝试把DeepSeek的开源项目集成到自己的系统里了,有做推理服务的,有做微调的,还有纯粹为了学习的。不管你是...