“『DeepSeek』 甚至绕过了『英伟达』 CUDA”,论文细节再引热议

『英伟达』刚刚从 『DeepSeek』-R1引发的 4 万亿元暴跌中缓过劲来,又面临新的压力?

硬件媒体 Tom's Hardware 带来开年最新热议:『DeepSeek』 甚至绕过了 CUDA,使用更底层的编程语言做优化。

这一次是 『DeepSeek』-V3论文中的更多细节,被人挖掘出来。

来自 Mirae Asset Securities Research(韩国未来资产证券)的分析称,V3 的硬件效率之所以能比 Meta 等高出 10 倍,可以总结为“他们从头开始重建了一切”。

在使用『英伟达』的 H800 GPU 训练 『DeepSeek』-V3 时,他们针对自己的需求把 132 个流式多处理器(SMs)中的 20 个修改成负责『服务器』间的通信,而不是计算任务

变相绕过了硬件对通信速度的限制。

『DeepSeek』-V3 Technical Report

这种操作是用『英伟达』的 PTX(Parallel Thread Execution)语言实现的,而不是 CUDA。

PTX 在接近汇编语言的层级运行,允许进行细粒度的优化,如寄存器分配和 Thread / Warp 级别的调整。

这种编程非常复杂且难以维护,所以行业通用的做法是使用 CUDA 这样的高级编程语言。

换句话说,他们把优化做到了极致。

有网友表示,如果有一群人嫌 CUDA 太慢而使用 PTX,那一定是前量化交易员。

一位亚马逊『工程师』提出灵魂质问:CUDA 是否还是护城河?这种顶尖实验室可以有效利用任何 GPU。

甚至有网友开始畅想,如果“新源神”『DeepSeek』 开源了一个 CUDA 替代方案……

那么事情是否真会如此?

『DeepSeek』 真的绕过了 CUDA?

首先要明确的是,PTX 仍然是『英伟达』 GPU 架构中的技术,它是 CUDA 编程模型中的中间表示,用于连接 CUDA 高级语言代码和 GPU 底层硬件指令。

PTX 类似汇编语言,代码大概长这样:

来自 tinkerd.net

在实际编译流程中,CUDA 代码首先被编译为 PTX 代码,PTX 代码再被编译为目标 GPU 架构的机器码(SASS,Streaming ASSembler)。

CUDA 起到了提供高级编程接口和工具链的作用,可以简化开发者的工作。而 PTX 作为中间层,充当高级语言和底层硬件之间的桥梁。

另外,这种两步编译流程也使得 CUDA 程序具有跨架构的兼容性和可移植性。

反过来说,像 『DeepSeek』 这种直接编写 PTX 代码的做法,首先不仅非常复杂,也很难移植到不同型号的 GPU。

有从业者表示,针对 H100 优化的代码迁移到其他型号上可能效果打折扣,也可能根本不工作了。

所以说,『DeepSeek』 做了 PTX 级别的优化不意味着完全脱离了 CUDA 生态,但确实代表他们有优化其他 GPU 的能力。

事实上,我们也能看到 DeekSeek 已经与 AMD、华为等团队紧密合作,第一时间提供了对其他硬件生态的支持。

One More Thing

还有人提出,如此一来,让 AI 擅长编写汇编语言是 AI 自我改进的一个方向。

我们不知道 『DeepSeek』 内部是否使用 AI 辅助编写了 PTX 代码 —— 但是确实刚刚见证 『DeepSeek』-R1 编写的代码显著提升大模型推理框架的运行速度

Llama.cpp项目中的一个新 PR 请求,使用 SIMD 指令(允许一条指令同时处理多个数据)显著提升 WebAssembly 在特定点积函数上的运行速度,提交者表示:

这个 PR 中的 99% 的代码都是由 DeekSeek-R1 编写的。我唯一做的就是开发测试和编写提示(经过一些尝试和错误)。

是的,这个 PR 旨在证明大模型现在能够编写良好的底层代码,甚至能够优化自己的代码。

llama.cpp项目的创始人检查了这段代码后表示“比预期的更爆炸”。

参考链接:

  • [1]https://www.tomshardware.com/tech-industry/artificial-intelligence/deepseeks-ai-breakthrough-bypasses-industry-standard-cuda-uses-assembly-like-ptx-programming-instead

  • [2]https://x.com/bookwormengr/status/1883355712191123666

  • [3]https://tinkerd.net/blog/machine-learning/cuda-basics/

  • [4]https://www.amd.com/en/developer/resources/technical-articles/amd-instinct-gpus-power-deepseek-v3-revolutionizing-ai-development-with-sglang.html

  • [5]https://x.com/ggerganov/status/1883888097185927311

特别声明:[“『DeepSeek』 甚至绕过了『英伟达』 CUDA”,论文细节再引热议] 该文观点仅代表作者本人,今日霍州系信息发布平台,霍州网仅提供信息存储空间服务。

猜你喜欢

创新发展看杨浦丨海能投顾:金融服务也能装上“智慧心”(上海杨浦发展感想)

落户杨浦以来,企业扎根数字经济赛道,以“AI+量化”为核心技术引擎,不断创新服务模式,已为近2000万人群提供了更智慧化、个性化、有温度的投顾服务。 在AI赋能下,海能投顾构建了“量化工具+分层服务+投顾协同…

创新发展看杨浦丨海能投顾:金融服务也能装上“智慧心”(上海杨浦发展感想)

『唐艺昕』亮片裙造型美翻了!白到发光配逆天长腿,甜妹性格太圈粉(『唐艺昕』红裙)

『唐艺昕』身着一袭银白亮片羽毛裙惊艳亮相,无论是在蓝色背景下拍摄的时尚写真,还是在室内温柔的抓拍镜头中,她的身材优势和独特魅力都得到了充分展现。她白皙的肌肤和修长的大长腿吸引了无数目光,而她那甜美的性格更是加分不…

『唐艺昕』亮片裙造型美翻了!白到发光配逆天长腿,甜妹性格太圈粉(『唐艺昕』红裙)

李兰迪海边红泳衣太会选 腰侧小镂空藏肉 微胖女生也能照搬(李兰迪红毯)

最吸引我注意的是她身上的泳衣设计,简直给我们这些普通身材的女生指明了方向。它会在视觉上形成一个向内的V字形状,你的视线自然会跟随这个线条聚焦在最细的交点上。 交叉的部分通常会位于腰部最细的位置,或者稍微高…

李兰迪海边红泳衣太会选 腰侧小镂空藏肉 微胖女生也能照搬(李兰迪红毯)

孟天柱不愧是安杰看中的潜力股,他的优秀远超江家的任何一个子女(孟天柱的扮演者)

卫国当时也是副营职,看到江昌义的晋升,忍不住感叹:哎,你该毕业了吧?孟天柱被安杰看中后,很快就安排了和亚菲的相亲。 可见,孟天柱在明知亚菲不喜欢他,还愿意追求她,一方面是因为亚菲的确非常优秀,另一方面也是因为…

孟天柱不愧是安杰看中的潜力股,他的优秀远超江家的任何一个子女(孟天柱的扮演者)

49岁天王内地开唱发生舞台事故,趴地上久久未能起身粉丝大叫(华语天王)

最近,天王『王力宏』正在忙于举办他的《最好的地方世界巡回演唱会》,此次演唱会的最新一站在浙江省的诸暨市举行,吸引了大批观众前来捧场,现场气氛非常热烈。在演唱过程中发生了一段小小的插曲,『王力宏』在舞台上不小心摔倒,趴…

49岁天王内地开唱发生舞台事故,趴地上久久未能起身粉丝大叫(华语天王)