一份CUDA源码,跑上了苹果GPU

无需改代码,CUDA程序直通苹果M3 Pro

网友@Abhinav的测试结果显示,同一套CUDA/HIP风格的算法可以相对透明地运行在Apple Silicon等不同硬件后端上。在搭载M3 Pro的苹果设备上,原本为英伟达CUDA编写的计算内核几乎无需修改就成功执行。这一突破不仅验证了苹果GPU在异构计算场景下的兼容潜力,也展示了M系列芯片在AI推理和通用计算领域的可扩展性。测试中,该程序还跑通了CUDA后端的全线测试,意味着这套原本偏向Apple Silicon的机器学习框架,正在反过来向NVIDIA GPU生态延伸。

一份CUDA源码,跑上了苹果GPU

从英伟达到苹果,跨平台GPU生态迈出关键一步

长期以来,CUDA作为英伟达GPU的专属编程模型,形成了强大的生态壁垒。开发者如果想在苹果的Metal或AMD的ROCm平台上运行相同算法,通常需要重写大量代码。@Abhinav的成果首次证明,通过CUDA/HIP抽象层,同一套算法可以无需大幅修改就在多个硬件后端上编译执行。这不仅让苹果M系列芯片获得了一个“CUDA兼容”的入口,也为AMD、Intel等厂商的GPU接入同一套软件栈提供了参考路径。未来,软件开发者或许不再被单一GPU生态所绑定,硬件选择将更加灵活。

开发者迎来新选择:不再被单一GPU绑定

对于AI和HPC领域的开发者而言,这意味着他们可以更自由地选择硬件平台。过去,为了利用CUDA的成熟生态,开发者往往不得不锁定英伟达GPU。现在,一台搭载M3 Pro的MacBook也能运行同一套CUDA源码,从而在开发、测试和生产部署之间实现更平滑的迁移。同时,苹果公司正把重心放在AI上,这一兼容性突破或许会加速其Mac和iPad在AI工作流中的普及。此外,社区中还有“32G大战RTX3090”的讨论,暗示苹果统一内存架构在大模型推理时的独特优势,进一步降低了开发者对单一GPU的依赖。

苹果GPU加速AI计算:从量子采样到具身智能

除了基本的CUDA兼容性,苹果GPU在特定领域的加速效果也得到验证。例如,在连续数据量子采样工作流中,借助英伟达CUDA-Q等框架,苹果M系列芯片已经实现了显著的GPU加速。而影眸科技在具身顶会RSS上提名最佳论文的工作,更是展示了139.6倍的加速和100%的安全约束,这些成果都在不同程度上证明了苹果GPU在科学计算和AI训练中的巨大潜力。随着CUDA源码在苹果硬件上的原生运行,未来更多开发者将能够利用MacBook Pro等设备进行高性能计算,而无需等待英伟达的专门优化。