AI图像生成公司Midjourney的联合创始人David Holz近日公开表示,因早期选择谷歌TPU而非英伟达GPU进行模型训练,导致其研究进度落后了约一年。据悉,Holz指出,尽管TPU在规模化推理阶段能显著降低成本,但其在研究和快速迭代阶段,与主流PyTorch框架及社区生态的兼容性问题,严重拖慢了开发速度。
这一事件凸显了当前AI基础设施竞争的核心:硬件性能之外,软件生态的成熟度与社区支持至关重要。英伟达凭借CUDA生态和PyTorch的广泛普及,在研究领域建立了深厚护城河。而谷歌TPU虽在特定任务上效率高,但要求使用JAX等框架,对主流研究工具链支持不足,增加了开发者的学习和迁移成本。
作为应对,谷歌在近期发布了采用训练与推理分离设计的第八代TPU,并推出了旨在让PyTorch原生运行在TPU上的“TorchTPU”项目,试图降低生态迁移门槛。与此同时,行业也出现了混合策略的范例,例如Anthropic公司同时使用英伟达GPU、谷歌TPU和亚马逊Trainium芯片,根据不同工作负载选择最合适的平台,以平衡研究效率、训练成本与供应链安全。
分析认为,未来AI算力格局将更趋多元化。研究和小规模实验可能仍以英伟达GPU为主,而大规模训练和推理任务则会更多考虑TPU等专用芯片的性价比优势。然而,软件生态的融合与跨平台开发工具的成熟,将是决定专用芯片能否广泛渗透研究领域的关键。

粤公网安备 44010602000162号
网友评论