Meta决定更进一步,投资研发自主人工智能芯片,以驱动支撑Facebook、Instagram、WhatsApp及其新型生成式人工智能工具的庞大基础设施。此举旨在应对计算能力需求的急剧增长,以及几乎完全依赖Nvidia和AMD等供应商所带来的日益高昂的成本。
通过此次发布,马克·扎克伯格的公司旨在减少对第三方供应商的依赖,降低数据中心的运营成本,并根据其平台内的特定工作负载定制硬件。这并非向其他公司出售处理器,而是为内部使用构建定制芯片。
MTIA是什么?Meta为什么想要自主研发人工智能芯片?

该计划的核心是元训练和推理加速器(MTIA)系列,这是该公司自2023年以来一直在研发的项目,目前已推出多款芯片型号,并逐渐成型。其核心理念是设计更紧凑、更高效的处理器,用于处理特定的AI任务,而非目前市场上占主导地位的大型通用芯片。
正如该公司解释的那样,MTIA 的架构专注于平衡计算能力、内存带宽和内存容量,以服务于分类和推荐模型,并应对日益增长的推理工作负载。换句话说,它们经过优化,能够决定每个用户看到的内容、AI 助手的响应速度以及如何处理数百万个并发请求。
Meta强调,其产品并非面向大众市场,因此其芯片无需包含传统GPU的所有组件。这种省略不必要功能的做法,使其能够降低成本,并根据自身服务的实际需求对设计进行微调。
这些新芯片将由台积电(TSMC)生产,台积电是全球最大的半导体代工厂,也是苹果、英伟达和高通等科技巨头的长期合作伙伴。从设计到首批芯片交付,整个过程大约需要两年时间。
四代功能各异的MTIA芯片
目前的路线图设想推出四代自主研发的芯片:MTIA 300、400、450 和 500,并将在 2027 年前分阶段发布。所有这些芯片都在并行开发,使 Meta 能够根据其 AI 工作负载的演变来调整每次迭代。
MTIA 300已投入生产,并应用于分类和推荐系统——即决定在 Facebook 和 Instagram 上向每位用户展示哪些内容、广告和视频。这款首款产品旨在以低能耗实时处理大量请求。
其继任者MTIA 400(内部代号 Iris)已通过实验室测试,并正在公司数据中心部署。Meta 声称,与 MTIA 300 相比,MTIA 400 的某些操作性能提升了四倍,并显著提高了内存访问速度,从而实现了更快的响应速度和更大的并发流量处理能力。
下一代模型MTIA 450 和 MTIA 500(代号分别为 Arke 和 Astrid)面向大规模高级推理任务,并将于 2027 年开始更广泛地采用。其中,Astrid 功能更强大,与前代产品相比,其内存容量提高了约 80%,访问速度提高了 50%,使其更适用于生成式人工智能场景和大型语言模型。
Meta公司工程副总裁宋义俊指出,这四款产品正在并行开发,并将以大约六个月的间隔陆续发布。他解释说,人工智能工作负载的快速变化需要根据不断变化的需求,持续修订产品路线图并调整开发方向。
数百万美元的投资和长期战略
Meta公司转向自主研发芯片的同时,也制定了一项前所未有的支出计划。该公司计划到2025年为其整个技术基础设施投入115.000亿至135.000亿美元的资本,随着新数据中心的建成,预计未来几年这一数字仍将居高不下。
芯片的设计和生产成本并不低廉:从设计到制造的整个过程通常耗资数十亿美元,而且只有在大规模应用和高利用率的情况下才能实现盈利。Meta 希望利用其平台上的海量流量和请求,从中获得竞争优势。
为了增强内部实力,该公司采取了一系列重大举措。在收购韩国FuriosaAI失败后,Meta最终收购了位于圣克拉拉的半导体公司Rivos及其数百名员工。此举旨在加速人工智能定制芯片的设计,并能够同时推进多个芯片项目。
与此同时,Meta与博通在特定设计方面展开合作,并与英伟达和AMD保持着大批量供货协议。今年2月,该公司签署了价值数百亿美元的合同,以确保GPU的持续供应,这些GPU在未来几年仍将是训练和部分推理处理的关键。
内部芯片和外部GPU之间的平衡
公司管理层坚称,对MTIA的投资并非意味着与Nvidia或AMD决裂,而是为了补充它们的产品。目前,Meta自主研发的芯片主要用于内容推荐和推理系统,而大型语言模型的训练仍然依赖于外部供应商的硬件。
公司首席财务官苏珊·李解释说,该策略涉及根据任务的不同组合使用不同类型的处理器。对于某些高度专业化的工作负载,他们自主设计的芯片可以提高效率并降低成本;而对于其他工作负载,例如训练下一代模型,来自英伟达或AMD的高性能GPU仍然至关重要。
李女士本人也承认,Meta 的目标是未来开发出能够训练其最先进 AI 模型的处理器,但她也承认,要达到目前主流第三方厂商的水平还需要时间。目前,公司的首要任务是拓展 MTIA 在分类、推荐和生成式推理领域的应用。
除了硬件研发,Meta 还通过组建由Maher Saba领导的新工程团队来加强其内部人工智能架构,该团队将与公司的超级智能实验室协同工作。此外,Meta 还达成了多项内容访问协议,例如与新闻集团签署的价值高达每年 50 万美元的协议,用于利用新闻素材和档案资料训练其模型。
在硅谷竞赛中与谷歌、亚马逊和微软展开竞争
Meta 的举动符合科技行业的大趋势。谷歌多年来一直在开发其 TPU,用于在其云端训练和运行 AI 模型,而亚马逊则拥有 Trainium 和 Inferentia 等自主研发的处理器。微软方面,也已开始部署自主设计的芯片用于特定功能,并结合为 Azure 提供大部分支持的第三方硬件。
凭借MTIA,Meta正式加入对基础设施最关键层级的直接控制权争夺战。然而,该公司也意识到,英伟达仍然占据主导地位,拥有超过90%的AI芯片市场份额,并在专用GPU领域拥有十多年的技术优势。
Meta 的策略并非一夜之间取代英伟达,而是构建一个专为自身服务量身定制的硬件层,使其能够根据社交和人工智能应用网络的实际需求调整性能、功耗和成本。在计算能力需求激增的背景下,任何单位成本的节省,一旦应用于数万台服务器,都将产生巨大的影响。
Meta的基础设施规模有助于解释其这一战略。该公司正在美国多个州扩建数据中心,并加强其全球能力,以支持其社交网络和新型人工智能产品,例如基于应用程序的助手以及提供图像和价格推荐的产品搜索功能。
Meta 的这项自主芯片计划使其技术发展处于关键阶段:如果该计划能够帮助 MTIA 在保持服务所需性能的同时降低成本,公司就能在 GPU 市场波动时获得更大的灵活性,并能够继续扩展其大规模 AI 项目,而无需过度依赖第三方。挑战在于,如何在技术飞速发展的行业中按时执行复杂且成本高昂的路线图。正如公司自身所承认的,这种发展速度甚至令行业前沿人士都感到惊讶。
