LinkedIn在AI推进中保持数据中心容量不变
WIRED AI··作者 Paresh Dave
关键信息
LinkedIn的计划覆盖其上个月开始、到明年六月结束的财年,管理层表示已经把内存芯片价格上涨考虑进去。公司还称,其训练侧GPU利用率已超过95%,并正在优化训练与推理等不同工作负载之间的资源分配。
资讯摘要
LinkedIn表示,未来一年它将把算力规模和数据中心扩张大体维持不变,同时继续推出更多依赖算力的AI产品。公司称,过去六个月里,它把现有GPU的效率提升了约两倍,因此避免了在AI硬件上进行大额新增支出。文中的支出计划对应LinkedIn本月刚开始、到明年六月结束的财年。管理层也表示,他们已经把内存芯片价格上涨纳入考虑,不过他们承认,AI硬件需求变化很快,这一计划仍可能受到影响。LinkedIn负责工程的首席技术官Erran Berger表示,公司希望在尽量保持算力占用不增长的同时,把更多算力密集型功能投入生产环境。
负责基础设施的首席技术官Raghu Hiremagalur则说,公司的目标是谨慎花钱,并推动工程团队在开发新的生成式AI功能时更有创造性。他补充说,这些效率提升可能会随时间累积,等公司未来再次提高预算时,可以从数据中心扩容中获得更多收益。Hiremagalur还强调,以LinkedIn的规模来看,整整一年不增加存储和算力并不是一件小事。文章将LinkedIn与OpenAI、Meta和Google等公司形成对比,后者正在疯狂筹资并建设大型数据中心,但也面临芯片、劳动力和零部件短缺等问题。文中引用的一位风投人士认为,LinkedIn的做法说明AI正在从“试验阶段”转向“生产纪律”阶段,真正的胜负不只取决于谁花得最多,也取决于谁把基础设施运营得更好。

资讯正文
这些支出计算适用于 LinkedIn 本财年——该财年于上月开始,将于明年 6 月结束。公司表示,由于在过去六个月里找到了让现有 GPU 的使用效率提高一倍的方法,因此得以避免在 AI 硬件上大笔投入。LinkedIn 的计划仍有可能被打乱,因为 AI 对硬件的需求变化非常迅速,但高管们表示,公司已经把内存芯片价格飙升的因素考虑在内。
“我们设定的目标之一,是尽量让我们的算力占用保持持平,或者尽可能接近持平,同时把更多算力需求更高的东西推向生产环境,”LinkedIn 工程首席技术官 Erran Berger 说。“在今天这个世界里,说出这样的话,确实相当大胆。”
Berger 和 LinkedIn 基础设施首席技术官 Raghu Hiremagalur 表示,他们希望在支出上保持审慎,而新的约束将促使工程团队在开发 LinkedIn 计划推出的许多新的生成式 AI 功能时更有创造性。Berger 说,他相信效率提升会随着时间推移不断累积,最终使 LinkedIn 在未来再次提高预算时,能够从数据中心扩建中获得更多回报。
“我真的想特别强调一下,对于我们这样规模的公司来说,全年做到不增加任何存储和算力,这绝不是一件小事,但为了达到这一点,我们付出了大量工作,”Hiremagalur 说。
像 OpenAI、Meta 和 Google 这样的公司正在竭尽所能筹措资金,并以出人意料的合作方式联合起来,建造、配备并运营装满最新电脑芯片的大型数据中心。劳动力和零部件短缺拖慢了许多项目,不少企业还不得不限制客户对某些 AI 工具的使用。但外界也越来越多地质疑,对 AI 的持续投入是否可持续。LinkedIn 拥有超过 13 亿用户,或许是迄今为止首家公开谈及支出担忧、并逆着这股建设热潮行事的最大型企业。
Principal Venture Partners 管理合伙人、服务器制造商 HP 董事会成员 Songyee Yoon 说:“这对整个行业来说是一个令人鼓舞的信号。它表明,AI 正开始从试验阶段走向生产纪律。最终胜出的公司,不会只是那些在基础设施上花最多钱的公司。”
自有掌控
微软在 2016 年收购 LinkedIn 几年后,这家公司曾尝试迁移到母公司的 Azure 云服务,但把这个庞大的社交网络塞进通用数据中心并不符合经济性。Hiremagalur 说:“Microsoft Azure 当时增长得非常快,客户需求高得不得了,与此同时,我们也看到 LinkedIn 侧的增长在迅猛攀升。”
2022年,LinkedIn 把赌注完全押在了自己位于俄勒冈州、得克萨斯州和弗吉尼亚州的数据中心上。自有数据中心让 LinkedIn 能够对技术的每一个细节拥有更大的控制权,也让公司为适应一个新时代的现实做好了准备。大约在同一时期,LinkedIn 开始开发基于 AI 的助手,帮助用户撰写消息、寻找工作以及招聘候选人。这项工作并不便宜。Hiremagalur 说:“我们网站上的每一次查询,成本都在随时间上升。” 他补充称,LinkedIn 存储的数据量每年都在翻倍。“这不是一个可持续的状态。”
LinkedIn 采取措施,在 AI 流水线的每个阶段优化数据中心的使用效率,从训练模型到在用户查询时提供模型服务。Hiremagalur 的团队开发了测量工具,用来了解各个团队分别使用了多少计算和存储资源。随后,公司建立了一套系统,更高效地把项目分配给数据中心里的计算机,从而减少它们闲置的时间。“我们在训练侧的资源分配效率和 GPU 利用率,是我见过最好的,”Hiremagalur 说,并称使用率超过了 95%。
LinkedIn 还采用了蒸馏等技术,用较大的模型训练较小的 AI 模型。对于其职位推荐工具,一个单一模型从两个更大的模型中学习,既负责识别相关职位空缺,也负责预测哪些用户最有可能点击这些职位。Berger 说,虽然较小的模型运行成本更低,但质量并没有因此打折扣。“人们正在找到并发现他们之前没能成功找到的工作,因为这个模型非常善于理解”他们的意图,他说。
用于选择在用户动态信息流中展示哪些帖子的模型,最初运行成本也很高,但 Berger 说,LinkedIn 找到了一种办法,让它以“相当具有成本效益的方式”运行。他表示,公司做了数十项改进,例如简化模型训练、复用先前推荐中的信息,以及更好地平衡 CPU 和 GPU 之间的工作负载。
LinkedIn 甚至重构了部分运行在 Nvidia 处理器上的基础软件,使其能够处理原本超出设计范围的更大任务。公司还调整了其他软件,让任务在 CPU 上运行,而不是使用更昂贵、采购更困难且耗电更多的 Nvidia GPU。综合来看,LinkedIn 估计,过去 12 个月里的这些效率提升工作已为公司节省约 2400 万美元,相当于大约 1100 块 GPU 连续运行一年。
LinkedIn 的高管承认,对于一家年销售额达到 180 亿美元的公司来说,这些节省算不上什么大数目。但 Hiremagalur 说,“工艺”同样重要,“敏捷性”也重要,因为资源被释放出来了。工程师可以更快开始下一个项目,并在不增加 LinkedIn 计算资源占用的情况下整合更多 AI 功能。
伯杰认为,LinkedIn 在控制成本并为微软带来财务回报的同时,已经能够提供更好的职位和候选人匹配结果。他说:“如果可以的话,我们应该能够通过部署更大模型、进行更深层次的推理,并且以更低的成本来实现更高质量的交付。”
尽管支出保持不变,LinkedIn 的数据中心并没有因此停滞不前。公司已经承诺采购新服务器,以便在现有机器逐渐老化或在未来几个月内损坏时,继续升级设备。但公司也通过提前采购锁定了一些节省。希雷马古拉说:“所有这些硬件的成本都已经飙升。”他指出,过去几个月里,有些服务器的价格涨了三倍。“这简直太疯狂了。”
LinkedIn 推动效率提升,是更广泛趋势的一部分,这种趋势有时被称为“tokenomics”——即更深入地分析使用生成式 AI 工具的成本。Gartner 的咨询顾问奇拉格·德卡特帮助企业思考其 AI 云战略,他说:“企业正在从一个‘多买’时代,转向一个‘多做’时代。直到现在,口号一直是,多买才能省更多。但多买只会增加成本。”
德卡特说,他最近看到一些规模较小、对基础设施控制力不如 LinkedIn 的企业,也在设法削减成本。它们清理了闲置软件并裁减了员工,从所谓的“neoclouds”购买数据中心空间——这类服务可能比传统供应商更便宜——还针对不同项目尽可能采用最低成本的 AI 模型。
他多少有些担心,如果 LinkedIn 和其他公司设置过多财务约束,可能会碰到瓶颈,因为更大规模的算力和存储需求终究是不可避免的。德卡特说:“总有一天,某些东西必须让步。要么你必须在 AI 野心上做出妥协,要么你必须在冻结 IT 支出的要求上做出妥协。”
LinkedIn 并没有发誓将来不再扩张数据中心。不过,它正在改变基础设施的分配方式。希雷马古拉说,已经不再是凭借“一个胡乱的猜测”去估算团队在来年会使用多少计算资源。伯杰则说,LinkedIn 选择“拥抱混乱”,按季度逐步推进,同时把长期投资回报放在眼前。也许,支出趋平的状态不会像计划中那样持续太久。
来源与参考
收录于 2026-07-31