打造自动化优先基建 适配高密度AI运算负载-ITBeer科技资讯

打造自动化优先基建 适配高密度AI运算负载

商业

ITBeer科技资讯 2026-07-29 18:01:00

摘要   可以说,人工智能正在重塑企业构建软件的方式,同时也促使企业深入审视其背后的基础设施。当企业训练大语言...

来源: 千家网

打造自动化优先基建 适配高密度AI运算负载

  可以说,人工智能正在重塑企业构建软件的方式,同时也促使企业深入审视其背后的基础设施。当企业训练大语言模型、运行推理任务或处理海量数据集时,它们需要传统基础设施无法提供的速度与规模。

  相关数据印证了这一点:IDC 预计到 2028 年,全球人工智能基础设施支出将超过 2000 亿美元;Gartner 则预测,未来几年内,企业产生的数据中将有超过四分之三是在传统数据中心之外进行处理的。简而言之,对于基础设施领域而言,自动化已不再仅仅关乎效率,而是成为了一项业务刚需。

  旧有的运作模式已不再适用

  企业必须承认,其多年来部署的基础设施最初并非为应对以 AI 为核心的工作负载需求而设计。在 AI 尚处于试验阶段的过去,手动配置 GPU 集群或人工监控漫长的训练过程或许尚可应付;但如今情况已截然不同。现代企业往往需要运行数百个 AI 流水线和推理服务,每日处理数百万次请求,其数据工程工作流需要在数小时内实现从 TB 级到 PB 级的数据规模扩展。

  此外还有成本考量。Gartner 的数据有力地证明了自动化为何至关重要:实现了 AI 基础设施自动化的企业,其资源配置时间缩短了多达 73%,计算资源浪费也减少了近 40%。闲置的 GPU 和延迟的请求只会白白消耗企业的预算并拖累生产力。鉴于 AI 技术的普及速度,企业已不能再将“自动化优先”视为一种可有可无的选项;它是实现可持续运营的唯一途径。

  “自动化优先”的真正含义是什么?

  “自动化优先”这一理念的内涵远不止是将少数琐碎任务设为“自动运行”那么简单。其真正的含义在于构建一种基础设施:让自动化流程自主运行,仅在出现问题时才进行人工干预。以“基础设施即代码”(IaC)为例,借助 Terraform、Pulumi 或 Crossplane 等工具,人们可以完全基于版本控制的代码来复现整个环境。这样一来,数据科学家只需通过自动化工作流,在几分钟内即可完成环境部署,而不必耗费数日时间等待审批。

  然而,部署仅仅是其中的一部分。企业需要的是能够根据 GPU 使用情况进行智能自动扩缩容的能力,以及根据业务优先级调度工作负载的能力。如果某个模型训练任务意外中断,系统应能自动处理检查点恢复(checkpoint recovery)。这绝非小事;Flexera 发布的《2025 年云状态报告》显示,84% 的企业将云成本优化列为首要任务。鉴于 AI 成本飙升,拥有此类基础设施自动化能力对于控制成本至关重要。

  一个鲜少被提及的 GPU 问题

  在企业级 AI 领域,GPU 既是最关键的资源,也往往是最容易被闲置的资源。人们或许认为供需关系会确保每一份硬件资源都得到充分利用,但现实情况是,许多企业并未能最大化利用其现有资源。

  数据印证了这一点。Weights & Biases 的研究表明,对于典型的 AI 团队而言,GPU 利用率通常徘徊在 35% 到 45% 之间;换言之,超过一半的算力处于闲置状态。考虑到顶级 AI 加速器动辄数万美元的昂贵价格,若能提升利用效率,大型企业每年便可节省数百万美元的开支。

  弥合这一差距的途径在于自动化。企业可以利用集群自动扩缩容功能(Cluster Autoscaler)迅速释放空闲节点,或者让 Kubernetes 调度器承担繁重的工作负载装箱(bin-packing)任务。此外,还有各种性能分析工具能够在训练任务启动前识别出那些资源浪费严重的任务。顶尖的 AI 平台企业在对待 GPU 利用率时,已将其视为与系统正常运行时间或应用延迟同等重要的指标,并给予了同样的严谨关注。

  可观测性是基石,而非事后补充

  自动化能带来多大成效,取决于投入了多少心力。然而,许多企业在投资自动化平台时,往往未能充分考量实现真正智能化所需的“可观测性层”。在处理人工智能(AI)任务时,仅关注 CPU 或网络利用率等传统基础设施指标已远远不够。你需要洞察 GPU 显存、张量(tensor)吞吐量、存储带宽以及工作负载层级的成本归因等关键指标。缺乏这种可见性,自动化系统便无法做出明智的决策。

  行业正朝着这一方向发展。OpenTelemetry 已成为云原生可观测性的首选标准,而 Grafana、Arize、Weights & Biases 和 NVIDIA DCGM 等工具则提供了针对 AI 工作负载的专业监控能力。数据也印证了这一点:Splunk 发布的《可观测性现状报告》显示,与仅采用基础监控的企业相比,那些建立了完善可观测性体系的企业,在故障响应速度和运营成本控制方面表现更为出色。

  结语:从小处着手,但要立即行动

  没有任何一家企业能指望一蹴而就地实现全面自动化并从此高枕无忧。对于初涉此道的企业,明智之举是挑选一个既具重复性又能产生重大影响的流程,并着手构建端到端的自动化方案。无论是实现闲置 GPU 集群的自动关机、为 AI 团队搭建自助服务门户,还是建立针对训练任务的成本监控机制,关键在于确保流程的端到端自动化。纵观那些在 AI 基础设施领域处于领先地位的企业,你会发现它们未必都拥有最雄厚的资金实力。它们的共同点在于拥有一种将自动化视为“第二天性”的工程文化:那里的工程师不会纠结于某项工作是否可以自动化,而是会反问为何当初没有将其自动化。

  作者:Sameer Kadam,基础设施工程副总裁

  文章内容仅供阅读,不构成投资建议,请谨慎对待。投资者据此操作,风险自担。

海报生成中...


要闻阅读

热门标签