AI训练更高效,算力利用更充分:南凌科技SD-WAN提升跨域传输效率
商业
摘要 随着AI训练规模不断扩大,企业将GPU集群部署于异地数据中心以降低成本,而训练语料与业务数据却分散在各地...
随着AI训练规模不断扩大,企业将GPU集群部署于异地数据中心以降低成本,而训练语料与业务数据却分散在各地。面对TB/PB级训练数据的跨地域持续传输需求,传统网络常因带宽瓶颈、链路拥堵及抖动丢包,不仅影响传输效率,更可能让高性能GPU陷入等待,降低算力利用率,延长模型训练与迭代周期。针对这一问题,南凌科技依托自研SD-WAN为企业构建面向AI业务的智能传输网络,提升跨地域传输效率与稳定性,进一步释放GPU资源价值。
海量训练数据集中传输,大带宽解决"传不动"
训练开始前,TB级甚至更大规模的语料、样本和数据集需要从总部、研发中心或云端同步至GPU集群,短时间内形成大流量数据传输,对跨地域链路承载能力提出更高要求。
南凌科技自研SD-WAN可结合企业节点分布与业务需求,整合专线、互联网等多种网络接入资源,为数据源与GPU集群提供充足带宽承载,减少数据同步等待,提升训练数据传输效率。
训练任务持续运行,智能选路解决"传不稳"
数据传至GPU集群后,训练过程中仍会持续产生和交换检查点、模型文件、增量数据及中间结果,长时间运行对链路稳定性提出更高要求。
南凌科技自研SD-WAN可持续感知链路状态,并根据链路质量和业务需求智能选路,在链路出现波动时及时调度至更优路径,降低拥塞、时延和丢包对训练业务的影响,保障传输稳定连续。
数据、算力分布多地,统一管理解决"看不清"
当训练数据、GPU集群和研发环境分布在不同地域,节点与链路增多也让网络运行状态更难统一掌握,异常排查和问题定位更加复杂。
南凌科技依托智能网安运营管理平台,统一纳管不同地域的网络节点与链路状态,集中呈现跨地域连接情况,帮助运维人员及时发现异常、快速定位问题,提升网络运维效率。
文章内容仅供阅读,不构成投资建议,请谨慎对待。投资者据此操作,风险自担。
海报生成中...
