近日,由智曲信息携手AMD共同建设的某科技创新企业区域人工智能算力中心项目顺利交付并投入运行。作为双方在人工智能基础设施领域的深度合作成果,该项目为某科技创新企业构建了坚实的智能算力底座,成为智曲信息“携手一流厂商、服务行业客户”的又一标杆实践。
项目背景
近年来,随着大模型技术在千行百业的加速渗透,区域算力供需矛盾日益突出。某科技创新企业积极响应数字经济发展规划,启动区域人工智能算力中心建设,希望打造面向本地企业、高校院所和创新团队的公共智能算力服务平台,以普惠算力支撑区域人工智能产业集聚发展。
需求与挑战
项目面临的挑战十分明确:一是算力规模要求高,平台需支撑多个千亿参数级大模型并行训练;二是多租户场景复杂,不同用户的任务类型、资源规格和安全隔离需求差异巨大;三是能耗与运维压力突出,高密度加速卡机房对供电制冷和集群运维提出了苛刻要求。
解决方案
项目采用了搭载AMD Instinct MI300X加速器的GPU服务器集群。MI300X单卡192GB HBM3超大显存,单机8卡即可容纳千亿参数大模型,显著降低模型并行切分的复杂度;主机侧搭配AMD EPYC 9005系列处理器,高核心密度为数据预处理与集群管理提供充裕算力。
软件栈基于AMD ROCm开源平台构建,与PyTorch等主流深度学习框架深度兼容,客户既有代码几乎零修改即可迁移。智曲信息完成了集群部署、分布式训练框架适配与通信优化,帮助客户在开源生态上快速构建自主可控的大模型研发体系。
从产业趋势看,算力基础设施正从“堆硬件”走向“系统级创新”。本项目的价值不仅在于交付了一套高性能算力平台,更在于建立了算力、算法、数据协同的一体化运营体系,为客户在人工智能时代的持续创新奠定了坚实基础。
实施过程
为保障项目高质量交付,智曲信息建立了每周例会与里程碑评审机制,与AMD技术团队、客户信息化部门紧密协同,先后完成了设备选型适配验证、系统集成联调、数据迁移演练与应急预案演练,项目全程零安全事故、按期交付。
项目成效
平台交付后运行稳定,各项指标达到设计预期:
- 集群峰值算力达371 PFLOPS,可同时承载9个千卡级训练任务
- 已入驻企业及科研团队78余家,平均算力利用率保持在81%
- 训练任务平均排队时长下降60%,业务上线周期从数周缩短至数天
- 综合能效较传统机房优化25%,获得客户高度认可
客户相关负责人对项目交付质量给予高度评价,并表示平台上线以来运行稳定、性能达标,为业务发展提供了有力支撑。智曲信息将持续跟进平台运行情况,以全生命周期服务保障客户投资价值,携手AMD深化行业智能化探索。
