智曲信息联合中科曙光为某智算科技企业打造区域人工智能算力中心

 人工智能     |      2026-03-15 10:30:00

历时5个月的建设周期,智曲信息携手中科曙光为某智算科技企业打造的区域人工智能算力中心正式上线。项目团队克服了工期紧张、场景复杂等多重挑战,一次性通过客户验收,各项性能指标全面达成设计目标。

项目背景

人工智能应用从演示走向规模落地的过程中,算力短缺成为制约区域数字经济发展的突出瓶颈。某智算科技企业立项建设区域人工智能算力中心,定位为覆盖模型训练、推理服务和数据加工的一体化公共算力底座,为区域产业智能化转型提供长期的基础设施支撑。

需求与挑战

在方案论证阶段,某智算科技企业提出了三个核心诉求:集群性能要能扛住大规模训练任务的长周期满载运行;资源调度要兼顾科研用户与企业用户的不同优先级;同时整体能效与交付周期也必须控制在预算范围之内,避免基建投入挤占运营资金。

解决方案

依托在高端计算领域二十余年的技术积淀,中科曙光为本项目提供了以曙光I620-G30 GPU服务器为核心的大规模智算集群。单节点高密度加速卡配置结合高速无阻塞网络,实现大规模训练任务的线性扩展;存储侧配置ParaStor分布式全闪存储,为海量训练数据提供高吞吐、低时延的数据供给。

软件层面部署曙光DAS人工智能基础软件栈,兼容主流深度学习框架,配合智能调度平台实现千卡级资源的秒级调度与能效管理。智曲信息作为集成交付方,完成了集群部署、性能调优与故障自愈机制建设,并提供全生命周期运维保障服务。

对于人工智能平台建设方而言,能否把算力高效转化为生产力才是成败关键。项目通过标准化的算力服务目录与敏捷的资源交付流程,让客户从“拥有算力”走向“用好算力”,切实降低了业务团队的智能化应用门槛。

实施过程

为保障项目高质量交付,智曲信息建立了每周例会与里程碑评审机制,与中科曙光技术团队、客户信息化部门紧密协同,先后完成了设备选型适配验证、系统集成联调、数据迁移演练与应急预案演练,项目全程零安全事故、按期交付。

项目成效

经过一段时间的稳定运行,平台交出了亮眼的成绩单:

  • 单集群日均完成614批次大规模训练作业,任务成功率达74%
  • 支撑181家单位开展大模型研发,累计交付算力服务超过11万卡时
  • 推理服务平均响应时延控制在毫秒级,平台可用性达99.9%
  • 机房PUE降至1.2以内,每年可节约电费数百万元

回顾项目建设历程,智曲信息始终坚持“以客户为中心”的交付理念,从需求调研阶段的深入业务访谈,到方案设计阶段的多轮专家评审,再到实施阶段的精细化质量管理,每一个环节都力求精益求精。项目验收后,智曲信息还为客户建立了专属服务档案,定期开展系统巡检与健康度评估,让算力基础设施持续保持最佳运行状态。

客户相关负责人对项目交付质量给予高度评价,并表示平台上线以来运行稳定、性能达标,为业务发展提供了有力支撑。智曲信息将持续跟进平台运行情况,以全生命周期服务保障客户投资价值,携手中科曙光深化行业智能化探索。