在数字化转型浪潮下,某重点高校选择与智曲信息及中科曙光合作,共同推进科研高性能计算集群建设。依托中科曙光领先的教育信息化与科研计算产品技术与智曲信息专业的集成服务能力,项目实现了高质量按期交付。
项目背景
随着计算密集型研究范式在生命科学、地球系统科学等领域的普及,某重点高校各院系对高性能计算的需求持续攀升。为避免重复建设,某重点高校决定集中建设科研高性能计算集群,统一支撑全校跨学科科研计算。
需求与挑战
各学科负载差异巨大——有的需要大规模MPI并行,有的依赖GPU加速,有的则是高吞吐小作业。平台需要在一套资源池上兼容多种计算模式,并保证关键课题的计算资源供给。
解决方案
方案以中科曙光I840-G30多路服务器构建通用计算分区,I620-G30 GPU服务器构建加速计算分区,通过高性能集群管理软件统一纳管,MPI并行、GPU加速与高吞吐小作业在同一资源池灵活调度,充分匹配高校多学科混合负载特征。
存储侧采用ParaStor分布式存储构建统一数据空间,支撑各院系科研数据的安全共享。智曲信息为校方定制了学科配额与优先级策略,完成作业调度系统与校园统一认证的对接,并提供典型HPC应用的适配与性能优化支持。
值得关注的是,项目在建设过程中同步完成了人才培养与知识转移:通过联合教研、师资培训与实训环境共建,平台不仅服务于当下的教学科研需求,更为学校储备了面向未来的人工智能教育能力。
实施过程
项目实施期间,智曲信息派出驻场工程师全程跟进,从设备上架、布线规范到系统部署逐项落实标准化作业;同步开展知识转移,为客户运维团队提供系统管理与故障处置培训,确保平台交付后客户具备自主运营能力。
项目成效
新集群成为全校科研创新的重要引擎:
- 峰值性能2 PFLOPS,存储容量扩展至8PB级
- 全年完成作业14万个,服务院系课题组100个
- 重点课题计算资源得到优先保障,成果产出周期明显缩短
回顾项目建设历程,智曲信息始终坚持“以客户为中心”的交付理念,从需求调研阶段的深入业务访谈,到方案设计阶段的多轮专家评审,再到实施阶段的精细化质量管理,每一个环节都力求精益求精。项目验收后,智曲信息还为客户建立了专属服务档案,定期开展系统巡检与健康度评估,让算力基础设施持续保持最佳运行状态。
在服务保障方面,智曲信息为客户构建了三级服务响应体系:一线驻场工程师负责日常巡检与快速处置,二线远程专家团队提供疑难问题会诊,三线原厂技术通道确保重大问题获得最优解决路径。这种多层协同的服务模式,让客户的每一分算力投资都获得可靠保障。
该项目的成功落地,是智曲信息与中科曙光生态协同的又一次成功实践。未来,智曲信息将继续携手中科曙光,把经过验证的行业解决方案推广至更多客户,以专业服务与可靠产品助力千行百业迈入智能化时代。
