科研高性能计算集群是某研究院数字化战略的重点工程。经过多方比选,某研究院最终选择智曲信息与NVIDIA联合提供的解决方案,由智曲信息担任项目总集成方,NVIDIA提供核心产品与全程技术支持。
项目背景
某研究院在材料模拟、气象海洋、计算化学等领域承担多项国家级科研任务,原有集群建成已逾五年,算力与存储均接近饱和。某研究院启动科研高性能计算集群建设,为全校重点学科提供新一代高性能计算支撑。
需求与挑战
HPC场景对平台要求严苛:大规模并行作业的通信时延必须足够低;作业调度系统要兼容多学科用户的使用习惯;海量科学数据的存储与共享要安全高效;且集群必须全年稳定运行,支撑长周期科学计算任务。
解决方案
方案构建了以NVIDIA HGX A100与L40S为核心的教学科研算力平台:HGX节点支撑深度学习课程实训与科研训练任务,L40S节点面向图形渲染与推理实验,配合完整的CUDA软件生态覆盖教学所需的框架与工具链,学生可直接使用业界主流开发环境。
平台预置主流框架的实验环境模板,支撑课程快速开展。智曲信息为校方搭建了GPU资源分时调度系统,实现教学班级批量发放实验环境,并提供CUDA开发环境的日常技术支持。
教育数字化战略行动深入推进的当下,算力平台正在成为学校的新型基础设施。本项目将教学、科研、管理三类负载统一纳管,既保障了教学的公平性与可用性,又释放了科研的创新潜力,为学校数字化转型提供了可复制的实践样本。
实施过程
在项目实施过程中,智曲信息组建了涵盖解决方案架构师、系统工程师、软件研发与交付专家的专项团队,遵循“调研—设计—部署—调优—验收”五步交付法,完成从机房勘察、方案深化设计、设备到货安装、系统联调测试到上线割接的全流程实施,并针对客户核心业务场景组织了多轮压力测试与性能调优。
项目成效
集群投运后,重点课题的计算瓶颈得到有效缓解:
- 集群理论峰值性能达7 PFLOPS,较原有平台提升5倍
- 支撑国家自然科学基金等重点课题54项,年度完成计算作业36万个
- 典型应用并行效率保持在86%以上,作业平均等待时长下降61%
回顾项目建设历程,智曲信息始终坚持“以客户为中心”的交付理念,从需求调研阶段的深入业务访谈,到方案设计阶段的多轮专家评审,再到实施阶段的精细化质量管理,每一个环节都力求精益求精。项目验收后,智曲信息还为客户建立了专属服务档案,定期开展系统巡检与健康度评估,让算力基础设施持续保持最佳运行状态。
客户相关负责人对项目交付质量给予高度评价,并表示平台上线以来运行稳定、性能达标,为业务发展提供了有力支撑。智曲信息将持续跟进平台运行情况,以全生命周期服务保障客户投资价值,携手NVIDIA深化行业智能化探索。
