NVIDIA NIM 是用于 AI 推理的微服务集合,以预构建、优化的容器形式交付,让企业快速、可靠、可扩展地部署大语言模型、多模态模型与检索增强生成(RAG)应用。

核心特性:
- 单容器即可部署,包含 Triton 推理服务器与 TensorRT-LLM 优化引擎
- 支持主流开源大模型与 NVIDIA Nemotron 系列模型
- 推理性能与吞吐量较原生部署提升数倍,显存占用更低
- 提供标准化 API,兼容 OpenAI 接口规范,便于应用集成
- 可通过 AI Enterprise 获得企业级支持与安全更新
NIM 让生成式 AI 应用的生产部署从数周缩短到数分钟,是企业在本地与云端构建推理服务的首选方案。
