
SGLang Model-Free NIM 是一个可部署的推理容器,可为广泛的大型语言模型提供服务,无需特定于模型的容器镜像。Model-free 容器没有提供内置的模型清单,而是在运行时指向任何受支持的模型——例如 Hugging Face 仓库、NVIDIA NGC 构件、S3 / S3 兼容的存储桶、ModelScope 仓库、Google Cloud Storage 存储桶或本地目录。该容器可识别模型架构与量化方式,在启动时生成清单和部署配置文件,并在 SGLang backend 推理后端的支持下,通过兼容 OpenAI 的 API 开始提供模型服务。 该容器非常适合灵活的单镜像部署(只需一个镜像通过安全审查,即可为任何受支持的模型提供服务)、对最新发布模型提供零日(day-zero)支持,以及从任何受支持的来源提供自定义或微调模型服务。 容器组件已可供商业使用。
SGLang Model-Free NIM 是一个可部署的推理容器,可为广泛的大型语言模型提供服务,无需特定于模型的容器镜像。Model-free 容器没有提供内置的模型清单,而是在运行时指向任何受支持的模型——例如 Hugging Face 仓库、NVIDIA NGC 构件、S3 / S3 兼容的存储桶、ModelScope 仓库、Google Cloud Storage 存储桶或本地目录。该容器可识别模型架构与量化方式,在启动时生成清单和部署配置文件,并在 SGLang backend 推理后端的支持下,通过兼容 OpenAI 的 API 开始提供模型服务。
该容器非常适合灵活的单镜像部署(只需一个镜像通过安全审查,即可为任何受支持的模型提供服务)、对最新发布模型提供零日(day-zero)支持,以及从任何受支持的来源提供自定义或微调模型服务。
容器组件已可供商业使用。
适用条款: NIM 容器受 NVIDIA Software License Agreement 和 Product-Specific Terms for NVIDIA AI Products 的管辖;对该容器提供的任何模型的使用均受 NVIDIA Open Model License Agreement 以及管辖所使用的特定模型的任何附加条款的约束。
您有责任确保您对 NVIDIA 提供的软件和模型的使用符合所有适用的法律。
全球
Model-free 容器并不绑定于单一模型。实际可运行的 GPU 和并行度取决于您加载的模型以及在启动时为其生成的部署配置文件。针对您选择的模型运行 list-model-profiles 即可查看兼容的配置文件。
SGLang Model-Free NIM 提供了一个兼容 OpenAI 的 API,以便无缝集成到现有的应用程序和工作流中。
API 端点:
/v1/chat/completions — 聊天补全(流式和非流式)/v1/models — 列出可用模型/health/ready — 健康检查操作系统: Linux
我们的 AI 模型经过设计和/或优化,可在 NVIDIA GPU 加速系统上运行。通过利用 NVIDIA 的硬件(如 GPU 核心)和软件框架(如 CUDA 库),与仅使用 CPU 的解决方案相比,该模型实现了更快的推理时间。
以下示例使用环境变量 NIM_LLM_IMAGE 来指代 model-free NIM 容器镜像:
export NIM_LLM_IMAGE=nvcr.io/nvstaging/nim/sglang-model-free-nim:1.0.0
通过以下任意一种方法提供模型。如果同时提供了两者,则后端 CLI 位置参数优先。
NIM_MODEL_PATH 环境变量:
docker run --gpus=all
-e NIM_MODEL_PATH=hf://meta-llama/Llama-3.1-8B-Instruct
-e HF_TOKEN=<your-token>
-p 8000:8000
${NIM_LLM_IMAGE}
后端 CLI 位置参数:
docker run --gpus=all
-e HF_TOKEN=<your-token>
-p 8000:8000
${NIM_LLM_IMAGE}
hf://meta-llama/Llama-3.1-8B-Instruct
| 前缀 | 来源 | 示例 |
|---|---|---|
hf:// | Hugging Face Hub | hf://meta-llama/Llama-3.1-8B-Instruct |
ngc:// | NVIDIA NGC | ngc://nim/meta/llama-3.3-70b-instruct:hf |
s3:// | AWS S3 / S3 兼容存储 | s3://my-bucket/my-org/my-model |
modelscope:// | ModelScope Hub | modelscope://LLM-Research/Llama-3.2-1B-Instruct:d3e... |
gs:// | Google Cloud Storage | gs://my-bucket/my-org/my-model |
| (绝对路径) | 本地目录 | /mnt/models/my-llama |
Model-free NIM 会为张量并行 (TP)、流水线并行 (PP) 和 LoRA 的组合生成配置文件。您可以通过 NIM_MODEL_PROFILE 环境变量选择配置文件,或传递后端 CLI 参数(优先级更高)。支持以下参数:
| 参数 | 作用 | 默认值 |
|---|---|---|
--tensor-parallel-size | GPU 数量 | 1 |
--pipeline-parallel-size | 节点数量 | 1 |
--enable-lora | 启用 LoRA 适配器支持 | Disabled |
docker run --gpus=all
-e HF_TOKEN=<your-token>
-p 8000:8000
${NIM_LLM_IMAGE}
hf://meta-llama/Llama-3.1-8B-Instruct
--tensor-parallel-size 2
使用 list-model-profiles 可查看为给定模型生成的配置文件。由于该容器使用 SGLang backend,因此配置文件描述带有 sglang- 前缀。
docker run --gpus=all
-e NIM_MODEL_PATH=hf://meta-llama/Llama-3.1-8B-Instruct
-e HF_TOKEN=<your-token>
${NIM_LLM_IMAGE}
list-model-profiles
有关完整参考资料——包括模型下载详情、S3 环境变量、离线(air-gap)部署以及特定模型的高级用法(例如 MiniMax-M3)——请参阅 CND 用户文档。
请查阅 NGC 上的“安全扫描 (Security Scanning)”选项卡以查看最新的安全扫描结果。
对于扫描结果中列出的某些开源漏洞,NVIDIA 提供了漏洞可利用性交换 (VEX) 文档形式的响应。可从“安全扫描”选项卡查看和下载 VEX 信息。
NVIDIA 认为构建值得信赖的 AI 是一项共同的责任,我们已制定相关政策和实践,以支持广泛 AI 应用程序的开发。当按照我们的服务条款下载或使用时,开发者应与其内部开发团队合作,确保这些软件组件符合相关行业和用例的要求,并应对不可预见的产品误用。
请在此处报告质量、风险、安全漏洞或 NVIDIA AI 相关问题。
通过 NVIDIA Developer Forums 访问社区知识库文章和支持案例。
访问知识库文章和支持案例,或提交工单。