统信UOS环境+英伟达CUDA异构平台下SGLang部署手册
·
部署环境说明
服务器: 浪潮NF5468M6
服务器操作系统: UOS V2500
SGLang版本: 0.5.4
训练卡:NVIDIA A100 X 2
Python版本: 3.11.6
大语言模型: DeepSeek-R1-Distill-Qwen-1.5B
部署步骤
1.CUDA异构平台安装部署
参考统信UOS环境下英伟达CUDA异构平台部署手册文档完成CUDA异构平台安装部署。
2.物理机部署SGLang服务
- 创建python虚拟环境
# 安装pip
yum install python3-pip
# 更新pip最新版本
pip install --upgrade pip
# 创建虚拟环境
cd /root
python3 -m venv sglang_venv
#激活虚机环境
source /root/sglang_venv/bin/activate
- 在线安装SGLang服务
# 安装依赖
yum install numactl numactl-devel python3-devel
# 安装SGLang服务
pip install sglang==0.5.4 --extra-index-url https://flashinfer.ai/whl/cu118/torch2.3/
# 启动SGLang服务
python3 -m sglang.launch_server --model-path /root/xyh/models/DeepSeek-R1-Distill-Qwen-1.5B --host 0.0.0.0 --tp 1 --served-model-name DeepSeek-R1-Distill-Qwen-1.5B --api-key uniontech --enable-metrics
常用参数说明:
model-path: 本地模型路径
host: 允许API服务访问地址
tp: GPU训练卡数量
served-model-name: API服务模型名称
api-key: API服务密码key
port: API服务端口
mem-fraction-static: 缓存池的内存使用量默认0.9
dp: GPU卡节点数量
enable-metrics: 启用Metrics
- 验证SGLang服务
curl -X POST http://localhost:30000/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer uniontech" \
-d '{
"model": "DeepSeek-R1-Distill-Qwen-1.5B",
"messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
"temperature": 0.7,
"max_tokens": 200,
"stream": false
}'
3.容器化部署GSLang服务
- 安装docker服务
# 安装docker
yum install -y docker
# 启动docker服务
systemctl start docker
# 设置docker服务自启动
systemctl enable docker
# 安装docker-compose
yum install -y docker-compose
-
安装nvidia-container-toolkit
参考统信UOS环境下英伟达CUDA异构平台部署手册文档中第八步。 -
容器化启动SGLang服务
创建sglang-compose.yaml配置,文件内容如下:
docker run -d \
--name sglang \
--restart always \
--network host \
--privileged \
--ipc host \
--ulimit memlock=-1 \
--ulimit nofile=65535:65535 \
--gpus all \
-v /data/models:/home/models \
registry.uniontech.com/uos-ai/uos-server-2500-sglang:v0.5.4 \
--model-path /home/models/DeepSeek-R1-Distill-Qwen-1.5B \
--host 0.0.0.0 \
--port 30000 \
--tensor-parallel-size 4 \
--mem-fraction-static 0.8 \
--served-model-name DeepSeek-R1-Distill-Qwen-1.5B \
--enable-metrics

- 验证SGLang服务
curl -X POST http://localhost:30000/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer uniontech" \
-d '{
"model": "DeepSeek-R1-Distill-Qwen-1.5B",
"messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
"temperature": 0.7,
"max_tokens": 200,
"stream": false
}'

更多推荐

所有评论(0)