部署环境说明

服务器: 浪潮NF5468M6
服务器操作系统: UOS V2500
SGLang版本: 0.5.4
训练卡:NVIDIA A100 X 2
Python版本: 3.11.6
大语言模型: DeepSeek-R1-Distill-Qwen-1.5B

部署步骤

1.CUDA异构平台安装部署

参考统信UOS环境下英伟达CUDA异构平台部署手册文档完成CUDA异构平台安装部署。

2.物理机部署SGLang服务
  • 创建python虚拟环境
# 安装pip
yum install python3-pip
# 更新pip最新版本
pip install --upgrade pip
# 创建虚拟环境
cd /root
python3 -m venv sglang_venv
#激活虚机环境
source /root/sglang_venv/bin/activate
  • 在线安装SGLang服务
# 安装依赖
yum install numactl numactl-devel python3-devel
# 安装SGLang服务
pip install  sglang==0.5.4 --extra-index-url https://flashinfer.ai/whl/cu118/torch2.3/


# 启动SGLang服务
python3 -m sglang.launch_server --model-path /root/xyh/models/DeepSeek-R1-Distill-Qwen-1.5B  --host 0.0.0.0 --tp 1 --served-model-name DeepSeek-R1-Distill-Qwen-1.5B  --api-key uniontech --enable-metrics

常用参数说明:
model-path: 本地模型路径
host: 允许API服务访问地址
tp: GPU训练卡数量
served-model-name: API服务模型名称
api-key: API服务密码key
port: API服务端口
mem-fraction-static: 缓存池的内存使用量默认0.9
dp: GPU卡节点数量
enable-metrics: 启用Metrics

  • 验证SGLang服务
curl -X POST http://localhost:30000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer uniontech" \
  -d '{
    "model": "DeepSeek-R1-Distill-Qwen-1.5B",
    "messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
    "temperature": 0.7,
    "max_tokens": 200,
    "stream": false
  }'
3.容器化部署GSLang服务
  • 安装docker服务
# 安装docker
yum install -y docker
# 启动docker服务
systemctl start docker
# 设置docker服务自启动
systemctl enable docker
# 安装docker-compose
yum install -y docker-compose

创建sglang-compose.yaml配置,文件内容如下:

docker run -d \
  --name sglang \
  --restart always \
  --network host \
  --privileged \
  --ipc host \
  --ulimit memlock=-1 \
  --ulimit nofile=65535:65535 \
  --gpus all \
  -v /data/models:/home/models \
  registry.uniontech.com/uos-ai/uos-server-2500-sglang:v0.5.4 \
    --model-path /home/models/DeepSeek-R1-Distill-Qwen-1.5B \
    --host 0.0.0.0 \
    --port 30000 \
    --tensor-parallel-size 4 \
    --mem-fraction-static 0.8 \
    --served-model-name DeepSeek-R1-Distill-Qwen-1.5B \
    --enable-metrics

  • 验证SGLang服务
curl -X POST http://localhost:30000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer uniontech" \
  -d '{
    "model": "DeepSeek-R1-Distill-Qwen-1.5B",
    "messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
    "temperature": 0.7,
    "max_tokens": 200,
    "stream": false
  }'

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐