国内主流大模型

厂商模型名称 (最新版)开源状态核心特点 / 杀手锏适用场景
深度求索DeepSeek-V4 / R1✅ 完全开源极致性价比 & 推理之王。采用 MoE (混合专家) 架构,以极低训练成本实现顶级性能。R1系列在数学、逻辑推理上比肩甚至超越o1,且完全开源权重。硬核逻辑推理、数学解题、代码生成、低成本高性能私有部署、学术基准测试。
智谱 AIGLM-5 / GLM-4✅ 全面开源逻辑严谨、主权AI。中文理解极佳,生态完善,尺寸齐全。私有化部署、微调研究、政府/国企项目。
阿里 (通义)Qwen-3.5 / Qwen-3✅ 全面开源全能王者。代码、多语言、视觉理解全球领先,社区最活跃。通用应用开发、多模态任务、企业级基座。
月之暗面Kimi K2.5❌ 闭源长文本 & Agent。百万级上下文,自主规划能力极强。法律/金融分析、科研文献、复杂任务自动化。
MiniMaxMiniMax M2.5❌ 闭源代码工程 & 多模态交互。拟人化交互、游戏/社交场景首选。游戏NPC、社交应用、代码辅助。
百度 (文心)文心 5.0❌ 闭源知识图谱融合。依托搜索实时数据,事实性准确率高。搜索增强、企业知识库、营销文案。
华为 (盘古)盘古 5.0❌ 闭源行业垂直 & 昇腾适配。专为B端行业设计,软硬一体。工业互联网、气象、药物研发、政务。
字节 (豆包)Doubao-Pro⚠️ 部分开源性价比 & 端侧优化。极致成本控制,移动端响应快。移动端App、高并发C端应用。

开源模型对比:

维度阿里 Qwen-3智谱 GLM-5DeepSeek-V4/R1
定位全能型选手稳健型专家极致推理极客
最强项综合能力强,多模态、多语言均衡,生态最大。中文语境好,逻辑稳,B端落地经验丰富。数学/逻辑推理、代码、极致性价比。
架构特点稠密 + MoE 混合,尺寸最全。GLM 独特架构,注重长窗口和指令遵循。纯 MoE 架构,激活参数少,推理效率极高。
社区热度⭐⭐⭐⭐⭐ (全球最高)⭐⭐⭐⭐ (国内政企首选)⭐⭐⭐⭐⭐ (开发者/学术界最爱)
一句话评价“不知道选谁时就选 Qwen,不会错。”“国企和政府最放心的开源选择。”“用最低的成本,跑最强的逻辑推理。”

从何下载大模型

  • Hugging Face = AI 界的 GitHub (全球通用):资源最全、国际标准、开发者首选,但在中国访问困难。
  • 魔搭社区 (ModelScope) = AI 界的 Gitee (中国本土):阿里发起、国内访问极速、中文友好、针对国内合规优化。

核心区别:

维度Hugging Face (HF)魔搭社区 (ModelScope)
归属/背景美国公司 (全球最大 AI 社区)阿里巴巴达摩院 (中国最大 AI 社区)
网络访问🇨🇳 国内极慢/经常无法访问
需梯子或镜像站
🇨🇳 国内极速
阿里云骨干网支持,无需梯子
模型资源量🌍 全球最全
几乎所有首发模型都会上传 HF
🇨🇳 国内最全 + 部分国际
国产模型首发地,国际模型同步稍慢
下载速度🐢 国内通常只有几十 KB/s (甚至超时)🚀 国内可达几十 MB/s (跑满带宽)
主要语言英语为主 (国际化)中文为主 (本土化)
合规性遵循国际法律,内容较自由严格遵循中国法律法规
敏感模型会被下架或审核
特色功能Spaces (在线 Demo), Datasets, PapersModelStudio (创空间), 灵积 (API 市场), 数据集
工具链兼容transformers, diffusers (原生支持)modelscope (SDK), 兼容 transformers
典型用户全球研究者、海外开发者、前沿探索者中国开发者、企业用户、高校学生

如果需要部署国内大模型,就选ModelScope,如果部署国外大模型就选Hugging Face

私有化部署开源大模型工具

  • Ollama = “开箱即用”的极简体验(适合个人开发者、本地测试、快速上手)。
  • vLLM = “极致性能”的生产引擎(适合企业部署、高并发服务、生产环境)。

两者核心区别如下:

维度OllamavLLM
定位个人/开发者的本地运行工具高性能推理服务框架
上手难度⭐ (极低,一行命令启动)⭐⭐⭐ (需配置 Python 环境、参数调优)
核心优势simplicity (简单)、跨平台、自动量化Throughput (吞吐量)、高并发、PagedAttention
推理速度中等 (适合单用户交互)极快 (适合多用户同时访问)
并发能力弱 (主要优化单路对话)极强 (支持连续批处理 Continuous Batching)
量化支持内置自动量化 (默认加载 4-bit/5-bit)需手动转换模型格式 (AWQ/GPTQ/FP8)
API 兼容自有 API (兼容 OpenAI 部分接口)完全兼容 OpenAI API
操作系统Windows, macOS, Linux主要 Linux (Windows 支持尚在完善中)
显存管理自动管理,简单粗暴精细控制 (PagedAttention 技术)
典型场景本地写代码助手、个人知识库、快速测试模型企业内部大模型服务、高流量 API 网关、SaaS 后端

基于vLLM本地私有化部署开源大模型

购买云算力服务器

因为我本地 mac m1 笔记本,并无显卡,所以就购买云算力服务器,至于需要购买多大显存、内存、存储的的服务器,可以把要部署的模型名称丢给千问,千问会帮我们估算需要什么配置的服务器,我们参考着购买即可。
我选择的 AutoDL算力云服务器,推荐选按量计费方式,晚上睡觉休息可以关机不扣费。
在这里插入图片描述

安装 vLLM部署工具

# 安装vllm
pip install vllm
# 查看安装的版本
vllm -v
0.17.0

下载Qwen/Qwen3.5-0.8B模型

魔塔模型详情页有下载方式介绍:在这里插入图片描述

进入算力云服务器终端界面:
在这里插入图片描述

创建目录和代码文件:
在这里插入图片描述

我选择 sdk 方式下载,在算力云服务器编写下载模型代码:

#模型下载
from modelscope import snapshot_download
# model_dir = snapshot_download('Qwen/Qwen3-8B', cache_dir='/root/autodl-tmp/models', revision='master')

model_dir = snapshot_download('Qwen/Qwen3.5-0.8B', cache_dir='/root/autodl-tmp/models', revision='master')

下载模型:

python autodl-tmp/code/download.py

在这里插入图片描述

部署Qwen/Qwen3.5-0.8B模型

在服务器终端执行部署命令:

python -m vllm.entrypoints.openai.api_server \
  --model /root/autodl-tmp/models/Qwen/Qwen3.5-0.8B \
  --served-model-name qwen3.5-0.8b \
  --max-model-len 8192 \
  --host 0.0.0.0 \
  --port 6006 \
  --dtype float16 \
  --gpu-memory-utilization 0.8 \
  --enable-auto-tool-choice \
  --tool-call-parser hermes

由于我们购买算力云服务器是没有公网 ip 的,所以我们需要建立 ssh 隧道,使得本地网络可以访问服务器上部署的大模型服务。
在这里插入图片描述
在这里插入图片描述

浏览器访问:http://localhost:6006/docs,就可以看到 vllm 部署大模型后fastapi 接口文档了:
在这里插入图片描述

调下检查健康的接口,是能看到接口请求成功返回 200:在这里插入图片描述
在这里插入图片描述

下载deepseek-ai/DeepSeek-R1-0528-Qwen3-8B模型

修改模型下载代码:

#模型下载
from modelscope import snapshot_download
# model_dir = snapshot_download('Qwen/Qwen3-8B', cache_dir='/root/autodl-tmp/models', revision='master')

model_dir = snapshot_download('deepseek-ai/DeepSeek-R1-0528-Qwen3-8B', cache_dir='/root/autodl-tmp/models', revision='master')

执行代码下载模型:

python autodl-tmp/code/download.py

部署deepseek-ai/DeepSeek-R1-0528-Qwen3-8B模型

python -m vllm.entrypoints.openai.api_server \
  --model /root/autodl-tmp/models/deepseek-ai/DeepSeek-R1-0528-Qwen3-8B \
  --served-model-name ds-qwen3-8b \
  --max-model-len 8192 \
  --host 0.0.0.0 \
  --port 6006 \
  --dtype float16 \
  --gpu-memory-utilization 0.8 \
  --enable-auto-tool-choice \
  --tool-call-parser hermes

本地私有化部署开源大模型比较简单,只要有服务器硬件条件满足能部署,下载模型–>安装 vllm–>部署。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐