废话不多说,初步测试记录整理如下:

复刻Ollama应用

打开模板中心页面:https://cloudstudio.net/t

找到Ollama项后,点击【使用模板】按钮,或者直接打开应用【AI模板——Ollama - Cloud Studio】(https://cloudstudio.net/a/26997635105468416)后复刻,结果是一样的。这里读者直接复刻本人已经复刻好的应用Ollama-Qwen3.8 - Cloud Studio[https://cloudstudio.net/a/37595859894779904]就好了。

启动及升级应用环境

由于是最新版本的模型,这里需要升级一下ollama引擎。

curl -fsSL https://ollama.com/install.sh | sh

拉取模型运行

考虑到16GB显卡运行成本较低,这里特意选取大小合适性能不错的基于Unsloth Dynamic V3.0的UD-Q3_K_XL量化版本。

ollama run --verbose hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q3_K_XL

测试默写长诗

总的说来,eval rate大约10 tokens/s。

root@8f17b6ae31ac(Qwen3.8):/workspace  2026-08-15 09:21:26+00 #

ollama run --verbose hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q3_K_XL

>>> /show parameters

Model defined parameters:

  stop                           "<|im_start|>"

  stop                           "<|im_end|>"

  stop                           "<think>"

  stop                           "<|im_start|>user"

>>> /set nothink

Set 'nothink' mode.

>>> /set parameter temperature 0.1

Set parameter 'temperature' to '0.1'

>>> 你是谁

我是通义千问(Qwen),是由阿里巴巴集团通义实验室独立开发的大型语言模型。

我可以帮你解答问题、提供建议、进行创意写作、编写和调试代码、分析数据,或者只是陪你聊聊

天。

请问今天有什么我可以帮你的吗?

total duration:       6.224271694s

load duration:        423.265261ms

prompt eval count:    13 token(s)

prompt eval duration: 489.461ms

prompt eval rate:     26.56 tokens/s

eval count:           58 token(s)

eval duration:        5.308317s

eval rate:            10.93 tokens/s

>>> /bye

root@8f17b6ae31ac(Qwen3.8):/workspace  2026-08-15 09:23:25+00 #

ollama ps

NAME                                         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              

hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q3_K_XL    d389d2a85119    13 GB    100% GPU     4096       4 minutes from now    

root@8f17b6ae31ac(Qwen3.8):/workspace  2026-08-15 09:23:28+00 #

```

## 文章默写测试之《春江花月夜》

```

root@8f17b6ae31ac(Qwen3.8):/workspace  2026-08-15 09:23:28+00 #

ollama run --verbose hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q3_K_XL

>>> 《春江花月夜》

Thinking...

【此处省略部分】

...done thinking.

你是指唐代张若虚的《春江花月夜》吗?这是中国古典诗歌中非常著名的一首乐府旧题诗,常被称作“孤

篇横绝”“孤篇盖全唐”。下面是全文与简要赏析:

## 《春江花月夜》  

**唐·张若虚**

春江潮水连海平,海上明月共潮生。  

滟滟随波千万里,何处春江无月明!  

江流宛转绕芳甸,月照花林皆似霰。  

空里流霜不觉飞,汀上白沙看不见。  

江天一色无纤尘,皎皎空中孤月轮。  

江畔何人初见月?江月何年初照人?  

人生代代无穷已,江月年年望相似。  

不知江月待何人,但见长江送流水。  

白云一片去悠悠,青枫浦上不胜愁。  

谁家今夜扁舟子?何处相思明月楼?  

可怜楼上月徘徊,应照离人妆镜台。  

玉户帘中卷不去,捣衣砧上拂还来。  

此时相望不相闻,愿逐月华流照君。  

鸿雁长飞光不度,鱼龙潜跃水成文。  

昨夜闲潭梦落花,可怜春去不复还。  

江水流春去欲尽,江潭落月复西斜。  

斜月沉沉藏海雾,碣石潇湘无限路。  

不知乘月几人归,落月摇情满江树。

---

## 简要赏析

这首诗以“春、江、花、月、夜”五个意象为核心,把自然景色、人生哲理与离愁别绪融合在一起。

### 1. 开篇气势宏大  

“春江潮水连海平,海上明月共潮生。”  

春潮浩荡,月光随潮水升起,视野辽阔,意境开阔,一下子把读者带入一个宏大而清明的夜晚。

### 2. 月色之美极尽清丽  

“滟滟随波千万里,何处春江无月明!”  

月光洒满江面,随波荡漾,无处不在。这里写的是视觉之美,也有一种无处不在的思念之情。

### 3. 由景入理,追问宇宙人生  

“江畔何人初见月?江月何年初照人?”  

诗人由眼前明月联想到人类与宇宙的关系:人生短暂,代代更替;而江月恒久,年复一年。

### 4. 离情与相思贯穿全诗  

后半部分转入具体的人情:  

“谁家今夜扁舟子?何处相思明月楼?”  

一边是漂泊在外的游子,一边是楼上思念的闺人。月光成为连接两地情感的媒介。

### 5. 结尾余韵悠长  

“不知乘月几人归,落月摇情满江树。”  

月亮落下,情思却仍在江树间摇荡。结尾不直接说愁,却把愁思写得弥漫、深远、余味无穷。

---

这首诗最动人之处,在于它不是单纯写景,也不是单纯抒情,而是把**自然之美、生命之思、离别之情

**融为一体,语言清丽,意境空明,是中国诗歌中极具代表性的名篇。

total duration:       3m17.50365817s

load duration:        414.802759ms

prompt eval count:    58 token(s)

prompt eval duration: 716.266ms

prompt eval rate:     80.98 tokens/s

eval count:           1866 token(s)

eval duration:        3m16.113149s

eval rate:            9.51 tokens/s

>>> Send a message (/? for help)

32G V100下速度超过30t/s

ollama show hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q3_K_XL

total duration:       4.526492467s

load duration:        424.568082ms

prompt eval count:    53 token(s)

prompt eval duration: 1.368403s

prompt eval rate:     38.73 tokens/s

eval count:           99 token(s)

eval duration:        2.729842s

eval rate:            36.27 tokens/s

>>>

显卡相关

root@fa50b9ca797b(Qwen3.8):/workspace  2026-08-15 09:41:34+00 #

ol ps

NAME                                         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              

hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q3_K_XL    d389d2a85119    15 GB    100% GPU     32768      4 minutes from now    

root@fa50b9ca797b(Qwen3.8):/workspace  2026-08-15 09:41:38+00 #

nv

Sat Aug 15 09:41:52 2026      

+-----------------------------------------------------------------------------------------+

| NVIDIA-SMI 580.65.06              Driver Version: 580.65.06      CUDA Version: 13.0     |

+-----------------------------------------+------------------------+----------------------+

| GPU  Name                 Persistence-M | Bus-Id          Disp.A | Volatile Uncorr. ECC |

| Fan  Temp   Perf          Pwr:Usage/Cap |           Memory-Usage | GPU-Util  Compute M. |

|                                         |                        |               MIG M. |

|=========================================+========================+======================|

|   0  Tesla V100-SXM2-32GB           On  |   00000000:00:0A.0 Off |                    0 |

| N/A   38C    P0             37W /  300W |   16107MiB /  32768MiB |      0%      Default |

|                                         |                        |                  N/A |

+-----------------------------------------+------------------------+----------------------+

+-----------------------------------------------------------------------------------------+

| Processes:                                                                              |

|  GPU   GI   CI              PID   Type   Process name                        GPU Memory |

|        ID   ID                                                               Usage      |

|=========================================================================================|

|  No running processes found                                                             |

+-----------------------------------------------------------------------------------------+

root@fa50b9ca797b(Qwen3.8):/workspace  2026-08-15 09:41:52+00 #

注意事项

上下文长度

如果上下文过长,导致暴显存就会速度明显下降,可以使用下面命令限制较小的尺寸。

>>> /set parameter num_ctx 8192

Set parameter 'num_ctx' to '8192'

>>>

在线预览

1分钟就能进入在线预览环境体验哦

打开

https://cloudstudio.net/a/37595859894779904

后,点预览数秒后启动环境,出现命令提示符。马上执行此命令行即可:

ollama run --verbose hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q3_K_XL

测试记录

➜  /workspace cd /workspace/tools && sh ollama_start.sh
Creating log directory...
Starting Ollama service...
-e Ollama service is running
-e Log file: /workspace/logs/ollama.log
-e Recent logs:
time=2026-08-15T10:22:34.713Z level=INFO source=images.go:919 msg="total unused blobs removed: 0"
time=2026-08-15T10:22:34.713Z level=INFO source=routes.go:1990 msg="Listening on [::]:11434 (version 0.32.13)"
time=2026-08-15T10:22:34.716Z level=INFO source=runner.go:60 msg="discovering available GPUs..."
time=2026-08-15T10:22:35.618Z level=INFO source=model_list_cache.go:112 msg="model list cache hydration complete" models=3 failures=0 elapsed=904.678546ms
time=2026-08-15T10:22:35.981Z level=INFO source=model_recommendations.go:177 msg="model recommendations cache sleep scheduled" wait=4h1m32.182861324s consecutive_failures=0
➜  tools ollama run --verbose hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q3_K_XL
>>> 你是谁   
Thinking...
用户问“你是谁”,这是一个直接的自我介绍请求。我可以直接回答我是通义千问(Qwen),由阿里巴巴集团通义实验室研发
。回答应简洁、自然,不需要提及内部指令或版本信息。
...done thinking.

我是通义千问(Qwen),由阿里巴巴集团通义实验室自主研发的大语言模型。我可以协助你进行问答、创作、逻辑推理、编
程等多类任务,也可以与你进行多轮对话。很高兴为你服务!

total duration:       10.373439949s
load duration:        416.912759ms
prompt eval count:    53 token(s)
prompt eval duration: 1.195378s
prompt eval rate:     44.34 tokens/s
eval count:           95 token(s)
eval duration:        8.757272s
eval rate:            10.85 tokens/s
>>> Send a message (/? for help)

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐