登录社区云,与社区用户共同成长
邀请您加入社区
这里注意一下,由于我们选择了 Qwen3.5-4B-Thinking,40亿的参数训练出来的结果一定是不尽人意,所以如果说想要训练更好的模型,就要选择更高参数的基础模型,还有更高的算力,使用的参数一定也不一样。因为作者名字里带兔,那么有句古话说的好,RabbitMQ(兔子没钱),所以我就不租用那么高的算力了,我们能看出来这个模型训练有效就算完成学习。然后选择 Chat 模式,点击加载模型,验证这个
多模态大模型的视觉编码器通常被视为一个"黑盒"——图像进去,token 出来;但是当我们需要回答"为什么 Qwen2-VL 能处理任意分辨率的图像"或"它和 Swin Transformer V2 的本质差异在哪"等这样细致的问题,我们必须打开这个黑盒,追踪从像素到 token 的每一行代码;因此本文基于 Qwen2-VL 官方源码,将从数据流、核心模块、框架对比三个层面逐层拆解;
本文介绍了Qwen3-0.6B模型中KVCache的显存开销问题及其优化方案。传统KVCache管理方式存在显存浪费严重的问题,分页注意力通过预分配连续空间并分割为等长块来提高空间利用率。文章详细讲解了分页注意力的核心原理,包括内存不连续处理、Packed模式等,并展示了flash-attn库的使用方法以及如何用triton实现分页注意力。该方案能有效减少显存占用,适用于长序列和大规模请求场景。
对于使用 MiniMax-H3、LTX、Qwen、Grok、分块解码、低显存放大、资产 API 以及 Mistral、Llama tokenizer 的用户,本次更新包含了直接相关的功能支持或问题修复。对于显存资源有限的设备,低显存模式往往是维持工作流可运行的重要选择。对于使用 LTX 系列模型的用户来说,v0.32.0 带来了对 2.5 版本的直接支持,并同步提供了对应的新节点能力。本次版本覆盖
我们采用的大模型是 qwen3.5-9b ,是阿里 Qwen 团队开源的一款约 9B 参数的原生多模态大模型,既能处理文字,也能理解图片qwen3.5-9b,是一个具有 9b 参数的大模型,也就是 90 亿参数的大模型;这个大模型是已经具备有图片理解,文字识别的能力,因此我们是在一个具备学习能力的模型的基础上把它培养成一个更擅长某种任务的模型;模型的下载可以通过魔塔社区直接下载,权重所占内存大约是
在很多情况下,去训练一个神经网络模型,本地的算力肯定是不够的,我们往往采用租或者使用学校或者公司的服务器进行模型训练等操作,本篇博客主要从零开始介绍如何使用远程服务器进行开发,帮助初学者更好的入门。
本文介绍了使用Unsloth框架对医疗问答模型Qwen2.5-3B-Instruct进行微调的方法。通过4bit量化和LoRA技术实现低资源消耗,采用GRPO强化学习算法优化模型。关键点包括:1) 使用包含语义正确性、流畅性和格式检查的混合奖励函数;2) 基于Deepseek-R1蒸馏的医疗数据集训练;3) 实验显示奖励值在50步后收敛至0.6左右。最终模型能规范生成包含<reasoning
用户输入↓↓│ YES → query() 调用 LLM ││ NO → 本地命令执行,直接返回结果 │↓↓├→ stream_event → 更新使用量├→ system (compact_boundary) → 压缩历史└→ ...其他类型↓预算/轮次检查↓返回 result特性实现方式价值流式处理实时响应、内存高效权限追踪包装 canUseTool透明记录、可审计会话恢复预持久化 trans
HAMi是一个开源的GPU虚拟化中间件,专为Kubernetes设计,能够实现细粒度的GPU资源管理。它支持显存和算力的动态分配,提供硬隔离保障,并兼容多种异构加速器。通过拦截CUDA API,HAMi确保每个Pod只能使用申请的资源量。该方案可应用于开发调试、模型推理和训练等场景,显著提升GPU利用率。平台集成监控和配额管理功能,支持Binpack等高级调度策略,为多租户提供安全共享GPU资源的
前文中写了自注意力的基础版本,成功跑起了推理,但这个实现有个问题,在实际使用中不得不面对:它申请了一块M×NM\times NM×N的注意力权重矩阵当MN变大时,比如prefix阶段计算一个长度为S的提示词,就需要申请S2S^2S2大小的注意力权重,这至少会产生三个开销额外的显存开销开辟、释放显存的开销读写全局内存的开销如果能避免这个中间矩阵申请就能同时降低显存开销和计算开销。
本文用 80 行 PyTorch 把 DeepSeek V2/V3 的 MLA 从论文推到能跑,然后在 RTX 3090 上量化了三件事:cache 体积(比同规模 MHA 小 56.9x,3090 实测一致)、朴素实现的 decode 开销(16k 上下文 MLA 反而比 MHA 慢约 4x)、absorption 和 decoupled RoPE 在数学上的等价与冲突关系(两行 einsum
前文用triton完成了FlashAttentionV2,成功将显存开销削减到ONO(N)ON,但16位下耗时显著长于官方实现。本文将分步提升性能,最后耗时从官方的237%下降到112%
LoRA轻量化微调实战教程,使用PEFT+BitsAndBytes在单张RTX 4090上微调Qwen2.5-7B大模型。包含4bit量化加载、LoRA参数配置、自定义数据集构建、SFT训练、模型合并、推理对比等完整Python代码,所有代码可直接运行。
我查了一下:AutoSOTA 论文把流程拆成三段:资源/目标设定、实验评估、反思/构想,并用 8 个专门 agent 协作;GitHub 仓库目前更像是“优化结果榜单 + 每篇论文的 OPTIMIZATION.md”,不是开箱即用的完整系统。等你已经连续优化了 3-5 篇论文,再考虑写调度 agent:自动排队实验、监控日志、失败重试、生成报告。项目结果页:https://tsinghua-fib
备数据 → 做预处理 → 加载模型 → 冻结骨干 → 配损失优化器 → 前向传播算损失 → 反向更新 → 验证 → 保存 → 推理 → 解冻精调。
大家可以从魔搭社区平台,下载各种版本的各种大模型,尽量能在自己的电脑上运行,所以这边下载1.5B的版本下载后的文件夹里的东西不要动即可。
依托面向多种AI芯片的统一开源系统软件栈众智FlagOS的跨芯能力,众智FlagOS社区在Qwen3.5模型发布后,即完成了397B MoE多模态模型的全量适配、精度对齐、及多芯片迁移,实现Qwen3.5在多款芯片的同步适配上线。