登录社区云,与社区用户共同成长
邀请您加入社区
本文介绍阿里千问 8 月 20 日发布的 GUI 智能体基座模型 Qwen-UI-Agent。它让 AI 学会"看懂屏幕、点击按钮、填写表单",从而真正替人操作手机和电脑。文章用数据对比展示其在真机测试中的领先表现,并通过跨 App 办事、无 API 操作、跨设备协同等案例说明能力边界,同时解答"现在能否使用"和"安全性如何"两大核心疑问。
在AutoDL T4 GPU上部署vLLM推理服务,使用Qwen2-1.5B模型实现OpenAI兼容API。详解模型下载、服务启动、多种API调用方式(对话/流式/角色设定),附T4环境踩坑记录(HuggingFace镜像、flash-attn兼容)。
你是否觉得现在使用AI大模型成本太高?是否觉得模型越贵参数越多效果就越好?下面是一组前端动效的对比视频,分别是我用Qwen3.8-27B和Opus4.6生成的,使用的提示词完全相同:看完这个对比,不知道你们能否分辨出它们的身份?说实话,如果这不是我自己测的,我会毫不犹豫的认定第二个是Qwen3.8-27B的成果,因为这个的特效相比第一个要稍逊一筹。但实际上,第一个才是Qwen3.8-27B生成出来
DeepSeek Harness(dsh)表面是一个开源 Agent 框架,底层是一套「无特权核心、一切皆插件」的运行时。它把模型、工具、会话、沙箱、调度、UI 全部下沉为可热替换的插件,而支撑这种「随时拆装」的元框架叫做 Cordis——一份被 DeepSeek 整体 vendor 进仓库、改了 18 处的 TypeScript 微内核。
本文基于官方 Benchmark 数据,对 Ornith-1.5 的 9B、35B 与 397B 三个版本进行纯编程能力横评,并与 Ornith-1.0、Qwen、Gemma、DeepSeek 及 Claude Opus 4.8 逐项对比。结果显示:9B 在编码任务上大面积超越 30B+ 模型,35B MoE 全面压制同尺寸竞品,397B 首次进入 Claude Opus 4.8 的对话圈;而全文
简要介绍DeepSeek模型服务调价事件的时间、背景及核心原因(如算力成本、市场竞争、服务升级等)。
Qwen3.8与Qwen3.6技术架构解析 核心摘要 阿里巴巴Qwen系列大模型实现两大技术突破: Qwen3.8-Max旗舰版:2.4万亿参数MoE架构,仅激活950亿参数实现高效推理,在第三方评测中综合能力全球第二,支持百万Token上下文和原生多模态能力,首次开源Max级模型权重(4.89TB BF16版本)。 Qwen3.6私有化部署版:35亿总参数MoE模型仅激活3亿参数,使大模型首次适
DeepSeek技术架构与源码分析摘要 DeepSeek系列模型通过"以轻驭重"的工程化理念,在算力受限条件下实现高性能。开源生态包括从轻量级推理模型到超大规模MoE模型的完整矩阵,采用MIT许可证,在GitHub和ModelScope平台同步发布。 核心模型分析: DeepSeek-R1蒸馏版:通过动态知识蒸馏框架(特征层/输出层/任务特定三层蒸馏)实现小模型高性能。R1-0528版本在数学推理
在 RAM 只有 8GB 的树莓派 5 或者 Rockchip RK3588 边缘嵌入式板卡上跑 Qwen-1.5B 或 Llama-3-8B-INT4 时,最头疼的莫过于长文本推理过程中内存渐进式泄漏。系统刚启动时一切正常,连续运行 48 小时处理数万条上下文后,板卡突然失联。登跳板机查看内核日志,发现系统被内核oom-killer强制屠杀。在受限芯片上运行 LLM,纯靠理想化的内存管理不靠谱。
本文给出一套七层阅读法:模型身份、开放范围、许可证、训练数据、训练方法、评测证据、限制与复现资产。案例覆盖 Llama 4、Qwen3、DeepSeek、Gemma、gpt-oss、OLMo 和 Nemotron。目标不是替某个模型背书,而是训练你把模型报告读成一条可核验的证据链。
文章摘要: DeepSeek-Harness(dsh)是DeepSeek推出的本地大模型API调试工具,需通过Node.js命令行运行。提供三种启动方式:1)npx临时运行;2)全局安装(推荐);3)dsh-launcher桌面启动器(适合新手)。重点介绍了dsh-launcher的功能优势(双击即用、开机自启、错误诊断等)和安装方法,并给出常见问题的解决方案(如命令未找到、端口占用等)。最后推荐
2026年8月17日,DeepSeek新版API价格生效,V4 Pro峰时输出涨至27元/百万Token(约3.5倍)。本文提供完整决策指南:成本测算→替代方案评估→迁移成本估算→综合决策。还包含缓存优化、模型分级等防守策略,助你理性应对涨价。
千问团队开源Qwen3.8-27B大模型,在多模态处理、推理深度、编程办公等场景实现全面升级。实测显示:该模型在Linux知识(满分)、逻辑常识(满分)、传统文化(90分)、高考数学(95分)四科测试中表现优异,推理速度稳定在50 tokens/秒,支持262K长上下文。相比前代,Qwen3.8通过混合架构和词表扩展显著提升中文理解与多任务处理能力,尤其适合运维、开发等复杂场景。大模型技术正重塑职
DeepSeek 涨价首日(8·17),全网都在骂。但有一个数据被骂声盖住了:它的调用量,没掉。更反常识的是——真正被这轮涨价"精准收割"的,不是那些喊着要离开的人,而是把缓存命中率优化到 98%、把 Pro 当默认选项的重度用户,比如我。这篇文章不替谁喊冤,只做两件事:把"暴跌"的谣言拆干净,把"怎么不再被坑"的账算明白。
170-210 tok/s,3090 本地部署 Qwen3.8-27B 全记录:从翻车现场到 3 倍加速的实战避坑指南
一个约 17GB 的模型文件,如今已经能在家用机器上完成过去需要大型专有模型才能完成的工作:它拥有长上下文、有效的工具调用、强大的视觉能力和合格的代码生成能力,还能驱动编码智能体完成真实任务。这件事本身就足够令人惊叹。仅仅一年前,类似的能力还可能需要昂贵的专有模型和数据中心级硬件;现在,一台配置不错的笔记本电脑就能运行一个相当有竞争力的开放权重模型。Qwen 3.8 27B 当前最大的短板不是能力
本文介绍了DeepSeek Harness(dsh)内置评测闭环插件的设计与实现,旨在解决当前LLM智能体评测中的核心缺陷。文章系统分析了现有评测生态的四大问题:高成本实时推理依赖(G1)、模型与框架变更混淆(G2)、重结果轻过程(G3)以及多Agent评测薄弱(G4)。针对这些问题,提出了三大创新方案:零token离线回放回归(N1)实现低成本消融测试,确定性评测(N2)通过HTTP录制回放隔离
GRPO(Group Relative Policy Optimization)是一种旨在替代PPO中Critic网络的方法,通过组内比较计算相对优势,解决了PPO在大模型训练中的显存占用高、训练不稳定和工程复杂度问题。其核心机制包括在线组采样、规则打分、组内优势计算和PPO裁剪更新。GRPO省去了独立的Critic网络,显存占用降低30~40%,且支持纯RL训练(如DeepSeek-R1-Zer
本文详细介绍了如何在DeepSeek Harness(DSH)中接入免费的NVIDIA GLM5.2和MiniMax-M3模型,并为其添加多模态图片识别能力。主要内容包括:1)获取NVIDIA API Key的步骤;2)在DSH中添加自定义Provider的方法;3)通过修改配置文件开启多模态输入功能;4)常见问题及解决方案。文章特别指出GLM5.2通过NVIDIA API不支持图片识别,建议使用
deepseek-v4-flash-0731-in-c 是一个纯 C99 + OpenMP 的大模型 CPU 推理引擎,可在不使用 GPU、CUDA、PyTorch和权重转换的情况下,直接加载原生 DeepSeek-V4-Flash-0731 284B-A13B 权重。本文给出环境要求、完整运行命令、实测 TTFT/TPOT,以及 MoE 专家流式读取、缓存、I/O 计算流水线和低比特算子优化的实
DeepSeek Harness(DSH)作为以插件为核心设计的AI开发平台,其官方核心功能有限,真正的生产力来自1000多个社区插件。本文精选10个最实用的第三方插件,涵盖文件引用、交互式UI生成、视觉增强、多Agent协作等功能。重点介绍了dsh-at-file实现@文件引用、dsh-genui将模型输出转为交互组件、ModLens为纯文本模型添加视觉能力等插件的实现原理和使用价值。文章还解析
本周海内外AI产品集中发布,海外OpenAI、xAI、Meta、NVIDIA持续迭代大模型与智能体产品,国内阿里、DeepSeek、智谱、小红书、腾讯等接连开源语音、超大参数基座、Agent开发框架与多模态生成工具,各家普遍加码长任务AI智能体能力,开源生态、本地离线推理、AI内容合规溯源成为近期行业核心方向,一起来回顾本周发生的AI新鲜事儿吧!
本文承接上篇《DeepSeek Harness 安装教程》,专聊刚开源的 DeepSeek Agent 框架 Harness 的插件生态。对于插件:先讲清楚插件到底能干嘛、它和 Harness 是什么关系,再给你盘一波我亲自翻过几个插件站、挑出来的高人气实用插件,每个都附安装命令和用法。最后再推荐几个找插件的网站。
区分逆向Sub2API(GPTplus‑pro/Claude‑max):逆向接口单价低,但受网页账号配额限制,高并发容易截断、封号,不适合生产业务;聚合平台为正规资源,支持长文本、高并发。API聚合平台核心价值:一次接入,全模型调用,简化开发、稳定可控、成本优化,适合个人开发者与中小型AI项目。2. 自研网关保障稳定:负载均衡、故障自动切换、缓存优化,缓解TTFT延迟,规避单点接口报错。AI应用开
2026 年,如果你只允许一个 AI 工程师保留一个技能,那不再是 Prompt Engineering,而是Context Engineering(上下文工程)。窗口已经"够用"了,但 Agent 依然在失忆。截至 2026 年中,主流旗舰模型的上下文窗口已达 1M token 级别(Claude Opus/Sonnet 4.6 的百万 token 窗口于 2026 年 3 月全面 GA,GPT
DeepSeek发布开源智能体工作台DeepSeek-Harness,支持通过插件实现功能扩展。文章详细介绍从安装到实战提取术语的全过程:1)安装Node.js和Harness;2)申请DeepSeek API密钥;3)完成API配置;4)通过提示词熟悉操作;5)实战演示如何从双语docx文件中自动提取术语并生成Excel术语表。整个过程无需编程基础,半小时内即可完成,显著提升翻译工作中术语管理的
冻结284B DeepSeek和417M MoonViT,仅训练40M PatchMerger连接器,用10万样本、5张H200、2000美元、20小时获得基础视觉能力,验证了"冻结大模型+训练小连接器"的VLM范式。
摘要: 本文详细介绍了如何在本地使用Ollama部署大模型(如DeepSeek-R1、Qwen2.5),解决显存不足等问题。Ollama简化了模型运行流程,支持一键下载和对话。针对显存不足,提供了改用小模型、CPU运行或调整存储路径等方案。推荐Open WebUI提升交互体验,并演示了通过API调用本地模型的方法。常见问题如CUDA报错、端口占用等均有解决方案。本地部署兼顾隐私与离线使用,适合轻量
Claude Code 的会话恢复,更像是把上次的工作重新接起来,而不是让程序回到关闭前的那一刻。JSONL 留下对话和状态记录,parentUuid找回当前路线,仍然有效的工作状态再回到当前进程。这套实现也提供了一个很实用的工程思路:日志不一定只是写给人看的几行字符串。JSONL 仍然是文本,但每一行都有固定结构,程序可以一边运行一边追加,也能在之后重新解析。同一份日志还能保存多种类型的记录。对
文章摘要: 本文对比了阿里云开源的两个大模型Qwen3.8-27B和Qwen3.6-35B-A3B-FP8的性能差异。Qwen3.8-27B是2026年8月发布的新一代27B参数稠密模型,在编码、推理和多模态能力上全面领先,8个基准测试得分高出3.2-12.9分。而Qwen3.6-35B-A3B-FP8是4月发布的35B参数MoE模型,采用FP8量化,每token仅激活3B参数,在推理效率、部署成
*对话系统:达到810令牌/秒的处理速度,支持实时交互*文档处理:基于MLA的缓存机制在长文本处理中表现突出*轻量级部署:通过专家共享和RMSNorm优化,内存占用降低40%### 总结DeepSeekMoE通过创新的混合专家架构、潜在注意力缓存和优化的归一化策略,在模型规模与计算效率之间找到了新的平衡点。:在配置64个专家(其中8个共享)的情况下,DeepSeekMoE较Switch Trans
同一个 DeepSeek V4 Pro,换个环境跑分从 91 涨到 99,模型没变。社区一度怀疑官方在 API 背后路由了三个模型,实验和源码给出更可信的答案:Minimal 模式复刻了模型 RL 训练时的原始环境,环境对上能力就释放,社区插件靠“先锚定后放开”稳定跑出 98/99。同一天,V4 Flash 也被曝“超进化”:按任务难度动态分配思考强度后,这个轻量模型在物理仿真任务上进了第一梯队。
DeepSeek Harness在48小时内创下GitHub最快涨星纪录(5万+Star),成为Agent开发领域的革命性产品。其核心创新在于"一切皆插件"的架构设计,通过Cordis元框架实现了完全的模块化:模型适配器、工具注册表、Agent Loop等所有组件均可热替换,无需修改源码。相比传统框架(如LangGraph、CrewAI),它彻底消除了"特权内核",支持配置驱动的动态组装和热更新,
摘要: 谷歌闪电发布Gemini 3.7 Flash,距3.6版本仅三周,实现推理速度与代码质量的跨越式升级。新版本通过动态混合思考机制,在保持亚秒级响应的同时,显著提升复杂任务处理能力,首遍代码准确率(Pass@1)大幅跃升。基准测试显示,其生产代码质量(FrontierCode 1.1得分43.6%)、真实Bug修复(DeepSWE v1.1提升16.3%)及Agent自动化(Automati
2026 年 8 月 14 日,智谱 AI 正式发布新一代旗舰基座模型 **GLM-5.3**。核心卖点:编程能力最强的开源模型,编程体感较前代提升 50%,编程与智能体能力接近 Claude Fable 5关键事实与 GLM-5.2 使用完全相同的基座(总参数约 7430 亿),性能提升全部来自极致的后训练 Scaling- 即日上线智谱官方编程工具 ZCode、效率工具 AutoClaw,及
场景一:模型选型: 开发者不再盲目听从宣传,而是根据自己的业务需求(如数学能力、编程能力),运行Harness查看客观分数,选择最适合的模型。展望“志鹏AI”: 承诺在未来的专栏中,将持续利用DeepSeek harness等专业工具,为大家带来深度、客观的模型评测和技术解读。多维度评估: 集成大量权威基准测试(如MMLU, GSM8K, HumanEval等),涵盖常识、数学、编程、逻辑推