登录社区云,与社区用户共同成长
邀请您加入社区
预训练= 读万卷书(学知识)SFT= 拜师学艺(学格式)RLHF= 社会打磨(学做人)纯 RL= 闭关顿悟(学会思考)SFT 对齐= 融会贯通(既会思考,也会聊天)DeepSeek-R1 的革命性在于:它证明了深度推理能力不需要人类手把手教,只要给模型一个"对/错"的判卷机,它就能自己"悟"出来。这也是为什么 R1 的训练成本远低于 OpenAI o1,却能取得相近甚至更好的推理效果——它绕过了最
DeepSeek V4-Flash-Vision 首个支持图像输入的实验模型上线。本文提供最小可运行 Python 代码,演示多模态 OCR、图表抽取与文档结构化,并对比云端与本地部署的取舍。
DeepSeek多模态模型上新:AI能看图,企业内容策略要变8月22日消息,DeepSeek 推出面向 Agent 时代的多模态模型 deepseek-v4-flash-vision-exp,在保持 V4-Flash 文本能力的基础上新增视觉理解能力,可处理图片输入。多模态 Agent 基准测试表现接近 Opus-4.8。这意味着 AI 不仅能读文字,还能读截图、图表、设计稿。对企业内容产品而言,
【摘要】DeepSeek Harness(DSH)记忆插件生态半年内涌现20+项目,形成功能重叠但未饱和的市场。本文通过GitHub API数据梳理生态全景(含License自查),指出当前插件多基于存在中文缺陷的官方sessionQuery构建,导致中文召回普遍受限。重点分析三个百星项目(dsh-memory-evolve/dsh-mnemon/dsh-noema)的差异化特性,提出"修地基而非
在技术选型的关键节点,面对琳琅满目的大模型服务,开发者往往容易陷入参数对比的迷宫。我们常常看到各种评测报告罗列着惊人的上下文窗口大小或训练数据截止日期,但当真正将模型接入实际业务流时,却发现它在多轮对话中“失忆”,或在生成复杂代码时频繁抛出逻辑错误。这种理论与实战的落差,不仅浪费了宝贵的开发时间,更可能让项目进度受阻。对于一线工程师而言,选择一个合适的模型不仅仅是看它的宣传亮点,更要看它在真实场景
摘要:近期DeepSeek宣布调整API价格,引发开发者关注。文章详细解析了价格调整细节(如输入/输出Token单价、缓存差异等),评估了对个人与企业用户的成本影响,并对比了主流替代方案(如国内/海外模型、开源自部署)。决策框架建议综合考虑调用频率、迁移成本及模型能力,若需切换服务商,可通过抽象API层、灰度测试降低风险。最终结论需结合业务场景判断:高频调用或依赖特定功能的用户可能继续使用Deep
本周优化聚焦提升PDF文档问答系统的工程能力,主要包含以下改进: 双层缓存机制:通过文档哈希缓存OCR中间结果,通过问题参数哈希缓存最终答案,大幅减少重复处理耗时。文档缓存默认开启,答案缓存按需启用。 性能监控:新增TimingRecorder模块,精确记录PDF解析、OCR处理、VLM生成等11个阶段的耗时,便于性能分析和优化定位。 提示词优化:实现prompt类型自动推断(通用/表格/标题/总
金融市场中的大模型智能体,即便能够引述监管规则,依然可能提交违反可执行约束的交易订单,或是误读监控证据。本文提出ReguSim——一套受控金融合规仿真环境,以及ReguBench——带目标标记的监管监控评测基准。二者将四类关键信息解耦:模型口头推理陈述、尝试执行的动作、执行层强制拦截结果、监控可获取的证据。基于DeepSeek V4 Pro、Gemini 3.5 Flash开展交易智能体实验:即便
【摘要】国产大模型Kimi K3智能分突破60分,追平GLM-5.3,接近GPT-5.6 Sol,但实际选型需结合能力、速度和成本三维度。K3在长文档解析(1.05M上下文)和深度推理上表现突出,但速度较慢;GLM-5.3以85 token/秒的速度成为实时交互首选;DeepSeek V4 Pro则以0.05美元/百万token的极致性价比适合批量任务。业务场景建议混合调用:聊天用GLM-5.3,
如果你不想自建复杂的路由系统,像EasyAPI这样的工具是一个极佳选择:多模型接入:一个入口支持多家主流模型(如OpenAI、DeepSeek等),只需配置更改即可切换切换灵活:业务代码零改动,无缝切换至成本更优或性能更高的模型账单透明:实时了解调用成本,拒绝隐藏费用团队轻量化:不需要投入大量资源开发定制系统,适合中小团队快速优化成本
如果你不想一上来就折腾Switchyard这种开源路由库,也可以先走EasyAPI——它帮你提前完成供应商解耦,一个Key接入所有主流模型,切换只需要改配置项,不碰业务代码。先跑通"简单任务走Flash、复杂任务走Pro"这两档,就能看到明显变化。
本文给出一套七层阅读法:模型身份、开放范围、许可证、训练数据、训练方法、评测证据、限制与复现资产。案例覆盖 Llama 4、Qwen3、DeepSeek、Gemma、gpt-oss、OLMo 和 Nemotron。目标不是替某个模型背书,而是训练你把模型报告读成一条可核验的证据链。
Qwen3.8-27B是一款270亿参数的原生多模态大模型,支持26.2万tokens长上下文,适合处理长文档、代码和多步骤任务。通过算桥API可快速接入,兼容OpenAI标准接口,提供按量计费服务。建议用真实业务数据测试模型效果,重点关注任务完成度、响应速度和成本控制。平台支持一键切换不同模型,降低试错成本。
在 64K、128K 长度级别的文档理解任务里,0731 的显存占用更平稳,生成总结时的整体耗时下降明显。尤其是「先读全文、再输出长摘要」这类对 KV Cache 压力较大的场景,体验提升最容易被用户感知。大模型的竞争正在从参数规模转向推理效率与工程化能力。它相比预览版的核心变化,不是「模型突然变聪明了 6 倍」,而是「同样的能力,用更少的等待时间和更低的成本就能拿到」。对大多数生产环境来说,后者
从技术架构(RAG+原生DeepSeek)、产品落地效能、客户实际场景三个角度深度评测聊天宝客服快捷回复助手,解析其如何把大模型做成客服开箱即用的效率工具。
本文探讨了 DeepSeek Harness 插件系统如何通过依赖注入和服务定位机制解决传统 import 方式的耦合问题。核心观点包括: import 将功能需求与实现绑定在代码层,导致变更时需要修改多处文件; DeepSeek Harness 采用 YAML 配置实现运行时绑定,通过上下文(Context)和服务(Service)机制解耦; 服务提供方通过继承 Service 基类注册服务,消
本文介绍了DeepSeek Harness(dsh)内置评测闭环插件的设计与实现,旨在解决当前LLM智能体评测中的核心缺陷。文章系统分析了现有评测生态的四大问题:高成本实时推理依赖(G1)、模型与框架变更混淆(G2)、重结果轻过程(G3)以及多Agent评测薄弱(G4)。针对这些问题,提出了三大创新方案:零token离线回放回归(N1)实现低成本消融测试,确定性评测(N2)通过HTTP录制回放隔离
如果你不想自己搭路由,也有现成的方案。像EasyAPI就是把路由、缓存、配额管理打包成一层网关,一个接口接进去就能在多模型之间做调度。省下来的时间比省下来的钱更值钱。
这些流程结束之后,模型厂商们通常还会写一个“技术报告”
GRPO(Group Relative Policy Optimization)是一种旨在替代PPO中Critic网络的方法,通过组内比较计算相对优势,解决了PPO在大模型训练中的显存占用高、训练不稳定和工程复杂度问题。其核心机制包括在线组采样、规则打分、组内优势计算和PPO裁剪更新。GRPO省去了独立的Critic网络,显存占用降低30~40%,且支持纯RL训练(如DeepSeek-R1-Zer
本文详细介绍了如何在DeepSeek Harness(DSH)中接入免费的NVIDIA GLM5.2和MiniMax-M3模型,并为其添加多模态图片识别能力。主要内容包括:1)获取NVIDIA API Key的步骤;2)在DSH中添加自定义Provider的方法;3)通过修改配置文件开启多模态输入功能;4)常见问题及解决方案。文章特别指出GLM5.2通过NVIDIA API不支持图片识别,建议使用
策略做法token 成本信息保真适用场景全量传递把完整对话历史塞给下一个 Agent高最高单 Agent 深度长对话摘要传递用 LLM 生成结构化摘要再传递中高(有损)跨 Agent 任务交接引用传递传会话 ID + 查询接口,按需取数低可控共享黑板、知识库、数据库全量传递在多 Agent 场景下几乎总是错误选择:假设八个 Agent 每人 2000 token 的对话历史,汇聚到编排层就是 16
源自 Palantir 前沿驻场工程师理念,不再单纯交付模型 / 代码,而是。核心痛点:解决行业三大断层,是业务执行主体。;周红伟体系中将其定义为。模型 = 大脑;Harness = 神经系统 + 运行环境,负责工具调用、权限沙箱、插件管理、链路可观测、任务循环、外部系统互通。。模型、工具、Agent 循环、沙箱、子智能体全部支持热插拔替换,不再绑定单一运行内核。
dsh-rpg-workstation 是一款为 DeepSeek Harness 打造的 RPG 游戏化插件,将每次完整对话回合转化为经验值,支持等级成长、14 项成就、连击加乘(3/7/30 天分别 ×1.1/×1.25/×1.5)及每日任务(每完成一项 +20 XP)。右下角浮动面板实时展示战绩,包含称号、经验条、签到日历、周报告和成就列表;数据本地持久化(~/.dsh/rpg-data.j
摘要 本文提出了一种面向DeepSeek Harness(dsh)框架的动态模型路由系统dsh-model-router,解决大语言模型多样化带来的运行时模型选择问题。系统具有三大创新设计:(1)步骤级路由,通过dsh框架预留的扩展点在agent运行时内实现细粒度路由;(2)可逆插件范式,模型注册和路由规则作为可逆副作用,支持热插拔;(3)表级数据守卫,为不同复杂度的表分配专属守卫模型。实现结果表
GitHub Copilot 是集成在 VS Code 中的 AI 编程助手,可以帮助我们解释代码、修改项目、排查错误以及执行 Agent 任务。如果想在 Copilot Chat 中使用 DeepSeek,过去通常需要手动配置 API 地址、模型名称和各种参数。现在借助插件,只需要安装插件并填写 DeepSeek API Key,就能直接把 DeepSeek V4 添加到 Copilot Cha
DeepSeek Harness 初体验:入门+安装 + 自定义插件实战
作为维护过 Electron 应用、插件宿主与多包工作区的工程师,我认为测试最容易出现的假象是“数量很多,但没有覆盖真实失败边界”。纯函数单测可以证明参数判断,却不能证明 Cordis Loader 真能发现打包后的插件;TypeScript 通过可以保证声明收敛,却不能证明中存在 pnpm、DSH CLI 与 native 文件;开发模式页面能打开,也不能证明 headless 构建机不会因为一
随着大语言模型(LLM)从"对话工具"演进为"自主行动体",如何工程化地承载 agent 的推理—行动循环(reason-act-observe loop)成为系统设计的关键课题。本文对 DeepSeek AI 开源的 agent harness 框架——DeepSeek Harness(dsh)——进行系统性的设计与实现分析。
性质:这是欧盟 AI 法案第 50 条生效后的首个头部厂商落地动作,不是 Anthropic 的自愿创新,全球生效是技术限制下的被动选择;技术:SynthID-Text 通过替换选词随机数的来源织入水印,不加字符、不降质量、不加价、不可追溯,但在校对、翻译、短文本、代码、纯事实五类场景存在明显盲区;对抗:现有研究显示单轮释义即可移除 98% 以上的 SynthID 水印,水印是概率信号而非铁证,攻
跑分的是13个模型,覆盖Gemini 3、GPT-5、GPT-4.1和Gemma 3四个家族,每个模型开关thinking各跑一遍,每道题采样八次,攒出约450万条回答。出题全交给了模型:Gemini-2.5-Pro生成,Google搜索逐题验证,答案不唯一或题目有歧义的,连带整条事实一起丢弃。Gemini-3-Pro存下了94.5%的冷门事实,热门事实是99.5%,只差5个点。谷歌提出的「知识画
2026 年,如果你只允许一个 AI 工程师保留一个技能,那不再是 Prompt Engineering,而是Context Engineering(上下文工程)。窗口已经"够用"了,但 Agent 依然在失忆。截至 2026 年中,主流旗舰模型的上下文窗口已达 1M token 级别(Claude Opus/Sonnet 4.6 的百万 token 窗口于 2026 年 3 月全面 GA,GPT
冻结284B DeepSeek和417M MoonViT,仅训练40M PatchMerger连接器,用10万样本、5张H200、2000美元、20小时获得基础视觉能力,验证了"冻结大模型+训练小连接器"的VLM范式。
DeepSeek Harness 设计解析:解决Agent工程两大核心问题 摘要: 本文剖析了DeepSeek Harness如何通过20万行代码解决Agent工程的两个核心问题。当业务逻辑与基础设施紧密耦合时,会出现两大痛点:1) 切换模型厂商需要大量适配工作;2) 新增功能需修改核心循环代码。DeepSeek Harness的解决方案基于三大设计原则:1) 插件化架构 - 所有组件均为可替换插
阿里巴巴开源AI模型Qwen3.827B引发行业震动。该27B参数模型采用Apache2.0商业友好协议,支持262K长上下文和原生多模态处理,在智能体编码任务中表现接近Claude Opus水平。但实测显示其运行速度慢、显存需求高(最低24GB显存),且基准测试成绩尚未获独立验证。模型完整权重55.6GB,支持本地部署实现零边际成本,为中小企业提供闭源API之外的替代选择,但吞吐量瓶颈使其不适合
Anthropic 发布了 Claude 文本水印方案。本文用程序员常见操作解释它的实际影响:直接复制粘贴 AI 代码会不会保留信号,批量修改变量名、自动格式化、删除注释、局部采用代码和二次重构分别可能产生什么变化;同时说明文本水印、C2PA 文件凭证以及概率检测的适用边界。
一个 DeepSeek Harness 插件,让模型能直接调用工具查询运行时真实状态(插件是否加载、凭证是否配置、批准策略、token 压力、子代理树等),不用再手动跑命令排查。