登录社区云,与社区用户共同成长
邀请您加入社区
随着国产大模型生态的全面爆发,DeepSeek-V4、GLM-5.2、Seedance、Kling可灵、通义Qwen3、文心5.0等模型的迭代速度远超预期。但对于绝大多数企业和开发者而言,真正的挑战不在于“选哪个模型”,而在于“如何低成本、高稳定、合规地接入并调度这些模型”。2026年,API聚合平台已经从“可选工具”变成了“基础设施”。本文将基于技术能力、成本结构、稳定性、合规性四个维度,梳理当
第五课的本课要把它拆成两个插件:最终调用链是:模型调用工具 → 工具插件调用统计服务 → 统计服务完成业务计算 → 结果原路返回模型。
优点:原生多模态是真的能打——后台截图不用任何预处理,数字、表格、涨跌箭头都能准确读懂;超长上下文让多平台汇总毫无压力;归因和建议的质量超出预期,不是套话而是可落地的动作。缺点/注意:多模态单次调用比纯文本慢,批量截图要留点时间(4 张约 3 分钟);模型偶尔会重复单位这类小瑕疵,需要在拼接层做兜底。整体上,它把运营同学从最枯燥的"数据搬运"里解放了出来。
25 万次请求被拆分成 7 个批量推理工作,全部完成且 0 失败;99.99% 的返回结果符合 JSON Schema,模型与数据集自带产品标签的一致性达到 83.6%。最大的推理任务每个包含 40,000 次请求,完成时间为 1.4~2.2 小时,远低于 24 小时的 Completion Window。一个包含 25,000 次请求、使用 Claude 模型的批量推理任务只用了 17 分钟。
生成式 AI 大规模进入办公场景,员工将合同、源码、业务数据粘贴到公有大模型,已成为企业数据泄露的重要新渠道。传统 DLP 终端防护对 AI 网页、AI 客户端存在监管盲区。本文结合**迪康端点安全一体化管理系统**实践,讲解企业如何落地**AI 工具行为审计**,实现对豆包、千问、DeepSeek、元宝、Mimo 等主流大模型交互行为的日志留存、风险告警、事件溯源,平衡办公效率与数据安全,满足等
本文介绍如何通过Ollama结合Qwen2,搭建OpenAI格式的聊天API,并与外部函数结合来拓展模型的更多功能。tools是OpenAI的Chat Completion API中的一个可选参数,可用于提供函数调用规范(function specifications)。这样做的目的是使模型能够生成符合所提供的规范的函数参数格式。同时,API 实际上不会执行任何函数调用。开发人员需要使用模型输出来
详细拆解安装、配置、使用全流程。无需科学上网,通过国内镜像站直接调用强大的Claude模型,让你在命令行里拥有一个贴身的AI编程专家。
即便都是 Claude 模型,不同聚合平台的协议实现水平也参差不齐。很多平台不支持 Anthropic 的原生协议细节,导致 Cursor 或 Cherry Studio 在处理流式输出或复杂 System Prompt 时出现诡异 Bug。我们观察到,非线智能API 在协议兼容上做得相当透彻。它宣称是市面上少有的能实现“零适配成本”的平台。
least_conn 负载均衡会把同一会话的多轮请求分散到不同实例,而 vLLM 的前缀缓存(Prefix Cache,即 KV cache 复用)是每个实例各自独立的——第二轮请求落到另一台机器时,前几轮已算好的 KV cache 完全用不上,长历史会话的 prefill 成本每轮都全价重算。同一会话的多轮请求始终落在同一实例,直接命中该实例的 KV cache。如业务几乎不使用超长上下文,可考
2026 年 8 月 20 日,Anthropic 宣布 Computer Use、Skills API 和 Files API 在 Claude Platform 全面可用,同时新增 Browser Use 工具。如果只看功能列表,这像是一次常规的平台更新:Claude 会点鼠标了、能加载 Skill 了、也能保存文件了。但把它们放到同一条业务链路里,意义就不一样了——Claude 开始具备一套
要保留长程记忆,就在砍之前先总结。把超出窗口的旧轮次交给模型压成一段摘要,替换进上下文。这样模型既不被旧信息淹没,又不丢关键事实。context_summary = "" # 跨轮累积的对话摘要# 摘要用与主回答相同的模型即可;想更省可换成 deepseek-v4-flash(以控制台模型广场为准)messages=[{"role": "system", "content": "把对话压缩成一段中
默认 loop()是Agent契约的唯一实现,但契约本身可以再实现。为什么极少需要:绝大多数"不同行为"都能落到第 7 章的扩展点上。只有当你要重写 turn 驱动语义(认领、重试、步进策略)时,才需要自己的驱动。实现契约的方式:构造自己的服务,实现createresume),通过注册,会让走你的实现而不是默认 loop。每个 agent 的注册与生命周期要走agent/*事件词汇和日志纪律 ——
用于故障转移,当主模型无法访问时,启用备用模型。{'messages': [HumanMessage(content='你是啥模型', additional_kwargs={}, response_metadata={}, id='a5bef311-6a1e-4ec0-a5d5-8510e0024226'), AIMessage(content='我是 DeepSeek 最新版模型,由深度求索公司
摘要 DeepSeek Harness(DSH)的核心架构Cordis采用"一切皆插件"的设计理念,模型适配器、工具注册表等所有组件均为可动态替换的插件。系统分为三层:底层Cordis微内核管理插件生命周期;中间层通过Profile、Bundle、Patch三级配置机制灵活组装插件组合;顶层提供四种预设运行模式。插件系统基于五个核心概念(插件写法、Context、Service、Fiber、inj
本文探讨了DeepSeek Harness(dsh)作为Agent系统运行时的核心设计理念与工程实现。dsh通过插件化架构将模型、工具、上下文等组件解耦,构建了一个可动态装配的运行时环境。文章详细分析了dsh的分层架构(Launcher、Composition、Runtime等六层),重点阐述了插件系统的三大特征:1)基于服务名的依赖管理,实现局部替换而不影响全局;2)完整的生命周期管理,包括初始
《DeepSeek Harness云服务器部署与优化指南》 本文详细介绍了在Linux云服务器上部署DeepSeek Harness(DSH)AI开发工具的全流程及优化方案。通过SSH隧道实现本地访问,利用systemd实现服务常驻后台,并创建一键启动脚本简化操作。重点推荐使用Tailscale组建虚拟局域网,实现多设备(包括移动端)通过内网地址直接访问DSH Web界面,同时保障传输安全。文中涵
从资源盘点、上下文、缓存、回环监听、SSH 隧道和观测记录六个环节,说明 Qwen3.8-27B 远程服务器部署前应完成的验证与回滚准备。
摘要 DeepSeek大模型的本地化部署正成为企业关注的核心议题。本文从金融科技公司面临的数据合规问题切入,系统分析了大模型部署的两种主流模式:云端服务与本地部署,并对比了二者在数据安全、硬件投入、网络依赖等维度的差异。DeepSeek因其卓越的中文理解、代码生成能力及免费政策优势,其本地化需求尤为突出。文中详细探讨了本地化部署的四大场景(数据安全、网络限制、成本控制、定制开发),并梳理了Deep
摘要:本文介绍了社区项目deepseek-harness-desktop的安装与使用指南,帮助开发者快速上手DeepSeek Harness的桌面版应用。
就在上周 DeepSeek-V4-pro 、Grok 4.6 、DeepSeek Harness、GLM 5.3 相继炸场的时候,Qwen 3.8 迎来了开放权重的时刻。就在大家相继追捧 DeepSeek 、GLM 的时候,Qwen 也迎来了属于它的时刻。。已经在 Hugging Face 上,可以看到 Qwen-3.8-2.4T 和 Qwen-3.8-27B 了。然后 unsloth 又给大家提
本文系统梳理了影响 Claude Code 会话成本与效率的核心因素,涵盖模型选择、输入输出 Token、提示缓存机制,以及如何通过 /clear、/compact、@ 提及文件和子代理等策略减少上下文噪音,帮助你在日常工作中更高效地利用每一个 Token。
Claude Code 桌面版已经支持接入API进行使用了,通过下面的接入方法,无需登录订阅 Claude Code 官方账号,在国内网络环境下,你也能直接使用上 Claude Code 桌面版 app应用程序,并且还支持使用强大的 Claude Fable 5模型。
本文详细记录了在2核2G内存的阿里云服务器上搭建本地AI知识库的全过程。作者选用"Ollama + Open WebUI"方案,通过本地大模型、嵌入模型和向量检索实现知识库功能。针对服务器配置限制,推荐使用Qwen2.5-0.5B等量化模型,并详细解决了国内服务器下载模型时的TLS超时问题,提供了从ModelScope和HF-Mirror下载GGUF文件的多种方法。文章还包含手动导入模型、创建交换
本文介绍通过命令行修改Claude配置文件的方法:1)使用Win+R打开运行窗口,输入cmd启动命令提示符;2)通过PowerShell命令修改用户目录下的.claude.json文件,添加或更新hasCompletedOnboarding属性为true;3)最后重启Claude应用使更改生效。这个操作可以跳过Claude的初始引导流程,适合需要快速使用的场景。全文提供了完整的命令行操作步骤,通过
本文介绍了基于DeepSeek-Harness开发的Linux文件管理授权插件,重点展示了其强大的代码能力和四种工作模式(标准/PTC/极简/创造模式)。作者分享了在ARM嵌入式Linux项目中的实战经验,包括通过PM2部署Web服务端(端口3080)、Nginx反向代理配置及HTTPS证书处理等关键技术细节。文章特别强调了创造模式的独特价值——通过JavaScript自由组合系统级插件,实现类似
梳理 DeepSeek 2026 年 8 月 API 涨价预告前后时间线,并给出开发者判断「换不换模型」的三个检查项:缓存、时段、任务可迁移性。
本文探讨了在DeepSeek涨价背景下,尝试切换至opencode作为替代方案的使用体验。作者发现虽然opencode提供了两种经济实惠的计费模式(按token计费和Go订阅服务),且主对话模型切换顺利,但DeepSeek Harness的联网搜索功能仍会消耗DeepSeek官方额度。深入分析发现,联网搜索本质上是向DeepSeek API发送特定提示词请求,且opencode不支持此功能。文章还
本文档针对GLM大模型仅支持文本输入的问题,提出了通过PreToolUse钩子拦截图片读取的解决方案。当Claude Code调用Read工具读取图片时,会触发400错误。此前在CLAUDE.md中添加的软提示因依赖模型自觉而无效。新方案在工具执行前通过本地shell脚本硬性拦截图片文件读取,检查文件扩展名(如png、jpg等)并返回提示信息引导用户改用文本方式。脚本通过jq解析输入JSON,匹配
本文介绍了将阿里云百炼API接入DeepSeek Harness的详细步骤:首先在阿里云百炼控制台获取API Key(需选择北京地域),然后通过Web UI或配置文件两种方式在Harness中配置自定义模型提供方,需设置基础URL和API协议等参数,并管理API Key的安全性。配置完成后发送测试消息验证接入是否成功。注意事项包括地域限制、密钥安全和配置变更处理等。
值得关注的是,DeepSeek-V4-Pro-0813 的权重已正式开放。8 月 13 日消息,DeepSeek-V4-Pro-0813 正式开源,同时还推出了其开源(MIT 协议)的代码智能体框架 Harness 的 v0.1 开发者预览版(基于 Cordis),并同步开放了配套的插件生态系统。DeepSeek-V4-Pro-0813 正式开源,同时还推出了其开源(MIT 协议)的代码智能体框架
摘要:最近团队接入Claude Code做结对编程,Demo阶段很顺,一上协作就崩。排查下来发现,问题不在模型能力,而在工具调用、记忆管理和任务规划这三个底层环节。本文复盘真实踩坑过程,给出可执行的优化方案。---目录Agent的本质:别被"智能"两个字骗了规划能力:别让模型自己决定做什么工具调用:权限和边界才是核心记忆系统:短期和长期的取舍失败恢复:Demo能跑不等于生产能扛总结:先想清楚再动手
是 .claude.local.md还是 CLAUDE.local.md?
DeepSeek-Harness (DSH) 开启局域网访问?一行改动让 DSH Web UI 绑定所有网卡
Claude Code + DeepSeek 安装与启动。
单价低 ≠ 总成本低,AI Token 成本要算"单价 × 消耗量(含重试)"这笔总账;正确省法是任务分级 + 路由:简单任务走 DeepSeek 档,复杂任务走旗舰档;建议先用上面的脚本把你的真实场景跑一遍,再决定切档方案。
本文详细介绍了在8卡V100服务器上部署Qwen大模型的实战步骤。首先配置服务器硬件环境(浪潮NF5468M5服务器,8张Tesla V100 32GB显卡),然后安装NVIDIA GPU驱动并进行验证。后续将展示通过vLLM框架高效部署通义千问系列大模型的完整流程,包括环境准备、模型加载和性能优化等关键环节,为开发者提供可复现的部署方案。该方案特别适合需要快速搭建大模型推理服务的场景,充分利用多
在很多情况下,去训练一个神经网络模型,本地的算力肯定是不够的,我们往往采用租或者使用学校或者公司的服务器进行模型训练等操作,本篇博客主要从零开始介绍如何使用远程服务器进行开发,帮助初学者更好的入门。