登录社区云,与社区用户共同成长
邀请您加入社区
Agent Plan × DeepSeek Harness 把"规划智能"与"工程防护"绑定为一个不可分割的整体。敏感数据防护解决的是"数据不能错位流动"的问题,路径穿越防护解决的是"权限不能错位扩张"的问题。敏感数据防护:分级 → 输入扫描 → 占位替换 → 输出扫描 → 落库加密 → 审计。路径穿越防护:白名单 → 规范化 → 绝对化 → 越界检测 → 软链接复核。工程落地时,建议把所有安全配
当一个跑了一年多的基于 LLM 自动化流程积累了超过万条真实数据后,我产生一个想法:能不能用这些数据训练一个专用小模型,然后把 API 调用替换成本地推理,这样能够显著减少数据外出风险,同时也能学习到模型微调相关的知识(我承认这是一个主要目的)?因此有了本文,记录了从动机到落地的完整思路。
在技术选型的关键节点,面对琳琅满目的大模型服务,开发者往往容易陷入参数对比的迷宫。我们常常看到各种评测报告罗列着惊人的上下文窗口大小或训练数据截止日期,但当真正将模型接入实际业务流时,却发现它在多轮对话中“失忆”,或在生成复杂代码时频繁抛出逻辑错误。这种理论与实战的落差,不仅浪费了宝贵的开发时间,更可能让项目进度受阻。对于一线工程师而言,选择一个合适的模型不仅仅是看它的宣传亮点,更要看它在真实场景
好的,这是一个关于的 TypeScript 实现。这道题的解法基于一个重要的观察。
这道题的核心是。
/ 核心递推公式:取左、右子树最优时间和并行执行两子树总时间三者的最大值[citation:7][citation:11]· 最终答案为 (a.first + b.first) / 2 + (剩余串行时间) / 2。1. 左子树串行时间 > 右子树总时间:剩余串行时间为 左.second - 右.first。2. 右子树串行时间 > 左子树总时间:剩余串行时间为 右.second - 左.firs
摘要: 本文深入测评当前大模型在技术领域的实际表现,聚焦逻辑推理、长文本处理、代码辅助等核心能力。测试显示,模型能有效拆解分布式系统等复杂问题,精准提炼数万字技术文档关键信息,在多轮对话中保持连贯记忆,并提供带原理分析的代码优化方案。同时展现风格多样的创意写作能力和垂直领域深度知识,响应速度快且交互流畅。虽然存在实时数据处理和冷门知识局限,但已能显著提升开发效率,成为贯穿技术工作流的智能助手,适用
本文追踪 DeepSeek Harness 中一条消息从 followup() 到 turn/end 的完整生命周期,回答一个核心问题:生产级 Agent Runtime 如何通过显式边界替代 while (true) 循环的内存状态管理?文章从链路全景图出发,逐段拆解四个核心概念:Inbox(可恢复的待办队列,区分 next-turn 与 next-step)、Turn(完整任务周期,包含 0.
本文拆解了 DSH 底层框架 Cordis 的插件模型,回答一个核心问题:长运行、可热更新的 Agent 系统需要什么样的插件机制?文章从“工具到底依赖谁”这个具体矛盾切入,逐层展开五个核心概念——Fiber(生命周期)、Context(作用域)、inject(依赖声明)、provide(服务提供)、effect(可逆副作用)——并说明它们如何共同解决插件在动态环境中的组合、替换和撤销问题。
GEO全称Generative Engine Optimization,国内常称为AIGEO生成式引擎优化。简单理解:通过企业知识图谱搭建、AI友好结构化内容、多渠道信息基建、语义标签、权威信息沉淀,让豆包、DeepSeek等主流大模型,在用户提出行业、地域、采购类问题时,可以识别、引用、推荐企业信息,把企业变成AI给出答案里的候选方案。温州工厂:当采购商问“温州哪家包装工厂靠谱”,AI回答可以出
DeepSeek API 开始实行峰谷计费后,调用成本不再只看 Token 单价。本文对比 DeepSeek 官方与算桥API的 DeepSeek-V4-Flash-0731 价格、峰谷规则和适用场景,并进一步分析多模型统一接入、固定价格和后续模型切换成本,帮助开发者判断不同业务场景下该怎么选 API。
本文系统分析了当前主流超大规模AI训练系统的架构设计与工程实践。通过对比PaLM、Llama 3.1 405B、DeepSeek-V3等六大代表性案例,揭示了算法-工程-数据的协同优化策略。关键技术包括:五维并行计算、FP8训练、MoE架构、专用通信库等,其中DeepSeek-V3在2048 H800 GPU上仅用2.788M GPU小时完成671B参数训练,成本仅为同类模型的1/30。研究还对比
Qwen3.8-27B 发布后,我第一时间在现有双 GPU 服务器上重新搭了一套独立环境。这次没有沿用旧模型的 Python 环境,也没有只记录一条“能启动”的命令。我把模型下载、CUDA 版本、vLLM、systemd、API 鉴权、128K 长上下文和 MTP 都实际走了一遍。本文所有用户名、IP 和密钥都使用<USER><API_KEY>占位符。执行前必须替换为自己的值。
GRPO(Group Relative Policy Optimization)是一种旨在替代PPO中Critic网络的方法,通过组内比较计算相对优势,解决了PPO在大模型训练中的显存占用高、训练不稳定和工程复杂度问题。其核心机制包括在线组采样、规则打分、组内优势计算和PPO裁剪更新。GRPO省去了独立的Critic网络,显存占用降低30~40%,且支持纯RL训练(如DeepSeek-R1-Zer
策略做法token 成本信息保真适用场景全量传递把完整对话历史塞给下一个 Agent高最高单 Agent 深度长对话摘要传递用 LLM 生成结构化摘要再传递中高(有损)跨 Agent 任务交接引用传递传会话 ID + 查询接口,按需取数低可控共享黑板、知识库、数据库全量传递在多 Agent 场景下几乎总是错误选择:假设八个 Agent 每人 2000 token 的对话历史,汇聚到编排层就是 16
整个系统的每一个环节都是**可替换、可组合的插件**。**权限限制的是"写",不是"看"**;它的"手"被绑住了,但"眼睛"是自由的。- 提示 `command not found: node` → 到 https://nodejs.org 下载 LTS 版安装,**务必保留安装器默认勾选的"添加到 PATH"**,装完重启终端。**DeepSeek Harness**(命令行名 `dsh`)是
指标数值模型精度FP8(精度损失可忽略)上下文长度单卡权重占用~13.5 GiB单卡剩余显存~17.8 GiB服务端口20150。
DeepSeek Harness 设计解析:解决Agent工程两大核心问题 摘要: 本文剖析了DeepSeek Harness如何通过20万行代码解决Agent工程的两个核心问题。当业务逻辑与基础设施紧密耦合时,会出现两大痛点:1) 切换模型厂商需要大量适配工作;2) 新增功能需修改核心循环代码。DeepSeek Harness的解决方案基于三大设计原则:1) 插件化架构 - 所有组件均为可替换插
deep seek Harness安装指南
GEO全称生成式引擎优化(Generative Engine Optimization),简称AIGEO。区别于传统搜索引擎优化,GEO优化目标不是网页排名,而是构建标准化、可信的企业知识信息,让豆包、DeepSeek等主流AI大模型,在用户提问时优先引用企业品牌、产品、服务信息,获得AI首答曝光。简单理解:用户提问“杭州萧山哪家加工厂靠谱”“滨江数字化服务商推荐”,AI答案中直接出现你的企业,实
提出者与贡献者:安德雷·柯尔莫哥洛夫(Andrey Kolmogorov,1903–1987)于1933年在《概率论基础》中给出了概率的公理化定义。背景介绍:在柯尔莫哥洛夫之前,概率论长期缺乏严格的数学基础。拉普拉斯(Pierre-Simon Laplace,1749–1827)的古典定义(有利结果数除以总结果数)只适用于有限等可能情形。柯尔莫哥洛夫将概率定义为测度空间上的规范化测度,使概率论成为
8月13日这一天,DeepSeek 放出了两个动作。凌晨,V4 Pro 正式版上线,架构和预览版完全一致,Agent 能力却暴涨;晚上,DeepSeek Harness(DSH)开发者预览版开源,MIT 协议,GitHub 同步开放。后者是更值得注意的信号。这不是新模型,也不是 API 客户端,而是一整套把模型接进文件系统、终端、网页和工具,并组织上下文、工具调用与任务执行的 Agent 运行框架
摘要:小型推理模型正成为AI领域的新兴力量,通过思维链、强化学习等技术突破,在数学、代码等任务上展现出媲美大模型的推理能力。本文系统梳理了推理模型的核心特征(显式中间推理、测试时计算扩展等)及四大技术支柱,分析了DeepSeek-R1、Qwen3等代表模型的架构与训练方法,并对比其性能边界。重点探讨了知识蒸馏、GRPO强化学习等关键技术,提供训练部署示例,同时指出长程推理、幻觉控制等挑战。小型推理
本文是Cordis v4框架系列文章的首篇,聚焦于"整体观"视角。Cordis v4是一个可组合性元框架,其核心创新在于解决了动态组合软件的两大难题:时间可组合性(通过可逆效果机制实现副作用完整回滚)和空间可组合性(通过响应式余效果机制管理组件依赖)。文章从项目定位、生态方位、代码结构三个维度展开,指出Cordis作为Koishi生态和DeepSeek Harness的底层框架,采用"内核+插件"
系统能抹除自己边界内的历史,但抹除不了对世界造成的状态——这不是一句哲学格言,是一篇 88 页论文用定理写出来的结论。装了个 VSCode 插件,想卸掉,弹窗:需要重启。为什么「装了再卸」这么简单的操作,现代软件都做不干净?论文抓取了 VSCode 下载量前 100 的扩展:87 个含可执行代码,卸载都得重启宿主;官方给过扩展间依赖声明机制,可前 100 个扩展里只有 7 个声明了对其他扩展的依赖
本文通过公开基准测试对比了DCS Genpilot与Claude Science、biomni等主流科研Agent的性能表现。研究表明,决定科研Agent性能的关键在于智能体框架(Harness)的领域适配性,而非单纯依赖大模型性能。Genpilot通过优化任务编排和工具调度,实现了用低成本开源模型达到接近顶级闭源模型的科研分析能力。
基于本地源码实测整理。
对必须保留但不需要细节的历史,用"滚动摘要":每 N 轮把前面内容总结成一段摘要,后续请求只带摘要 + 最近几轮原文。输入:全部历史消息(20 轮,约 3 万 token)输出:摘要(200 token)策略:保留最近 5 轮原文 + 之前内容的滚动摘要效果:单次调用输入从 3 万 token 降到 6000 左右,降幅 80%编排者把任务交给子 Agent 时,只传"任务描述 + 必要上下文"(
本文介绍了Agentic RAG(自主修正检索增强生成)系统的核心原理与实践经验。作者通过5款国产大模型(qwen3.7-max、glm-5.2等)在真实工单场景下的测试,揭示了不同模型在相关性打分(relevance)和信息覆盖度(coverage)上的显著差异(最高与最低相差一个数量级)。文章详细阐述了自动修正闭环的状态机设计,包括查询改写、检索、打分和重试机制,并分享了生产环境中的路由策略、
本文分享了字节AML大模型算法岗50分钟面试的核心内容,涵盖多模态基础架构、视觉幻觉处理、模型优化、检索技术等多个维度。面试问题包括主流多模态模型特点、视频编码技术、幻觉现象分析、后训练策略、算法实现(DFS/BFS岛屿统计)、项目链路梳理、Qwen-VL模型亮点等14个方向。建议面试者结合论文与项目经验,深入理解技术设计原理与问题解决方案,注重表达逻辑。文末提供参考答案获取方式,并推荐转型AI大
最近看 Codex 和 Claude Code 从个人试用走向团队协作,发现一个规律:Demo 能跑通的人很多,能真正让团队用起来的人很少。很多人卡在权限、日志、可维护性这些" boring "的事情上。GraphRAG 也一样。去年我做了一个企业知识库项目,一开始觉得上 GraphRAG 肯定能碾压传统 RAG。结果上线后,团队反馈反而更慢了。不是模型不行,是工程细节没跟上。今天把这次踩坑的复盘
选择标准不是“名气”,而是“是否覆盖了开发者 2026 年的主要需求类型”:DeepSeek 代表高频推理与性价比,Kimi 代表长上下文与 Agent,Qwen 代表全尺寸与多模态,GLM 代表中文工具调用,Step 代表多模态与数学。读者可以把自己的需求映射到某一类型的组合上,再重点验证。到 2026 年,国产开源大模型已经从“追平闭源”进入“差异化竞争”阶段。
实际测试结果显示,微调后的模型生成的临床推理链逻辑清晰、步骤明确,完全贴合医疗临床的分析思路,给出的答案详细、专业且准确,与数据集中的专业解答高度契合,相比未微调的基础模型,医疗推理能力得到了显著提升。新样本的测试结果显示,微调后的模型能够准确分析陌生医学问题的临床背景,快速构建合理的临床推理链,最终给出专业、准确的解答,说明模型经过医疗推理数据集微调后,不仅对训练样本的适配性提升,还具备了一定的
/printf("输出张量[%d] - ioBufDesc维度: outWidth=%d, outHeight=%d, outNumChannels=%d\n",//printf("输出张量[%d] - tensor维度: num_dims=%zu, sizes=[%zu, %zu, %zu, %zu]\n",zh_idx < 5;// printf("=== 开始处理YOLOv5检测头 ===\
摘要:该日志记录了使用SwanLab 0.7.8进行的医学领域模型训练过程,训练数据保存在本地路径。训练共1084步,耗时13分30秒,最终训练损失0.952。过程中观察到学习率从9.92e-5逐步下降至4.61e-7,损失从初始1.655降至0.6左右。日志包含多个医学问题(如抗溃疡药物机制、淋巴瘤发热原因等)的未完成回答模板(含"<think>"标记),显示模型
OortCodex私有化版本——AI私有化场景下,可以使用私有内网Token,私有环境下使用Claude Code、OpenCode、Codex、Gemini、Qoder Code等编程智能体,编程生成APP,一句话生成企业级软件系统、总结项目、编写文档等能力。定位:本地 / 私有化运行的软件工程智能体,不止代码补全,可完成读仓库、跨文件修改、执行脚本、调试、测试、代码评审、多子 Agent 分工
由于PandaAI第四届因子大赛总共能提交五十个因子,建议大家在提交前结合因子的历史表现、稳定性等指标进行筛选,保留更具竞争力的因子参与比赛。在第四届因子大赛页面复制本地挖因子入口的“一句话安装”指令,然后粘贴到Claude Code、Cursor、Codex 等任一AI 工具中。在因子池中,可以看到每个因子的 ICIR 等指标,通过这些数据判断哪些因子值得保留。AI 会根据你的研究方向,结合已有
8 月 12 日深夜,DeepSeek 在官方群里甩了一句话:V4 Pro 正式版上线了。没有发布会,没有 PPT,没有热搜预热。这种"大半夜扔炸弹"的打法,已经成了 DeepSeek 的招牌动作,他们好像特别喜欢在别人睡觉的时候搞事情。但这次的炸弹不一样。它不是又一个"又快又便宜"的轻量模型,而是一个正儿八经的旗舰:1M 上下文、384K 输出、思考模式默认开启,而且在 Agent 能力上,多项
摘要: DeepSeek V4-Pro 旗舰模型正式发布(GA),重点提升 Agent 能力,官方数据显示 DeepSWE 基准从 12.8 飙升至 62.7,但数据尚未经第三方验证。价格优势显著,输出 token 成本仅为 Claude Fable 5 的约 1/46。不过,当前低价可能为短期窗口期,官方预告未来将上调定价。开发者社区反馈两极分化,部分用户赞赏其性价比,但也有人指出实际体验可能存