登录社区云,与社区用户共同成长
邀请您加入社区
模型生成的 tool-call 只是意图。本文拆解 DSH 如何将意图变为受控行动:通过参数校验、pre-execute 策略、guard、一次性审批、checkpoint、sandbox、结果治理与有序提交九层链路,把“允许/拒绝/询问”的决策、外部副作用前的可恢复留痕、以及并发执行与顺序落库的确定性统一起来。核心结论是:可见性不等于授权,`ask` 缺失即拒绝,checkpoint 不保证操作
本文回答一个核心问题:Agent 为什么不能只存 messages 聊天记录?文章建立了 Log → Surface → Messages → Request 的四层模型。Log 存所有事实,Surface 从中挑出三类事件(user/message、assistant/message、tool/result)供模型可见,deriveMessages() 将其投影为 API 格式,request/
Qwen3.8与Qwen3.6技术架构解析 核心摘要 阿里巴巴Qwen系列大模型实现两大技术突破: Qwen3.8-Max旗舰版:2.4万亿参数MoE架构,仅激活950亿参数实现高效推理,在第三方评测中综合能力全球第二,支持百万Token上下文和原生多模态能力,首次开源Max级模型权重(4.89TB BF16版本)。 Qwen3.6私有化部署版:35亿总参数MoE模型仅激活3亿参数,使大模型首次适
DeepSeek技术架构与源码分析摘要 DeepSeek系列模型通过"以轻驭重"的工程化理念,在算力受限条件下实现高性能。开源生态包括从轻量级推理模型到超大规模MoE模型的完整矩阵,采用MIT许可证,在GitHub和ModelScope平台同步发布。 核心模型分析: DeepSeek-R1蒸馏版:通过动态知识蒸馏框架(特征层/输出层/任务特定三层蒸馏)实现小模型高性能。R1-0528版本在数学推理
本文追踪 DeepSeek Harness 中一条消息从 followup() 到 turn/end 的完整生命周期,回答一个核心问题:生产级 Agent Runtime 如何通过显式边界替代 while (true) 循环的内存状态管理?文章从链路全景图出发,逐段拆解四个核心概念:Inbox(可恢复的待办队列,区分 next-turn 与 next-step)、Turn(完整任务周期,包含 0.
DeepSeek Harness在48小时内创下GitHub最快涨星纪录(5万+Star),成为Agent开发领域的革命性产品。其核心创新在于"一切皆插件"的架构设计,通过Cordis元框架实现了完全的模块化:模型适配器、工具注册表、Agent Loop等所有组件均可热替换,无需修改源码。相比传统框架(如LangGraph、CrewAI),它彻底消除了"特权内核",支持配置驱动的动态组装和热更新,
Qwen3.8-2.4T-A95B是一款开源MoE大模型,总参数量2.4万亿,单次推理仅激活950亿参数。其核心优势在于细粒度MoE架构(512专家/层)、混合注意力机制(全注意力+线性注意力交替)和超长上下文支持(原生262K Token)。部署门槛极高,需30+张A100/H100(推荐NVIDIA GB300 NVL72集群),首年成本达千万级。适合超长文档处理、复杂推理等场景,但不适合简单
Claude Instant是一款更轻便、更便宜、更快速的选择,它可以处理简单和短暂的文本任务,同时保持较高的可靠性和可预测性。A:Claude是基于Anthropic公司对训练有益、诚实和无害的人工智能系统的研究而开发的,它采用了一些先进的技术和方法,例如对抗性训练、可解释性分析、监督学习等,来提高输出的质量和安全性。Claude不会透露或讨论自己的Claude不会透露或讨论自己的内部机制、规则
Chat YouTube是一款基于ChatGPT与OpenAI的在线服务,其操作非常简单:只需提供一个YouTube视频链接,它就能根据视频内容回答您的问题、总结视频要点,甚至帮助您理解外语视频内容,不再需要费时地观看整个视频。AIGC是人工智能领域中的一种创新技术,其基本原理是利用人工智能技术中的“自然语言处理”、“机器学习”、“深度学习”等技术,对大量的语言数据进行深入分析、学习和模拟,从而实
更诡异的是“s键打不出”:KeepAlive让贪吃蛇游戏的keydown监听器在注册页生效,吞掉“s”键。高内聚、低耦合,敏感逻辑收口,公共接口设防(Redis五层防爬虫),系统才能在公网“独善其身”。多Agent协同,让系统拥有“自我进化”能力。我始终认为,优秀的架构师应像对待孩子一样对待产品:给予生命(功能),更要通过“教育”(重构)与“引导”(架构演进),让它从蹒跚学步成长为逻辑自洽的“成年
很多团队准备把 Codex、Claude Code 这类编程 Agent 接进研发流程,但真正要先补的不是写码速度,而是分支权限、测试、review、回滚和审计这 5 道工程闸门。能安全进入团队流程的 Agent,应该是可控、可审阅、可回滚、可追溯的流程节点。
agent 会的本事越多,全写进系统提示就越贵越乱。这课拆 Claude Code 的技能与命令机制——核心就一个词:按需加载(渐进式披露)。
是由 Google 推出的一个开源项目,用于展示和运行端侧(Edge)AI应用。它的核心目标是:👉让AI模型能够在本地或边缘设备上直接运行和展示适合开发者快速体验与构建AI应用。Google AI Edge Gallery 更像是一个:👉AI应用展示与运行平台降低AI使用门槛提供统一展示入口支持本地AI运行搭建AI展示平台做模型Demo构建本地AI工具这个项目非常值得尝试。
维度传统理解现代工程视角深层依据定位“输入文本”模型运行时的控制平面(Control Plane),等效于操作系统内核调度指令LLM无显式状态机,所有行为均由输入token序列触发作用域单次调用优化跨会话策略中枢:串联记忆、工具、RAG、安全过滤器的统一入口点共同构成完整执行上下文价值锚点提升回答质量降低LLM不确定性熵值:将概率分布输出约束至业务可接受的确定性子集实验表明,优质prompt可使事
本文基于2026年大厂校招/社招高频面试场景,对6大核心系统设计做**全维度、标准化、可落地**的知识体系拆解,统一遵循「需求目标→架构分层→核心难点与解决方案→高可用/高并发/一致性设计→容灾降级→监控运维→高频面试考点」的结构化框架,同时补充通用设计原则与横向对比,适配面试答题与工程落地双重需求。
架构决策、业务理解、用户价值。从个人使用到团队基础设施的跨越,需要的不只是工具,更需要:统一的规范、共享的上下文、清晰的边界约定、以及持续的实践和迭代。- 架构决策(不能外包给AI)- 安全审查(AI会漏掉复杂的业务逻辑漏洞)- 业务逻辑验证(AI不懂你的业务规则)- 最终代码提交前的完整阅读### 5.2 建立AI协作规范。- 样板代码生成(CRUD、DTO、测试框架)- 代码解释和文档- 调试
本文基于当前产业落地实践,系统拆解 AI Agent 核心架构、关键技术、工程落地路径与典型场景方案,详细阐述神经符号融合、动态 MoE 路由、反思式记忆、多智能体协同等关键技术,结合金融、办公、工业、客服等真实落地案例,给出一套可直接部署、低门槛接入、高稳定性的企业级 Agent 建设方案。智能体以大模型为认知底座,具备感知、规划、推理、执行、反思全闭环能力,能够像人类员工一样理解目标、拆解任务
如果你用过各种AI Agent框架,可能会有一个共同的感受:模型不缺执行力,缺的是判断力。规划(Planning)在Agent系统中指的是:给定一个目标,分解出可执行的子任务序列,并在执行过程中根据反馈动态调整。:每次观察都会影响下一次思考,规划不再是一次性的静态分解,而是动态演化的过程。### Plan-and-Execute:分离规划与执行对于复杂任务,单纯的ReAct有个问题:过于局部化,容
攻击者通过精心构造的文本输入,试图让模型忽略你的指令,转而执行攻击者的意图。更麻烦的是,现有的传统安全工具对这类攻击几乎无效。:让专人尝试攻击你的系统,发现盲点AI安全是一个持续的猫鼠游戏。建立系统性的防御体系,并保持持续学习,是AI应用安全的正确态度。这在RAG系统中特别危险:如果攻击者能控制被索引的文档,就能通过文档内容影响AI的行为。:基于规则的过滤器是必要但不充分的防御,攻击者可以绕过已知
这一期的最大焦点是 DeepSeek-V4-Flash 连续第 5 周登顶。但很多评论文章漏掉了一个细节——DeepSeek 旗下还有一款定位"旗舰"的 DeepSeek-V4-Pro,为什么挂在头版的是 Flash 而不是 Pro?这个问题的答案,就是 OpenRouter 这种"路由层 + 比价"场景下选型逻辑的最佳样本。先看产品参数。根据DeepSeek V4 发布公告和DeepSeek-V
是否需要五家以上模型可切?├── 否 → 走聚合平台或单一 provider OpenAI 兼容路径,不做翻译层└── 是 → 是否需要流式工具调用?├── 否 → 翻译层只写 to_anthropic / to_gemini + 响应统一,1 周可上线└── 是 → 翻译层 + 三套 stream 累加器 + 完整 mock 单测,2-3 周完整版一句话总结五家 Function Calling
你跟 agent 说过一次用两空格缩进,换个会话它又用回四空格——很多工程师线上栽在这种失忆上,以为塞进上下文就叫记住了。上一课压缩会丢东西,那跨会话长期记得的事放哪?这课把记忆从上下文窗口里拎出来,单独当一个架构模块拆。
是否需要原生 video + audio?├── 是 → 海外主体?│ ├── 是 → Gemini 3.0 Pro│ └── 否 → GLM-5.2 + 外挂多模态(次优方案)└── 否 → 是否前沿编程 / 长程 Agent?├── 是 → 海外主体?│ ├── 是 → Fable 5(编程)/ GPT-5 Preview(Agent)│ └── 否 → GLM-5.2(合规可用,能力近似但有
从 Naive RAG 到生产级 RAG,核心差距在于。
当一次 Agent 任务跑两个小时、烧掉几十次 LLM 调用、写过磁盘、调过外部 API,Worker 重启那一瞬间,你希望发生什么?长回答就是这篇文章要讲的事情——从 Replay Boundary 第一性原理出发,拆解 LangGraph、Temporal、Anthropic Claude Managed Agents、Microsoft Durable Task 这四个主流方案的工程做法,再
(2026年):- 将 DeepSeek 的强化学习方法论移植到具身领域- 自主探索生成训练数据,减少人工标注依赖—## 三、VLA 模型的核心技术挑战### 挑战一:数据稀缺语言模型有互联网上海量文本,视觉模型有数十亿图片,但机器人操作数据极难获取:- 需要物理机器人执行和记录- 失败轨迹也要标注- 数据采集成本是文本的 1000 倍以上。这背后的核心技术,是。(2026年4月最新):- 在操作
Apache 2.0 协议,完全开源。策略:- 奇数层:局部窗口注意力(窗口大小 4096 tokens)- 偶数层:全局注意力这样既保证了局部连贯性,又维持了全局理解能力,同时把整体计算量降低约 40%。—## 四、训练策略:从数据到对齐### 预训练Gemma 4 的预训练数据量约为 13 万亿 tokens,来源:- 高质量网页文本(经多轮过滤)- 代码:GitHub 代码库 + 合成代码数
这个设计的好处:- 共享专家承载通用语言理解能力,不随路由变化- 8 个路由专家专注细分能力(代码、数学、多语言等)- 避免了纯 MoE 在"基础能力退化"上的问题### Qwen3.6-Plus 的纯 MoEQwen3 系列坚持纯 MoE(无 shared expert + 无 dense MLP),靠增加专家数量和精细的路由负载均衡来保持质量。上下文窗口独树一帜- GLM-5.1 是其中唯一
应对从最简单的协作模式开始,根据实际需求逐步增加复杂度。
## 第一部分:AI产品的需求分析框架### 传统用户故事 vs AI用户故事传统用户故事:> “作为一个用户,我想要搜索商品,以便找到我需要的东西"AI用户故事需要额外维度:> “作为一个用户,当我用自然语言描述我的需求时,我希望系统能理解我的意图并推荐相关商品———## 第二部分:AI用户体验设计原则### 原则一:透明性——让用户知道AI在做什么好的AI产品不会把AI"黑盒化”。—## 第三
以下插件均经生产环境验证,