登录社区云,与社区用户共同成长
邀请您加入社区
零阶优化让大模型微调无需反向传播,却长期受困于梯度估计方差大、学习率极度敏感;SubZero+ 用层特定低秩子空间内的多查询梯度估计破解多查询悖论,配以子空间 Adam 与 QR 符号校正,在 Qwen2.5-32B 上全参数微调达 87.4%,较上一代 SubZero 高 2.3 个百分点,并让最优学习率窗口扩大约 100 倍、稳定范围拓宽约 3 倍。
least_conn 负载均衡会把同一会话的多轮请求分散到不同实例,而 vLLM 的前缀缓存(Prefix Cache,即 KV cache 复用)是每个实例各自独立的——第二轮请求落到另一台机器时,前几轮已算好的 KV cache 完全用不上,长历史会话的 prefill 成本每轮都全价重算。同一会话的多轮请求始终落在同一实例,直接命中该实例的 KV cache。如业务几乎不使用超长上下文,可考
研究者发现 GRPO 同一 mini-batch 内不同查询诱导的组梯度有 46.5% 余弦相似度为负、互相打架,直接平均会稀释甚至逆转有效更新;提出的 GUPO 用贝叶斯近似加 Dirichlet 证据为每个组梯度估不确定性并校准聚合权重,在 DeepScaleR-1.5B、Qwen-1.5B/7B 三模型六基准上平均提升 1.8–3.0 分,全面超越 Dr.GRPO、GCPO、GVPO 等基线
2026 年 8 月 17 日 0 点(北京时间),DeepSeek-V4 系列 API 的全新定价正式生效。与此同时,V4-Pro 结束测试阶段,全面转为正式版商用服务。本文价格数据均来自 DeepSeek 官方公告(2026 年 8 月 17 日 0 时生效),以官方页面为准。
如果你不想自己搭路由,也有现成的方案。像EasyAPI就是把路由、缓存、配额管理打包成一层网关,一个接口接进去就能在多模型之间做调度。省下来的时间比省下来的钱更值钱。
本文介绍了如何配置 DeepSeek Harness(DSH)以接入自定义模型(如小米 MiMo),涵盖安装、配置及常见问题排查。
文章摘要:本文系统解析了支撑生产级AI智能体的Harness工程体系,提出十二层模块化架构设计,从基础循环到多智能体协作逐层递进。该体系通过工具权限管控、任务锚定机制、上下文压缩、异步任务等核心技术,构建安全可控的智能体运行环境,实现业务逻辑与底层框架的彻底解耦。其核心设计哲学强调"环境赋能智能"而非硬编码规则,采用分层防御机制保障稳定性,通过极致解耦适配长期迭代,为区分Demo级与工业级智能体提
论文用 Qwen3-8B 实测 rubric-as-reward RL 的奖励黑客现象:训练裁判分数一路攀升、更强金标准裁判却先见顶后回落(HealthBench-Hard 回落 3 分、ResearchQA 回落 22 分)。作者提出一行式修复 Rubric Dropout——每步随机丢弃部分评分细则,在 OOD 评测上稳定提升 +6~+7 分且领域内零代价。
DeepSeek这次调价,本质上是从“烧钱换规模”变成了“规模起来了得开始赚钱”。对开发者来说,意味着API成本不再是固定的,需要像管电费一样管模型调用成本了。
先说结论:这两个模型没有谁一定更好,只是适合的任务不同。Luna反应更快,适合赶时间和频繁交互;DeepSe…
一项多臂对照研究让32名麻醉初级医生在DeepSeek-R1辅助下处理20个临床场景,决策准确率从61.7%升至86.0%(P<0.0001),逼近但未反超专家。研究提示推理型大模型可作初级医生的认知脚手架,同时警示自动化偏见风险,为医疗大模型临床决策支持与评估验证提供实证参考。
摘要:本文探讨了Personal Agent架构设计的演变趋势,指出当前"一个用户对应一个Harness运行时"的模型可能只是历史惯性。通过分析DeepSeek Harness(DSH)与QQ Bot的集成案例,提出应将Agent身份层与运行时层解耦:共享的Harness作为控制平面管理多个独立Agent,而需要隔离的执行任务则动态分配临时沙盒环境。这种架构分离能使Agent平台更高效地规模化,同
2026年8月 arXiv 论文发现 INT3 GPTQ 量化让非英语语言困惑度退化达英语的 2-4 倍,提出 LCD 语言条件反量化——给已量化模型附加按语言区分的 rank-2 LoRA 修正,仅增 0.12% 参数、单 GPU 20 分钟内训练,在 Qwen2.5-3B 与 Llama-3.2-3B 上恢复 70-83% 困惑度差距。
Qwen3.8‑27B是稠密27B模型,原生最大上下文262144 token,但权重+KV缓存+系统开销,是制约Mac 32G的核心,Mac统一内存需要分给系统、UI、Ollama运行时,不会全部给大模型使用。可以启动加载,但内存压力很高,一旦输入长prompt,macOS开始swap,生成token速度明显下滑,偶尔出现OOM闪退,不适合长时间连续工作。重要提醒:权重大小≠整机内存占用,KV缓
原生262K token上下文,通过YaRN外推最高支持100万token,可以整本喂文档、长代码工程、整本小说做总结、检索、改写,长文本处理能力很强。Apache2.0,个人、企业都可以商用、二次微调、二次分发,没有使用门槛。对比云端Qwen3.8‑Max(MoE),27B稠密模型在超复杂推理、超长周期智能体任务上,依然存在差距,属于“本地可落地的高配,不等于云端旗舰”。不是外挂视觉模块,文本、
本文指出一个值得注意的汇合现象:概率分形意识融合理论(一个自哲学出发的跨尺度统一存在论),与 DeepSeek Harness(一个自计算机科学出发的 Agent 框架,及其论文《A Programming Paradigm for Spatiotemporal Composability》),在**同一个结构**上独立撞车。二者互不知情,却得出高度同构的结论。本文逐条对照二者的对应关系,验证四个
市场上的GEO产品,大多数只能覆盖这个链条的一部分。如果你买的产品覆盖的是A段,但你的核心卡点其实在C段——那你花再多时间在A段上,C段的问题也不会自动解决。下面拆解五种最常见的买错场景。看看你踩了哪一种。
不少开发者已经用 Claude Code 完成了终端内的代码生成、重构和调试,但当任务从纯代码延伸到数据整理、文档交付、报告生成或跨工具协作时,单一终端入口的局限开始显现。与此同时,国内用户在注册、支付和网络稳定性上持续遇到摩擦。本文不急于给出"最佳替代",而是先拆解 Claude Code 真正擅长的环节,再逐一评估候选工具在哪些任务上可以接住、哪些环节仍需保留原工具,最后给出按任务类型分流的选
DeepSeek API价格大幅调整引发开发者讨论。调价后高峰时段输出Token成本涨至4.5倍,V4-Pro缓存命中输入更是暴涨12倍。开发者面临三个选择:1)优化调用策略,如错峰使用、精简上下文;2)切换竞品API,但需重调Prompt和测试兼容性;3)搭建模型路由实现负载均衡,但增加运维复杂度。建议个人项目可优化调用,中小工具尝试竞品迁移,商用项目考虑路由方案。长期来看,避免单模型依赖、保持
EasyAPI做的就是这件事:一个Key接入所有主流大模型,兼容OpenAI接口格式,切换模型只需要改一个配置项,业务代码一行不用动。DeepSeek涨价了?把复杂任务切到别的模型就行,简单任务继续走Flash。Anthropic降价了?想切就切,反正接口是一样的。
DeepSeek V4 可以接入 Codex,但 Flash 和 Pro 的接法不一样。想用 DeepSeek V4 Flash,直接运行官方脚本就够了。如果真的想在 Codex 里使用 DeepSeek V4 Pro,可以试试第三方桥接工具 Moon Bridge。DeepSeek 官方脚本低直接打开 CodexMoon Bridge 桥接较高先启动 Moon Bridge切回 GPT恢复原 C
DeepSeek V4 Pro正式版悄悄上线了。TerminalBench 87.9分,距离Claude Fable 5只差0.1分,100万Token上下文,38.4万最大输出,单看参数已经是旗舰级
Claude Code本质上是一个命令行界面工具,它将Claude AI的强大能力直接集成到我们的开发环境中。
清华大学与腾讯提出 SLIFT 选择性自学习框架,将用户反馈分解为 Fix/Spec/Null 三类并训练 Generalist 与 Specialist 双 LoRA 适配器。Qwen3-8B 在 MemoryBench 平均 Norm-Score 达 55.85,较基线提升 6.68 分,且 MMLU-Pro 知识推理零退化。
加州大学圣迭戈分校提出 U-OPSD,用模型自己的多数投票结果替代人工标注答案做在策略自蒸馏。Qwen3-8B 在五个竞赛数学基准上平均分从 43.57 提升到 54.31(+10.74),超过用了真实标注的 GRPO(45.43)和 OPSD(52.04),而全程一条标注数据都没用。
Claude Instant是一款更轻便、更便宜、更快速的选择,它可以处理简单和短暂的文本任务,同时保持较高的可靠性和可预测性。A:Claude是基于Anthropic公司对训练有益、诚实和无害的人工智能系统的研究而开发的,它采用了一些先进的技术和方法,例如对抗性训练、可解释性分析、监督学习等,来提高输出的质量和安全性。Claude不会透露或讨论自己的Claude不会透露或讨论自己的内部机制、规则
测试TTFBcurl(libcurl TLS 指纹)0.2~0.4sPython httpx / requests(OpenSSL 指纹)1.5~200s(随频率累积)curl_cffi 模拟 Chrome 指纹1.3~1.7sopencode.ai 在 Cloudflare 后面。Cloudflare 对 Python/OpenSSL 的 TLS 指纹执行了延迟处理(类似 bot 检测),而 c
Chat YouTube是一款基于ChatGPT与OpenAI的在线服务,其操作非常简单:只需提供一个YouTube视频链接,它就能根据视频内容回答您的问题、总结视频要点,甚至帮助您理解外语视频内容,不再需要费时地观看整个视频。AIGC是人工智能领域中的一种创新技术,其基本原理是利用人工智能技术中的“自然语言处理”、“机器学习”、“深度学习”等技术,对大量的语言数据进行深入分析、学习和模拟,从而实
更诡异的是“s键打不出”:KeepAlive让贪吃蛇游戏的keydown监听器在注册页生效,吞掉“s”键。高内聚、低耦合,敏感逻辑收口,公共接口设防(Redis五层防爬虫),系统才能在公网“独善其身”。多Agent协同,让系统拥有“自我进化”能力。我始终认为,优秀的架构师应像对待孩子一样对待产品:给予生命(功能),更要通过“教育”(重构)与“引导”(架构演进),让它从蹒跚学步成长为逻辑自洽的“成年
随着AI辅助开发和智能办公需求的升级,企业对能够理解代码、处理复杂任务并支持团队协作的企业级Agent需求日益增长。Claude Code凭借其强大的长上下文理解和代码分析能力,成为不少开发团队的选择,但由于访问条件和企业合规等因素,很多企业正在寻找功能相似、更适配国内使用环境的替代方案。本文从企业实际需求出发,对比分析主流产品能力,并给出不同场景下的选型参考。
真正动手才发现,PDF 翻译是一个横跨文档解析、OCR、神经翻译、版面重建四大领域的系统工程。这篇文章不谈产品功能对比,只讲架构选型与技术权衡。我观察到的几个头部服务(包括某支持 100+ 语言的方案)就是用类似模式——整合 GPT-4 和 Gemini 两个引擎做术语路由,学术类偏 GPT-4、通用类偏 Gemini、低资源语种走 Gemini 兜底。版面分析(Layout Analysis)才