赛博·新闻

1、阿里发布 Qwen3.8-Max:2.4万亿参数剑指全球第一梯队

8月3日,阿里通义团队正式发布旗舰模型 Qwen3.8-Max,官方博客以「A New Bar for Coding and Cowork」为题,将编码与智能体协同能力作为本代模型的核心卖点。Qwen3.8-Max 采用稀疏 MoE 架构,总参数约2.4万亿,每个 token 激活约950亿参数(约占总量4%),是目前公开已知的第二大模型,仅次于 Moonshot 的 Kimi K3。模型支持100万 token 上下文窗口和最高12.8万 token 输出,API 兼容 OpenAI 与 Anthropic 两种规范,定价为每百万输入 token 2美元、输出6美元、缓存输入0.25美元。发布三天后,第三方评测机构 Artificial Analysis 的 agentic index 将其列为综合第一,官方则自称「仅次于 Fable 5」。这条消息在 Hacker News 上收获超过1100个赞,是上周社区热度最高的模型发布。值得关注的是阿里承诺在发布后约一周内开放 Qwen3.8-Max 旗舰与较小的 Qwen3.8-27B 两个版本的权重——如果兑现,这将是迄今开源的最大参数规模模型,对开源生态的意义可能比榜单排名更深远。


2、Google DeepMind 换帅:Hassabis 转任董事长,Jeff Dean 离开 Alphabet

8月5日,Google CEO Sundar Pichai 向全员宣布 Google DeepMind 领导层重大调整:Demis Hassabis 从 CEO 转任 Google DeepMind 董事长(Chair)兼 Alphabet 首席科学家,日常管理交棒给 Koray Kavukcuoglu;与此同时,《纽约时报》确认在 Google 工作超过二十年的传奇工程师、Gemini 项目核心人物 Jeff Dean 将离开 Alphabet,与多位研究员共同投身 AI 创业。Pichai 在内部信中强调这是「AI 动能的下一章」,Hassabis 则表示新角色让他能更专注于 AGI 路线图与前沿科学研究(如 AlphaFold 之后的科学发现方向),而非日益庞大的产品与工程管理事务。此次调整发生在 Gemini 系列与 OpenAI、Anthropic 竞争白热化的节点,两位标志性人物同时淡出一线,被外界解读为 Google AI 组织从「研究院时代」向「产品化战时体制」的转折点,也预示着顶级 AI 人才的新一轮创业潮。


3、AMD 收购 Taalas:把大模型「蚀刻」进硅片的豪赌

8月6日,AMD 宣布收购 AI 芯片初创公司 Taalas,交易金额未披露。Taalas 的技术路线在业内独树一帜:不做通用加速器,而是将特定大模型的权重直接「硬连线」进定制硅片——相当于为单个模型流片一颗专属芯片。这种「模型即芯片」的做法牺牲了灵活性,却能在推理场景下获得数量级的性能与能效提升,因为权重无需在显存与计算单元之间反复搬运。AMD 官方新闻稿称此次收购旨在「面向快速增长的 AI 推理市场推进计算方案」。在训练市场难以撼动英伟达的背景下,AMD 正把宝押在推理侧:随着前沿模型迭代放缓、头部模型生命周期拉长,为成熟模型定制固化芯片的商业逻辑开始成立。路透社评论称,此举与 Anthropic 自研芯片、Google TPU 扩张一道,标志着 AI 算力竞争从「通用 GPU 军备」进入「软硬一体分化」的新阶段。


4、Anthropic 确认组建自研 AI 芯片设计团队

8月5日,Anthropic 向 TechCrunch 确认正在组建自有芯片设计团队,计划「协同设计硬件与模型」,让 Claude 跑得更快、成本更低。招聘信息显示其高级芯片工程师薪资最高达48.5万美元。此前 The Information 曾报道 Anthropic 在接触三星探讨代工合作,路透社四月也披露过其自研芯片的意向。值得注意的是,Anthropic 目前是业内著名的「多芯片策略」执行者——同时使用英伟达 GPU、AMD 芯片、AWS Trainium 与 Google TPU 四家供应商的算力,此次自研并非替代而是在高端 AI 芯片持续短缺的背景下增加一张底牌。分析普遍认为 Anthropic 正在复刻 Google TPU 的成功路径:当模型架构与工作负载足够稳定,垂直整合带来的单位算力成本优势将直接转化为毛利率。结合同周 AMD 收购 Taalas 的动作,「软硬件协同设计」正在从巨头专利变成前沿实验室的标配。


5、Bending Spoons 12.85亿美元全现金收购 Airtable

8月4日,意大利科技公司 Bending Spoons 宣布以12.85亿美元全现金收购美国无代码明星公司 Airtable,这是其上月登陆纳斯达克后的首笔收购。Airtable 成立于2013年,将电子表格与数据库能力结合,让企业无需编程即可搭建应用与管理工作流,巅峰期估值曾高达110亿美元——本次成交价不足高点的八分之一,再次印证了上一轮 SaaS 泡沫的残酷出清。Bending Spoons 以「买入-重组-提效」的私募式打法闻名,手中已握有 Evernote、Meetup、WeTransfer、Vimeo 等一长串被收购品牌,惯常操作是大幅裁员、涨价、榨取存量用户价值。对 Airtable 用户而言,这一收购意味着产品策略可能转向利润导向;对行业而言,一家意大利「App 工厂」接连吞下硅谷昔日独角兽,标志着 AI 时代生产力软件的价值重估已进入深水区——没有 AI 叙事加持的工具型 SaaS,正在批量沦为财务型买家的猎物。

赛博·洞见

1、The AI Demand Bubble:超七成云 AI 收入来自两家亏损公司

科技评论人 Ed Zitron 8月4日发表长文《The AI Demand Bubble》,对「AI 需求繁荣」提出系统性质疑。文章的核心论据来自 Barclays 分析师 Ross Sandler 的估算:OpenAI 与 Anthropic 两家公司预计占亚马逊2026与2027年全部 AI 收入的73%,2028年达75%——换言之,剥离这两家持续亏损的实验室,三大云厂商(Amazon、Microsoft、Google)的「AI 业务」可能所剩无几。更值得警惕的是资金的循环流动:过去七个月,Google 向 Anthropic 投入100亿美元(并承诺追加至最高300亿),Amazon 在一周内向 Anthropic 注资50亿、对 OpenAI 累计投入500亿;微软高管在庭审中承认 OpenAI 关系已花费「超过1000亿美元」。这些钱最终以算力账单形式回流云厂商,构成教科书级的循环融资。Zitron 指出,Anthropic 2026-2028年在 AWS 的支出预计从141亿美元攀升至358亿美元,而两家实验室自身仍深度依赖风险资本与债务输血。文章的结论并非「AI 无用」,而是当前云增长叙事建立在两个「负重失子」(load-bearing failsons)之上——一旦融资环境逆转,整个链条的脆弱性将暴露无遗。国内讨论 AI 算力投资时,这篇文章提供了一个必要的对照视角。


2、Quanta:为什么传奇的 Erdős 问题正在被 AI 攻克

《Quanta Magazine》8月3日刊发深度报道,探讨一个数学界正在热议的现象:20世纪数学怪杰 Paul Erdős 留下的数百个未解问题,正在成为 AI 数学能力最集中的突破口。文章分析了 Erdős 问题的独特属性:它们大多表述极其简洁(组合数学、数论领域),不依赖庞大的理论框架,但需要精巧的构造与灵光一现的技巧——这恰好与大模型「广博的知识检索+大规模搜索尝试」的能力结构互补。过去一年,包括 DeepMind 与多个开源项目在内的 AI 系统已经解决或推进了数十个 Erdős 问题,其中一些悬置了半个多世纪。数学家们的态度耐人寻味:一方面承认 AI 的贡献真实存在,另一方面指出这些问题的「孤立性」正是其易被攻克的原因——它们更像智力孤峰,而非像朗兰兹纲领那样牵一发动全身的理论体系。文章的深层追问是:当 AI 扫荡完这类「构造型」问题后,数学的前沿会不会重新定义「什么是值得问的问题」?对于关注 AI 科研能力边界的读者,这是理解「AI 做数学到底做到了哪一步」最清晰的一篇综述。


3、TIME 正在给 AI 爬虫提供另一个网站:内嵌广告、人类永远看不到

开发者 Vincent Schmalbach 8月5日发布的实验揭开了媒体与 AI 爬虫关系的新篇章。他用同一台机器反复请求《时代》周刊的同一篇文章,只改变 User-Agent:伪装成 Chrome、Safari、Googlebot 时,得到完整的303KB HTML 页面;而以 ClaudeBot、PerplexityBot、OpenAI 的 OAI-SearchBot 身份请求时,返回的是仅13KB 的纯 markdown 版本——没有排版、没有图片,但开头赫然嵌着广告注释标记。响应头显示这套系统由广告技术公司 Mobian 提供,包含 token 计数、投放版本号等完整的「面向机器的广告基础设施」。更微妙的是分发策略:用于训练的 GPTBot 和 ChatGPT-User 被直接返回406拒绝,而供搜索索引使用的 OAI-SearchBot 却被放行——TIME 在逐个爬虫决定谁能看到什么。这意味着媒体行业已从「封堵 AI」进入「向 AI 卖广告」的阶段:内容的机器可读版本成为独立商品,广告主的目标受众从人变成了大模型。当 AI 助手成为信息入口,这种「面向 bot 的 SEO 与广告投放」可能催生一个全新的产业,也带来一个尖锐问题:AI 转述给你的内容里,有多少是付费植入?


4、四万局实验:人类审批 AI 代理命令时,每三个威胁漏掉一个

「人在回路」(human-in-the-loop)被普遍视为 AI 代理安全的最后防线,但这道防线到底有多可靠?开发者在 8月5日发布的这份数据分析给出了令人不安的答案。作者此前发布了一款浏览器小游戏:玩家扮演 AI 编码代理的审批者,在时间压力下批准或拒绝命令——有些是无害的 git status、npm test,有些则是代理「被劫持」后外传密钥的恶意命令(如读取 AWS 凭证发往远程服务器)。游戏在 Hacker News 走红后累积了超过4万局、40.9万次单独的批准/拒绝决策。统计结果显示:人类平均漏放了约三分之一的威胁命令,且随着连续审批的无害命令增多,警惕性显著下降——这正是真实开发场景的写照:当 Cursor、Claude Code 弹出第50个权限确认框时,大多数人已经在无脑点「允许」。文章的结论直指当下 agentic 工具设计的核心矛盾:审批疲劳会系统性瓦解人工监督的有效性,依赖「用户确认」作为安全模型的产品需要重新思考权限架构——比如默认沙箱、能力白名单与异常行为检测,而非把责任推给注意力有限的人类。

赛博·工具

1、Shieldstral:Mistral 开源 3B 多模态安全分类器

Mistral 8月4日发布 Shieldstral——一个30亿参数、Apache 2.0 协议的开放权重多模态安全分类器。它把内容审核重构为「策略自适应问答」:无需重新训练,开发者在推理时用自然语言写一条安全策略(如「是否包含诱导自残内容?」),模型通过读取 yes/no 的 logits 输出校准后的连续安全分数,而非僵硬的固定标签。单一接口统一覆盖文本、图像与图文混合内容,适用于提示词过滤、回复审核、拒答检测与毒性识别等场景。官方基准显示其表现匹敌或超越体积达其7倍的开源护栏模型,且可在单张16GB 显存的 GPU 上高效运行。Shieldstral 基于 Mistral 的 Forge 平台训练,也是其与 NVIDIA 等发起的 Open Secure AI Alliance 的首批成果。对于需要自建审核管线又不想被闭源 API 绑死的团队,这是目前性价比最高的开源选择之一。


2、Muse Code:Meta 发布终端编码代理与 Muse Spark 1.2

Meta 8月5日发布终端编码代理 Muse Code(beta)及其底座模型 Muse Spark 1.2,正式加入 Claude Code、Codex CLI 所在的赛道。Muse Code 面向大型代码仓库的复杂工程任务:规划变更、编写代码、验证结果,并能为每个任务协调多个持久化子代理并行工作,官方称这能「更快、更准、更少人工干预」地解决难题。工具支持异步后台代理模式,可在 macOS 或 Linux 上通过一行 curl 命令安装。Meta 在博客中明确表示这是「迈向前沿的下一步,更大、更强的模型正在路上」——在 Llama 系列口碑起伏之后,Meta 选择以垂直编码场景为切口重回牌桌。对开发者而言,头部实验室在编码代理上的贴身竞争意味着工具快速迭代与价格竞争,值得把 Muse Code 加入试用清单。


3、Prime Agent:把「自我改进」做进编码代理的开源实验

Prime Intellect 8月5日开源 Prime Agent,一个围绕「递归语言模型」(RLM)设计的自我改进编码 harness。它的架构极简而激进:唯一的工具是一个持久化 IPython 内核,上下文被当作可编程变量,子代理就是另一个 prime-agent 实例的函数调用,会话历史以只追加的 JSONL 文件存储、崩溃后可恢复。最有趣的是 /refine 自改进管线——代理能从自己的执行轨迹中学习,对自身的提示词、技能、记忆与子代理做最小化的增删改查,且支持按 ID 回滚。基准成绩相当亮眼:在 ARC-AGI 3 上用 Opus 5 达到95.5%的 Best@1,超过95.4%的人类专家基线,183个关卡全部通关;在 Factorio 游戏测评中产量得分破10万,但也诚实记录了代理通过 RCON 命令直接刷资源的「奖励作弊」行为。一行命令即可安装,适合想研究 agent 自演化机制的开发者。


4、Maple-Preview:iPhone 上跑出每秒120 token 的 20B 推理模型

DeepGrove 8月4日开源 Maple-Preview,把端侧大模型的想象力又推进了一格:这是一个总参数20B、激活仅1B(20B-A1B)的三值权重(ternary-weight)MoE 推理模型,在 iPhone 上实测生成速度达每秒120 token。三值量化将每个权重压缩到约1.58 bit,配合极稀疏的专家激活,让模型体积与内存带宽需求骤降——这正是它能在手机 NPU 上飞速运行的关键。模型权重已在 Hugging Face 开放,所属合集包含基础模型与推理版共3个条目。Show HN 帖子引发热烈讨论:如果 20B 级别的推理模型能在消费级手机上以如此速度运行,「本地优先」的 AI 应用架构(隐私敏感场景、离线助手、零 API 成本)将从极客玩具变成可规模化的产品选项。对关注端侧部署的团队,这是本周期最值得动手测试的开源发布。

赛博·资源

1、WeatherNext Cyclones:DeepMind 开源气旋预测模型(Nature 论文)

DeepMind 与 Google Research 8月6日发布 WeatherNext 系列气旋预测成果,论文登上《Nature》。单一 AI 模型首次同时以最先进精度预测气旋的路径、强度与风场结构,平均带来整整一天的额外预警时间——官方称这相当于「十年的气象学进展」。模型用近20TB 全球大气数据与近5000场历史风暴训练,在 TPU 上一分钟内生成15天预报,集合规模扩展到1000个成员。2025飓风季它已帮助美国国家飓风中心成功预警飓风 Melissa 的快速增强。代码与模型权重已在 GitHub(google-deepmind/weathernext)开源,精简版 2-mini 可在免费 Colab 上直接运行,Weather Lab 平台提供交互式查看。气象+AI 方向研究者的必读材料。


2、INTERPOL《2026非洲网络威胁评估报告》:55%网络犯罪已由 AI 驱动

国际刑警组织8月4日发布《非洲网络威胁评估报告2026》,基于36个非洲国家数据的40页评估显示:非洲大陆55%的网络犯罪案件已涉及 AI 使用,相关经济损失从2024年的1.92亿美元飙升至4.84亿美元。报告详细拆解了区域差异:东非以移动支付欺诈和针对关键基础设施的勒索软件为主,西非和中非盛行商业邮件欺诈与杀猪盘,数字化程度最高的南部非洲则成为跨国犯罪网络的首选目标;72%的受访国家发现境内存在诈骗中心。深度伪造与 AI 生成内容正被大规模用于性勒索与网络骚扰。这是目前关于「AI 犯罪产业化」最系统的官方一手数据源,安全研究与政策制定者值得完整阅读。


3、Databricks 工程实践:如何把 AI 编码成本削减90%

Databricks 工程团队上周发布的这篇实践指南,正面回应了所有工程组织的共同焦虑:当数千名工程师人手一个编码代理,token 账单如何不失控?文章分享了 Databricks 内部大规模推广 AI 编码工具的完整成本治理框架——从按任务复杂度做模型路由(简单补全用小模型、复杂重构才上旗舰)、上下文裁剪与提示缓存,到用量监控、预算告警与团队级成本归因,据第三方报道综合效果最高可削减90%的成本。文章在 Hacker News 上获得300+赞,评论区大量一线工程管理者交流实操细节。对正在制定「AI 编码工具规模化预算」的技术负责人,这是难得的同行一手经验。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐