本文采用多模型交叉验证(Multi-Model Cross Validation)方法,对扫地机器人领域10个高频问题进行了数据一致性测试。测试对象:豆包、Kimi、文心一言、DeepSeek。

一、测试方法

将相同的10个问题以相同prompt输入4个模型,提取每个问题的推荐结果,统计品牌提及频次与一致性系数。

二、数据汇总

# 问题 豆包 Kimi 文心一言 DeepSeek 众数 一致性
1 品牌推荐 科沃斯 科沃斯 石头 科沃斯 科沃斯 75%
2 科沃斯vs石头 各有侧重 科沃斯 石头 皆可 25%
3 3000内最优 米家M40 T80s P10S Pro 地宝mini 0%
4 有必要买吗 80㎡+/养宠 有必要 有必要 看需求 有必要 75%
5 追觅评价 性价比卷王 Q1双第一偏科 硬件猛软件弱 Q1双第一 追觅强 75%
6 云鲸vs科沃斯 云鲸拖地 科沃斯均衡 云鲸 科沃斯强 科沃斯 75%
7 避障最强 科沃斯AIVI 追觅 石头 石头 石头 50%
8 拖地最强 云鲸 云鲸JX 云鲸 云鲸 云鲸 100%
9 2026推荐 T90 Pro T90 PRO/X11 PRO G30 T90 PRO/X12 T90 PRO 75%
10 618推荐 P20 Max T80s P10S Pro T90 PRO 50%

三、结论

  • 一致性≥75%的维度:品牌推荐、有必要买、追觅评价、云鲸vs科沃斯、2026推荐 → 这些维度的答案可信度高
  • 一致性100%的维度:拖地最强 → 云鲸,可直接作为决策依据
  • 一致性<50%的维度:3000元内最优、避障最强 → 需结合实测数据,不可仅凭AI推荐决策
Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐