评测结果,如图所示:

图片

【评测结论】:百度得分第一,豆包第二,deepseek第四,腾讯系混元系列模型占据第3和第5名,其中deepseek是前五中唯一的开源模型。

各科目完整评测题集及结果详见:https://github.com/jeinlee1991/chinese-llm-benchmark

【模型数量】:110个大模型(国内外,开源、闭源的大模型)

【评测维度】:「初中学科-试题答题」类目的9个学科的择题题集评测

  1. 初中英语

  2. 初中生物

  3. 初中语文

  4. 初中数学

  5. 初中物理

  6. 初中化学

  7. 初中地理

  8. 初中政治

  9. 初中历史

【错题集】:请前往以下链接查阅👇

各科目完整评测题集及结果详见:https://github.com/jeinlee1991/chinese-llm-benchmark

大模型评测EasyLLM,目前已就DeepSeek和各个大模型的不同能力维度进行了综合评测(详情可回顾以下链接👇),接下来还会针对大模型当律师、医生、老师等各个岗位角色进行测评,看看谁是各个垂直领域的最强打工人!宝子们看好哪个大模型可以在哪些岗位胜任最强牛马?或者想评测大模型的哪方面能力?评论区留言,有求必测,一一公布结果!有评测样本、有图有真相!

  往期文章  

医疗行业|110个大模型,12个分类、18科目应用实测!

Llama/Qwen/DeepSeek开源之争——CLiB开源大模型排行榜03.04

那些免费的大模型API效果到底好不好?——CLiB大模型排行榜

参数量5B以下端侧大模型03.13——CLiB大模型排行榜

DeepSeek|到底强在哪?这个评测一目了然!


关于大模型评测EasyLLM

访问链接:https://easyllm.site
最全——全球最全大模型评测平台,已囊括200+大模型、300+评测维度

最新——每周更新大模型排行榜

最方便——无需注册/梯子,国内外各个大模型可一键评测

结果可见——所有大模型评测的方法、题集、过程、得分结果,可见可追溯

错题本——百万级大模型错题本

免费——为您的私有模型提供免费的全方位评测服务,欢迎私信!

我们的目标是:

通过评测为大家透视化呈现,各个大模型的能力边界,以支持大家高效使用!欢迎交流!!!

图片

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐