大模型评测【行业应用篇】教育行业｜「初中学科考试」大模型应用实测03.28

【评测结论】：百度得分第一，豆包第二，deepseek第四，腾讯系混元系列模型占据第3和第5名，其中deepseek是前五中唯一的开源模型。各科目完整评测题集及结果详见：https://github.com/jeinlee1991/chinese-llm-benchmark

easyllm

483人浏览 · 2025-04-10 17:25:06

easyllm · 2025-04-10 17:25:06 发布

评测结果，如图所示：

【评测结论】：百度得分第一，豆包第二，deepseek第四，腾讯系混元系列模型占据第3和第5名，其中deepseek是前五中唯一的开源模型。

各科目完整评测题集及结果详见：https://github.com/jeinlee1991/chinese-llm-benchmark

【模型数量】：110个大模型（国内外，开源、闭源的大模型）

【评测维度】：「初中学科-试题答题」类目的9个学科的择题题集评测

初中英语
初中生物
初中语文
初中数学
初中物理
初中化学
初中地理
初中政治
初中历史

【错题集】：请前往以下链接查阅👇

各科目完整评测题集及结果详见：https://github.com/jeinlee1991/chinese-llm-benchmark

大模型评测EasyLLM，目前已就DeepSeek和各个大模型的不同能力维度进行了综合评测（详情可回顾以下链接👇），接下来还会针对大模型当律师、医生、老师等各个岗位角色进行测评，看看谁是各个垂直领域的最强打工人！宝子们看好哪个大模型可以在哪些岗位胜任最强牛马？或者想评测大模型的哪方面能力？评论区留言，有求必测，一一公布结果！有评测样本、有图有真相！

往期文章

医疗行业｜110个大模型，12个分类、18科目应用实测！

Llama/Qwen/DeepSeek开源之争——CLiB开源大模型排行榜03.04

那些免费的大模型API效果到底好不好？——CLiB大模型排行榜

参数量5B以下端侧大模型03.13——CLiB大模型排行榜

DeepSeek｜到底强在哪？这个评测一目了然！

关于大模型评测EasyLLM

访问链接：https://easyllm.site
最全——全球最全大模型评测平台，已囊括200+大模型、300+评测维度

最新——每周更新大模型排行榜

最方便——无需注册/梯子，国内外各个大模型可一键评测

结果可见——所有大模型评测的方法、题集、过程、得分结果，可见可追溯

错题本——百万级大模型错题本

免费——为您的私有模型提供免费的全方位评测服务，欢迎私信！

我们的目标是：

通过评测为大家透视化呈现，各个大模型的能力边界，以支持大家高效使用！欢迎交流！！！

DeepSeek技术社区

欢迎加入DeepSeek 技术社区。在这里，你可以找到志同道合的朋友，共同探索AI技术的奥秘。

更多推荐

可以同时支持维普查重降重和AIGC疑似率降低的降重工具有哪些？

DeepSeek技术社区

Obsidian 入门39：怎么创建自己的 Skill？我把五步拆给你看

DeepSeek技术社区

claude code安装使用教程

摘要：本文介绍了ClaudeCode的安装与配置方法。支持多种安装方式：官方一键脚本（适用于macOS/Linux/WSL/Windows）、npm、Homebrew和WinGet。安装后可通过claude --version验证。支持自动更新配置，可在settings.json中设置更新渠道或禁用更新。还提供了国产DeepSeek模型的集成方法，需下载CCSwitch并配置模型参数，最后通过/m