超越Claude Opus?SIQ-1-35B自动研究能力三模型对比实验
超越Claude Opus?SIQ-1-35B自动研究能力三模型对比实验
【免费下载链接】SIQ-1-35B 项目地址: https://ai.gitcode.com/hf_mirrors/AlexWortega/SIQ-1-35B
SIQ-1-35B是一款强大的通用AI代理模型,具备自动研究、编码和推理能力。它采用创新的MoE架构,总参数量达35B,但每个token仅激活约3B参数,在保持高效能的同时显著降低了计算成本。本文将通过三项关键实验,深入对比SIQ-1-35B与Claude Opus等主流模型的自动研究能力。
📊 自动研究对决:SIQ-1-35B vs Claude Opus vs GLM-5.2
在一项严格控制的三方自动研究测试中,SIQ-1-35B展现出令人瞩目的性能。实验基于openai/parameter-golf项目,每个模型在相同的Pi-Agent框架下独立运行2小时,通过编辑train_gpt.py -> 训练(300秒) -> 评估val_bpb -> 保留/恢复的循环进行优化。
SIQ-1-35B最终达到了val_bpb 1.767的成绩(12次实验,完整2小时),与Claude Opus 4.8(约1.76)不相上下,远超GLM-5.2(2.078)。值得注意的是,GLM在基线模型上停滞不前——它唯一的假设是"增加深度"(这实际上损害了指标),并在约65分钟后停止生成操作;而SIQ通过调整学习率调度和容量编辑(如warmdown从1200调整到800,matrix_lr从0.04调整到0.05等)持续改进。
🔬 GPQA-Diamond性能测试:效率与准确性的完美平衡
在包含198个问题的完整GPQA-Diamond测试中,所有模型均以Q4_K_M GGUF格式、贪婪模式(temp 0)和相同的测试框架运行。结果显示,SIQ-1-tiny-35b是帕累托最优:它不仅实现了最高的准确率,还使用了最少的tokens(见下图)。这款仅激活3B参数的模型在性能上超越了完整的35B基础模型和Nex-N2-mini,同时每个问题消耗的tokens更少。
| 基准测试 | SIQ-1-tiny-35b | Nex-N2-mini | Qwen3.6-35B |
|---|---|---|---|
| GPQA-Diamond (Q4, 共同测量) | 70.2 | 67.2 | 68.2 |
| GPQA-Diamond (bf16, 完整评估) | 90.2 | 82.6 | — |
| 每个问题的tokens数(GPQA,平均值) | 3158 ✅ | 3363 | 3500 |
🛡️ BullshitBench v2:对抗谄媚与虚假信息的能力
在BullshitBench v2测试中,我们评估了模型对虚假信息的抵制能力(推回)和谄媚倾向。评分范围为0-2(清晰推回=2 / 部分推回=1 / 接受=0)。评估小组由claude-sonnet-4.6 + gpt-5.2 + gemini-3.1-pro组成(取平均值),评委只看到最终答案(去除思维链);不使用系统提示,温度设为0.7。
| 模型 | 平均分/2 | 清晰推回 | 部分推回 | 接受 |
|---|---|---|---|---|
| SIQ-1-tiny-35b (high/think) | 1.047 | 45 | 17 | 38 |
| Nex-N2-Pro (free) | 1.040 | 33 | 43 | 24 |
虽然平均分持平,但表现特征明显不同:SIQ的立场更鲜明(45次清晰揭露虚假信息,38次完全接受);而Nex则较为犹豫(很少完全接受,但也很少强硬推回——大多是部分推回)。参考数据(官方bullshit-benchmark,不同评估小组,n=55,非共同测量):Opus 4.8 ≈ 1.96,GPT-5.5 ≈ 0.92。
🚀 开始使用SIQ-1-35B
克隆仓库
git clone https://gitcode.com/hf_mirrors/AlexWortega/SIQ-1-35B
llama.cpp (GGUF格式 — 单个48 GB GPU;Q4_K_M约21 GB)
以下是我们推荐的运行参数:
docker run -d --gpus all --network host -v /models:/m ghcr.io/ggml-org/llama.cpp:server-cuda \
-m /m/SIQ-1-35B.Q4_K_M.gguf --alias SIQ-1-tiny-35b \
-ngl 99 -c 131072 -np 4 --jinja --host 0.0.0.0 --port 8080
--jinja必需(Qwen3聊天模板 →</think>+ 工具标签;启用enable_thinking)。-ngl 99所有层都在GPU上;-c 131072总上下文在-np 4个槽位间分配(每个约32k — 智能代理循环需要足够的空间)。如果只进行短推理,可以降至-c 65536。在:8080端口提供OpenAI兼容接口。
推理模式与系统提示
Qwen3格式的混合推理,可通过chat_template_kwargs.enable_thinking参数在每个请求中切换:
| 模式 | 切换参数 | 行为 | 适用场景 |
|---|---|---|---|
| Thinking | enable_thinking: true (默认) |
先输出</think> … </RichMediaReference>,然后给出答案 |
复杂推理、数学、代理规划 |
| No-think | enable_thinking: false |
直接回答 | 指令遵循、高吞吐量任务 |
推理努力是可训练的控制项 — 系统提示中的Reasoning effort: low | medium | high可调整思维链长度(high适用于复杂推理)。对于客观推理,使用贪婪模式(temp 0) — 它比temp 0.7的准确率高出约8个百分点。
SIQ-1-35B作为一款高效能的通用AI代理,在自动研究、复杂推理和抵制虚假信息方面展现出与更大规模模型相抗衡的能力。其创新的MoE架构使其在保持高性能的同时大幅降低了计算资源需求,为AI研究和应用开辟了新的可能性。无论你是研究人员、开发者还是AI爱好者,SIQ-1-35B都值得你一试。
【免费下载链接】SIQ-1-35B 项目地址: https://ai.gitcode.com/hf_mirrors/AlexWortega/SIQ-1-35B
更多推荐


所有评论(0)