IQuest-Q1 评测:320B 稀疏 MoE 驱动的开源 Agent 基础模型,专攻代码与智能体长程任务

导读摘要:
IQuest-Q1 是至知创新研究院(IQuestLab)开源的一款 Agent 基础模型,核心定位聚焦代码生成与智能体任务执行。该模型采用稀疏 MoE 架构,总参数量达 320B,但每个 token 仅激活约 15B 参数,在保持旗舰级任务能力的同时显著降低了推理成本。IQuest-Q1 经过合成环境中的多 harness 强化学习与多教师在线蒸馏(MOPD)训练,可直接接入 Claude Co...
1. IQuest-Q1是什么
IQuest-Q1 是至知创新研究院(IQuestLab)开源的一款 Agent 基础模型,核心定位聚焦代码生成与智能体任务执行。该模型采用稀疏 MoE 架构,总参数量达 320B,但每个 token 仅激活约 15B 参数,在保持旗舰级任务能力的同时显著降低了推理成本。IQuest-Q1 经过合成环境中的多 harness 强化学习与多教师在线蒸馏(MOPD)训练,可直接接入 Claude Code 或 Codex 等主流 Agent 工具,在 NL2Repo、CyberGym 等多个专业榜单中稳居开源模型前列,整体能力均衡,尤其擅长前端生成、办公自动化与 AI 研发诊断等场景。

技术定位与领域: IQuest-Q1 属于自然语言处理与智能体(Agent)基础模型交叉领域,其独特定位在于专为 CLI 智能体操作、仓库级代码生成和中长程多步任务执行而设计,而非追求通用对话能力的泛化模型。它面向的是真实生产环境中需要自主调用工具、读写代码库、从错误中恢复的复杂工作流。
研发背景: 该模型由至知创新研究院(IQuestLab)开发,团队在研发过程中采用了"人机协同的自进化研发流程"——模型自身参与能力诊断、训练方案设计和部分实验执行,人类研究员负责方向调整与高成本实验决策。这种研发模式本身即是模型能力的实践验证。
核心价值: IQuest-Q1 解决了开源社区中"强代码能力"与"低推理成本"难以兼得的矛盾。通过稀疏激活机制,以接近 15B 激活参数的计算开销获得 320B 参数级别的任务表现,同时通过 MOPD 多教师在线蒸馏将多个专业方向的强化学习模型折叠为单一模型,避免了部署多个专用模型的资源浪费。
技术特点: 模型采用 decoder-only Transformer 主干加稀疏混合专家结构,训练分预训练、中期训练和后训练三阶段推进。其差异化优势在于多 harness 强化学习——让单一策略跨多个执行环境训练,保留各自工具与上下文管理方式,使模型学到的不只是解题能力,还包括在真实智能体系统中工作的行为模式。
2. 主要功能
仓库级代码生成: 用户仅需输入一句话需求,模型即可生成完整可运行的多文件项目。在 NL2Repo 榜单上,IQuest-Q1 以 63.0 分位列开源模型第一梯队,超越 DeepSeek-V4-Pro 与混元 Hy4,展现了从需求理解到工程落地的全链路代码生成能力。
CLI 智能体操作: 模型能够读写代码库、调用命令行工具、检查执行结果并从错误中自主恢复。该能力使其可无缝对接 Claude Code 和 Codex 使用,作为底层推理引擎驱动完整的智能体工作流,而非仅停留在对话式代码补全层面。
前端交互应用生成: 一次生成即可产出包含 3D 场景、交互逻辑和视觉呈现的可运行网页应用,典型示例包括 FPS 游戏、赛车游戏、体素海底城市等。该功能覆盖从场景搭建、交互逻辑到视觉呈现的完整前端开发链路。
办公全流程自动化: 通过飞书 lark-cli 交叉核对聊天记录与文档,完成事件定级、报告撰写、任务分配与进度跟踪的完整闭环。这一能力将 Agent 从"代码世界"延伸到"办公世界",实现了跨应用的信息整合与流程自动化。
AI 研发自我诊断: 模型能够追查强化学习训练过程中的异常,定位根因、修复代码并用新指标曲线验证修复效果。该功能体现了模型在元层面的应用价值——不仅辅助人类研发 AI,还能参与 AI 自身的研发迭代。
多步复杂任务执行: 面向中长程任务设计,模型可自主推进持续数小时的复杂工作流,覆盖网络安全、终端操作等场景。在 DeepSWE、Terminal-Bench、JobBench 等八个榜单中均稳居前列,无显著能力短板。
3. 如何使用
获取模型权重: 从 Hugging Face 或 GitHub 仓库下载模型权重与推理代码。HuggingFace 模型库地址为 https://huggingface.co/IQuestLab/IQuest-Q1 ,GitHub 仓库为 https://github.com/IQuestLab/IQuest-Q1 ,ModelScope 渠道即将上架。
部署推理服务: 使用 SGLang 或 vLLM 启动 OpenAI 兼容的推理服务。硬件要求为 8 卡张量并行(TP=8)、bfloat16 精度,同时需加载 IQuest 专用的 tool-call 和 reasoning 解析器,以确保工具调用和推理过程的正确解析。
加速与调参(可选): 如需更高吞吐量,可启用递归 MTP 投机解码功能。若需复现官方评测结果,建议设置 temperature=1.0、top-p=0.95、top-k=20,这些参数组合经过官方验证可达到评测基准表现。
直接调用模型: 通过 Python API 或 OpenAI 兼容接口直接发起请求。需使用 IQuest 格式的 chat template 进行工具调用和推理,确保请求格式与模型训练时的数据分布一致。
接入 Agent 工具使用: 通过支持工具调用的网关接入 Claude Code 或 Codex CLI。配置好网关地址和 API Token 后,即可让 IQuest-Q1 作为底层模型驱动智能体完成代码生成、工具调用和长程任务执行。
4. 优缺点分析
| 优点 |
|---|
| 极致推理效率: 320B 总参数但每 token 仅激活 15B,以接近小模型的推理成本获得旗舰级任务能力,在保证性能的同时大幅降低算力开销。 |
| 成绩均衡全面: 在 DeepSWE、NL2Repo、CyberGym、Terminal-Bench、JobBench 等八个榜单中全部稳居前列,无明显能力短板,适合多场景统一部署。 |
| 代码能力突出: 仓库级生成在 NL2Repo 上取得 63.0 分,超越 DeepSeek-V4-Pro 和混元 Hy4,位列开源模型第一梯队,工程落地能力强。 |
| 真实智能体闭环: 不仅能生成代码,还能读日志、调工具、从错误中恢复,交付可验证的最终结果,而非停留在生成文本层面。 |
| 一键接入主流 Agent: 提供 OpenAI 兼容接口和官方 Docker 镜像,可直接替换进 Claude Code 和 Codex 使用,迁移成本低,生态兼容性好。 |
5. 同类工具对比
| 对比维度 | IQuest-Q1(至知创新) | DeepSeek-V4.1-Flash(深度求索) | DeepSeek-V4-Pro(深度求索) |
|---|---|---|---|
| 核心架构 | 稀疏 MoE,decoder-only Transformer,总参数 320B / 激活 15B | 稀疏 MoE,Flash 为高效推理档 | 稀疏 MoE,旗舰级配置 |
| 性能指标(NL2Repo) | 63.0(开源第一梯队) | 未上榜 | 61.5 |
| 性能指标(DeepSWE v1.1) | 64.3 | 74.2 | 未公开 |
| 性能指标(CyberGym) | 84.5 | 88.1 | 未公开 |
| 功能特色 | 专精 CLI 智能体、仓库级代码生成、多 harness 强化学习、MOPD 蒸馏 | 通用旗舰的轻量推理版本,追求高吞吐低延迟 | 通用旗舰模型,覆盖广泛 NLP 任务 |
| 部署方式 | 8 卡 TP=8,SGLang/vLLM,Docker 镜像 | 轻量化部署,资源需求较低 | 高性能集群部署 |
| 开源协议 | 开源(权重开放下载) | 开源 | 开源 |
| 社区生态 | 新项目,社区建设初期 | 社区成熟,生态完善 | 社区成熟,生态完善 |
选型建议: 若您的核心场景是 CLI 智能体操作、仓库级代码生成或需要接入 Claude Code / Codex 的 Agent 工作流,IQuest-Q1 在 NL2Repo 上的领先表现和专精定位使其成为开源模型中的优选。其 320B 总参数 / 15B 激活的架构设计,在推理成本与任务能力之间取得了较好的平衡。
若您更看重通用推理能力和成熟的社区生态,DeepSeek-V4.1-Flash 在 DeepSWE 和 CyberGym 上的得分更高,且 Flash 版本针对高效推理优化,适合对吞吐量有较高要求的规模化生产环境。对于深度绑定腾讯云生态的团队,混元 Hy4 的云原生集成优势值得考虑,但其在代码生成专项榜单上的表现不及 IQuest-Q1。
6. 编辑总结
IQuest-Q1 是开源 Agent 基础模型领域一次值得关注的工程实践。其技术创新的核心在于两点:一是多 harness 强化学习策略,让模型在真实 API、MCP 服务器和仓库构建的可执行环境中训练,并在优化前进行失败归因,确保只有模型自身的错误才成为学习信号——这一设计直接提升了模型在真实智能体系统中的行为可靠性;二是 MOPD 多教师在线蒸馏,将四个专业方向的强化学习模型折叠为单一模型,解决了"专才模型难以兼得"的部署难题。
从实用价值来看,IQuest-Q1 在 NL2Repo 上超越 DeepSeek-V4-Pro 的成绩具有指标性意义,证明开源模型在仓库级代码生成这一高难度任务上已具备与商业闭源模型竞争的实力。其"一键接入 Claude Code 和 Codex"的设计降低了迁移成本,而"AI 研发自我诊断"功能则体现了模型在元层面的应用潜力。
适用人群方面,该模型适合有 8 卡 GPU 集群配置的 AI 团队、智能体应用开发者,以及需要自动化办公流程的企业技术部门。对于个人开发者或算力受限的团队,15B 激活参数的架构设计意味着其推理成本低于同等能力的密集模型,但仍需评估硬件投入的可行性。
未来发展潜力上,IQuest-Q1 的"人机协同自进化研发流程"值得关注——模型参与自身的能力诊断和训练方案设计,这种模式若持续迭代,有望加速模型版本的演进速度。不过,作为新开源项目,其社区生态、文档完善度和第三方工具链仍需时间沉淀,ModelScope 渠道的上架进度也值得关注。
7. 应用场景
智能编程开发: 开发者输入一句话需求,IQuest-Q1 即可生成完整可运行的多文件项目。在 Claude Code 或 Codex 环境中,模型能自主读代码、修 bug、跑测试,交付可验证的工程成果,适用于原型快速搭建和代码库维护。
交互式网页与游戏生成: 根据文字描述一次性产出 3D 游戏、可视化工具、设计页面等前端应用。该场景覆盖场景搭建、交互逻辑与视觉呈现的完整链路,适合游戏原型设计、数据可视化和创意展示等需求。
办公流程自动化: 通过飞书 lark-cli 打通聊天、文档、表格与会议,完成信息交叉核验、事件定级、报告撰写、任务分配与进度跟踪的全流程。适用于企业内部的运营管理、项目协作和事件响应等场景。
AI 研发与训练运维: 模型可自动诊断训练异常,定位根因并修复代码,辅助 AI 团队维护和优化自己的研发管线。适用于强化学习训练监控、模型调参和实验验证等场景,降低人工排查成本。
网络安全与终端操作: 面向中长程任务,模型可持续数小时自主推进,覆盖网络安全检测、终端命令执行等场景。在 CyberGym 榜单 84.5 分的表现,验证了其在安全攻防模拟和系统运维中的可用性。
8. 常见问题FAQ
Q:IQuest-Q1 的硬件部署要求是什么?
A:官方推荐使用 8 卡张量并行(TP=8)配置,精度为 bfloat16,推理框架支持 SGLang 或 vLLM。模型总参数 320B,但每 token 仅激活 15B,因此推理时的显存占用主要集中在模型权重的加载上,需确保单卡显存足以承载对应的分片权重。
Q:IQuest-Q1 与 DeepSeek-V4-Pro 相比如何选择?
A:在 NL2Repo 仓库级代码生成任务上,IQuest-Q1 以 63.0 分超越 DeepSeek-V4-Pro 的 61.5 分,代码生成能力更具优势。但在 DeepSWE 和 CyberGym 等任务上,DeepSeek-V4.1-Flash 得分更高。若核心场景是智能体代码操作,选 IQuest-Q1;若追求通用推理和更高吞吐,考虑 DeepSeek 系列。
Q:IQuest-Q1 如何接入 Claude Code 或 Codex?
A:通过支持工具调用的网关接入。用户需设置网关地址和 API Token,IQuest-Q1 提供 OpenAI 兼容接口,可直接替换原有模型配置。同时官方提供 Docker 镜像,简化部署流程。
Q:模型是否支持中文?
A:原文信息显示模型经过中期训练将数据分布转向代码与 STEM,并加入长上下文智能体轨迹,但未明确说明中文能力的专项优化情况。建议中文场景用户在实际部署前进行针对性测试,以确认模型表现。
Q:IQuest-Q1 的训练流程是怎样的?
A:训练分为三阶段:预训练奠定通用能力和世界知识;中期训练将数据分布转向代码与 STEM,加入长上下文智能体轨迹;后训练围绕软件工程、长时程任务和通用推理做专项的 SFT 与强化学习收敛。后训练阶段采用多 harness 强化学习和 MOPD 多教师在线蒸馏。
Q:如何复现官方评测结果?
A:官方建议设置 temperature=1.0、top-p=0.95、top-k=20,并加载 IQuest 专用的 tool-call 和 reasoning 解析器。启用递归 MTP 投机解码可提升吞吐量,但可能影响评测结果的精确复现。
9. 项目地址
- 项目官网:https://iquestlab.github.io/
- GitHub 仓库:https://github.com/IQuestLab/IQuest-Q1
- HuggingFace 模型库:https://huggingface.co/IQuestLab/IQuest-Q1
相关 AI 模型文章

Claude Haiku 5.5 – Anthropic 推出的最轻量级模型
Claude Haiku 5.5 是 Anthropic 于 2026 年 10 月 7 日正式发布的最新小型语言模型,定位为"最便宜、最快、最能打"的高性价比产品。该模型将输入价格降至 $0.10/百万 token,综合成本降低约 75%,同时实现了电脑操作能力从 15.7% 到 72.4% 的大幅跃升。其支持 100 万 token 上下文窗口和五档可调思考机制,适用于智能摘要、数据分类、实时...
Startlux-Decision – StartLux Labs 开源的决策模型家族深度评测
StartLux-Decision 是 StartLux Labs 推出的开源决策模型家族,涵盖从 0.8B 至 27B 的五个稠密模型以及 35B-A3B 混合专家模型,专为类型化决策任务设计。该模型家族接收文本、JSON 或图片形式的状态输入,针对选择、是非、评分等结构化问题,通过单次前向推理直接返回每个选项的概率分布,天然可作为置信度使用。模型原生支持 256K token 超长上下文,具备...

SemIf – 开源的 AI 决策模型,复现 Jev 语义决策模式
SemIf(原 OpenJev)是一个开源的 AI 决策模型,旨在通过开源手段复现 TypeSafe 闭源服务 Jev 的语义决策接口模式。该模型采用单次前向传播机制,直接读取候选选项对应的 logits 进行打分,由服务端构造结构化结果,从而规避了传统自回归生成后再解析文本的复杂流程。在多个问题共享相同状态时,SemIf 还可复用前缀计算,吞吐量提升近一个数量级。该模型在单张 RTX 3090 ...
MAI-Transcribe-2-Streaming:微软实时流式语音转写模型深度评测
MAI-Transcribe-2-Streaming 是微软推出的首个实时流式语音转写模型,能够在讲话进行时持续输出文字,覆盖 60 种语言并自动检测语言切换。该模型在 Artificial Analysis 流式转写榜单中以 2.50% 的词错误率和 0.13 秒的最终转录延迟双双登顶,首批文本延迟低至数百毫秒,文字最快在语音后 320 毫秒显示。其核心价值在于将传统语音转写从"说完再识别"的批...
版权声明:本文部分内容由 AI 辅助生成并经人工校准,版权归本站所有,未经允许禁止任何形式的转载。
