9 月 29 日,至知创新研究院(IQuest Research)发布并开源 IQuest-Q1。模型重点面向代码、软件工程与复杂任务执行,在训练过程中进一步覆盖推理、工具使用、长上下文理解及多步任务处理等能力。
模型权重与 Blog 已同步发布。
GitHub:https://github.com/IQuestLab/IQuest-Q1
Hugging Face:https://huggingface.co/IQuestLab/IQuest-Q1
Blog:https://iquestlab.github.io/
多场景任务中的能力验证
IQuest-Q1 的训练重点覆盖从代码生成到智能体任务,并延伸至工具调用、信息搜索、长上下文理解和复杂环境中的多步执行。模型可在任务过程中持续理解上下文、调用工具、处理反馈,并完成可验证的最终结果。
在涵盖代码、软件工程、终端操作、工具使用和复杂智能体任务等多个领域的标准评测中,IQuest-Q1 均展现出均衡稳健的性能。

其中,IQuest-Q1 在仓库级代码生成基准 NL2Repo 和网络安全基准 CyberGym 上展现出一定能力;同时,在 Terminal-Bench 2.1、代码长程任务基准 DeepSWE v1.1,以及面向专业办公场景的 JobBench 等复杂任务评测中,也表现出较好的任务执行能力。
具体到实际任务,可以一起看下在几个典型场景中的实测。
· 复杂交互应用开发
在前端开发中,用户输入自然语言指令后,模型可以直接生成可运行的交互应用。
以 FPS 游戏为例,IQuest-Q1 可以一次完成三维场景、角色移动、生命值、计分、游戏模式切换以及资源和装备购买等功能,同时处理代码生成、多文件组织、交互逻辑和视觉呈现。

再来看一个赛车游戏的例子,构建这类场景,如赛道延展、前景背景之间的切换,通常对场景延伸能力有较高的要求。IQuest-Q1 能够轻松应对这类具有空间关系和连续交互要求的应用生成。

· 训练诊断与代码修复
IQuest-Q1 也可以进入已有代码和训练环境,定位并修复实际问题。
一次强化学习训练出现异常后,模型根据训练曲线进一步读取日志和执行轨迹,分析可能原因,定位代码中的具体问题并完成修改。训练重新启动后,再通过新的指标变化验证修复结果。正如案例中所展示的,发现根因是 " 训练轨迹中插入了一个空格 ",修复后重新训练,指标恢复上升。

· 复杂工作环境任务执行
IQuest-Q1 可以在包含多类信息和工具的工作环境中执行多步骤任务,并根据任务进展持续读取信息、调用工具和调整结果。
在工作场景中,模型可接入聊天、云文档、表格和评论等信息,综合不同上下文完成分析、文档生成和结果修订,最终形成可直接交付的方案。
可持续的模型迭代机制
IQuest-Q1 采用了 decoder-only Transformer 主干与稀疏 MoE 架构,总参数约 320B、激活参数约 15B。模型训练分为预训练、中期训练和后训练三个阶段,逐步建立基础代码能力,并向复杂任务执行延伸。

后训练阶段,团队围绕软件工程、长时程任务和通用推理对模型开展了专项训练,并通过监督微调和强化学习进一步强化相关能力。同时,通过 Multi-Teacher On-Policy Distillation(MOPD)整合不同教师模型在各类任务上的能力。

此外,经过验证的模型更新、训练资产和研究流程会进入下一轮迭代,并被后续版本直接复用。每轮形成的数据流程、训练配置、评估方法和工具也会持续沉淀,形成模型能力优化与研发流程优化并行推进的迭代机制。
无论是实测中赛车能不能开、游戏能不能玩,还是训练中出现 Bug 能不能及时找到根因。AI 能不能把复杂任务做对、做完,都成为下一次进化的起点。
从此次实践来看,我们观察到至知研究院这个模型赛道新玩家,在代码智能、复杂任务执行和模型自进化等方向上的探索,已经开始呈现出更清晰的技术脉络,这家机构下一步的动态值得持续关注。


登录后才可以发布评论哦
打开小程序可以发布评论哦