北京智源研究院发布了InfoSeek数据集,这个开源数据集专门为深度研究任务设计。用这个数据集训练的30亿参数模型,在深度研究任务上表现与Gemini/Sonnet 4.0相当。

InfoSeek有三个特点值得注意:


开源社区对这类专业数据集的需求一直存在。大多数现有数据集要么规模太小,要么质量参差不齐。InfoSeek的出现填补了这个空白。
该数据集在海外反响不错。研究员Tobe Duru评价说"这看起来像是研究的游戏规则改变者"。确实,在AI研究领域,高质量数据往往比模型架构更重要。

同期,通义实验室也发布了Tongyi DeepResearch,一个开源且对标OpenAI的Deep Research的智能体。

它在HLE基准测试达到32.9分,BrowseComp测试双项超过43分,xbench-DeepSearch更是取得75分。

技术栈采用从Agentic CPT预训练开始的全流程方案,支持原生ReAct和新开发的Heavy模式。
项目资源链接:
Hugging Face数据集:https://huggingface.co/datasets/Lk123/InfoSeek
GitHub代码库:https://github.com/VectorSpaceLab/InfoSeek
技术论文:https://arxiv.org/abs/2509.00375
通义博客: https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/
通义模型 HuggingFace: https://huggingface.co/Alibaba-NLP/Tongyi-DeepResearch-30B-A3B