首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >InfoSeek:一个专为深度研究任务打造的开源数据集

InfoSeek:一个专为深度研究任务打造的开源数据集

作者头像
用户11563501
发布2026-06-23 09:40:03
发布2026-06-23 09:40:03
2210
举报

北京智源研究院发布了InfoSeek数据集,这个开源数据集专门为深度研究任务设计。用这个数据集训练的30亿参数模型,在深度研究任务上表现与Gemini/Sonnet 4.0相当。

InfoSeek有三个特点值得注意:

  1. 这是第一个专为深度研究任务打造的开源数据集
  2. 完全开源,包括数据集和数据合成框架
  3. 包含5万多个高质量、多步推理样本

开源社区对这类专业数据集的需求一直存在。大多数现有数据集要么规模太小,要么质量参差不齐。InfoSeek的出现填补了这个空白。

该数据集在海外反响不错。研究员Tobe Duru评价说"这看起来像是研究的游戏规则改变者"。确实,在AI研究领域,高质量数据往往比模型架构更重要。

同期,通义实验室也发布了Tongyi DeepResearch,一个开源且对标OpenAI的Deep Research的智能体。

它在HLE基准测试达到32.9分,BrowseComp测试双项超过43分,xbench-DeepSearch更是取得75分。

技术栈采用从Agentic CPT预训练开始的全流程方案,支持原生ReAct和新开发的Heavy模式。

项目资源链接:

Hugging Face数据集:https://huggingface.co/datasets/Lk123/InfoSeek

GitHub代码库:https://github.com/VectorSpaceLab/InfoSeek

技术论文:https://arxiv.org/abs/2509.00375

通义博客: https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/

通义模型 HuggingFace: https://huggingface.co/Alibaba-NLP/Tongyi-DeepResearch-30B-A3B

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2025-09-18,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档