动态与通知

科学地平线1.5正式上线,AI4S 智能评价与资源生态体系焕新升级
2026-07-20
科学地平线(SciHorizon)平台是依托科学领域国家人工智能应用中试基地,由中国科学院计算机网络信息中心牵头建设,旨在构建面向科学智能(AI4Science)方向的“数据+模型”一体化综合评测体系,围绕AI-Ready科学数据质量、大模型科学领域能力、科学大模型竞技场、科学领域垂类能力等主题形成了多元化权威评价与基准支撑。
近期,平台完成了 1.5 版本系统级迭代升级,发布科学数据评价智能体系统,更新专栏推荐榜单和新一期大模型评测榜单,新增生物信息领域和地图导航评价领域垂类榜单,并上线资源广场专区,持续推进科学智能生态建设。

科学数据评价方法升级:智能体自动完成综合评估

随着 AI4Science 的快速发展,传统数据质量评价已难以满足科学数据智能发现、模型训练与科学研究的需求。为此,SciHorizon 平台升级科学数据 AI 就绪评价方法,提出 SciHorizon-DataEVA 科学数据评价智能体系统,通过多智能体协同完成科学数据解析、评价规划、工具调用、结果审核和报告生成,实现科学数据 AI 就绪度的自动化综合评价。



系统基于数据质量、治理可信度、AI兼容性、科学适配性四个维度,对多领域、多模态科学数据进行综合分析,不仅能够生成综合评分和分维度评价结果,还能够自动形成数据特点分析、AI 建模分析、科学价值分析、应用场景推荐和数据优化建议等可解释评价报告,为科研人员理解和选择科学数据提供更加全面的参考。目前,该功能处于内测阶段,后续将持续扩展更多学科领域和更多优质科学数据资源,并正式向用户开放,敬请期待!



基于全新的科学数据评价方法,SciHorizon 平台面向 ScienceDB 科学数据奖等优质科学数据资源,新增 ScienceDB 科学数据专栏 AI 就绪评价榜单。评价结果围绕四大维度进行展示,同时提供综合评分及科学智能体自动生成的数据解读,帮助科研人员更加直观地了解科学数据的特点、AI 应用潜力及科研价值。



模型榜单持续更新:近期大模型科学能力评测上线
平台本期新增完成 GPT-5.5、Gemini-3.5-Flash、DeepSeek-V4-Pro等 8 款近期发布模型的系统评测,进一步扩展了科研场景下主流模型的横向对比结果。

截至目前,GPT-5.5 在全学科综合榜单中暂列第一(综合评分 78.28),在知识维度(71.71)同样位居榜首,整体表现最为均衡;Gemini-3.5-Flash 以 77.73 的综合评分排名第 2,并在理解维度取得 86.26 的全榜最高分,显示出较强的科学文本理解能力。本期国产模型表现同样突出:DeepSeek-V4-Pro综合评分排名第 3,在推理维度达到 92.19,位列全榜前列,展现出较强的复杂科学问题求解能力。




垂类榜单持续扩展
平台新增生物信息领域和地图导航评价领域垂类榜单,目前形成基因领域、计算机辅助工程领域、地图导航领域、安全领域、生物信息领域五大垂类榜单,推动通用大模型在垂类应用场景下的可靠应用与发展。

01 新增生物信息领域评价

BioFlowBench 构建了一个从静态知识评估转向动态执行评估的多层次综合基准,旨在全面评估大语言模型及智能体在生物信息工具使用和工作流构建方面的能力。BioFlowBench重点从三个模块展开全面考察:语法理解、语境应用、真实世界执行。为了克服环境依赖复杂及人工标注成本高昂的难题,研究团队引入了基于智能体的自动化数据生成框架,实现了低成本、大规模的执行测试。




BioFlowBench全面评测了 8 种大语言模型和 4 种智能体框架,主要结论如下。
知行鸿沟。顶级的大语言模型在静态问答任务上表现良好。然而,在真实世界的复杂执行场景中,这些模型往往表现不佳,难以将理论知识转化为实际行动。
智能体的执行优势。在真实的执行场景中,专门的智能体表现优于通用大模型。智能体能够通过与环境进行主动交互并基于实时反馈进行迭代优化,从而在处理复杂的多步工作流时展现出更高的可靠性和规划效率。

领域知识匮乏是核心瓶颈。缺乏专业领域知识是当前模型面临的主要瓶颈。这种匮乏使得模型在选择工具和配置参数时无法做出符合生物学逻辑的决策,经常导致模型生成语法正确、可执行,但生物学结果并不准确的输出。




更多关于BioFlowBench的构建、智能体自动生成流程以及实验结果的深度分析,欢迎访问开源代码与数据集。
开源代码仓库:https://github.com/YufeiHouAnne/BioFlowBench
评测数据集:https://cstr.cn/31253.11.sciencedb.37614

02  新增地图导航领域评价
MobilityBench是基于10万+真实用户提问构建的路线规划 Agent 评测基准。评测基准覆盖多城市、多场景、多类型路线规划任务,并通过确定性的 API 回放沙盒解决实时服务不稳定带来的评测不可复现问题,从指令理解、规划、工具调用、决策、效率五大维度对 Agent 进行全面评测,旨在为路线规划智能体提供一个更接近真实应用的系统化评估框架。

*本榜单为科学地平线平台与高德地图、中国科学技术大学等机构共建。




根据现有评测结果,主要有以下结论:
现有大模型在基础任务上表现尚可,但复杂约束任务表现较差。模型在基础信息查询和基础路线规划上整体表现较好,比如查地点、查天气、点对点导航等任务,通常完成得比较稳定。但一旦进入偏好约束路线规划,例如“避开高速”“少换乘”“指定经过某条道路/站点”等任务,模型性能就会明显下降,说明它们对复杂规则的理解和执行能力仍然不足。
闭源模型仍领先,但差距在缩小。在 Plan-and-Execute 框架下 Claude-Opus-4.5 FPR达65.77%,而Qwen3-235B-A22B(开源)FPR达64.16%,效果接近,性价比突出。ReAct vs Plan-and-Execute。ReAct 这种“边思考、边行动、边观察”的方式,通常能取得更高的最终成功率,因为它可以根据工具返回结果实时调整策略。但它的问题是输入 token 更多、推理成本更高,在实际部署中会带来更高的延迟和费用。相较之下,Plan-and-Execute 更省资源,但面对动态和复杂约束时,稳健性不如 ReAct。
思考模式有增益,但成本高。在开启Thinking后,Qwen3-30B-A3B 的 FPR 提升 5.98%,说明复杂路线规划确实需要更强的思考过程。但与此同时,token 消耗和推理成本也显著上升。因此这种方式虽然有效,却不一定适合实时、高并发的生产环境。

更多关于MobilityBench的构建以及实验结果的深度分析,欢迎阅读我们的论文并访问开源代码与数据地址。
开源代码仓库:https://github.com/AMAP-ML/MobilityBench
数据地址:https://huggingface.co/datasets/GD-ML/MobilityBench

资源广场:汇聚优质资源,助力科研创新
除评价服务外,SciHorizon 平台同步接入资源广场,为科研人员提供更加丰富的科研资源服务。资源广场汇聚科学数据、人工智能模型、软件工具及科研服务等多类资源,支持资源发现、浏览与获取,帮助用户快速找到适用于科研工作的优质资源。

未来,SciHorizon 将持续加强评价平台与资源广场的协同建设,不断丰富优质科学数据、模型和工具资源,为科研人员提供更加完善的 AI4Science 资源服务体系,进一步支撑科学研究与技术创新。




科学地平线(SciHorizon)简介
科学地平线(SciHorizon)平台是依托科学领域国家人工智能应用中试基地,由中国科学院计算机网络信息中心牵头建设,专注于面向科学领域的高质量数据与人工智能大模型的评价与应用研究。平台牵头建设单位具有国家认证认可监督管理委员会(CNCA)批准的认证服务机构资质,是我国首个获批的科学数据应用和服务第三方认证机构,是国际数据委员会(CODATA)中国全国委员会秘书处依托单位。
核心项目团队在科学数据、人工智能领域拥有丰富的科研和标准研发经验,在Nature Communications、Nature Cities、IEEE TKDE、ACM TOIS、KDD、SIGIR、WWW、NeurIPS、AAAI、IJCAI等国际顶级学术期刊和会议上发表学术论文200余篇,主持研发了包括IEEE国际标准、科学数据国家标准、可信人工智能和大模型行业标准在内的众多国内外标准。

DSL实验室介绍
中国科学院计算机网络信息中心科学数据智能与创新实验室(Data Intelligence for Scientific Innovation Lab)简称DSL,聚焦于研发面向科学大数据的新一代人工智能技术,融合多学科领域知识,助力解决复杂科学问题,构建跨学科创新应用,提升科研创新效率,支撑学科发展。实验室汇聚了来自于人工智能、大数据、管理科学以及跨学科领域的专家学者,重点聚焦于负责任的AI4Science、科学大数据知识计算、新一代科学智能应用等研究方向。


调查