从能力到评测:DeepAnalyze 发布数据能力Benchmark,补全代码智能体评估闭环

行业资讯
报道时间:2026-06-26

CoDA-Bench正式发布


2025年,中国人民大学信息学院范举教授团队联合清华大学研究力量,正式发布了首个面向数据科学的Agentic大语言模型——DeepAnalyze


该模型能够像数据科学家一样自主完成数据准备、分析、建模、可视化到报告生成的全流程。发布不到一周,便在GitHub上获得超1000个星标,国内外社交媒体累计浏览量超20万次。


模型在和鲸社区ModelWhale平台部署,用户无需本地配置即可在线体验。


发布至今,团队收到大量来自企业用户的反馈:LLM和AI Agent在真实数据分析场景中落地,严重缺少可复现的Benchmark来评估它们的能力。传统的代码生成Benchmark侧重于函数级编程,数据分析Benchmark侧重于单表查询,而真实企业场景中既要处理成百上千个文件的海量数据,又要完成复杂分析任务,这部分内容则长期处于评估空白。


为此,人大团队发布了CoDA-Bench,评估Agent在海量数据(平均每个环境~1000文件)中解决复杂分析任务的能力。


相关论文已被ICML 2026接收。


CoDA-Bench的论文、数据、评估代码已全部开源,支持一键评估Claude Code、Codex等主流智能体。




如果你也在探索LLM+数据分析落地,欢迎加入讨论群并试用,一起推动数据智能体评估体系建设。
CoDA-Bench交流群
更多关于DeepAnalyze,欢迎关注我们~
开启 AI 之旅新篇章,立即体验和鲸 ModelWhale 的云端协作魅力
数以万计的用户正在使用中
电话咨询
商务咨询请致电:
021-8037 0235(转8)
微信咨询
工具使用、办赛需求 欢迎联系我们
新Momo