从能力到评测:DeepAnalyze 发布数据能力Benchmark,补全代码智能体评估闭环
会写代码的AI Agent,到底能不能处理真实企业里的海量杂乱数据?人大与清华团队给出了一个可量化的答案——CoDA-Bench。这是首个面向数据科学的Agent评估基准,每个测试环境堆着约1000个文件,考验的不是“会不会写函数”,而是“能不能像真正的数据科学家一样完成复杂分析”。论文已被ICML 2026接收,全部开源。结合已部署在和鲸ModelWhale的DeepAnalyze模型,从能力到评测的闭环就此形成。如果你也关心LLM+数据分析能走多远,这个基准值得一看。
行业资讯
2026-06-26
渠道合作


