跳到主要内容

1 篇博文 含有标签「reasoning」

查看所有标签

AI4Math 的数据集十年:从小学应用题到 Lean Eval

· 阅读需 18 分钟

如果从传统数学史看,数学的发展可以讲成代数、几何、分析、概率、拓扑、逻辑不断分化又统一。但如果从计算机和 AI4Math 看,近十年的主线更像一部数据集形态变化史

一开始,AI 做数学主要是在回答题:给出最终答案,算 exact match。后来,数据集开始要求模型写过程、生成多条解法、接受 verifier 打分、调用代码执行器、进入 Lean/Coq/Isabelle 这样的 proof assistant,最后又发展出 live leaderboard、去污染评测、研究级问题和提交制 formalization 平台。

换句话说,前沿不只是“模型更会做题了”,而是数学数据集本身从静态题库变成了可执行、可验证、可审计、可持续更新的数学工作流。