10月初,一份目录在数学圈和AI圈同时炸开。某前沿实验室公开了719份AI生成的数学手稿,覆盖372个结果族,其中不少触及长期悬而未决的开放问题。原先是722份,后来因为一处符号错误连带撤回3份。数字很唬人,但真正让数学家坐不住的,不是数量,而是这些证明能不能被人类看懂。
菲尔兹奖得主陶哲轩很快在社交平台发声。他并不反对AI做数学——他自己就是AI辅助研究的积极用户。他反对的是把“用AI快速攻克著名难题”当成产品展示的主要目标。他给这种现象起了个名字:证明消化不良。
问题不在算得快,而在没人来得及消化
传统数学里,一个长期猜想的突破从来不只是“得到答案”。作者要做报告、参加研讨、跟同行反复交流,证明随后被简化、写进教材、催生新的问题、新的合作者、新的方向。这是一个缓慢但肥沃的循环。
AI批量产出的模式把这个循环掐断了。提示者驱动模型自主解题,目标一旦达成,后续的理解、报告、同行讨论和领域建设却很少发生。陶哲轩说得直白:发布者可能都不足以解释AI的输出,更别说回答领域内的追问。人类来不及验证、理解、写作、教学,结果就是一堆“无人能消化的证明”。
更麻烦的是不可逆性。一个问题一旦被公开“解决”,就几乎无法恢复到“未解决”状态。哪怕后来有人想找不同路径、想从过程中提炼新方法,仅仅知道答案已经存在,就会污染这条探索路线。换个角度看,这等于把开放问题当作可批量消耗的资源来收割。
透明度与形式化,卡在哪儿
发布前,该实验室咨询过由普林斯顿高等研究院主持的“数学与人工智能顾问小组”。小组的建议很具体:停止在专有、外界无法访问的模型上测试高难度数学问题;披露模型名称、提示词、推理链、耗时和计算成本;证明应当便于数学家审查和学习。
对照公开信息,这次发布并没有完全达标。仍使用专有模型,719份手稿里只有10份附有推理链。约42%的证明没有做形式化处理,也没有提供把自然语言证明与形式化产物关联起来的机器可读元数据。顾问小组还专门声明,咨询角色不构成对结果的认可,最终仍要由数学界评估建议是否被充分执行。
说白了,争议的核心不是AI能不能做数学,而是做出来的东西有没有进入学术共同体的验证轨道。透明度、形式化验证、同行审查,这三样缺一个,产出再多也只是仓库里的库存。
对研究团队来说,落地场景意味着什么
如果你在高校实验室或研究型团队里接触这类AI辅助工作,有几件事值得提前想清楚。第一是数据留存:推理链、提示词、中间产物、形式化文件,体量远比最终论文大,需要稳定的存储和可追溯的目录结构。第二是算力调度:形式化验证工具吃CPU和内存,模型推理吃GPU,两类负载混在一起容易互相拖慢。第三是访问控制:未公开的研究数据一旦外泄,优先权就没了。
这也是为什么不少研究团队在部署内部实验环境时,会倾向于选物理服务器而不是共享型云主机。物理机的资源独享、IO稳定、长期跑批不容易被邻居干扰,对需要持续数周验证的任务更友好。新酷云的物理服务器产品线就是面向这类场景,支持按需配置,适合把推理、验证、存储分开部署,避免互相抢占资源。
如果团队同时维护多个课题站点、数据门户或预印本镜像,站群服务器在IP隔离和批量管理上会更省心。而有对外接口、又担心被扫描或攻击的研究平台,则更适合上高防服务器,把清洗能力放在前面,别等数据被拖走才想起来补。
回到数学本身。陶哲轩的担忧不是技术悲观主义,而是一个很朴素的判断:速度和数量不等于理解与洞见。AI可以高速生成命题、证明和反例,但验证、教学、吸收这些环节,目前还得靠人。工具越强,越需要有人愿意慢下来,把答案变成共识。否则我们得到的不是数学的进步,而是一堆没人接得住的证明。