8 min remaining
0%
AI

灯塔问题:当人工智能回答时,谁能理解?

这篇文章深入探讨了菲尔兹奖得主关于人工智能对数学理解影响的警告,强调了过程的重要性而非仅仅是答案。

8 min read
Progress tracked
8 分钟阅读·

二十五位菲尔兹奖得主——数学界最接近诺贝尔奖的荣誉——共同签署了一份关于人工智能的警告。互联网的反应自然而然:老一辈感到害怕。专家们在捍卫他们的权威。拥有终身职位的反对者。

然后你打开声明,反应就消失了。

它首先归功于人工智能。在过去几个月里,大型语言模型在多个数学领域解决了重要的开放问题。没有保留,没有否认。最有资格检查这些工作的人员是那些确认其有效性的人。

警告是在胜利之后发出的,而不是针对胜利的。他们自己对问题的称呼在标题中:严重的不对齐。人工智能公司正在优化答案。数学存在是为了产生理解。这两者并不是同一种产品。

简而言之:该声明并不是反对人工智能——其主要签署者以测试前沿模型为生。实际的主张是:著名的未解决问题是灯塔,而不是顶峰。它们的价值在于它们所迫使的导航和沿途构建的工具——费马大定理产生了350年的数论工具,我们今天仍在使用。人工智能现在解决了问题,跳过了旅程,提供的证明几乎没有增加知识。最稀缺的资源是“学生和想法”——按这个顺序——当答案是免费的时,学徒制就会崩溃。这是古德哈特法则应用于整个文明的记分板,而同样的不对齐也将影响每一个知识产业。包括我的。

我是詹姆斯,水星科技解决方案公司的首席执行官。来自香港数码港——2026年9月15日。我的公司为企业构建人工智能与人类之间的桥梁,因此来自世界顶尖数学家的声明,描述机器输出与人类理解之间的差距,对我来说并不是一个抽象概念。这是产品规格。更多内容见下文。

发布警报的人

陶哲轩于9月11日在他的博客上发布了该声明。记住你正在打交道的人:陶被邀请进入前沿人工智能实验室,以压力测试他们在数学方面最强大的模型,他还在YouTube上展示了他如何使用人工智能实时解决问题。他比大多数构建模型的人更具人工智能原生性。

在同一个博客上,同一天,他发布了第二件事:关于一个几十年来未解决问题的公开挑战的公告——安德鲁斯-柯蒂斯猜想——他帮助组织这个挑战,其规则明确欢迎人工智能工具。

同一个人。同一天。一篇帖子中发出警报,另一篇帖子中向机器发出邀请。"守护领土"无法解释这种组合。解释它的是一个区别:他欢迎工具并拒绝记分牌。

前二十五位签署者都是菲尔兹奖得主,名单仍然开放,名字中包括2026年获得奖项的中国数学家邓宇。这些人并不是相关性正在减弱的人。

著名问题究竟是为了什么?

外部人士将著名的未解决问题视为高峰。费马最后定理、黎曼假设、双素数猜想——山峰,谁先插旗谁就赢。问题结束。

声明称它们是地标和灯塔。这个隐喻就是整个论点,所以慢慢来。高峰是一个目的地。灯塔是一个方向。它位于没有人跨越的水边,其整个功能是将船只引导到那里——在途中,船只建造东西。

费马最后定理花了三百五十年。怀尔斯在1994年解决了它。但我们保留的不是旗帜,而是机制——在这个过程中发展起来的整个代数数论领域,仍然在数学和密码学中日常使用。如果你只盯着最终的证明,你无法看到这个学科实际上走了多远。问题从来不是重点。旅程才是重点,而旅程留下了基础设施。

照着灯塔找路,和直接把灯泡拧下来,是两回事。

没有人需要的千万行证明

我找到的最清晰的解释并不是来自二十五位,而是来自评论中的一位数学家。以双素数猜想为例——至今未被证明,但该领域的每个人都相信它是真的,并大致知道原因。现在把一份千万行的机器验证证明交给那位数学家。

他的知识大约增加为零。

唯一的新事实是AI现在已经证明了它。"然后呢?"即使每一步都经过机器验证,人类仍然需要阅读、消化、理解——在任何人能够在此基础上进行构建之前。这项工作无法压缩。它不是你收集的收据;它就是产品本身。

我们已经进行了这个实验。在2002年和2003年,格里戈里·佩雷尔曼发布了三篇极其简洁的预印本,证明了百年未解的庞加莱猜想——没有期刊,没有精炼的论证,步骤被跳过。答案在公共互联网中存在,免费且正确,持续了三年,而多个数学团队填补了每个空白,产生了数百页详细的论证,并进行了一个又一个的研讨会。到2006年左右,结果终于属于数学。

注意这意味着什么:答案在2003年就存在。理解在2006年到来。只有第二个算数,因为只有理解才能推动下一个结果。没有人理解的证明不会进入数学。它进入档案。

学生在思想之前

声明中最安静的激进观点是:该领域最宝贵的资源是“学生和想法”——按这个顺序。

这里是这一观点背后的实践。数学顾问故意给学生分配那些答案已经知道的问题——有时是几十年前在文献中解决并印刷的问题。答案从来不是作业。作业是三天卡在墙上,错误的转弯,凌晨三点两个想法终于结合在一起的时刻。这就是工具如何在负载下学习的——这些工具必须承载四十年的研究。

人工智能现在在挣扎中将答案摆在桌面上。学生们接受了。当然,他们会接受;我也会。在正确的提示就在一条提示之外的情况下卡了三天,而明智的选择是拒绝?不。

声明并不责怪学生。它责怪评分系统。当整个行业根据人工智能解决了多少著名问题来评分时,所有下游的优化都朝着公告而不是理解的方向发展。排行榜可以衡量快速、正确、可比较。它们无法衡量“写得让其他人可以跟随”,“其他人可以重用的方法”,“一个从另一边变得更强的学生”。这就是不对齐:被优化的事物和实际有价值的事物已经分开。古德哈特法则,从一个指标扩展到一个文明。

为什么一家人工智能公司应该倾听

水星的创始前提是,人工智能的最后一公里是人类——在机器产生的结果与人类吸收之间,巨大的价值损失发生。数学家们无疑是最纯粹的案例:他们的答案需要最长的时间来消化,因此他们最先感受到这个差距。

但这个模式并不只是他们的。没有人阅读的报告。没有人信任的仪表板。高管在董事会面前无法辩护的AI分析,没有翻译。输出并不等于理解——在任何行业都是如此。随着模型以机器速度提供答案,理解成为每个接触它们的组织的瓶颈。我们为客户衡量的本质上是答案产出:机器产生的多少转化为人类的决策和能力。菲尔兹奖得主们在这一曲线的艰难端生活了一整年。

他们以克制的方式结束。他们没有指责任何人错误。他们说:这项技术的发展取决于控制它的人指向何方——而数学只是第一个答案开始比理解更快到达的领域。

如何解决不对齐的问题

对于AI构建者:停止单独基准测试答案。添加理解度指标。一个称职的人能在合理的时间内验证输出吗?非专家从中学到了什么可重复使用的东西吗?一个证明没人能消化的模型已经为新闻稿进行了优化。

对于领导者:有意识地保护学徒制。在课程中保留已知答案的问题——挣扎就是内容。根据他们能解释的内容来评估年级团队,而不是他们能提示的内容。

对于现在采购人工智能的任何人:在签署之前问数学家的问题。当机器是正确的,我的团队实际上获得了什么?如果供应商的回答只是“速度”,那么你买的是一个灯泡,而不是海岸线。

停止评分答案。开始评分理解。

二十五名奖牌得主不会停止基准赛——数学对机器推理来说是太好的健身房,实验室也知道这一点。但他们已经写下了整个经济即将进行的交易的最尖锐描述。船只刚刚学会如何拆卸灯塔。现在是否还有人知道海岸线是一个管理问题。

水星科技解决方案:加速数字化。