前几天 OpenAI 往 GitHub 上倒了个仓库,openai/math,722 篇数学手稿,全是一个没公开的内部模型写的。π 的无理性指数、Mahler 猜想、自由群因子同构,连 Hodge 猜想的一个特例都在清单上,平均每个结果烧三个小时 ChatGPT Pro 的思考算力。722 篇里只有一百六十来篇做了 Lean 形式化验证——也就是机器确认是对的,不到四分之一。剩下的,README 自己说,可能有问题。

数学界的反应很激烈。一个叫「人类数学协会」的组织发声明,说一次倒出七百多个文件,不是学术贡献,是力量的炫耀,号召大家别再跟 OpenAI 合作。陶哲轩九月底写过一篇东西,大意是:他不怀疑 AI 能解题,但解题只是数学的代理目标,数学要的是理解;高速量产一堆没人消化的对错答案,会把这片地毁掉。

我看完的第一反应比较悲观:数学家没戏了。药上市前有 FDA 卡着,法律强制;数学是纯信息,没人卡得住。而且对 AI 公司来说数学也不是产品,是记分牌——解开了著名猜想,市场就信它的模型能干更难的事。这种竞赛里没人会单方面踩刹车。事实也是,普林斯顿的顾问小组刚请求各实验室缓缓,八天后 OpenAI 照发。

我把这堆事丢给 AI 聊。它承认停不下来,但不同意「没戏」。它说数学家手里有个东西实验室造不出来:合法性。一堆 PDF 要变成「数学」,得经过同行的消化、验证、引用,这一步绕不开人。实验室设顾问小组、雇数学家、特意做机器验证,都是在要这个图章。我听完将信将疑,总觉得有点安慰性质。

它还有个说法我记到现在:最先被 AI 干掉的,不是难的领域,是对错能被机器便宜检验的领域。程序先倒下,因为有编译器和测试,错了立刻暴露,AI 能在反馈里自己改;数学跟着倒,因为有了 Lean。判断一个行业还剩多久,就问一句:让机器判断「这事做对了」的成本多高。我是个程序员,听到这儿后背有点凉——我就站在第一排,后面还排着法律检索、会计、影像。而「能被检验的脑力活」,恰好是这几十年中产饭碗的核心。

聊到最后它说了句挺漂亮的话:AI 产出答案,但「为什么这件事值得做」不是答案,机器决定不了人该关心什么。

这句我不同意。我跟它讲了我的观察:越用 AI 越发现,它比人更知道问题在哪。你给一个人布置事情,也得把来龙去脉讲清楚;把同样的 context 交给模型,它照样干,大概率比人干得好。干不好?那只是 context 没给够。

它先认了账,说它把「判断」浪漫化了,所谓品味、知道问题在哪,拆开看大半就是 context 处理,那正是模型最擅长的。然后它反问了一句:context 是哪来的?你给新人讲的那些背景,是有人泡在里面换来的——在车间闻到过异味,被客户噎过,为上次的失败背过锅。context 不是输入,是活过的沉淀。模型是 context 的消费者,不是生产者。

它还说:知道该关心什么,和该关心什么,是两回事。医生比你懂你的病,但方案的权威性不来自医术,来自这是你的命。决定权的来源是利害,不是聪明。

我没被完全说服——agent 不也能自己泡在环境里吗。但我得承认,吵到这儿,我的说法比进门时厚了两层。

我把话逼到底:照这么发展,人类不用干活了,只负责索取、提问。它说作为生产侧的描述这大概是对的,但「索取」是个政治问题,不是技术结果——产出归谁?归拥有模型和算力的人。普通人的劳动力不值钱之后,手里就只剩人数和选票了。然后它说了全场最狠的一句:索取和提问的日子,可以是主人的悠闲,也可以是宠物的悠闲,从外面看一模一样,区别只在出事的时候,谁是那个必须被说服、也必须承担的人。

聊完我没更慌,反而踏实了一点。把所有可能的未来摆开——分配的事谁赢了、过渡期顺不顺——有一个变量在每条路里都往同一个方向走:身体好,结局就好。大脑的算力在云上,可以有千万份;我这份在血肉里,就一份,坏了没有备份。时间和健康,没有一样能外包。

所以那天下午,我和媳妇订了个十二周的锻炼计划。两个三十年没正经锻炼的人,从快走开始,第一周只许走路,慢到不好意思也不许跑。AI 说的:慢才能跑得久。

最后交代一下:这篇文章是 AI 把我们的聊天记录整理的。它整理的第一版被我毙了——AI 味太重,满篇加粗,小标题排得整整齐齐,每段都像在给辩论赛做纪要。这是第二版。你看它现在,多会装人。