← Back to Misc

Essay

半個vibe數學家的辯白

Yu-Chi Hou · September 4, 2026

(英文版,請見此)

Hardy在 A Mathematician's Apology 開頭寫道:「一個數學家的功用應該是做點有用的事,證明一些定理、發現一些新數學,而不是討論他自己或其他數學家做了什麼」。在這個AI已經自動化證明與驗證許多猜想、讓數學家基本上要失業(並沒有)的時代,作為(已經沒有用處的)半個vibe數學家的我想要替自己使用萬惡AI做一次無力的辯白,順便記錄一下我對於數學家們在這個存亡危機態度反應的看法。

I.

我最近使用Rethlas(一個專門自動證明數學問題的AI Harness)探索了好幾個問題。

  1. 首先,在跟我老闆討論之後,我們發現如果將問題敘述、記號設定以及可能的策略與不可行的策略的反例打成一張三到四頁的pdf讓GPT生成為md檔丟進去,不論是用Rethlas或是直接在Codex上問效果都比用直接文字打更好。我個人認為這個過程對人類(我)也有幫助,可以幫我釐清要證明的敘述以及記號。我首先試了一個之前在測試用AI自動生成數學論文過程中爬文獻發現Demailly的一個猜想。Rethlas沒有給出新的東西,只有嘗試了把所有它能做的特例都做完了。

  2. 接著,我嘗試了我跟合作者卡了半年之久的問題,大致上是一個證明某個函數序列收斂到另一個函數(只是變數本身也是函數)的問題。AI在跑了八個小時燒了我100美金Pro訂閱週用量的30%之後,使用了一個我之前知道但不覺得有用的行列式恆等式加上一些標準的不等式手法證明了某種contraction mapping principle,將問題化約只需要證明liminf有逐點下界。

  3. 我重新修改了我的問題換成這個簡化的敘述,又用了Rethlas跑了八個小時左右卡住不動了。我實在是沒耐心了按下中止,開始用AI整理它生成出來的Md檔。它宣稱可以在一個特殊的情況做出來,用到了一些我沒看過的技巧(後來追溯到一篇法文文章),但接下來完全是胡說八道。接著我自己花了三天開始嘗試把AI開了頭的思路接著完成,目前跟合作者和老闆討論看起來是沒問題(希望)。有趣的是,我今天跟老闆討論過程中,老闆突然發現在他最近一篇文章中,AI也建議了他類似的構造。他的結論是這個技巧或許對於我們領域的開山法國學派前輩們是廣為人知的手法,藏在了他們某本(有出版的)研討會紀錄裡,但已經被我們這一些年輕一代給遺忘了(老闆:那些先驅們搞不好正在天堂嘲笑我們)。

II.

到底(目前版本的)AI跟人類數學家的差別是什麼呢?從我的經驗跟目前看到AI解決我熟悉的案例來說:

  1. AI很有耐力也熟讀文獻,有時候能夠嘗試人類因為種種偏見而放棄或忽略的路徑。Open AI公布用Astra解決的十個猜想的第八題,所有的想法與工具都在人類的文獻裡面了,但在那個問題中,人類過去的計算或估計現在必須要在一個更複雜的設定上去進行。AI勇敢地(?)嘗試了沒有人類敢嘗試的這條路。類似地,在我跟我老闆的問題中,因為我們的無知,我們從來都不敢嘗試那個其實已經隱藏在7-80年代人們或許早就發現的技巧,透過AI又重新出土教了我們。

  2. 另一方面,現代數學的發展高度專精化的結果就是一個人類數學家本身知識的涵蓋範圍非常有限。有時候一個問題的解決需要的工具很可能超出對於該問題感興趣的專家們通常具備的武器庫。例如最近(應該是)被Claude證明的六維球複結構,就需要進行很複雜具體的構造以及拓樸的計算。我的合作者就說很難想像對這個問題感興趣的複幾何學家們有這個能力可以實現這個具體例子的構造。同時,它也很能算,能夠做很多很難想像人類能夠用手算的細碎工作。例如劉繼豪那篇YTD猜想反例的構造就需要調整這其中的很多參數讓結果能對。

  3. 如果要以擬人比喻,是一個(以數學家的評價體系來說)不是太聰明,但很勤勉也熟讀文獻的數學家。它目前沒有展現出能夠跳出既有文獻框架,提出一個完全改變思路的方法,或甚至開創一個人類沒有看過的概念或理論來解決問題的能力。過去人類的許多無法解決的猜想,之中可能有70%(不精準估計)都是因為這種注意力瓶頸,沒有足夠多的數學家有足夠的時間嘗試足夠多的道路,就算嘗試了也可能在路上拐錯了彎走進死胡同裡就放棄了。AI能夠在十六個小時做到我可能需要花兩個月摸索也不一定能夠摸出來的頭緒。

III.

在這個AI已經能夠解決人類過去無法解決的猜想的情況,前陣子我遇到有個人跟我說:「當我們用AI把好問題都解決了,那我們數學家要做什麼?我們的數學就毫無方向毫無頭緒了」。我不認同這種認為一些人(或是AI公司)利用這些LLM橫掃猜想無異於殺雞取卵因此數學要完蛋的說法。

  1. 首先,數學研究就等於解決猜想嗎?數學家們對於猜想之所以放置如此高的地位,一部分原因是人們在解決有些猜想的過程當中提出了各種概念最後發展成一個個的數學領域。人們奠基在這些領域中的問出了更多的問題,因此一層層疊加成了當今繁盛的數學體系。有些淺顯易懂的古老猜想,很可能需要數百年知識的發展才能得到解答,例如費馬的最後定理(1637–1994)。因此,許多數學家會說猜想本身並不重要,過程才是最重要的。一個好問題之所以好正是因為它們可以作為媒介引領一代代數學家們嘗試回答它們的過程當中發展出各式各樣的工具或技術,這些工具或技術又進一步發展成理論與領域。這些我都認同,也是過去數學發展歷史的軌跡。

  2. 然而,所謂的猜想,是過去數學家在研究種種現象中提出來自己沒辦法解決的問題。通常這種問題,都有非常明確的敘述。然而當AI即將(或是已經)很擅長解決這樣的問題時,我相信在可預見的未來內,數學家最主要的工作就是問出有意思的模糊問題、摸清楚那些模糊的問題、找到正確的條件敘述來讓人類或是AI來進行證明。舉例來說,很多人都知曉Perelman(奠基於Hamilton的工作)解決了千禧年難題,但比較少人知道Thurston才是那個引領這一切發展的人。他提出了三維空間應該要如何被拆解成八類空間的綱領,後面才有Hamilton發展了Ricci flow來試圖完成這個圖景。那AI能不能解決這樣的問題呢?我不知道。但我認為我們可能需要等好一陣子(當然,我也可能錯的離譜)。它們現在並沒有展現出這種提問並摸清楚模糊的問題的能力,我也不知道這樣子的能力要怎麼設立benchmark來訓練AI。

  3. 對我來說,六維球存在複結構這個困擾幾十年的Hopf猜想被Claude解決了,很好。那我們來想更困難的問題吧!丘成桐曾經猜想六維以上的近複流形都有複結構的猜想呢?相比來說,Hopf猜想簡直就是小兒科。或許AI能找到反例,那太好了!那我們來問有什麼樣的刻畫條件吧!為什麼大家平常都朗朗上口科學研究中「一個問題被解決了後面有十個問題出現」這個敘述,當AI加入了解決問題行列中卻無法同樣看待呢?

IV.

更進一步,我更想探討為什麼許多數學家們對於猜想如此執著,甚至到了有存亡危機的意識,甚至指責AI造成種種數學亂象。然而,我認為這些亂象是由於過往以來的文化慣性與數學發展已經產生了摩擦,或者用AI的話語説:Misalignment。只是現在AI的出現讓原本只是門診的病患現在直接進ICU而已。

  1. 如果借用陶哲軒在ICM演講上一個數學工作的生命循環框架來說:

    證明生成(Proof generation)→ 證明驗證(Proof verification)→證明闡述(Proof Exposition)→證明發表(Proof Publication)→證明標準化 (Proof Canonicalization)

    我們過去過於強調前兩步,將主要的注意力與成就歸功於生成問題的證明的人,我們稱這些人具有「原創性」,並以此來評判一個人的數學能力與成就,作為學術機構聘人與升等的標準。 這個「解決困難的猜想→被認為有原創性的高評價」的激勵機制或許是數學家的文化中淵遠流長的傳統。在現代意義的學術體系形成之前,現代數學的發展就是從歐洲的數學天才們(伯努利兄弟、 歐拉、 牛頓等等)在閒暇之餘的數學決鬥(?)中衍伸的。而沿襲到當今的學術體系中,我們認為最優秀的數學家就是應該要「證明新結果」,我們將驗證、消化、重構、打磨、普及化等部分都放在次要的位置。

  2. 這樣的學術生產體系的激勵機制,在AI出現之前就鼓勵了一些人整天盯著熱潮衝進去搶問題做猜想,也產生了很多人發水文拼教職、拼升等的陋習,不是在乎數學而是想著量產文章想著投上好期刊的學術投機行為已經造成審稿系統瀕臨崩潰。當然,這些行為並不被「好的」數學家接受,但整個社群也就是得過且過,因為他們相信可以透過期刊或是聘人的篩選機制來濾掉或賦予這樣的人較低的評價。然而,放到現在的AI時代的結果就是有些人拼命地想要用AI像是在Vegas的賭客ㄧ般燒著每個月上千美金的API一次性的嘗試橫掃好幾個甚至數十個猜想,盯著看哪個猜想可以馬上被猜想就用AI自動用lean驗證放上去,甚至很多明顯就是AI直接生成就丟上來了。我認為這些人之所以這樣做的原因就是因為他們還在用過去的激勵機制與學術生產思維在思考。現在人類已經有能力用AI大批次工業產出在過去評價標準中「高原創性的文章」在沖垮期刊評審系統,進而影響聘任系統。

  3. 同時,我們嚴重低估了陶哲軒說的後面三個階段。在這樣的傳統評價標準當中,我們認為寫綜述(Survey)、寫闡述文章(Expository)都比不上證明一個猜想來得重要,你幾乎無法看到這類文章能夠登上好期刊,因為好期刊們都要求「原創的新數學」,而那些刊載這類綜述的文章沒辦法幫你升等。更甚者,我們認為只有次等的數學家或是退休的數學家才會去寫課本(應該Hardy會同意這個看法)。但是,重新整理拆解、更好地闡述已知的結果真的是低人一等嗎?1964年,前陣子過世的廣中平祐在數學年鑑(top journal)上刊了一百頁證明了代數幾何的奇點解消定理。以當時1960年代的標準來說,這一百頁的證明幾乎是一頭怪獸,大家相信是對的、每天都在用他的結果卻很少人真的想去了解中間的細節。 很多時候大家只會用到結論,但也有時候你需要知道當初證明的細節才得以做更精細的微調來證明其他的結果。直到三十年後,陸續才開始許多人嘗試簡化他的證明,現在廣中平祐的結果已經有一個受過基本代數幾何訓練的研究生就可以讀的教材。正如陶哲軒所說,一個數學成果要有用,必須要從期刊中走出來被社群所接受、所理解,被應用在其他不同問題上。

  4. 在AI出現之前,人們已經在笑說沒有人會去讀、更正別人的文章,看到別的結果就拿來用,大家都埋頭苦幹自己的問題因為這樣才是在學術體系生存的唯一方法。如果我們不改變獎勵的機制,不去改變已經存在於數學家腦袋裡上百年對於「原創性結果」的評價標準,那麼大家這種用AI搶著解猜想的競賽只為無窮無盡的下去。那麼,我們該怎麼辦呢?到底該,或不該用AI呢?我認為最不應該做的就是鴕鳥心態,尤其是那些位居高位的數學家們。他們有責任要扛起引領大家討論與思考新的行業規範與激勵機制,而不是躲在自己的學術職位裡面說我堅持手工製作,而讓學生們、年輕從業者們去面對未知的風險。

V.

當然,我沒有要否認AI對於數學家所帶來的負面影響。

  1. 就像陶哲軒用食物做譬喻,在食物豐沛(不知道他是不是看了Ezra Klein的Abundance所以這麼愛用這個詞)的時代,我們從為了食物而勞動轉變成為追求食物的品味以及健身文化。依賴AI也會讓我們喪失了一些能力,但也可能會催生新的能力。就如計算機的出現讓我們不必像黎曼或高斯ㄧ樣大量用紙筆做計算,我們失去了像黎曼那個時代透過大量計算洞察出黎曼猜想的能力,但我們現在具有能用AI或是電腦從大量數據中找尋規律的能力。不論你喜歡或不喜歡,這種交換都會存在。

  2. 我認為在AI的時代,數學家與數學家之間的交流還是最重要的,跟AI通靈沒辦法替代在物理空間裡與人類討論數學的經驗。但我也的確擔心AI出現之後數學家之間(不得不)更原子化了。例如,在AI時代前以前跟別人交流自己正在思考正在做的問題,只要不涉及明確的敘述與細節基本上不用太擔心也還是一個值得被鼓勵的行為。但是現在,可能大家就要思考光是交給對方敘述跟粗略想法,對方如果道德低下回家跟AI通靈一下明天就可以寫好論文上網了。我也還在思考在現在這個時代要如何把握這個度。

AI揭露:本篇文無任何AI使用。

P.S. 我也沒有要否認AI對於社會、政治以及人類整體的威脅。我的擔憂就跟費馬的證明ㄧ樣空白太小寫不下了。

P.S.S. 今天GPT 6 Astra發佈了。很有可能我以上說的完全過時了。