自然組 AI適合擔任哲學論文獎的評審嗎?──首獎/周楷翔(摘錄)
周楷翔(資訊工程學系碩士班一年級)
近年來,隨著人工智慧(AI)技術急速發展,AI已展示出令人驚豔的語言處理和理解能力。這些發展對學術社群帶來機會與挑戰,其中一個問題是:AI是否可以審閱論文並判斷其好壞?更進一步地問,AI可以判斷哲學論文的優劣,成為相關獎項的評審嗎?
所謂「適合」,應分成兩階段討論:可行性與可欲性。我們必須先檢視使用AI作為評審是否可行,也就是AI是否能做到一個合格評審所需要的事情。若可行,則需進一步檢視使用AI作為評審是否可欲,有沒有可能無論AI能力多好,我們都不會想讓AI當評審。以下我將循著這兩階段探索:首先討論合格哲學論文評審應具備何種技能,並指出AI沒有這樣的能力;接著,討論為何使用AI作為評審本身是不可欲的,即便AI有能力當個好評審,人類也不應輕易將評審工作交給AI。
在本文章中,我所指的AI是指在現階段已存在或可預見未來可能出現的AI技術,其中又以自然語言處理(NLP)與大型語言模型(LLM)為主。自然語言處理旨在開發能理解、分析及生成人類語言的計算系統與演算法。大型語言模型則是近年來的熱門技術,在大量文本上訓練,學習語言結構和知識表徵。這些模型採用複雜的神經網路架構,能根據上下文生成連貫且具意義的文本,但其核心仍是基於統計機率的文字預測,而非真正的理解。簡言之,現階段的AI模型都還只是複雜的統計模型,在可預見的未來也會沿此方向發展。AI距離擁有如人類的意識仍非常遠,本文也不探討AI有沒有可能有意識的問題。
AI有能力完成評審的工作嗎?
我認為一個合格的哲學論文評審應能公正檢驗論文價值。雖然判斷論文價值無可避免有主觀因素,但仍有些客觀的、多數人接受的判準。以下列舉判斷哲學論文的判準,並討論AI是否有能力做出好的判斷。
寫作
一篇好的哲學論文至少要有足夠的文字表達水準。論文的目標是用紮實的論證傳達思想、說服論敵,不是堆砌專有名詞讓讀者有看沒有懂,也不是寫充滿錯字與文法錯誤的天書。再完美的論證也無法拯救拙劣的文字表達。
判斷寫作品質的AI工具已相當成熟。現今的AI不僅能識別文章錯別字、標點符號及文法錯誤,還能分析用字與句型結構複雜度、是否有足夠的路標詞(signposting words)等,以評估可讀性。相較於制式指標,分析文字流暢度、段落結構等相對受限,但已達到可作為人工審查輔助工具的程度。因此在可預見的未來,AI工具將可評估哲學論文寫作是否足夠好。
反對者可能指出,哲學文章有許多呈現方式,且文字表現手法必須在特定脈絡下才能判斷優劣。我認同有些哲學作品最好的呈現方式就是採用怪異的文字表現。然而,我們討論的不是任何哲學文章,而是哲學「論文」,對論文形式有明確期待。沒有人會否認《查拉圖斯特拉如是說》是一篇精彩的哲學著作,但它不是哲學論文。除非我們可以接受尼采拿著《查拉圖斯特拉如是說》的手稿來投稿哲學論文獎,否則我們只需要把焦點放在那些以當代論文形式呈現的文章即可,而現在的AI在此方面已有相當成熟的表現。
新穎性
一篇好的哲學論文,其想法必須有足夠的新穎性。把其他哲學家的觀點重新講一遍而毫無自己想法,也許可以寫教科書,但不能稱為好論文。重複別人的觀點而沒有適當引註,更可能涉及抄襲。評審的工作之一便是運用專業,判斷投稿想法是否具新穎性,還是只是重複過去既有觀點。
現在的AI以大量文本訓練,其讀過的哲學著作遠多於任何學者,看似更有能力判斷新穎性。但我認為並不一定是如此。首先,AI「讀過」一篇文章只代表在訓練中參考過並納入統計模型,不代表「記住」這篇文章,也許這篇文章對於統計模型的影響力微小到沒有被記住。此外,AI記住的是文字串接的機率,當同樣概念以不同方式呈現時,AI不一定能辨認。最後,AI訓練有時效性,太新的文章可能不在訓練集內,也就不能識別出那些與最新文章雷同的想法。
當然,人類也有類似限制:無法記住所有讀過的文章,無法保證能立即聯想到有相似觀念的著作,也無法永遠跟上最新進度。但人類評審作為領域專家,應時常關心最新學術發展,熟悉相關領域經典著作,所以我們有理由相信人類比通用型AI更能識別新穎性,更能認出概念出處,也更可能讀過最新發表。雖說如此,我認為人類在識別新穎性上是否超越現在的AI可能還需要更多經驗證據。
上述AI的技術限制並非完全不可能被突破。如今LLM已經可以大規模地檢索文獻,檢索增強生成(RAG)等技術則大幅提升了LLM從給定文本中檢索出相關資料的能力。因此在可預見的未來,AI也許有機會比人類更能判斷一個想法是否新穎。但至少以目前技術,我猜想人類應該還是略勝一籌。
論證品質與強度
哲學論文最重要的部分是論證是否成功。好的哲學論文必定有紮實論證,評審的工作包含檢視論證有效性,是否設想足夠好的批評者,以及對批評的回應是否成功等。
近年來,隨著chain-of-thought(CoT)指令技術及其伴隨的large reasoning models(LRMs)日漸成熟,LLM已展現驚人的邏輯推導能力。這些語言模型在數學與邏輯推導上表現出色,雖未達專家水準,但已接近大學生程度。但無論科技進展多亮眼,大學生程度的AI都不足以審閱論文。此外,目前較少文獻討論語言模型閱讀哲學文本的能力,我們不知道LLM理解哲學論證的能力如何,其程度可能甚至不如大學生。最後,雖然只是個案,但筆者讓ChatGPT閱讀哲學文本的經驗實在不甚理想,且觀察到多數人對LLM的哲學論證理解能力也不滿意。因此,現階段AI可能尚未具備處理哲學文本的能力。
雖然我傾向不認同現在的AI具備判斷哲學文本論證強度的能力,但隨著技術持續發展,AI在不遠的將來也許能具備這種能力。
有一種反對觀點認為:哲學論文常仰賴思想實驗作為論證工具,而思想實驗仰賴人類直覺,這是AI所不具備的。但判讀思想實驗是否成功,不需要擁有直覺,只需能判斷什麼符合多數人的直覺。AI不需要「擁有直覺」,只需判斷常人的直覺是什麼。目前類神經網路技術的核心正是捕捉難以用形式語言表達的人類直覺,透過大量資料讓電腦找出規律。若AI大量閱讀哲學文獻,它確實可能學會判斷人類直覺。當然,對於離奇、前所未見的案例,我們可以懷疑AI是否能符合多數人直覺,但面對複雜的思想實驗,人類自身直覺也很常沒有共識,也許這不只是AI會有的問題。
然而即便AI有能力判讀哲學論證的強弱,仍會面臨另一挑戰:設想反對意見的能力有限。好的評審應該能判斷哪些是作者應該回應的攻擊,所以評審必須要能設想反對意見。然而,研究顯示LLM在創意表現上不理想,很少給出出其不意的回應。機器學習重點在於找資料規律,但有創意的回應正是不會出現在訓練資料中的。在電車難題中,AI可能就不具備想出推胖子變體的能力,而想出這些變體以挑戰作者論點正是評審的工作。因此,AI作為評審,可能無法設想意想不到的挑戰,也就無法有效地衡量作者是否已經回應了所有可能的挑戰。當然我們不能排除未來出現具創造力的AI,但至少以現在的技術,AI尚不具備足夠的創造力來成為哲學獎評審。