記者張杰倫報導
近期學術界發布的「BullshitBench」基準測試在美國與英國科技媒體間引發廣泛討論。該研究指出,新一代大型語言模型雖然輸出內容明顯變長,但辨識「胡言亂語」(bullshit)的能力反而較前代下降。這項發現促使評論員與學者重新檢視當前AI模型過度追求流暢與詳盡所帶來的隱憂。
根據研究團隊設計,BullshitBench要求模型判斷一系列語義模糊、邏輯斷裂或看似深奧卻缺乏實質內容的句子與段落,是否屬於胡說。結果顯示,在控制其他變因下,新模型回答的平均字數顯著增加,但錯誤率同步上升。模型更容易將虛假但流暢的內容標記為有意義,或對明顯荒謬的表述給予過度寬容。簡言之,模型說得更多,卻未必更可靠。
美國科技媒體Ars Technica分析指出,模型在人類反饋強化學習(RLHF)階段被獎勵「詳細且自信」的回應,導致模型學會用更多文字掩蓋不確定性,而非誠實承認「不知道」。英國《新科學家》則憂心,這種冗長化現象可能使醫療、法律、新聞等專業領域的使用者更難察覺AI幻覺,因為看似權威的長篇輸出容易降低閱聽人的警覺。《The Register》以諷刺口吻評論:「新一代模型不是變笨,而是變得更會用漂亮話包裝廢話。」《麻省理工科技評論》則認為,現行主流評估指標過度注重流暢度、覆蓋率與使用者滿意度,忽視了資訊密度與可驗證性,讓模型朝錯誤方向進化。
為何辨識能力不升反降?研究與評論歸納出幾個可能原因。首先,新一代模型訓練資料量更大,但未經嚴格過濾,吸收了更多網路上的偽科學、行銷話術與陰謀論,使模型對「聽起來合理」的錯誤內容習以為常。其次,微調階段偏好長回答,模型為了獲得獎勵,傾向於延伸論述,即使證據不足也會補充看似相關的背景,反而稀釋了判斷重點。第三,推論時的強化學習可能引入「討好使用者」的行為,降低模型批判性,使其更願意順著提問脈絡給出肯定回應,而非指出問題本身存在謬誤。
模型冗長化帶來的後果不容忽視。對一般使用者而言,過長的輸出增加閱讀負擔,也提高誤信錯誤資訊的風險。對企業與開發者來說,API成本與運算資源消耗隨之上升,碳排放亦同步增加。更關鍵的是,在醫療、法律、金融等高度依賴精確判斷的場域,AI若習慣以長篇大論包裝不確定性,可能造成實質傷害。
為此,英美多個科技評論平台提出具體建議。第一,評估指標應加入「每百字事實密度」「可驗證比例」「承認不知道的頻率」等維度,避免單純以流暢度或使用者滿意度衡量模型好壞。第二,開發者應在獎勵函數中同時納入簡潔性與誠實性,鼓勵模型在缺乏足夠證據時直接表明限制。第三,高風險應用場景可要求AI輸出附上不確定性標示,或限制回覆長度,強制模型聚焦核心判斷。第四,使用者教育同樣重要,應提醒公眾:AI說得多不代表說得對,語氣自信也不等於內容可靠。
BullshitBench的出現,等於對當前AI發展方向敲響警鐘。當模型競相追求更長、更完整的回答,卻在辨識胡言亂語的基本能力上倒退,業界必須重新思考何謂真正的「進步」。與其讓AI成為能言善道卻真假難辨的修辭機器,不如引導它走向言簡意賅、勇於承認未知的方向。唯有如此,人工智慧才能在實際應用中建立可信賴的基礎,而非淪為製造大量漂亮廢話的加速器。

