簡而言之: 人工智慧有時會胡編亂造,因為它 預測的是接下來可能出現的詞語,而不是經過驗證的事實——流暢的表達並不代表正確。當話題比較小眾、事關重大,或需要提供確切的名稱和數字時,除非你對回覆進行背景調查並核實確鑿的訊息,否則人工智慧會用自信的猜測來填補空白。
您可能還想閱讀以下文章:
🔗 不要再像對待谷歌那樣對待人工智慧了,
了解為什麼更好的人工智慧結果需要不同的方法。
🔗 你的第一個真正的 AI 提示
使用簡單的結構構建清晰有效的提示。
🔗 優秀 AI 提示的 4 個組成部分
探索提升 AI 提示品質的四個基本要素。
🔗 人工智慧究竟是什麼?
用簡單、實用、日常的語言來理解人工智慧。
重點總結:
預測未知:將流暢的散文視為模式補全,而不是宣誓證據。
自信陷阱:自信的語氣是一種風格;準確性需要在聊天之外單獨核實。
假包裝:在相信看似完美的參考文獻清單之前,請自行搜尋引文標題和引言。
回覆時請提供來源說明,並禁止使用虛構的網址、研究報告或統計資料。
人工審核:首先抽查風險最高的索賠,尤其是在醫療、法律或金融領域。

預測並不等於知道
直白地說:大多數聊天軟體都是模式產生器。你提出問題,它們就會產生一個符合「完美答案」框架的回應。這個框架包括事實、語氣、結構——一整套包裝。有時,這套包裝包裹著真知灼見;有時,它只是填補知識空白的自信猜測。.
我想用個不太恰當的比喻或許能幫上忙,那我再稍微解釋一下。想像一下,一位聽過無數首歌的爵士鋼琴家。你讓他彈奏“那首關於藍色手提箱的歌”,他或許會即興創作出一首從未存在過的優美旋律——因為你的要求聽起來就應該是這樣。等等——這樣說有點誇大其詞了。這更像是打了興奮劑的自動補全功能。這個模型是在補全一個看似合理的段落,而不是打開一個標著「真相」的文件櫃。.
所以,當人們問 「為什麼人工智慧有時會編造數據」,簡而言之:它 東西來填補數據空白 。如果缺少某個引用,模型就會編造一個看起來學術性強的引用。如果不確定某個數字,它會提供一個簡潔的數字。如果缺少某人的中間名,它會編造一個符合時代和文化背景的名字。乍看之下可能有點令人驚訝,但一旦你了解了其中的規律,也就不足為奇了。
- 流暢的文字是創作的目標,而不是經過驗證的真相。.
- 知識的空白處仍不斷被灌輸各種言論。.
- 在模型排名中,「聽起來正確」的機率可以超過「正確」的機率。.
自信與準確性——這道尷尬的鴻溝
人類在不確定時會使用模稜兩可的表達方式。我們會說「我想」、「也許」、「我需要查證一下」。模型也可以使用模稜兩可的表達方式——如果你要求它們這樣做的話——但預設的輸出結果往往聽起來像是一份 充滿信心的簡報。這種潤飾是為了訓練模型以提供有用的信息而做出的,並不代表每個說法都有理有據。
自信和準確就像兩個不同的旋鈕。一個可以調得很高,另一個卻接近零。你一定也遇過這種情況:同事能非常肯定地解釋一個錯誤的流程。人工智慧也能做到這一點,而且速度更快,格式也更美觀。.
實用要點:將自信的措詞視為一種風格,而非證據。如果回覆中沒有任何可核實的來源,沒有承認任何不確定性,卻充斥著一堆具體的人名或數字——那就放慢速度。缺乏依據的具體細節是典型的伎倆。.
- 語氣強硬≠內容真實可靠。.
- 要求模型故意標記不確定性。.
- 比起虛假的萬無一失的簡報,我更願意坦誠地說「這是我不確定的地方」。.
捏造的引文和看似真實的細節
這種騙局之所以令人反感,是因為它看起來太專業了。 虛假的論文標題,虛假的期刊名稱,幾乎可以點擊的虛假網址,以及歸於名人名言的虛假引語。格式往往完美無瑕——斜體字、故意避免使用年份形狀的佔位符、聽起來像作者的名字——這些都足以蒙蔽匆匆瀏覽者。
這背後的原因顯而易見。引用格式在訓練文本中很常見。當你要求提供「來源」時,模型可能會產生 格式 ,但實際上並沒有檢索到任何真實的記錄。這就像是讓某人憑記憶畫一張收據一樣。你得到的東西看起來像收據,但這家商店可能根本不存在。
我曾經看過一份草稿,它虛構了一項關於遠距辦公效率的研究,作者名單看起來非常光鮮亮麗。感覺像是經過同儕審查的。但實際上什麼都沒有。這就是風險所在:當包裝看起來很高級時,你的大腦就會放鬆警惕。千萬別放鬆警戒。.
- 要求提供可以自行搜尋的書籍——然後認真搜尋。.
- 要警惕那些你從未要求過的、看似完美的引用加署名捆綁包。.
- 如果不能迅速找到“來源”,則將該說法視為未經證實。.
發明風險最高的新聞
並非所有聊天都一樣危險。一首關於咖啡的詩可以自由地運用比喻──這正是關鍵所在。而藥物劑量、法律期限、競爭對手的定價策略,或是已發表文章的歷史論斷,則完全是另一回事。.
當主題小眾、感覺是近期發生的或非常具體時,風險就會增加。當你要求確切的數字、指定的文件、公司內部資訊或「列出十篇同儕審查的研究」時,風險也會增加。要求越精確,模型就越容易用看似合理的填充詞來填補空白。.
冗長而令人印象深刻的回答可能比簡短謹慎的回答風險更大。篇幅長短會讓人覺得用心,用心又會讓人覺得認真,認真又會讓人覺得真實。正是這種錯綜複雜的印象鏈條,讓錯誤的訊息悄悄溜進了簡報。.
- 高風險: 健康、法律、金融、合規、安全、指定人員、確切統計。
- 中度風險: 小眾產業流程、工具設定、「最佳實踐」清單。
- 降低風險: 集思廣益、列提綱、重寫自己的草稿、修改語氣。
可靠輸出與不穩定輸出-快速對比
一張桌子比另一番激勵演講好得多。就算帶點小怪癖也無妨,因為普通的聊天本身就有點怪癖。.
| 訊號 | 它看起來像什麼 | 如何檢查 | 快速修復 |
|---|---|---|---|
| 接地回覆 | 與您已有的文件進行配對;承認存在缺口;引用可核查的標題 | 與您的來源文件或已知參考文件進行比較 | 要求它僅引用貼上的文本 |
| 自信的錯誤答案 | 流暢的文筆;具體的名稱/數字;零含糊其辭 | 先抽查一項確鑿的說法。 | “將每項聲明標記為已核實/不確定/未知” |
| 捏造的引用 | 漂亮的參考書目;「應該」存在的書目 | 搜尋確切標題;尋找真正的作者頁面 | 禁止捏造資訊來源;要求「不知道就說清楚」。 |
| 圖案填充 | 適用於任何公司的通用最佳實踐 | 問自己“如果我受到限制,哪些方面會改變?” | 貼上您的具體限制條件;要求進行客製化修改。 |
| 過於完整的列表 | 剛好十件,你要求的也是十件——而且全部整齊擺放。 | 對第3項和第7項提出質疑,並要求提供證據。 | 減少商品數量;品質比數量更重要。 |
時刻留意自己的表現。你會開始注意到那些不穩定的輸出,就像你會注意到照片中略微不自然的笑容一樣——那是擺拍的。.
如何在不變成疑神疑鬼的情況下辨識捏造的答案
你不需要核實每一個形容詞。但對於真正重要的訊息,你需要養成低成本的核實習慣。重點檢查最關鍵的部分:號碼、姓名、保單、報價。如果這些關鍵資訊不可靠,那麼其餘部分的資訊就值得懷疑。.
另一個跡像是:內部矛盾。模型聲稱某個工具「總是」執行 X 操作,然後又把例外情況描述得好像是標準功能一樣。或者它虛構了一個功能,然後又解釋瞭如何關閉它——就像一個不斷創造新門的夢。要追問一些能戳中痛點的問題。虛構的世界往往經不起考驗。.
也要注意那些「過於完美」的包裝。每一段話都同樣精雕細琢,每一條建議都同樣自信滿滿。真正的專業知識常帶有層次感-有保留意見、權衡取捨、「視情況而定」。過於完美的包裝更值得仔細檢視。.
- 首先要核實風險最大的論點,而不是整篇文章。.
- 問他“你最不確定的是什麼?”,看看他的面具是否會滑落。.
- 在聊天室外核對姓名、職稱和電話號碼。.
- 比起零散的事實,更傾向於提供與你貼上的文字相關的答案。.
減少發明創造的習慣
你無法用一句咒語消除 幻覺 ——抱歉——但你可以縮小其影響範圍。好的提示會限制遊戲,而糟糕的提示則會鼓勵即興發揮。
試試這些習慣。它們聽起來很枯燥,但比那些花哨的提示技巧更有效。.
- 知識範圍限定: “只使用我貼上的筆記。如果缺少某些內容,就說你不知道。”
- 禁止偽造來源: “不要捏造引文、引用或網址。”
- 力不確定性標籤: “給每個子彈貼上標籤:已知/推斷/猜測。”
- 要求提供替代方案: “給出兩個選項,並說明每個選項可能存在的問題。”
- 請求透過疑問解答: “列出你所做的假設。”
- 結構比氣氛更重要: 表格、清單和聲明/證據欄。
令人驚訝的是,告訴模型可以坦誠地說「我不知道」反而會降低其表現得確定無疑的社會壓力。模型會反映作業要求。如果作業要求不惜一切代價追求完整性,那麼模型就會編造出格式精美的謊言。如果作業要求坦誠地討論知識盲點,那麼模型就不會編造出華麗的謊言。
沒錯-後續跟進很重要。第一條回覆只是草稿。 「這個引用看起來是假的——刪除所有你無法核實的內容」是完全正常的第二個訊息。把聊天當作編輯工作,而不是自動販賣機,以為投幣一次就能得到真相。.
紮根、後續跟進和與不確定性共處
回歸現實 意味著將答案與模型即興發揮之外的事物聯繫起來:例如你貼上的政策文件、電子表格、會議記錄,或你會親自查閱的已知公開頁面。當回覆必須侷限於這個框架內時,創造性的空間就更小了。
後續跟進是第二道防線。 「這個數字從何而來?」「哪一部分是推論?」「不要引用任何研究,重新撰寫。」每個問題都是一次小型審核。我想,這才是使用這些工具的成熟方式——不盲目崇拜,不驚慌失措,只是進行審核。.
不確定性並非工作流程的漏洞,而是天氣。有時模型能精準概括你的文本,有時它卻會憑空捏造出一個從未召開過的小組委員會。你的任務是決定哪些輸出需要「雨衣」。.
- 當準確性至關重要時,請貼上原始素材。.
- 要求提供聲明層級的置信度標籤。.
- 在進行高風險決策時,要讓相關人員參與其中。
- 請將「創作自由」用於創作性任務,而不是服從性任務。.
當你在寫作過程中突然出現幻覺時該怎麼辦
別胡思亂想。別像工具背叛了你一樣,永遠放棄它——儘管這種衝動可能很強烈。糾正螺紋,繼續前進。.
一個簡單的恢復循環:
- 指出這一點: “這個消息來源似乎是捏造的。刪除未經證實的說法。”
- 重新定位: 貼上實際文件、引用或資料。
- 修改要切題: 要求修改部分內容,而不是要求寫一篇空洞潤飾的全新文章。
- 重新檢查清晰的邊緣: 名稱、數字、製程步驟。
- 決定信任等級: 腦力激盪夥伴 vs 草稿助手 vs 「不參與此主題」。
捕捉到一個幻覺可以改善接下來的對話——前提是你要收緊限制條件。模型本身不會“感到內疚”,但你更清晰的指令會改變它的最佳化目標。你是掌舵人。當出現創意時,要加大力度。.
日常生活中,這在不知不覺中卻是至關重要的場景
工作郵件:人為捏造的「行業標準時間表」可能會讓你產生無法實現的預期。學校與學習:虛假的解釋會在你不知不覺中根深蒂固。客戶支援草稿:編造的退款規則可能會變成承諾。創意寫作:盡情發揮想像-那就是你的遊樂場。.
貫穿始終的是後果。如果說錯話會造成金錢、信任、成績或安全方面的損失,那麼核實就不是可有可無的繁瑣工作。如果說錯話只會招致別人聳聳肩,那就放鬆一點。根據後果調整謹慎程度才是成年人應有的技能——這比記住「幻覺」這個詞更重要。
另外:團隊應該像規範「拼字檢查通過」一樣規範「我已核實此聲明」。否則,一段精心撰寫的文字一夕之間就會變成人盡皆知的常識。糟糕!.
重點總結
所以, 人工智慧有時會編造事實的原因 歸根究底在於:這些系統會預測看似合理的語言,用模式匹配填補空白,而且往往聽起來信心滿滿。這種組合會產生自信滿滿的錯誤答案、捏造的引文以及從未發生過的細節。
你無需懼怕工具本身,你需要養成習慣。對過於武斷的說法進行抽查。杜絕捏造的資訊來源。提供具體的背景資訊。主動詢問是否存在不確定性。將後續跟進作為審核手段。把自由發揮的創作留給風險較低的創意工作。.
流利程度並非人品證明。要像對待一位才華洋溢的實習生那樣看待他,他打字速度快得驚人,有時會捏造一個根本不存在的會議,但在指導下依然能表現出色。要堅持指導,保持幽默感,保持既輕鬆又務實的懷疑。這樣才能在不把虛構偽裝成事實的情況下,獲得應有的報酬。.
實際案例:識別競爭對手研究簡報中的虛假引用
幻覺聽起來很抽象,直到一段精心撰寫的文字幾乎出現在客戶簡報中。以下是一位英國市場分析師如何運用本指南中的技巧,避免將虛構的故事偽裝成研究成果──而且沒有放棄聊天機器人。.
設想
山姆有兩個小時的時間,為銷售啟動會撰寫一份一頁紙的競爭對手簡報。要求很常見:競爭對手的優勢、定價訊號以及「幾個可靠的來源」。山姆像以前一樣,輸入“總結競爭對手X及其來源”,結果得到一份簡潔明了的簡報,其中包含三個看起來很專業的學術引用和一個精確的市場份額百分比。聽起來像是事先準備的,但實際上大部分內容都是編造的。其中一個標題根本找不到,市佔率數據在競爭對手的網站上也找不到。.
Sam 不需要一個聽起來比較悅耳的模型。他需要的是一個切實可行的工作流程:貼上來源註釋,禁止虛假來源,強制標註不確定性,先抽查最有力的論斷,然後只重建有問題的部分。.
目標是提供一份團隊可以信賴的談話要點簡報,而不是一份僅看起來像收據、憑記憶寫成的收據。.
助理需要什麼
- Sam已有的素材包括:首頁文案、定價頁面文字、兩張最近的客服工單、一份失敗交易的筆記。
- 一條硬性規定:事實陳述只能使用貼上文字;如果註釋中沒有相關內容,則寫「我不知道」。
- 禁止捏造引文、引用、網址和統計數據
- 輸出形狀,用於區分已知/推斷/猜測。
- 在共享卡組之前,需要進行一次人工抽查,以核對姓名、號碼和任何「來源」頭銜。
- 允許提出最多三個澄清問題,而不是填補空白。
範例說明
任務一:僅使用下方貼上的筆記,撰寫一份一頁紙的競爭對手簡報,供銷售人員參考。簡報應 包含以下幾個部分:競爭對手的宣傳內容 / 顧客抱怨 / 定價訊號 / 未解問題。請勿捏造引文、引用、網址或統計資料。如果某個事實不在筆記中,請註明“未知”,並將其列在“未解問題”部分。請為每個要點加上標籤:已知 / 推斷 / 猜測。請使用英式英語。無需前言。
第二個訊息-疑點解答: 列出你所做的所有假設。除非你能提供貼上的句子來支持,否則請刪除所有標記為「猜測」的內容。如果你之前捏造了某個來源,請將其刪除並說明。
訊息 3 - 重新建構: 市場佔有率數據線不成立。僅重寫“定價訊號”部分,除非我的備註中已包含數字,否則不要添加任何數字。保留其他部分。
如何測試它
- 分別提出一個自由發揮的題目(「用三篇同儕審查的文獻總結競爭對手 X 的情況」)和上述的具體題目。比較虛構的標題和虛假的數據。.
- 首先抽查風險最大的說法(數字或指定的研究),而不是整頁內容。.
- 問:「你最不確定的是什麼?」有說服力的回答會指出不足之處;不堅定的回答則會更加固執己見。.
- 特殊情況:從貼上的備註中刪除定價信息,並確認草稿中顯示的是“未知”,而不是捏造一個計劃價格。.
- 分享前的驗收檢查:(1)每個「已知」要點都對應貼上的一行,(2)沒有捏造的引用,(3)開放性問題列出了真正的差距,(4)您自己搜尋了任何剩餘的標題,(5)沒有附帶註釋的確切統計數據。.
結果
結果示例 (僅代表一位分析師的競品簡報工作流程估算,並非已發表的研究):在8項簡報任務中,從“打開筆記”到“草稿準備人工核查”的實際耗時略有增加,從約12分鐘(一次性精修的虛構作品)的中位數增加到約15分鐘(基於事實的提示),但清理工作和出現尷尬情況的風險有所下降。人工核查關鍵論斷的耗時從約18分鐘(追蹤假標題和重寫)的中位數下降到約6分鐘(預先標記論點並禁止虛構來源),因此每份簡報的淨耗時減少了約9分鐘,所有簡報加起來減少了約72分鐘。根據驗收清單(無虛構引用、無無依據的統計數據、存在已知/推斷/猜測標籤、提出指出不足之處的開放式問題),8份基於事實的草稿中有7份在首次審核中通過,而8份一次性草稿中只有2份通過。限制:樣本量小,僅一位分析師,僅一種簡報類型;價格公開透明的競爭對手縮小了差距;「驗證時間」包括對可疑標題的網路搜尋。
要衡量你自己的版本:用你目前的習慣寫 5 份簡報,再用粘貼來源 + 禁止的虛構引用 + 聲明標籤寫 5 份簡報;記錄中位數草稿時間、中位數驗證時間和檢查清單通過率(顯示分母)。.
可能出現什麼問題
- 流暢性偏好: 完美的文法和整齊的重點會讓你忽略抽查。
- 引用角色扮演: 要求提供「來源」卻不貼上資料,這會導致學術研究形式缺乏相應的記錄。
- 過度填充的清單: 「給我十項研究」獎勵的是填充內容,而你的筆記中可能只有三項研究。
- 重寫整篇文章: 如果出現一行錯誤,請要求對該部分進行小幅修改,而不是要求進行徹底的潤色。
- 高風險議題: 醫療、法律、金融和合規需要比銷售話術簡報更強的人為把關。
- 無人為介入: 已標記的草稿仍可能誤讀貼上的句子。分享按鈕仍然由 Sam 控制。
實用要點
人工智慧之所以會編造故事,是因為它能預測出符合邏輯的語言來填補空白——而不是因為它想欺騙你。要把流暢性視為風格,而不是證據。要嚴謹地審查事實,禁止虛假資訊來源,標註不確定性,對最有力的論點進行抽查,並在發現任何漏洞時及時糾正。這樣,你既能享受到快速寫作夥伴的優勢,又不會發布一個從未發生過的自信滿滿的故事。.
常問問題
為什麼人工智慧有時會編造事實?
大多數聊天模型都是模式產生器:它們產生的回應符合「好答案」的格式,而不是經過驗證的、標有「真理」的文件櫃。空白處會被填上任何聽起來符合統計法則的東西——例如看似學術的引文、整齊的數字,或是符合時代背景的細節。流暢的文字是產生的最終目標,因此「聽起來對」比「正確」更重要。這就是為什麼編造的答案往往語法完美、條理清晰的原因。.
人工智慧的置信度與準確率相同嗎?
不。自信和準確性是兩個不同的概念——一個可能很高,而另一個卻接近零。預設的產出結果往往看起來像是一份自信滿滿的簡報,這是因為訓練鼓勵潤色,而不是因為每個論點都有事實依據。要把自信的措詞當作一種風格,而不是證據。如果回覆中沒有可核實的來源,沒有不確定性,卻充斥著大量的具體名稱或數字,那就應該放慢速度。.
為什麼聊天機器人會捏造引用和虛假來源?
引文格式在訓練文本中很常見,因此要求提供「來源」可能會產生一種學術論文的形式,卻無法檢索到真正的記錄——就像憑記憶畫收據一樣。虛假的論文標題、期刊名稱、網址和署名引文往往看起來足夠專業,足以蒙蔽快速瀏覽者。要求提供您可以自行搜尋到的標題;如果無法快速找到來源,則應將該說法視為缺乏依據。.
人工智慧發明風險最高的時間是什麼時候?
對於小眾、近期熱門或高度具體的話題,以及當你要求提供確切數字、具名文件、內部機密資訊或冗長的同行評審研究清單時,風險會顯著增加。高風險領域包括健康、法律、金融、合規、安全、涉及具體人名和確切統計數據。腦力激盪、列提綱、修改草稿和潤飾語氣通常風險較低。冗長而令人印象深刻的回答也可能給人一種比實際情況更安全的錯覺。.
如何在不逐字檢查的情況下識別出人工智慧產生的虛假答案?
首先檢查最關鍵的資訊—號碼、姓名、保單或報價。如果這些資訊不可靠,則將其他資訊列入觀察名單。注意內部矛盾和過於完美、沒有任何附加條件或權衡取捨的包裝。詢問模特兒最不確定的是什麼,在聊天之外核對姓名和頭銜,並優先考慮與你貼的文字相關的答案,而不是零散的資訊。.
哪些提示習慣可以減少人工智慧產生的幻覺?
你無法用一句神奇的話徹底消除幻覺,但你可以縮小其影響範圍。將知識範圍限定在貼上的筆記中,如果缺少某些內容,就說「我不知道」。禁止捏造引文、引文和URL。強制使用“已知/推斷/猜測”之類的標籤,要求提供假設,並優先採用“主張/證據”的結構。告訴模型可以接受“我不知道”,就能減輕它表現出虛假確定性的壓力。.
在將人工智慧應用於事實性工作時,「基礎性」意味著什麼?
回歸現實意味著答案要與模型即興發揮之外的事物聯繫起來——例如你的政策文件、電子表格、會議記錄或你會親自核查的公開頁面。當回應必須遵循這個框架時,創造性的空間就會受到限制。後續跟進就像第二道防線:詢問數字的來源、哪些部分是推斷,或在不引用具體研究的情況下重新表達。對於高風險決策,務必讓相關人員參與其中。.
談話中途突然出現幻覺,我該怎麼辦?
指出問題所在,用原始文件或資料重新定位,只重建出錯的部分,而不是要求重新撰寫一篇完整的文章。仔細檢查關鍵細節——例如人名、數字和流程步驟——然後決定該工具是腦力激盪的伙伴、草稿助手,還是「不適用於此主題」。更清晰的約束條件會改變模型的最佳化方向;當出現創新性內容時,要更謹慎地引導。.
如何阻止競爭對手研究簡報中出現捏造的引用?
貼上現有的來源註釋,禁止虛假來源和未經證實的數據,並要求標註已知/推斷/猜測,同時附上待解答的問題清單。首先抽查風險最高的說法,進行疑點審查,剔除缺乏依據的猜測,如果某個數字缺乏依據,則僅重寫錯誤部分。審核通過的條件是:每個「已知」條目都對應貼上的一行,並且所有剩餘的標題都將由人工進行核查。.
什麼時候才能允許人工智慧自由創造?
創意寫作和其他一些風險較低的任務可以自由發揮比喻——那是自由發揮的天地。但要根據後果謹慎行事:如果用詞不當會造成金錢、信任、成績或安全損失,那麼核實用詞就至關重要。如果只會造成輕微的負面影響,那就放鬆一點。語言流暢度並不等同於人品;要把這種寫作方式當作一個速度很快的實習生,他/她仍然需要在實際工作方面得到指導。.
參考
- OpenAI - openai.com
- 人本主義 - anthropic.com
- 美國國家標準與技術研究院 (NIST) - nist.gov
- IBM - ibm.com
- Google AI - ai.google.dev
- Google Cloud - 基礎架構 - docs.cloud.google.com