48% 的受試者在一分鐘視訊通話後,以為對方是真人。AI 視訊公司 Tavus 於 2026 年 10 月 1 日發表 Griffin,自稱是首個通過影片圖靈測試的模型。以下說明實驗做法、基準測試的限制,以及對企業的意義。
實驗結果明顯但條件寬鬆
Tavus 的研究中,54 人與預覽版 Griffin-Lite 通話,26 人認為對方是真人。參加者以為自己在和另一名參加者交談,直到通話結束後才被問及是否懷疑對方是 AI。前一代系統同樣測試下,41 人中只有 1 人(2.4%)誤認。Tech-ish 提出四點保留:參加者沒有主動找 AI;研究沒有真人對照組;樣本只有 54 人,以 95% Wilson 區間計算,真實比率約為 35% 至 61%;研究由 Tavus 自行進行及撰寫,並未附上論文或數據。INSIDE 同樣提醒,這不是外部學術機構執行的雙盲測試。
技術差異與 NVIDIA 基準
傳統 AI 視訊先轉文字、再由語言模型回應、再合成語音和臉孔,每個環節都增加延遲。Griffin 是全雙工的影片對影片模型,感知、決策和影片生成同步進行。Tavus 稱之為「人類互動模型」。在 NVIDIA 的 VideoFDB 基準中,Griffin 生成得分 3.83,真人為 3.92,次高為 2.80。不過 Tech-ish 指出,生成項只有三個 AI 系統參賽,對手是串接式架構,所以領先幅度要放在這個背景下理解。
測試結果由不足 3% 到 48%
圖靈在 1950 年提出測試,一般做法是讓評審同時面對真人和機器。Tech-ish 引述加州大學聖地牙哥分校今年的研究:GPT-4.5 在被設定扮演人類時,於文字對話中被選為真人的比率達 73%。Tavus 的測試形式不同,所以不宜直接與這類結果比較。前一代系統通過率不足 3%,Griffin 的躍升仍然明顯。
對企業與香港的啟示
Tavus 列出輔導、困難對話練習和鏡頭支援為潛在用途,並稱在處理安全問題前不會全面推出。風險則在詐騙:Tech-ish 認為騙案多靠短時間通話,對象並不會刻意找 AI,與這次測試條件相近。INSIDE 亦指出,這會為深偽偵測和線上身分驗證帶來新挑戰。香港企業可考慮在大額轉帳加入回撥已存號碼、預先約定暗語等多重驗證。當「見到人、聽到聲」不再足以證明身分,企業該以什麼作為信任依據?
資料來源:
