文:張恭銘&陳曉鳴律師
聲音複製、AI生成影片與假冒身分正以前所未有的速度改變網路犯罪的面貌。2026年,深度偽造已佔全球詐騙活動的11%,較2024年的6.5%幾近翻倍,三年間詐騙嘗試量暴增2,137%。
技術門檻崩塌,犯罪產業化
生成式AI工具如今僅需數秒音頻即可製作高品質的語音複製。湖北黃石三名老人接到「孫子」帶哭腔的求救電話,騙子利用AI擬聲技術克隆聲音,騙取現金共6萬元。內蒙古包頭一名科技公司法人代表在微信視頻中「確認」了好友的面孔和聲音後,10分鐘內被騙走430萬元,事後才發現騙子通過AI換臉和擬聲技術冒充其好友。
這已不是零星的個人犯罪,而是高度組織化的產業鏈。台灣刑事局破獲的假交友深偽詐欺集團,由黑幫背景的黃姓主嫌操控,旗下設有「名單組」「新客組」「培養組」「回客組」等分工,並由軟體工程師設計AI變聲程式模仿公關小姐聲紋與被害人對話,犯罪所得超過9億元,受害者逾2萬人。
人類辨識能力已近失效
英國iProov在2025年對2,000名消費者進行測試,僅0.1%能正確辨識所有真偽樣本。McAfee研究發現,70%的人對自己能否分辨克隆聲音與真實聲音缺乏信心,高品質深偽影片的人類識別率僅24.5%。
金融業防線的技術轉向
紐約州官員警告,2026年投資詐騙損失超過80億美元,較2024年增加38%,每位受害者損失中位數達10,560美元,詐騙者利用AI克隆聲音、偽造影片冒充金融專業人士。
防禦端也在進化。德國馬克斯·普朗克信息學研究所開發出新方法,不再搜尋視覺破綻,而是分析面部表情是否自然,平均檢測準確率超過95%,面對OpenAI的Sora 2生成的偽造影片也能正確識別近95%。台灣警方則在165網站設置「打詐儀錶板」,協助民眾查詢最新詐騙訊息。
實用辨識指引
專家提出「一遮、二問、三回撥」極簡辨別法:視頻通話時要求對方遮擋部分面部觀察畫面是否失真,交流中提出只有本人知道的問題,再通過原有聯繫方式回撥核實。更重要的是,5到10秒的隨意應答就足以提取完整聲紋特徵——接到陌生電話時,保持沉默比「戲耍騙子」更安全。
當聲音與面容不再是可信的身分憑證,個人、企業與金融機構都需要重建以多重驗證為核心的信任基礎設施。

