技術文章

AI 檢測準確度 98% 為什麼可能是陷阱?看懂檢出率與過殺率

淩琦科技研發團隊AI 視覺檢測驗收指標

在高良率產線上,「準確度」很容易失真。本文用一個簡單例子說明準確度悖論,並介紹混淆矩陣、檢出率與過殺率,以及實務上如何在漏檢與誤殺之間取捨。

評估 AI 瑕疵檢測系統時,常會聽到這樣的說法:「我們的模型準確度達到 98% 以上。」

聽起來很優秀,但在很多產線上,這個數字其實說明不了什麼。

一個簡單的例子

假設產線本身已經很穩定:

  • 一批產品共 100 件
  • 實際上有 98 件良品、2 件瑕疵品

如果 AI 採取最偷懶的策略:全部判定為良品。結果會是:

  • 98 件良品:全部判對
  • 2 件瑕疵品:全部漏掉

準確度 = 判對的數量 ÷ 總數 = 98 ÷ 100 = 98%

數字看起來合理,但 100% 的瑕疵都流到了客戶端,可能造成嚴重客訴。這就是「準確度悖論(Accuracy Paradox)」:當良品與瑕疵品的數量極度不平衡時,準確度會失去意義。

看懂混淆矩陣

要正確評估檢測系統,要把結果拆成四種情況:

AI 判定:瑕疵 AI 判定:良品
實際:瑕疵 真陽性 TP:成功攔截 偽陰性 FN:漏檢,瑕疵品被出貨
實際:良品 偽陽性 FP:誤殺,良品被報廢 真陰性 TN:順利放行

其中最需要關注的,是 FN(漏檢)FP(誤殺)

比準確度更重要的兩個指標

檢出率(Recall)= TP ÷(TP + FN) 所有瑕疵中,被成功攔截的比例。這是「絕對不能漏」的底線,致命瑕疵通常要求 99% 以上

過殺率(False Alarm Rate)= FP ÷(FP + TN) 所有良品中,被誤判為瑕疵的比例,在統計上稱為偽陽性率(FPR)。這是「不浪費人力」的門檻,數值太高,人工複判站就會被大量誤報淹沒,一般以低於 5% 作為目標。

產線實務上,也有人把過殺率定義為 FP ÷(TP + FP),也就是「被機台判定為瑕疵的產品中,有多少其實是良品」。兩種算法的視角不同:前者看良品被誤殺的比例,後者看送到複判站的產品中有多少是誤報。驗收時,請先和供應商確認採用哪一種定義,數字才能比較。

回到前面的例子:全部判良品的 AI,準確度 98%,但檢出率是 0%,一眼就能看出問題。

驗收 AI 檢測系統時,請要求供應商提供檢出率與過殺率,而不只是準確度。

漏檢與誤殺,只能取捨

完美的零誤差幾乎不可能。調校模型的本質,是在漏檢與誤殺之間,找到最符合商業利益的平衡點。

漏檢(FN) 誤殺(FP)
發生原因 AI 信心不足,沒認出真實存在的瑕疵 AI 過度敏感,把灰塵、水痕或允許的公差當成瑕疵
業務代價 下游組裝失敗、客訴退貨、商譽受損 報廢成本增加、人工複檢量暴增、拖慢產能
調校方式 降低判定門檻,寧可錯殺不可放過 提高判定門檻,信心夠高才報警
副作用 誤殺增加 漏檢風險增加

不同產業,策略不同

高風險產業(半導體、航太、車用) 單品價值高,瑕疵可能造成嚴重後果,策略是「零缺陷」:以壓低漏檢為最優先,接受較高的誤殺,再由人工複檢把關,並在漏檢為零的前提下,盡量減輕複檢負擔。

高速產線(飲料裝瓶、食品包裝) 產能極高、單品毛利較低,會把瑕疵分級處理:致命瑕疵(例如未封口)嚴格抓漏;不影響功能的外觀瑕疵,則全力壓低誤殺,避免無謂的報廢與停線。

調門檻不是萬靈丹

當漏檢與誤殺無法同時滿足需求時,就該跳脫軟體調校,回到源頭:

  • 重新定義瑕疵圖鑑:讓品保團隊與 AI 工程師對「公差邊界」有一致且量化的標準
  • 改善光學取像:針對反光、油污等問題,調整打光方式,從物理層面消除誤判來源
  • 增加前處理:在取像前加上吹氣、除塵,確保影像乾淨

光學取像的細節,可以參考〈工業視覺取像入門〉。

結語

「準確度 98%」不一定代表好系統。導入 AI 檢測時,先和供應商對齊檢出率、過殺率的目標,以及漏檢與誤殺各自的成本,才能選出真正適合產線的方案。淩琦科技的 AI 視覺檢測系統,會依產業風險與產線條件訂定驗收指標,歡迎與我們討論。

有任何需求,歡迎與我們聯繫

告訴我們您的想法,工程團隊將盡快回覆估價與交期。

立即諮詢
LINE 諮詢