在高良率產線上,「準確度」很容易失真。本文用一個簡單例子說明準確度悖論,並介紹混淆矩陣、檢出率與過殺率,以及實務上如何在漏檢與誤殺之間取捨。
評估 AI 瑕疵檢測系統時,常會聽到這樣的說法:「我們的模型準確度達到 98% 以上。」
聽起來很優秀,但在很多產線上,這個數字其實說明不了什麼。
一個簡單的例子
假設產線本身已經很穩定:
- 一批產品共 100 件
- 實際上有 98 件良品、2 件瑕疵品
如果 AI 採取最偷懶的策略:全部判定為良品。結果會是:
- 98 件良品:全部判對
- 2 件瑕疵品:全部漏掉
準確度 = 判對的數量 ÷ 總數 = 98 ÷ 100 = 98%。
數字看起來合理,但 100% 的瑕疵都流到了客戶端,可能造成嚴重客訴。這就是「準確度悖論(Accuracy Paradox)」:當良品與瑕疵品的數量極度不平衡時,準確度會失去意義。
看懂混淆矩陣
要正確評估檢測系統,要把結果拆成四種情況:
| AI 判定:瑕疵 | AI 判定:良品 | |
|---|---|---|
| 實際:瑕疵 | 真陽性 TP:成功攔截 | 偽陰性 FN:漏檢,瑕疵品被出貨 |
| 實際:良品 | 偽陽性 FP:誤殺,良品被報廢 | 真陰性 TN:順利放行 |
其中最需要關注的,是 FN(漏檢) 與 FP(誤殺)。
比準確度更重要的兩個指標
檢出率(Recall)= TP ÷(TP + FN) 所有瑕疵中,被成功攔截的比例。這是「絕對不能漏」的底線,致命瑕疵通常要求 99% 以上。
過殺率(False Alarm Rate)= FP ÷(FP + TN) 所有良品中,被誤判為瑕疵的比例,在統計上稱為偽陽性率(FPR)。這是「不浪費人力」的門檻,數值太高,人工複判站就會被大量誤報淹沒,一般以低於 5% 作為目標。
產線實務上,也有人把過殺率定義為 FP ÷(TP + FP),也就是「被機台判定為瑕疵的產品中,有多少其實是良品」。兩種算法的視角不同:前者看良品被誤殺的比例,後者看送到複判站的產品中有多少是誤報。驗收時,請先和供應商確認採用哪一種定義,數字才能比較。
回到前面的例子:全部判良品的 AI,準確度 98%,但檢出率是 0%,一眼就能看出問題。
驗收 AI 檢測系統時,請要求供應商提供檢出率與過殺率,而不只是準確度。
漏檢與誤殺,只能取捨
完美的零誤差幾乎不可能。調校模型的本質,是在漏檢與誤殺之間,找到最符合商業利益的平衡點。
| 漏檢(FN) | 誤殺(FP) | |
|---|---|---|
| 發生原因 | AI 信心不足,沒認出真實存在的瑕疵 | AI 過度敏感,把灰塵、水痕或允許的公差當成瑕疵 |
| 業務代價 | 下游組裝失敗、客訴退貨、商譽受損 | 報廢成本增加、人工複檢量暴增、拖慢產能 |
| 調校方式 | 降低判定門檻,寧可錯殺不可放過 | 提高判定門檻,信心夠高才報警 |
| 副作用 | 誤殺增加 | 漏檢風險增加 |
不同產業,策略不同
高風險產業(半導體、航太、車用) 單品價值高,瑕疵可能造成嚴重後果,策略是「零缺陷」:以壓低漏檢為最優先,接受較高的誤殺,再由人工複檢把關,並在漏檢為零的前提下,盡量減輕複檢負擔。
高速產線(飲料裝瓶、食品包裝) 產能極高、單品毛利較低,會把瑕疵分級處理:致命瑕疵(例如未封口)嚴格抓漏;不影響功能的外觀瑕疵,則全力壓低誤殺,避免無謂的報廢與停線。
調門檻不是萬靈丹
當漏檢與誤殺無法同時滿足需求時,就該跳脫軟體調校,回到源頭:
- 重新定義瑕疵圖鑑:讓品保團隊與 AI 工程師對「公差邊界」有一致且量化的標準
- 改善光學取像:針對反光、油污等問題,調整打光方式,從物理層面消除誤判來源
- 增加前處理:在取像前加上吹氣、除塵,確保影像乾淨
光學取像的細節,可以參考〈工業視覺取像入門〉。
結語
「準確度 98%」不一定代表好系統。導入 AI 檢測時,先和供應商對齊檢出率、過殺率的目標,以及漏檢與誤殺各自的成本,才能選出真正適合產線的方案。淩琦科技的 AI 視覺檢測系統,會依產業風險與產線條件訂定驗收指標,歡迎與我們討論。
