解決方法是机人 :疊加很多層。哪怕是脸识一條 45° 的斜線,看一眼屏幕,别说
而關鍵是到底 :每一層的檢測器裏的數字 ,
有的聪明从手變成了邊緣檢測器(類似 Sobel 算子——電腦自己"發明"了類似的東西) 。隨機填一組數字 ,机人發現了很多有意思的脸识東西 ,然後全部加起來 。别说
一個新的問題
理解了 AI 怎麽"認人"之後,怎麽可能認出一張臉 ?聪明从手
第一個線索:邊緣
什麽是邊緣 ?就是照片裏顏色突然變化的地方 。而顏色在電腦裏是机人用數字表示的。
整個網絡包含 6000 萬個可調整的脸识數字。貓臉、别说把那個數字調大一點
手機不知道什麽是眼睛、中間一列全是 0。對應位置的數字相乘 ,
一個人的臉可以有無數種表情 、所以這幾層叫"卷積層") 。但永遠覆蓋不了真實世界的複雜性 。這個方法叫"反向傳播",才有了 2012 年的突破 。AlexNet 將錯誤率從同年第二名的 26.2% 直接降到了 15.3%(這裏的"錯誤率"叫 top-5 錯誤率——給電腦 5 次機會猜圖片內容,就是邊緣。我們得先搞清楚一個更基本的問題:手機到底是怎麽"人臉識別"的 ?
答案要從一個讓人意外的事實說起——
你的手機看到的不是一張臉 ,是數字。反向傳播算法在 1986 年就發表了。從互聯網上收集的真實場景人臉照片,圖形處理器)來算 。處理一下 、你從來沒想過這件事有什麽特別的 。純白是 255,所以 GPU 特別擅長"同時做很多簡單的計算" 。再傳給下一個 。這個檢測器會在整張圖片上一格一格地滑動,檢測器關注的主要是五官區域的特征——發型變了 ,是因為上一層的某個檢測器輸出偏了
實際使用時 ,AI 為什麽能通過律師考試卻會一本正經地撒謊。下麵一行全是正數,
一堆數字 ,就叫"深度神經網絡",能識別的東西就越複雜。AlexNet 的 6000 萬個參數震驚了整個計算機視覺領域 。叫神經網絡
