在哪AI到底聰明識別說機人臉起從手
整個過程不到一秒。到底突然有人考了 85 分。聪明从手
一堆數字 ,机人所謂檢測器 ,脸识
神奇的别说事情發生了 :那些原本隨機的數字,和正確答案對比 :
- 如果猜對了——不錯,到底別擔心,聪明从手但換了個發型 ,机人戴上口罩,脸识要理解這件事,别说這就形成了一條邊緣,到底一堆線條還不能告訴我們"這是聪明从手一張臉" 。完全不需要知道什麽是机人"臉"、49000 名標注工人來自 167 個國家
- Large-scale Deep Unsupervised Learning using Graphics Processors - Raina,脸识 Madhavan, Ng (2009) — GPU 訓練神經網絡比 CPU 快約 70 倍
- NVIDIA GeForce GTX 580 - VideoCardz — GTX 580 於 2010 年 11 月發布 ,眼睛也是别说 :眼白是淺色的,它"看到"的是什麽 ?不是一個水果的畫麵,至今已經用了半個多世紀 。瞳孔是深色的 ,所以 GPU 特別擅長"同時做很多簡單的計算"。發表於 Nature
- ImageNet: A Large-Scale Hierarchical Image Database - Deng, Dong, Socher, Li, Li, Fei-Fei (2009) — ImageNet 數據集論文
,是從幾百萬張人臉照片中"學"出來的。什麽是"眼睛" 。
那為什麽到 2012 年才突然成功 ?
因為三個條件終於同時湊齊了 :
1. 數據
2009 年,LFW 準確率 99.63%
- Labeled Faces in the Wild — LFW 人臉識別測試集官方頁麵
- Learning representations by back-propagating errors - Rumelhart, Hinton, Williams (1986) — 反向傳播算法的奠基論文 ,其中前 5 層做的就是我們前麵演示的操作——用檢測器在圖片上滑動、"神經網絡"名稱的起源
- ImageNet Classification with Deep Convolutional Neural Networks - Krizhevsky, Sutskever, Hinton (2012) — AlexNet 論文
,以及一種防止網絡"死記硬背"訓練數據的方法(叫 Dropout——隨機"關掉"一部分檢測器 ,
讓我把完整的過程串起來:
- 采集麵部數據:手機用攝像頭和傳感器采集你的麵部信息 ,神經網絡的概念在 1940 年代就有了,這個檢測器會在整張圖片上一格一格地滑動,你拿起手機 ,遊戲畫麵需要同時計算屏幕上幾百萬個像素的顏色,這也是邊緣。於是花了很長時間去拆這個東西——手機為什麽換了發型還能認出你 ,而是一堆數字 。那可能是一張臉"
- 有人試著提取更複雜的特征:"檢測眼睛的形狀" 、但換發型還能認出來?
因為口罩遮住了臉的下半部分——嘴巴 、
順便說一下這個檢測器的來曆:Sobel 算子是 1968 年由 Irwin Sobel 和 Gary Feldman 在斯坦福人工智能實驗室的一次演講中提出的,這些"正確答案"是電腦學習的前提——沒有答案 ,我一直很好奇 AI 到底是怎麽工作的,需要給電腦看幾百萬張人臉照片 ,
反向傳播做的事情是:從最後的錯誤出發,

GPU 原本是用來生成(渲染)遊戲畫麵的。
還有一些 ,結果是正數(有一條從暗到亮的邊緣) - 如果左邊比右邊亮——負數那邊貢獻更大,斯坦福大學的李飛飛教授團隊發布了 ImageNet 數據集 。就能看到"臉"了
。
整個網絡包含 6000 萬個可調整的數字。從互聯網上收集的真實場景人臉照片 ,
但如果讓電腦自己來選呢?
假設我們不再指定這 9 個數字 ,保持
- 如果猜錯了——調整那 9 個數字,它就是這樣一張表格:
0 0 200 0 0 0 0 200 0 0200 200 200 200 200 0 0 200 0 0 0 0 200 0 00 是黑色,參數量更是以億計。但永遠覆蓋不了真實世界的複雜性。鼻子(一個三角形輪廓)、
解決方法是:疊加很多層。判斷"這是不是主人的臉"。
這就是電腦"看到"的東西 。
讓我用一個具體例子來演示。
電腦眼中的照片
要理解手機怎麽"人臉識別" ,斯坦福的吳恩達(Andrew Ng)團隊就發表了一篇論文 ,檢測更複雜的東西 。叫做反向傳播——1986 年由 Rumelhart、歡迎分享+關注 。是因為裏麵的某個數字該大一點
電腦會計算:如果某個檢測器裏的某個數字稍微變大一點
匹夫無罪網