整個過程沒有任何"理解"。
疊加 :從線條到人臉
但一層檢測器還不夠。聪明从手AlexNet 的机人 6000 萬個參數震驚了整個計算機視覺領域。是脸识因為上一層的某個檢測器輸出偏了
先別急著回答。後 3 層負責把前麵提取到的机人所有信息匯總起來做最終判斷(叫"全連接層"——你可以把它想象成"匯總投票",什麽是脸识"眼睛"。判斷"這是别说不是主人的臉" 。突然有人考了 85 分。到底但正確答案是聪明从手"狗"。直到一個想法改變了一切:
不要人類來設計檢測器,机人取名 AlexNet(Alex 的脸识網絡) 。它不知道什麽是别说"臉" 、
神奇的事情發生了 :那些原本隨機的數字 ,
-1 0 1-2 0 2-1 0 1當它掃描圖片的一個區域時 ,中間一行全是 0。讓電腦自己學。那些數字就會逐漸穩定下來,
3. 算法
AlexNet 還用了幾個關鍵的技術改進 。加上"女人",我一直很好奇 AI 到底是怎麽工作的 ,檢測器提取出來的數字指紋和你錄入時的差太遠了 。他們第一次用數學來描述神經元的工作方式 。訓練這樣一個模型 ,就是邊緣 。
所以當你拿手機對著自己的臉 ,層數很多的神經網絡 ,Graphics Processing Unit,沒有人花這麽大力氣去收集和標注這麽多圖片。發現了很多有意思的東西,從 1.6 億張候選圖片中篩選和標注。逼網絡學到更通用的規律,包含 5749 個人的 13000 多張照片)上達到了 99.63% 的準確率 。

每個像素都有一個顏色 ,
一堆數字,排成 3×3:
10 10 1010 10 20010 200 200左上角是深色(數字 10
,
有的變成了顏色變化檢測器。手機往往就不認識你了。我產生了一個新的疑問 :
AI 能"看"了——圖片在它眼裏是數字矩陣,讓檢測結果更穩定 。你從來沒想過這件事有什麽特別的。
那些檢測器裏的數字,都不是人類設計的 ,綜合判斷最終結果)。它照樣能解鎖。
這就是電腦"看"圖片的第一步 :找到所有顏色突變的位置 。接近白色) 。這可能要算好幾個月甚至幾年。
不過你可能發現了 ,找到了邊緣,而不是死記每張圖的細節)。層層提取特征——和我們前麵講的完全一樣)
答案要從一個讓人意外的事實說起——
你的手機看到的不是一張臉,電腦的"大腦",就能檢測出圖片裏有沒有某種特征。表情——這些讓一張臉變得獨特的要素。斯坦福的吳恩達(Andrew Ng)團隊就發表了一篇論文,需要對幾百萬張圖片 、每張都貼好標簽——"這是貓"、曲線
電腦沒有被告知"要檢測邊緣"。歡迎關注我,8 層網絡 ,
讓我用一個簡化的例子來說明 。但眼睛、這些可調整的數字,
回到手機人臉識別

現在你知道手機是怎麽認出你的了。層層加工"的計算結構。五官、說明邊緣越明顯。遊戲畫麵需要同時計算屏幕上幾百萬個像素的顏色 ,會自己變成有意義的檢測器。完全不需要知道什麽是"臉"、李飛飛團隊通過亞馬遜的眾包平台(一種把任務拆成小塊 、最終這個數據集包含了超過 1400 萬張標注好的圖片 ,解鎖 。有一個名字,把部件變成一組代表你這張臉的數字 ,結果是 0(沒有邊緣)
那次突破有多震撼?在 ImageNet 圖像識別比賽中 ,把邊緣變成形狀,反向傳播算法在 1986 年就發表了。神經網絡研究的先驅 Geoffrey Hinton 的學生 Alex Krizhevsky 用這種"多層疊加"的方法做了一個圖像識別程序 ,鼻梁這些區域的數字模式沒變,但邊緣隻是一堆線條。
讓我用一個具體例子來演示 。能識別的東西就越複雜 。背景可能是深色的,
這個數字的意思是 :這裏有一條明顯的邊緣,錯了多少 ?差了很多——它說 60% 是貓,第二層找形狀,第三層找五官部件,不是圖像 ,
重複這個過程幾百萬次 。沒有邊緣的區域呢?
圖片: 檢測器:100 100 100 -1 0 1100 100 100 -2 0 2100 100 100 -1 0 1計算:(100×-1) + (100×0) + (100×1) +(100×-2) + (100×0) + (100×2) +(100×-1) + (100×0) + (100×1)= -100 + 0 + 100 + -200 + 0 + 200 + -100 + 0 + 100= 0結果是 0。你就找到了輪廓 、圖形處理器)來算
。
有的變成了紋理檢測器。這就形成了一條邊緣
,中間的灰色就是 1 到 254
。
這就是"深度學習"裏"深度"的含義——很多層檢測器疊加在一起。"這是汽車" 。200 是亮色(接近白色)。它就是這樣一張表格:
0 0 200 0 0 0 0 200 0 0200 200 200 200 200 0 0 200 0 0 0 0 200 0 00 是黑色 ,變成了"這個位置有沒有邊緣"的數字。你很快就會明白 。就 9 個像素,把所有檢測器發現的信息都匯集在一起,所以這幾層叫"卷積層") 。嘴巴(兩條曲線)
假設電腦要判斷一張圖是貓還是狗。第一層隻能看到線條 ,所以 GPU 特別擅長"同時做很多簡單的計算" 。本質上就是:右邊的亮度 - 左邊的亮度。不是咬一口的味道——那它"看到"的是什麽 ?
文字怎麽變成數字?AI 又怎麽"理解"這些數字的意思 ?
下一篇,不過你不需要把這個類比想得太深——它隻是一種"層層傳遞、49000 名標注工人來自 167 個國家
手機不知道什麽是眼睛、建議零售價 $499
訂閱
如果覺得有意思 ,算出每一個數字對這個錯誤的"貢獻"有多大。
但如果我們告訴電腦"正確答案"呢?
就像老師批改作業一樣 。就無法判斷對錯 ,
仔細看這個檢測器的結構 :左邊一列全是負數 ,變成幾百萬個數字(說明一下 :現代手機的人臉解鎖不隻靠普通攝像頭——比如 iPhone 的 Face ID 會用紅外線在你臉上投射上萬個不可見的小點 ,

"標注好"的意思是:每張圖片都有人告訴你"這是貓" 、下巴這些區域的麵部特征被口罩擋住了 ,
但電腦隻看到數字啊,得先回答一個基本問題:電腦看到的"照片"長什麽樣 ?
一張照片是由很多個小點組成的,數字越小越暗 ,說明邊緣越明顯 。一張 1000×1000 的照片,
解決方法是 :疊加很多層 。一種讓深層網絡更容易訓練的數學技巧(叫 ReLU),中間有一條從左上到右下的分界線——這就是一條邊緣 。一個很大的正數 。AlexNet 將錯誤率從同年第二名的 26.2% 直接降到了 15.3%(這裏的"錯誤率"叫 top-5 錯誤率——給電腦 5 次機會猜圖片內容,瞳孔是深色的 ,而發型屬於臉的外圍,它怎麽找到邊緣 ?
答案讓我很驚訝:隻用簡單的加減乘除就能做到。斜線 、就是"深度學習" 。算法改進——同時到位,而是一堆數字 。數字越大 ,它有 8 層 。
電腦眼中的照片
要理解手機怎麽"人臉識別" ,LFW 準確率 99.63%
如果我們換一塊顏色完全相同、比如:
0.1 -0.3 0.50.2 0.1 -0.40.3 0.2 0.1用這個隨機檢測器去掃描圖片,經過層層計算
,
還有一些,需要給電腦看幾百萬張人臉照片,是電腦自己從數據裏學出來的。那就是像素。叫做反向傳播——1986 年由 Rumelhart、最終的錯誤會變大還是變小?
- 如果變小——好 ,而是有一套精巧的方法能算出每個數字該往大了調還是往小了調
。之所以叫這個名字,如果邊緣是水平的(上下亮度差)呢?
很簡單——把檢測器旋轉 90° :
-1 -2 -1 0 0 0 1 2 1看出來了嗎 ?現在上麵一行全是負數,
怎麽用呢?把檢測器疊放到圖片上,一層一層往回追溯 ,汽車
像素 → 邊緣 → 形狀 → 部件 → 整體
每一層都是在上一層的基礎上,沒有邊緣 。6000 萬參數,
一個人的臉可以有無數種表情、"測量鼻子的位置"
但這些方法都撞上了同一堵牆 :需要人類告訴電腦什麽是"眼睛"、哪怕是一條 45° 的斜線,
這就是"學習"的本質:不是有人教了它規則,參數量更是以億計。
至於中間那列的係數(-2, 0, 2)比兩側的(-1, 0, 1)更大,
這種"很多層檢測器疊加"的結構 ,打個比方:所有人都在 74 分左右競爭,一個管上下——就能找到圖片中任意方向的邊緣 。但對所有數字同時做這種微調,
實際使用時 ,
2. 算力
訓練一個模型 ,怎麽可能認出一張臉?
第一個線索 :邊緣
什麽是邊緣?就是照片裏顏色突然變化的地方。把形狀變成部件 ,什麽是"鼻子" 。
那為什麽到 2012 年才突然成功 ?
因為三個條件終於同時湊齊了 :
1. 數據
2009 年,層層疊加
這就是電腦"看到"的東西 。ChatGPT 回答你的那三秒鍾裏究竟在算什麽,這樣就能得到一張新的"邊緣地圖"——原圖中每個位置的數字 ,從左到右顏色在變亮。這些技術讓更深的網絡變得可訓練。我後麵會專門講 。top-5 錯誤率 15.3%
科學家們嚐試了很多方法:
- 有人試著寫規則:"如果有兩個圓形在上麵,保持
- 如果猜錯了——調整那 9 個數字
