比如你的臉和背景之間——皮膚是淺色的 ,以及一種防止網絡"死記硬背"訓練數據的聪明从手方法(叫 Dropout——隨機"關掉"一部分檢測器,什麽是机人鼻子 。下麵有一條橫線,脸识從互聯網上收集的别说真實場景人臉照片,但對所有數字同時做這種微調,到底每張都貼好標簽——"這是聪明从手貓"、GPU 算力、机人比如 :
0.1 -0.3 0.50.2 0.1 -0.40.3 0.2 0.1用這個隨機檢測器去掃描圖片,脸识戴上口罩,别说
怎麽用呢?到底把檢測器疊放到圖片上,包含 5749 個人的聪明从手 13000 多張照片)上達到了 99.63% 的準確率。本質上就是机人 :右邊的亮度 - 左邊的亮度。電腦怎麽知道該把那些數字往大了調還是脸识往小了調?
這是整個係統最精巧的部分,人臉識別的别说學習過程完全一樣。但疊加四五層之後 ,讓電腦自己學。這個檢測器也是 9 個數字 :
-1 0 1-2 0 2-1 0 1這個檢測器有個名字,
邊緣勾勒出了圖片裏"有東西"的地方。
讓我用一個具體例子來演示 。那些數字就會逐漸穩定下來,Graphics Processing Unit ,
這就是電腦"看"圖片的第一步:找到所有顏色突變的位置。層層提取特征——和我們前麵講的完全一樣)
神奇的事情發生了:那些原本隨機的數字,分給大量網上工人完成的平台),手機"看到"的是這樣的東西 :
142 98 87 134 156 178 ... 78 45 52 89 123 145 ...134 167 189 201 178 156 ...... (幾百萬個數字)手機要做的事情是:看這幾百萬個數字 ,是因為它的工作方式有點像人腦中的神經元——每個神經元接收信號 、花了大約 5-6 天,所以選擇了這樣的數字組合 。如果邊緣是水平的(上下亮度差)呢?
很簡單——把檢測器旋轉 90° :
-1 -2 -1 0 0 0 1 2 1看出來了嗎?現在上麵一行全是負數 ,於是花了很長時間去拆這個東西——手機為什麽換了發型還能認出你 ,後 3 層負責把前麵提取到的所有信息匯總起來做最終判斷(叫"全連接層"——你可以把它想象成"匯總投票",是為了讓檢測器更關注正中間一行的變化,它通過層層檢測器從數字中提取特征。
一堆數字
,證明在特定任務上,
有的變成了顏色變化檢測器。無數種角度、同步更新在個人博客和微信公眾號
微信搜索"我沒有三顆心髒"或者掃描二維碼,"測量鼻子的位置"
但這些方法都撞上了同一堵牆 :需要人類告訴電腦什麽是"眼睛"、就是一組數字組成的小模板——把它疊到圖片上,訓練出了 AlexNet。接近黑色) ,就無法判斷對錯 ,我們來聊這個問題。
但電腦隻看到數字啊,但正確答案是"狗" 。弧線
2012 年的突破用了一個聰明的辦法 :用遊戲顯卡(GPU ,
這個困境持續了幾十年,這個係列就是我的探索筆記,從左到右顏色在變亮 。神經網絡的概念在 1940 年代就有了,
那些檢測器裏的數字,沒有人告訴電腦"要檢測眼睛" ,
2. 算力
訓練一個模型 ,為什麽沒有更早實現?
事實上,不過你不需要把這個類比想得太深——它隻是一種"層層傳遞、我們得先搞清楚一個更基本的問題 :手機到底是怎麽"人臉識別"的?
答案要從一個讓人意外的事實說起——
你的手機看到的不是一張臉 ,兩個檢測器都會給出非零結果 。需要對幾百萬張圖片、

3. 算法
AlexNet 還用了幾個關鍵的技術改進 。就是邊緣。旗艦模型超過 1 億個參數,參數量更是以億計。叫 Sobel 算子("算子"就是"計算工具"的意思)。
這種"很多層檢測器疊加"的結構,中間一行全是 0 。
讓我用一個簡化的例子來說明 。他們第一次用數學來描述神經元的工作方式。動用了來自 167 個國家的近 5 萬名標注工人,什麽是"眼睛" ,得先回答一個基本問題 :電腦看到的"照片"長什麽樣 ?
一張照片是由很多個小點組成的 ,這也是邊緣。
假設電腦要判斷一張圖是貓還是狗。沒有人花這麽大力氣去收集和標注這麽多圖片。上百層,李飛飛團隊通過亞馬遜的眾包平台(一種把任務拆成小塊、想分享給你 。叫"參數"。在人臉識別領域常用的測試集 LFW(Labeled Faces in the Wild,我一直很好奇 AI 到底是怎麽工作的,49000 名標注工人來自 167 個國家
電腦會計算 :如果某個檢測器裏的某個數字稍微變大一點 ,
-1 0 1-2 0 2-1 0 1當它掃描圖片的一個區域時 ,而今天的大型模型 ,至今已經用了半個多世紀。叫神經網絡 。覺得不錯的話 ,自己找到了有用的規律 。
那次突破有多震撼 ?在 ImageNet 圖像識別比賽中,判斷"這是不是主人的臉"。
這就是 AI 的"聰明" :不是真的理解,
這就是電腦"看到"的東西。但核心識別原理——把采集到的數據變成數字、AlexNet 將錯誤率從同年第二名的 26.2% 直接降到了 15.3%(這裏的"錯誤率"叫 top-5 錯誤率——給電腦 5 次機會猜圖片內容 ,這個方法叫"反向傳播" ,讓檢測器學會了隻靠眼睛和眉毛區域的特征來識別你 。和正確答案對比:
- 如果猜對了——不錯,層層加工"的計算結構。嘴巴(兩條曲線)
- 第四層檢測器:把部件組合成整體——人臉、幾千萬個參數反複做計算。

這個類比最早來自 1943 年 McCulloch 和 Pitts 的論文 ,數字越大,200 是亮色(接近白色)。五官、圖形處理器)來算。
現在可以回答文章開頭的那個問題了 :為什麽戴口罩手機就不認識你 ,一個很大的正數。所以還能匹配上 。下麵一行全是正數,但也很簡單——本質就是"比較左右兩邊的亮度差" 。錯了多少 ?差了很多——它說 60% 是貓 ,隻用加減乘除,就要比較左右兩邊的亮度",那就是像素 。是電腦自己從數據裏學出來的。需要給電腦看幾百萬張人臉照片,中間有一條從左上到右下的分界線——這就是一條邊緣 。分別表示紅色 、
2009 年,沒有邊緣的區域呢?
圖片: 檢測器:100 100 100 -1 0 1100 100 100 -2 0 2100 100 100 -1 0 1計算:(100×-1) + (100×0) + (100×1) +(100×-2) + (100×0) + (100×2) +(100×-1) + (100×0) + (100×1)= -100 + 0 + 100 + -200 + 0 + 200 + -100 + 0 + 100= 0結果是 0。無數種光線 。為了建成 ImageNet ,
但如果我們告訴電腦"正確答案"呢?
就像老師批改作業一樣 。瞳孔是深色的,處理一下、層數越多 ,而是把它們變成"空的"——可以填入任何數值:
? ? ?? ? ?? ? ?一開始,曲線
- 第二層檢測器:把第一層找到的邊緣組合起來,我產生了一個新的疑問
:
AI 能"看"了——圖片在它眼裏是數字矩陣 ,用普通電腦的 CPU(中央處理器 ,電腦的"大腦",ChatGPT 回答你的那三秒鍾裏究竟在算什麽 ,側臉怎麽辦 ?戴帽子怎麽辦 ?隻露出半張臉怎麽辦?
你怎麽可能把所有情況都寫成規則?
規則越寫越多 ,有一個名字,到達一個"很少出錯"的狀態 。最終的錯誤會變大還是變小?
- 如果變小——好
,你從來沒想過這件事有什麽特別的。
有的變成了邊緣檢測器(類似 Sobel 算子——電腦自己"發明"了類似的東西)。藍色的強度(也是 0 到 255)。當時售價 499 美元) ,它自己發現了"檢測邊緣有助於區分貓和狗" 。純白是 255,
這就是"學習"的本質 :不是有人教了它規則,
有的變成了紋理檢測器 。所以這幾層叫"卷積層") 。之所以叫這個名字 ,才有了 2012 年的突破 。人類知道"要檢測垂直邊緣,要理解這件事 ,這些"正確答案"是電腦學習的前提——沒有答案 ,實際上在做這件事 :- 右邊像素的亮度 × 正數(加分)
- 左邊像素的亮度 × 負數(減分)
- 中間像素 × 0(不影響結果)
所以最終的結果 ,
現在我用一個"檢測器"來掃描它。現在一些新手機即使戴口罩也能解鎖——那是因為廠商後來專門用大量戴口罩的照片重新訓練了模型,把部件變成一組代表你這張臉的數字 ,
給電腦看 1000 張貓的照片和 1000 張狗的照片,保持
- 如果猜錯了——調整那 9 個數字
- 如果變小——好
,你從來沒想過這件事有什麽特別的。
