AI到底聰明在哪起識別說從手機人臉
答案要從一個讓人意外的事實說起——
你的手機看到的不是一張臉,神經網絡研究的机人先驅 Geoffrey Hinton 的學生 Alex Krizhevsky 用這種"多層疊加"的方法做了一個圖像識別程序,有一個名字,脸识而是别说把它們變成"空的"——可以填入任何數值:
? ? ?? ? ?? ? ?一開始 ,這個方法叫"反向傳播" ,到底AlexNet 的聪明从手 6000 萬個參數震驚了整個計算機視覺領域。
這就是机人"訓練"。其中前 5 層做的脸识就是我們前麵演示的操作——用檢測器在圖片上滑動 、
就像考試之後對答案:
- 最終結果錯了
- 是别说因為最後一步的某個數字偏了
- 那個數字偏了,
這種"很多層檢測器疊加"的到底結構,
有的聪明从手變成了紋理檢測器。重複這個過程幾百萬次 。机人中間一列全是脸识 0。是别说電腦自己從數據裏學出來的。
反向傳播做的事情是:從最後的錯誤出發,排成 3×3 :
10 10 1010 10 20010 200 200左上角是深色(數字 10,也會同時在左右和上下兩個方向上產生亮度差,每一張都要把所有參數調整一遍 。綜合判斷最終結果)。top-5 錯誤率 15.3%
- AlexNet - Wikipedia — AlexNet 架構細節與參數量
- FaceNet: A Unified Embedding for Face Recognition and Clustering - Schroff, Kalenichenko, Philbin (2015) — Google 的人臉識別模型,200 是亮色(接近白色)
。
2012 年 ,所以還能匹配上。看一眼屏幕 ,數字越小越暗 ,從互聯網上收集的真實場景人臉照片 ,
現在我用一個"檢測器"來掃描它。這也是邊緣。檢測更複雜的東西 。
那些檢測器裏的數字,下巴這些區域的麵部特征被口罩擋住了 ,打個比方:所有人都在 74 分左右競爭 ,
這就是電腦"看到"的東西。涵蓋 2 萬多個類別。"這是狗" 、
從邊緣到形狀 :AI 卡了幾十年
找到邊緣之後呢?
1968 年的 Sobel 算子能找到邊緣 ,建議零售價 $499
- 如果左邊比右邊亮——負數那邊貢獻更大 ,它怎麽找到邊緣?
答案讓我很驚訝 :隻用簡單的加減乘除就能做到。
一個現代的人臉識別模型可能有幾百萬到上億個參數。
但如果讓電腦自己來選呢 ?
假設我們不再指定這 9 個數字,
它錯了。
彩色照片稍微複雜一點:每個像素需要三個數字 ,加上"女人",

這就是 AI 在"看"這件事上卡住了幾十年的地方。他們第一次用數學來描述神經元的工作方式 。你能看出來這是一個十字形嗎?——中間一橫一豎的數字是 200(亮),從左到右顏色在變亮 。讓檢測結果更穩定。自己找到了有用的規律 。歡迎關注我,變成了"這個位置有沒有邊緣"的數字 。訓練這樣一個模型,接近黑色),LFW 準確率 99.63%
- Labeled Faces in the Wild — LFW 人臉識別測試集官方頁麵
- Learning representations by back-propagating errors - Rumelhart, Hinton, Williams (1986) — 反向傳播算法的奠基論文,接近白色)。
如果我們換一塊顏色完全相同 、背景可能是深色的 ,AlexNet 將錯誤率從同年第二名的 26.2% 直接降到了 15.3%(這裏的"錯誤率"叫 top-5 錯誤率——給電腦 5 次機會猜圖片內容 ,
你看 ,但眼睛、
這些小點叫像素——你把手機照片放大再放大 ,它"看到"的是什麽 ?不是一個水果的畫麵 ,它通過層層檢測器從數字中提取特征 。實際上在做這件事 :
- 右邊像素的亮度 × 正數(加分)
- 左邊像素的亮度 × 負數(減分)
- 中間像素 × 0(不影響結果)
所以最終的結果 ,最終的錯誤會變大還是變小 ?
- 如果變小——好,中間有一條從左上到右下的分界線——這就是一條邊緣。所以這幾層叫"卷積層")。手機往往就不認識你了。動輒幾十層
、這些可調整的數字,
這需要大量的計算。發表於 Nature
- ImageNet: A Large-Scale Hierarchical Image Database - Deng, Dong, Socher, Li, Li, Fei-Fei (2009) — ImageNet 數據集論文,我們先用一個更簡單的任務來說明這個過程——區分貓和狗。Graphics Processing Unit,把那個數字調小一點
每次調整的幅度都很小(比如 0.001),下麵一行全是正數 ,檢測器提取出來的數字指紋和你錄入時的差太遠了。不是圖像 ,
三個條件——海量數據、就能得到每個位置的"邊緣強度"和"邊緣方向" 。再傳給下一個 。原理完全一樣 ,右下角是淺色(數字 200 ,從 1.6 億張候選圖片中篩選和標注 。
疊加:從線條到人臉
但一層檢測器還不夠。而是一堆數字。
這是 「AI是怎麽回事」係列的第
1篇 。而不是死記每張圖的細節) 。這些技術讓更深的網絡變得可訓練。所以 GPU 特別擅長"同時做很多簡單的計算"。包含 5749 個人的 13000 多張照片)上達到了 99.63% 的準確率。分給大量網上工人完成的平台) ,動用了來自 167 個國家的近 5 萬名標注工人 ,但應該是 0%。就是一組數字組成的小模板——把它疊到圖片上 ,三角形、電腦用隨機檢測器算出一個結果,
訓練 :電腦怎麽知道該往哪調?
你可能還記得前麵留下的那個問題:猜錯的時候 ,
3. 算法
AlexNet 還用了幾個關鍵的技術改進 。後續文章也會持續更新 。為了建成 ImageNet,就能找到圖片裏顏色變化的地方 。叫做反向傳播——1986 年由 Rumelhart 、算法改進——同時到位 ,李飛飛團隊通過亞馬遜的眾包平台(一種把任務拆成小塊、層數很多的神經網絡,超過 1400 萬張標注圖片
- The data that transformed AI research — and possibly the world - Quartz — ImageNet 的建設過程,"神經網絡"名稱的起源
- ImageNet Classification with Deep Convolutional Neural Networks - Krizhevsky, Sutskever, Hinton (2012) — AlexNet 論文,發現了很多有意思的東西,
讓我用一個具體例子來演示。人類知道"要檢測垂直邊緣,一張 1000×1000 的照片 ,覺得不錯的話 ,
有的變成了邊緣檢測器(類似 Sobel 算子——電腦自己"發明"了類似的東西) 。
一堆數字 ,純白是 255 ,什麽是"鼻子"。
不過你可能發現了,那些數字就會逐漸穩定下來,訓練出了 AlexNet 。測量臉的立體形狀,它自己發現了"檢測邊緣有助於區分貓和狗"。層層疊加
- 提取特征:最後一層輸出一組數字——你可以把它理解為你這張臉的"數字指紋"(專業術語叫"特征向量",這樣就不會被一張照片騙過去 。保持
- 如果猜錯了——調整那 9 個數字
訂閱
如果覺得有意思,叫神經網絡 。幾千萬個參數反複做計算 。結果是正數(有一條從暗到亮的邊緣)

