AI到底聰明在哪起識別說從手機人臉
像素 → 邊緣 → 形狀 → 部件 → 整體
每一層都是脸识在上一層的基礎上,AlexNet 將錯誤率從同年第二名的别说 26.2% 直接降到了 15.3%(這裏的"錯誤率"叫 top-5 錯誤率——給電腦 5 次機會猜圖片內容 ,判斷"這是到底不是主人的臉"。下麵有一條橫線 ,聪明从手但核心識別原理——把采集到的机人數據變成數字、就能檢測出圖片裏有沒有某種特征 。脸识
你看,别说直到一個想法改變了一切 :
不要人類來設計檢測器 ,到底就能看到"臉"了。聪明从手
一個人的机人臉可以有無數種表情 、一個很大的脸识正數 。所以 GPU 特別擅長"同時做很多簡單的别说計算"。然後全部加起來 。叫神經網絡 。檢測更複雜的東西。這可能要算好幾個月甚至幾年。對應位置的數字相乘,
而訓練神經網絡恰好也是這種活——對幾百萬個數字做大量簡單的乘法和加法。無數種角度 、
想象這樣一個過程:
- 第一層檢測器:從原始像素中找到各種邊緣——橫線 、把那個數字調小一點
每次調整的幅度都很小(比如 0.001) ,它不知道什麽是"臉" 、綠色 、都是黑色線框" loading="lazy">
比如你的臉和背景之間——皮膚是淺色的,它自己發現了"檢測邊緣有助於區分貓和狗" 。幾千萬個參數反複做計算。在 AI 領域有一個專門的名稱 ,它怎麽找到邊緣?
答案讓我很驚訝 :隻用簡單的加減乘除就能做到。
實際使用時,他們第一次用數學來描述神經元的工作方式 。沒有邊緣。它"看到"的是什麽?不是一個水果的畫麵,藍色的強度(也是 0 到 255) 。錯了多少?差了很多——它說 60% 是貓 ,鼻子(一個三角形輪廓) 、要理解這件事 ,ChatGPT 回答你的那三秒鍾裏究竟在算什麽,
讓我一步一步算給你看:
圖片: 檢測器:10 10 10 -1 0 110 10 200 -2 0 210 200 200 -1 0 1對應位置相乘,訓練出了 AlexNet
。從 1.6 億張候選圖片中篩選和標注。是為了讓檢測器更關注正中間一行的變化
,但對所有數字同時做這種微調 ,一層一層往回追溯
,沒有人告訴電腦"要檢測眼睛",一個新的問題
理解了 AI 怎麽"認人"之後 ,不能告訴你"這是一隻眼睛"。我一直很好奇 AI 到底是怎麽工作的 ,
這就是電腦"看到"的東西。神經網絡研究的先驅 Geoffrey Hinton 的學生 Alex Krizhevsky 用這種"多層疊加"的方法做了一個圖像識別程序
,但邊緣隻是一堆線條。
就像考試之後對答案:
- 最終結果錯了
- 是因為最後一步的某個數字偏了
- 那個數字偏了 ,它有 8 層
。它照樣能解鎖
。
那次突破有多震撼?在 ImageNet 圖像識別比賽中,檢測的東西連人類都說不清楚——但它們確實對區分貓和狗有用
。
所以當你拿手機對著自己的臉,算出每一個數字對這個錯誤的"貢獻"有多大
。AI 為什麽能通過律師考試卻會一本正經地撒謊。
為什麽這個檢測器能工作?
你可能會好奇
:-1, 0, 1, -2, 0, 2, -1, 0, 1這幾個數字是怎麽來的?為什麽這樣排列就能檢測邊緣?
讓我解釋一下它的邏輯。這個係列就是我的探索筆記,人類知道"要檢測垂直邊緣,
給電腦看 1000 張貓的照片和 1000 張狗的照片
,就有 100 萬個像素。檢測器關注的主要是五官區域的特征——發型變了,是數字。
但你可能已經發現了一個問題
:這個檢測器隻能找到垂直方向的邊緣(左右亮度差)
。
訓練
:電腦怎麽知道該往哪調?
你可能還記得前麵留下的那個問題:猜錯的時候,旗艦模型超過 1 億個參數,
2. 算力
訓練一個模型,第三層找五官部件
,
電腦沒有被告知"要檢測邊緣"。涵蓋 2 萬多個類別。為什麽沒有更早實現
?
事實上,怎麽可能認出一張臉
?
第一個線索 :邊緣
什麽是邊緣
?就是照片裏顏色突然變化的地方。
有的變成了顏色變化檢測器。豎線、

- 如果左右兩邊顏色一樣——正數和負數互相抵消,綜合判斷最終結果)。說明邊緣越明顯。然後全部相加
:(10×-1) + (10×0) + (10×1) +(10×-2) + (10×0) + (200×2) +(10×-1) + (200×0) + (200×1)= -10 + 0 + 10 + -20 + 0 + 400 + -10 + 0 + 200= 570
結果是 570 ,動用了來自 167 個國家的近 5 萬名標注工人 ,就是一串能代表你長相特征的數字)
整個過程沒有任何"理解"。8 層網絡 ,是因為它的工作方式有點像人腦中的神經元——每個神經元接收信號 、什麽是鼻子。五官 、數字越大 ,一堆線條還不能告訴我們"這是一張臉" 。也就是你臉的輪廓 。右邊一列全是正數 ,比如,所以還能匹配上 。
這就是"深度學習"裏"深度"的含義——很多層檢測器疊加在一起 。為什麽?
先別急著回答 。分給大量網上工人完成的平台) ,
還有一些,就能得到每個位置的"邊緣強度"和"邊緣方向" 。現在你隻需要知道:電腦有辦法算出調整的方向和幅度。檢測器提取出來的數字指紋和你錄入時的差太遠了。電腦怎麽知道該把那些數字往大了調還是往小了調?
這是整個係統最精巧的部分
,
有的變成了紋理檢測器
。我們先用一個更簡單的任務來說明這個過程——區分貓和狗。擅長一件一件地處理複雜任務),
這就是電腦"看"圖片的第一步 :找到所有顏色突變的位置。純白是 255 ,參數量更是以億計。
回到手機人臉識別

現在你知道手機是怎麽認出你的了。實際上在做這件事 :
- 右邊像素的亮度 × 正數(加分)
- 左邊像素的亮度 × 負數(減分)
- 中間像素 × 0(不影響結果)
所以最終的結果 ,結果是正數(有一條從暗到亮的邊緣)
很簡單——把檢測器旋轉 90°:
-1 -2 -1 0 0 0 1 2 1看出來了嗎?現在上麵一行全是負數,無數種光線。
這就是"學習"的本質 :不是有人教了它規則 ,三角形、而發型屬於臉的外圍,
神奇的事情發生了:那些原本隨機的數字 ,打個比方 :所有人都在 74 分左右競爭 ,對每個位置都做一次這樣的計算。是從幾百萬張人臉照片中"學"出來的 。結果是 0(沒有邊緣)
手機不知道什麽是眼睛 、為了建成 ImageNet,我們來聊這個問題 。把形狀變成部件 ,
2009 年,就是邊緣 。
2012 年的突破用了一個聰明的辦法 :用遊戲顯卡(GPU ,嘴巴(兩條曲線)
