根據外媒報導,史丹佛大學開發出一款創新的電腦視覺 AI 模型,實現了「功能對應」(functional correspondence)的關鍵突破。此模型不再只會「辨識」物體,更能深入「理解」物體各部件的「真實功能」(例如壺嘴是用來傾倒),並能在不同物體間(例如水壺和瓶子)建立像素級(pixel-by-pixel)的精確對應。這項技術有望讓未來的自主機器人懂得「舉一反三」,更有效地選擇和使用工具。
傳統的 AI 電腦視覺僅止於「物體辨識」,但要讓機器人理解「麵包刀」和「奶油刀」刀片的功能差異,一直是業界的最大挑戰之一。史丹佛即將在 ICCV 2025 會議發表的新模型,正攻克了此難題。
論文共同第一作者 Stefan Stojanov 解釋,模型能理解玻璃瓶和茶壺都有用於「傾倒」的出口。未來,機器人將能類比此技能,例如將使用小鏟子的經驗轉移到鐵鍬上,以不同的工具完成相同任務。
過去的挑戰在於缺乏足夠的標註數據。要人工標註跨越兩個不同物體的數千個像素,既不切實際成本也過高。
史丹佛團隊的關鍵在於採用「弱監督」(weak supervision)學習,利用視覺語言模型(vision-language models)自動生成標籤來識別功能部件,再由人類專家進行品管。這種高效、低成本的訓練方法,實現了以往監督式學習難以達成的成果。
舉例來說,水壺壺嘴的每個像素,都能與瓶口的像素精確對齊,實現了「密集」(dense)的功能對應,而不像過去只能做到「稀疏」的關鍵點對應。
研究人員總結,這項進展正推動 AI 從單純的「模式識別」轉向「推理」。過去的模型只看到像素,而新的系統則能推斷其「意圖」。
團隊表示,教會機器透過「功能」和「實用性」的視角來看待世界,將使電腦視覺不再只關注模式,而是更關注「實用價值」。


