搜尋

會員登入

搜尋

導覽

會員
廣告
廣告

AI「相變」新證據 Transformers從詞序推理突變為語意理解

瀏覽次數:2087

大利 SISSA Medialab 與瑞士 EPFL(洛桑聯邦理工學院)聯合研究,首次從理論角度驗證:「Transformers」神經網路在訓練過程中會出現如同物理相變的轉折點,初期階段以「位置」為依據理解語句,當訓練資料量足夠後,模型會突然切換到以「語意」為核心的理解方式。此突破性發現有助於打造更高效、安全且具可預測性的 AI 模型。

Transformers 是目前自然語言處理(NLP)主流模型,其深層自注意機制可同時處理語句中的位置訊息與內容語意。過去研究多以實務觀察方式指出位置/語意機制的切換,然而該機制何時且如何觸發一直不明顯。

為填補知識黑洞,SISSA Medialab 與 EPFL 的 Hugo Cui、Freya Behrens、Florent Krzakala 和 Lenka Zdeborova 等人在 arXiv 發表研究,透過「可解析的自注意力模型」(dot-product attention),證明具有位置編碼(positional encoding)的 Transformers 在接近某臨界資料量後,會以類似相變(phase transition)的方式重構其注意機制:從純位置相依切換到語意相關權重結構,並以封閉形式描述這一臨界行為。

根據研究,當訓練樣本與資料維度比例達到某特定臨界值後,全局最小化的 loss landscape 將從「位置相關注意」態翻轉為「語意相關注意」態,這意味模型能跳脫對詞序依賴,開始理解句子語意結構。研究團隊透過理論解析與模擬驗證,畫出臨界切換線,清晰揭示兩種機制間的「相變」關係 。

超大規模資料中心重塑AI基礎設施
特別企劃半導體AI

超大規模資料中心重塑AI基礎設施

為了增加資料傳輸的速度、距離和效率,AI生態系統正在探索射頻(RF)矽中介層技術,以實現互補式金氧半導體(CMOS)、雙極互補式金氧半導體(BiCMOS)與三五族材料的異質整合。

為了增加資料傳輸的速度、距離和效率,AI生態系統正在探索射頻(RF)矽中介層技術,以實現互補式金氧半導體(CMOS)、雙極互補式金氧半導體(BiCMOS)與三五族材料的異質整合。