“現(xiàn)在的大語言模型沒有目標(biāo),也完全不具備真實體驗?!眻D靈獎得主、強化學(xué)習(xí)領(lǐng)域奠基人之一理查德.薩頓教授在近期舉行的“強化學(xué)習(xí)暑期學(xué)校”結(jié)業(yè)儀式上表示。該暑期學(xué)校由上海創(chuàng)智學(xué)院、上海交通大學(xué)人工智能(885728)學(xué)院與Openmind研究院聯(lián)合主辦。這也是身為Openmind研究院首席科學(xué)家的薩頓首次在中國系統(tǒng)、完整地講授其強化學(xué)習(xí)學(xué)術(shù)體系。在薩頓看來,心智的核心在于體驗交互,而當(dāng)下主流人工智能(885728)范式完全忽略了這一點。他所定義的體驗,是指與真實世界進行交互。心智存在的全部意義,就是從現(xiàn)實世界中獲取反饋。但如今,反饋往往被簡化為“獎勵信號”,系統(tǒng)的目標(biāo)就是最大化這個標(biāo)量數(shù)值,這套簡化邏輯并不貼合真實心智。他直言,現(xiàn)在的大語言模型并不在意人類的真實訴求,只專注于模仿人類文本。而真正的心智,會主動掌控、理解自身體驗,主動預(yù)測并干預(yù)外部世界。(解放日報)
