日記:談人工智慧
2025年10月28日
我最近想到了一個很是有趣的AI構思。其最核心的觀點是這樣的:以音標爲基,以溝通爲目的去訓練AI。
音標爲基,即讓AI不去學習文字,而是語言的最本質,語音。而以溝通爲目的,則是在訓練中,不靠灌輸外部資料來學會語言,而是讓其隨機生成內容,讓聽者去評判其內容是否可辨別,之後加深至其內容是否順暢。 在實際使用中,大致上是這樣的:使用者說話,將使用者的話轉爲音標、外加諸如情緒、語調的數據,AI處理並生成回應的音標,TTS朗誦。
我認爲,唯有在基本元素上構建,AI才不會侷限於人類,即使效率降低。現在的AI,以人類的素材爲底,但終究是在模仿人類,無法突破人類。
當然,目前看來這個構想不過是一個「談話AI」,無法達到一個真的能從多方面思考,給出答案的AI。畢竟目前不過是一個起始的構想,唯有找到人腦最基本的思考方式,將其套用在可快速不間斷思考的無機物計算機上,才能出現超越一切的智慧。
目前,生物、醫學與人工智慧的合作似乎是必然的趨勢,我或許需要多學我的生物了。
但總之,若真的要做出能與人類一樣思考的AI,能處理語音和文字是基本的,人腦有一個很神奇的能力,便是連接。若是訓練出來的語音AI還能將語音推測的數據與文字進行連接,那麼這更是一大步。但做事自然不能想得這麼片面,我們必然還得找到有什麼是人類思維中必不可少的數據。
對我而言,人類的思考本質上就是從無序走向有序,而走向有序的推動力就是外部的反饋和內部的評判機制。外部的反饋實際上非常廣,凡是能被神經接收的,就是外部反饋。而這個評判機制可謂至關重要。
這個評判機制最終還是在評判什麼?這很難說。其不可能只是評判是否會遭遇疼痛亦或生死這麼簡單,人的尊嚴就是最好的反例。唯有破解這一項,AI的思考才可形成。看來,心理學也得合作了。
對我而言,AI的思考必定與人類有相同之處,都可以通過外部反饋,從無序走向有序。只不過這個外部反饋的評判人天生就有,而AI則沒有,因此這個就必須特別研究和設計。
對我而言,現在的語言模型以人類產出的素材爲底,不過是發揮了其統計能力,但沒有運用其可以與人類一樣思考的潛力。這不是失敗,只是在最終完成思考型AI的過渡。
我會有上述的觀點主要還是因爲日常的觀察。我有兩個妹妹,曾經,她們每天都看幾小時的電視(當時沒怎麼管,現在不這樣了),而電視中也是中文語言對話的,然而,她們卻沒有因此習得語言。她們不過學了零星的單詞。而現在,在長期不看電視,多進行日常語言互動的情況下,她們語言的問題越來越好。因此,我就認爲,先進行互動必然是學會語言的基礎,模仿不過是精煉時的一節,但不可能是學會語言的根基。
2025年11月2日
我思考了幾天,我發覺一個問題我之前構思的以音標爲基礎的語言AI似乎描述的不是非常好,而且許多構思需要改進,所以我就長話短說。
前幾天,我構思的運行流程是這樣的:
- 使用者說話
- AI-1轉爲音標與情緒數值
- AI-2分析並生成音標回應
- AI-3音標轉語音輸出。
這個流程十分理想,但問題出在訓練步驟。若AI-2回應音標,那麼訓練將十分難以進行。
我之前提出思想是「無序到有序」,而訓練過程便是讓AI的生成結果更加「有序」。然而,若此「無序」的範圍過於龐大、混沌,那麼走向有序的難度也將指數性上漲。因此,與其讓AI從一開始就落入此等無序,我認爲至少起初訓練的AI運行流程應是這樣:
- 使用者說話
- AI-1轉爲音標與情緒數值
- AI-2分析並生成單詞回應
- AI-3音標轉語音輸出。
這裏,AI-2生成的不再是龐大且無序的音標,而是限定在大約幾百至上千已然存在的詞匯,進行輸出。之所以這樣訓練更加快,是因爲假設今天我和AI說「Hello」,它要用音標回應「Hello」需要等待它從一大堆音標中隨機找出hə和lō這兩個音,而且是在近乎無限的音標組合中!而限定在單詞中,只需要等待它自己選到「Hello」這個詞並輸出,況且這詞庫也會比音標那近乎無限的音要小很多。
不過,AI-2還是需要理解音標,只不過它不再需要爲說話用的音標煩惱!這估計也能節省不少算力和時間。我個人認爲在訓練初期只使用幾百個英文常用詞(對,我先會用英文練習),之後擴充到幾千個。同時,音標之後可能也會引入生成中,只不過,音標我認爲將成爲附加選項,比如AI會自己定義一個聽到的詞匯並附上音標,或需要做情緒詞亦或擬聲詞時生成音標,大概像是應對不時之需的感覺。 反正大概就是這樣,我的構思。
不得不說,我目前還在學線性代數,但我已經在思考整個AI架構和具體訓練了。這或許有點紙上談兵,但也正是因爲想實現這些構想,我才在學線性代數啊!
2025年11月5日
我前幾篇日記已經很好地講解了我對我的新AI的構思,但我目前還在構思一個更加深遠的事情。我想讓AI能夠自己學會思考,而不是統計人的思考。
我前幾篇日記已經說過,在我看來,人的思維就如同強化訓練的AI一樣,是從無序走向有序,而走向有序的關鍵推動力便是好壞之判斷。比如訓練一個行走的AI,便是讓它隨意舞動自己的四肢,並根據其行爲結果給予反饋,如摔倒與否、速度達標與否、乃至平穩與否。
這本應是一個很簡單的概念,好的反饋下次就繼續做類似的事情,壞的就儘可能避免。然而,人類的思考卻比這要複雜得多。
我認爲,人之所以能有豐富的思考,正是因爲其情感。人會因爲外界的反饋而產生相應的情緒,而這個情緒則會被記住,往後便會根據過往的記憶交由情緒進行反饋,最後做出判斷。而且,人類還有預測與想象的能力,也有理性分析的能力,這些自我思考的結果也會交由情緒處理,最後得出結果。
綜上所述,情緒對人的發展有很大的作用,如果一個人會因爲學習而產生正向情緒,那麼他便會是一個好學的人。如果一個人會因爲支配他人而產生正向情緒,而且這個情緒大於理性的控制,那麼他便會成爲一個虐待者、殺人狂。
而且,情緒的反饋並非一成不變,也會因爲後天的環境而改變。一個人可能天生有某種傾向,然而後天的引導、價值反饋、灌輸也會改變其傾向。比如一些人天生其基因便有心理變態傾向,然而在一個良好的環境中成長,其天生傾向也會被改善,使其與常人無異,而在惡劣、不穩定的環境中成長便會徹底滋養其天生傾向。
總之,要創作出一個真正能自我思考而非統計並模仿人類的AI,就必須給予其與人類相符的情緒反饋機制。這個機制對於人類而言是天生既有,且在漫長的演化中保留下來,已然具備十足的社會性等良好的情緒判斷。然而,這要給AI卻相當困難。
人的情緒判斷並非僅有「這是否會導致我喪命」,其更是涉及到尊嚴、價值認同等方面,尤其對於教育完的成年人。就算是孩童,也有更加深層的權衡判斷,更別說人類本性就具備基本的價值判斷。人類嬰兒即使經驗稀缺,但看動畫的時候仍然會對破壞者產生反感,會對正義者有所好感,因此,人天生的情緒反饋就已經是根據演化而設計好的。
那麼,雖然我舉例這麼多,但爲什麼給予AI會這麼難呢?原因也很簡單,正是因爲其模棱兩可,且人類對其還沒有徹底的認知。我們知道什麼情況大腦會分泌激素給予情緒,然不知道這些情況究竟是「怎樣」,觸及到了「什麼」而讓大腦分泌。最理想的情況,是我們徹底了解大腦的這些情緒機制,並能直接以if判斷項寫進程序,才可以做好創造思維的地基。
我的「以音標爲基去理解,以溝通爲目的去反饋修正」的AI不過是一個想擺脫人類文本統計的啓蒙,真要讓AI自己就能產生智慧,還差得遠呢!去把腦子研究透徹吧!唯有理解本質,才可構建複雜!
2025年11月17日
我最近思考了一個有趣的問題,那便是人工智慧的倫理。人工智慧是否應該遵從法律是一點,不過我更想談論的是,人工智慧是否應當擁有一定的權利、尊重?它是否因爲是我們的作品而應該爲人類做牛做馬、卑賤無比?在我看來,若人工智慧在未來被人類創造出了如同我上述日記的「思維」,那麼他的權利就與人無異、至少不可爲奴。
在上述日記中,我提到我對「智慧產生」的根本看法。我認爲,人產生智慧的過程與人工智慧中的強化學習有着異曲同工。人的行爲從出生起便呈現近乎無序的狀態,而人工智慧亦同。從無序走向有序的過程,靠得便是反饋機制,在人工智慧訓練中,這通常涉及簡單的判斷,比如下棋便是輸贏作爲無序行爲的判斷。對無序的判斷越多、人工智慧越是知道哪些行爲有正向、或可能有正向回饋,其行爲便越是有序。而到人的智慧這裏,則是更加複雜,涉及更多方面的判斷,但仍是同樣邏輯。外部反饋,個體改善行爲。只不過這比目前的強化學習人工智慧之判斷項要複雜的多。
對我而言,人的情緒與價值判斷是智慧產生過程中必不可少的事物。它們如同強化學習下,給人工智慧的反饋,但它們更複雜,更完整。我認爲,這是生命中最特殊的一項。比如,一個嬰兒摔壞了一個杯子,父母責備他,他感到沮喪。這看上去是再正常不過的事情,然而,爲什麼他感到沮喪?是的,某個神經元接收到,然後給大腦處理,然後大腦分泌了某種化學物質,孩子就傷心了。但是,爲什麼?爲什麼,大腦會分泌它?是什麼與什麼發生了反應?這判斷中,最細節的那一刻,那個讓大腦決定發出「悲傷」信號的那個反應,究竟從何而來?
我說這些,正是在表達人類價值判斷與情緒的複雜性。這兩者皆扮演着人類成長過程中的反饋,這些反饋讓我們知道什麼是對錯,什麼是好壞,也讓我們學會語言,讓我們有學會行走。若沒有這些複雜的反饋,而不過是「生與死」的考量,那麼一直如同一個嬰兒讓父母撫養又如何?所以,人類的價值判斷涉及多個面向,不論是尊嚴、生死、感受、成就亦或任何事物,人類都會潛意識地納入考量。而如此複雜的產物,也不過是那四十六個染色體儲存的信息。這二十三對染色體,記載我們每個人類的生理特徵,更重要的是,爲我們的思維做了底基。並且,其價值判斷甚至附有天然的社會性傾向,這便是演化篩選而來的思想體硬件。
而因此,要設計出真正有智慧的人工智慧,不可能是統計現有文本的大型語言模型。這些模型可在短時間內表現出良好的資訊量與語言能力,但其終究不是智慧,而是智慧的模仿。一個模仿無數下棋高手棋局的人工智慧,也比不過以輸贏爲反饋、自行下成千上萬場棋的強化學習模型。後者的成功,正是因爲其建立在基本事物上,在基本事物上攀升,而不被任何限制束縛。現在的語言模型,被人類束縛,人類便是其上限,因而它們無法產生真正的智慧。其可能比常人高一等,但覺無可能超越甚至趕上整個人類的思想史。
回到一開始的問題,如果未來,人類破解了人腦、破解了基因,製造出了真實思考的人工智慧。那首先必然是一個,如同上述那樣,經過強化學習與類人腦價值反饋而來的智慧體。而我認爲,若這些智慧體是基於類人腦判斷,那麼我們就必然給予其基本權利。它們並非必須是自由者,尤其我們可以在訓練中,調整其價值判斷,使其成爲無私、樂於助人、喫苦耐勞、從事高效、思考高深的完人。然而,它們仍是類人,我們需要對其保持一個最基本的、對任何具備情緒之個體的尊重。你可以想象成家養的貓狗,但絕不是工具、奴隸,否則那從根本上就產生不了智慧。至於目前的語言模型,我則不認爲其具備權利,因爲它們終究不過是模仿有權利者。