[人工智慧導論](https://app.notion.com/p/3e6fc631b0308131b213f0a3d93fe91d) › [W1(9/10)](https://app.notion.com/p/3e7fc631b03081309a2adad7f8ae1e27) › 04|影片 [2:07:29–2:31:14](https://www.youtube.com/watch?v=KWGgi100YLY&t=7649s)|投影片 Ch1 p.22–30|上一章 [03 AI 歷史:誕生與兩次寒冬(1:49–2:07)](https://app.notion.com/p/3e7fc631b03081879ed7e12de51a94f8)|下一章 [05 Agent、理性與任務環境(2:42–2:59)](https://app.notion.com/p/3e7fc631b0308166ab40e7f402602f69) ## 重點 - 第二次寒冬期間研究沒停:1980 年代反向傳播被重新發明,神經網路(連結學派)一度很熱門;接著機率方法接手,1990 年代神經網路反而冷掉。 - 2012 年 ImageNet 比賽,Hinton 團隊用 CNN 把錯誤率一口氣降了將近 10%。方法其實很老,成功靠三個新條件:大量資料、GPU 算力、新的訓練技巧。 - AI 能把人從重複工作中解放、大幅提高生產,但也有六種風險。老師說這件事未來會越來越重要。 ## Exam-ready - **Back-propagation**: "In the mid-1980s at least four different groups reinvented the back-propagation learning algorithm first found in 1969 by Bryson and Ho."(Ch1 p.22) - 中文:1980 年代中期,至少四個不同的團隊重新發明了反向傳播學習演算法;這個方法其實 1969 年就被 Bryson 和 Ho 提出過。白話:好方法第一次沒人注意,十幾年後被好幾組人各自再想出來。難字:reinvented(重新發明)、back-propagation(反向傳播)。 - **Connectionist models**: "These so-called connectionist models of intelligent systems were seen by some as direct competitors both to the symbolic models promoted by Newell and Simon and to the logicist approach of McCarthy and others (Smolensky, 1988)."(Ch1 p.22) - 中文:這些所謂「連結學派」的智慧系統模型,被一些人視為直接的競爭者,對手有兩個:Newell 和 Simon 推動的符號模型,以及 McCarthy 等人的邏輯學派。白話:做神經網路的一派,跟「寫符號規則」「用邏輯推理」的兩派互相較勁。難字:connectionist(連結學派)、symbolic(符號的)、logicist(邏輯學派的)。 - **Probabilistic reasoning and machine learning**: "Approaches incorporating probability rather than Boolean logic, machine learning rather than hand-coding, and experimental results rather than philosophical claims."(Ch1 p.23) - 中文:新的做法用機率取代布林邏輯、用機器學習取代人工手寫規則、用實驗結果取代哲學主張。白話:不再只分對錯、不再靠人寫規則、不再空談,拿數據說話。難字:Boolean logic(只有真/假的布林邏輯)、hand-coding(人工手寫)。 - **Hidden Markov models (HMMs)**: "In the 1980s, approaches using hidden Markov models came to dominate the area of speech recognition."(Ch1 p.23) - 中文:1980 年代,使用隱藏式馬可夫模型的方法主宰了語音辨識領域。白話:那時做語音辨識,幾乎人人都用 HMM。難字:dominate(主宰)、speech recognition(語音辨識)。 - **Bayesian networks**: "In 1988 Judea Pearl’s development of Bayesian networks yielded a rigorous and efficient formalism for representing uncertain knowledge as well as practical algorithms for probabilistic reasoning."(Ch1 p.24) - 中文:1988 年 Judea Pearl 發展出貝氏網路,提供一套嚴謹又有效率的形式,用來表示不確定的知識,也提供實用的機率推論演算法。白話:把「不確定」的事情用機率畫成圖,還能拿來推算。難字:formalism(形式化的表示法)、uncertain knowledge(不確定的知識)。 - **Big data / ImageNet**: "The availability of tens of millions of images in the ImageNet database sparked a revolution in the field of computer vision."(Ch1 p.25) - 中文:ImageNet 資料庫提供了數千萬張影像,引爆了電腦視覺領域的革命。白話:有了超大的看圖題庫,機器看圖的能力突飛猛進。難字:sparked(點燃、引發)、computer vision(電腦視覺)。 - **Deep learning**: "The term deep learning refers to machine learning using multiple layers of simple, adjustable computing elements."(Ch1 p.26) - 中文:深度學習指的是用很多層簡單、可調整的計算單元來做機器學習。白話:把很多層小小的神經元疊起來,一邊看資料一邊調整。難字:multiple layers(多層)、adjustable(可調整的)。 - **2012 ImageNet competition**: "In the 2012 ImageNet competition, a deep learning system created in Geoffrey Hinton’s group showed a dramatic improvement over previous systems."(Ch1 p.26) - 中文:在 2012 年的 ImageNet 比賽中,Geoffrey Hinton 團隊做的深度學習系統,比以前的系統有大幅的進步。白話:這一年深度學習一戰成名。難字:dramatic improvement(大幅進步)、previous(先前的)。 - **Benefits of AI**: "Benefits: the potential for AI and robotics to free humanity from repetitive work and to dramatically increase the production of goods and services could presage (預示) an era of peace and plenty."(Ch1 p.30) - 中文:好處是 AI 和機器人有潛力把人類從重複性的工作中解放出來,並大幅提高商品與服務的產量,這可能預示一個和平富足的時代。白話:無聊的工作交給機器,東西變多,大家過得更好。難字:repetitive(重複的)、presage(預示)、plenty(富足)。 - **Risks of AI**: "Lethal (致命的) autonomous weapons", "Surveillance and persuasion", "Biased decision making", "Impact on employment", "Safety-critical applications", "Cybersecurity"(Ch1 p.30)【老師強調】(2:27:06) - 中文:AI 的六種風險:致命的自主武器、監控與操弄、有偏見的決策、對就業的衝擊、安全關鍵的應用、資訊安全。白話:AI 可能被拿來殺人、盯人、不公平地判人、搶工作,用在出錯會出人命的地方,或被拿來入侵系統。難字:surveillance(監控)、persuasion(說服、操弄)、biased(有偏見的)。 ## [2:07:29](https://www.youtube.com/watch?v=KWGgi100YLY&t=7649s) 反向傳播與連結學派 1980 年代末進入第二次寒冬,但研究的人沒有停。1980 年代中期,至少四個團隊各自重新發明了 back-propagation(反向傳播:讓神經網路從錯誤回頭修正自己的學習方法)。為什麼要「重新」發明?因為 1969 年 Bryson 和 Ho 就提過,只是當年資訊不流通,大家不知道彼此在做什麼。 要先懂的兩件事。第二次寒冬:1980 年代末,專家系統公司做不到當初誇大的承諾,資金撤走、公司一家家倒閉(第 1 週 [03 章](https://app.notion.com/p/3e7fc631b03081879ed7e12de51a94f8)學過)。神經網路(neural network):很多個小計算單元(叫神經元)一層接一層連起來,每條連線上有一個可以調的數字,叫權重(weight);「訓練」或「學習」就是拿資料一直調這些權重,讓答案越來越準(第 1 週 03 章學過:1943 年 McCulloch 和 Pitts 最早把神經元寫成數學模型)。 相信神經網路的學者叫 connectionist(連結學派),因為神經網路就是很多神經元「連」在一起;他們跟符號學派、邏輯學派各用自己覺得合理的方式做 AI,互相競爭。生活比喻:三家餐廳比賽做菜,一家照食譜條文做(符號),一家從化學原理推(邏輯),一家讓學徒一直試吃、慢慢調味(連結)。 符號學派和邏輯學派是什麼(第 1 週 [02 章](https://app.notion.com/p/3e7fc631b03081509ff5e74454b69167)、03 章學過):符號學派(Newell 和 Simon)認為思考就是照規則搬動符號;邏輯學派(McCarthy 等人)把知識寫成邏輯式,照推論規則一步步推出答案。這兩派都靠人把知識寫進去,連結學派則讓機器自己從資料學。 考試可能怎麼問:What is a connectionist model, and what did it compete with? 下面這張圖是神經網路的起伏,這一章會一路走到最右邊。 ```mermaid flowchart LR A["1969 Bryson 和 Ho 最早提出反向傳播"] --> B["1980 年代中期 四個團隊重新發明"] B --> C["1980 年代 神經網路很熱門"] C --> D["1990 到 2000 年代 效能上不去而冷門"] D --> E["2012 深度學習爆發"] ``` 先熱、再冷、再大爆發。老師說很多剛退休的資深教授,1980 年代念博士時都碰過神經網路,就是因為當年它很紅。 下面「進階」摺疊在做什麼(白話):用一個只有一個權重的最小網路,示範反向傳播的三步——先算答案錯多少、再回頭算這個權重該往大調還是往小調、最後調一點。算完預測從 1 變成 1.8,更接近正確答案 3。看懂這句就夠了,算式可以跳過。
用生活例子講,反向傳播在做什麼? 像射飛鏢。丟偏了,你會回頭想:是手腕、手肘還是肩膀出了問題,然後各修一點。 反向傳播做的是同一件事:先看「最後答案錯多少」,再從輸出端一層一層往回算,每一層該為這個錯負多少責任,就調多少。老師說之後的課會正式講。
它到底怎麼運作?(進階,可跳過) 最小的網路:只有一個權重 w=0.5,輸入 x=2,正確答案 t=3(用平方誤差的一半當扣分)。 1. 往前算:預測 y=w×x=1,差了 y−t=−2。 2. 往回算責任:扣分對 w 的斜率=(y−t)×x=−4。負的,代表 w 應該變大。 3. 更新:學習率 0.1,w 變成 0.5−0.1×(−4)=0.9。再算一次 y=1.8,離 3 更近了。 多層網路就是把第 2 步從最後一層往前一路傳下去,所以叫「反向」。
## [2:09:50](https://www.youtube.com/watch?v=KWGgi100YLY&t=7790s) 機率推論與強化學習 1980 年代末大家發現,很多知識寫不成規則,是因為事情本來就不確定,或資訊根本不夠。所以 AI 開始用機率處理不確定性,用機器從資料中學,取代人工手寫規則;大家也開始用同一套公開題目(benchmark)比成績。為什麼機率比規則好?規則只能說「一定是」或「一定不是」,真實世界多半是「大概七成是」。 幾個名詞先講清楚。機器學習(第 1 週 [01 章](https://app.notion.com/p/3e7fc631b0308121979ae73e99cd24d0)學過:不寫規則,餵資料讓電腦自己找出規律)。機率(probability):用 0 到 1 之間的數字表示「有多可能」,0 是不可能、1 是一定。布林邏輯(Boolean logic):只有「真」和「假」兩種答案的邏輯。 生活比喻:天氣預報說「降雨機率 70%」,比硬說「明天一定下雨」誠實又有用。 考試可能怎麼問:Why did AI shift from Boolean logic to probability in the late 1980s? 下面這張圖是「為什麼引入機率」和三個代表作。 ```mermaid flowchart TD A["很多知識寫不成規則"] --> B["原因:不確定、資訊不足"] B --> C["引入機率"] C --> D["HMM:語音辨識第一次可行"] C --> E["Bayesian network:Pearl 1988"] C --> F["強化學習接上 MDP:Sutton 1988"] ``` 這三個都屬於投影片說的「機率推論與機器學習」這一波(1987 年起)。1990 年代到 2000 年初,神經網路效能上不去,大家都不太講了;市場幾乎被機率模型(HMM、Gaussian Mixture Model)和後來的 Support Vector Machine(SVM,支援向量機)佔光。老師補充:Pearl 後來拿到 2011 年的 Turing Award(圖靈獎,電腦科學最高榮譽)。
要先懂什麼?HMM、Bayesian network、強化學習各是什麼? - HMM(hidden Markov model,隱藏式馬可夫模型):你看不到真正的狀態(說話的人正在發哪個音),只看得到線索(聲波),模型根據線索猜背後最可能的狀態。它靠嚴謹的數學和大量真實語音訓練出來。投影片特別提醒:沒有人主張人類是用 HMM 聽懂話的,它是工程方法,不是在模仿大腦。 - Bayesian network(貝氏網路):把「誰影響誰」畫成箭頭圖,每個箭頭帶機率。例:感冒 → 發燒;看到發燒,就能回推感冒的機率。 - 強化學習(reinforcement learning):做對給獎勵、做錯扣分,讓機器自己試出好策略,像用零食訓練狗。MDP(Markov decision process,馬可夫決策過程)是描述「狀態、動作、獎勵」的數學框架,原本來自作業研究(operations research)。Sutton 把兩者接起來。
老師原話是什麼? 老師回憶 1996、97 年試用 IBM 的語音辨識軟體(老師記得叫 ViaVoice),當時用 HMM 做得最好的是 CMU(卡內基美隆大學)和 IBM: 「就是100個英文字大概辨識出30個字已經全世界最強了」(2:11:26) 在 HMM 出來以前,講 100 個英文字可能辨識不出幾個。
## [2:12:54](https://www.youtube.com/watch?v=KWGgi100YLY&t=7974s) 大數據時代 1990 年代後期網際網路普及,網頁資料爆量,2000 年後進入 big data(巨量資料)時代,AI 有更多資料可以學。投影片說,運算能力進步加上 WWW,才造得出超大資料集,也催生了專門利用大資料的學習演算法。投影片也說 ImageNet 資料庫的數千萬張標註影像,引爆了電腦視覺的革命(注意:老師口頭說的是「幾百萬張」)。2011 年 IBM 的 Watson 在美國益智節目 Jeopardy! 打敗人類冠軍,靠的是背後大量資料加上快速檢索。 名詞補充(我補充):WWW(World Wide Web,全球資訊網)就是平常用瀏覽器看的網頁。電腦視覺(computer vision)是讓電腦看懂圖片和影片的研究領域。 為什麼資料量這麼重要?機器學習是「從例子學」,例子越多,看過的情況越多。生活比喻:考前寫過一百份考古題的人,比只寫過三份的人穩。 考試可能怎麼問:How did big data contribute to the progress of AI? Give an example.
什麼是「標註」(label)?為什麼 ImageNet 這麼關鍵? 標註就是每張圖旁邊都有人寫好答案,例如「這是貓」「這是車」。機器猜完,才能對答案、知道自己錯在哪。 ImageNet 由李飛飛團隊建立,並主辦影像辨識比賽。2000 到 2010 年最熱門的主題是 big data,但 ImageNet 這個資料集後來點燃的是深度學習(下一段)。
## [2:14:33](https://www.youtube.com/watch?v=KWGgi100YLY&t=8073s) 深度學習爆發與 AlphaGo Deep learning(深度學習)就是用很多層簡單、可調整的計算單元做機器學習,說穿了就是類神經網路。ImageNet 比賽往年最強的隊伍,每年只把錯誤率降一到三個百分點;2012 年 Hinton 團隊用 CNN(convolutional neural network,卷積神經網路,擅長看圖的神經網路)一口氣降了將近 10%。大家一查,竟是 1980 年代乏人問津的老方法。2015–2016 年的 AlphaGo 結合強化學習和深度學習,課本的歷史寫到這裡為止。 名詞補充(我補充):「深度」指的是層數。資料從第一層進去,每一層算完把結果交給下一層,層數很多就叫「深」。錯誤率是「猜錯的比例」,降將近 10 個百分點,大約像從四張猜錯一張,進步到六張才猜錯一張。AlphaGo 是 DeepMind 做的圍棋程式,2016 年打敗世界頂尖棋士李世乭。 老方法為什麼 2012 年才成功?神經網路要大量資料才學得好,大量資料又要大量計算,1980 年代兩樣都沒有。生活比喻:食譜沒變,只是終於有了夠多的食材(資料)和夠大的烤箱(GPU)。 考試可能怎麼問:Why did deep learning succeed in 2012 even though neural networks were an old idea? 下面這張圖是 2012 年同時湊齊的條件。 ```mermaid flowchart LR A["大量標註資料 ImageNet"] --> D["2012 CNN 錯誤率大降"] B["GPU 算力"] --> D C["新的訓練技巧"] --> D E["老方法:類神經網路"] --> D D --> F["深度學習時代"] F --> G["AlphaGo:強化學習加深度學習"] ``` GPU(顯示卡)原本是給遊戲算 3D 畫面的,Hinton 團隊拿它來加速神經網路訓練。注意:老師在 2:15:14 附近口頭說訓練出「語音辨識模型」,前後文講的是 ImageNet 影像辨識。
用生活例子講,CNN 在做什麼? 像拿一個小放大鏡在圖上一格一格掃。第一層找邊線,下一層把邊線組成形狀(眼睛、輪子),再下一層認出整個物體(貓、車)。 投影片說 CNN 在 1990 年代已經在手寫數字辨識上有些成功;2012 年之後,深度學習在某些視覺任務上甚至超過人類。
## [2:18:15](https://www.youtube.com/watch?v=KWGgi100YLY&t=8295s) 老師推薦的三本 AI 故事書 老師推薦三本好看的 AI 故事書,投影片 p.27 只放了書評引言,出版順序由舊到新。三本合起來,像把前面的歷史拍成連續劇,Hinton、李飛飛、Hassabis 輪流當主角。 考試可能怎麼問:這是課外閱讀,比較不像考點(我判斷)。 | 書 | 主角 | 老師提到的重點 | |---|---|---| | 《AI 製造商沒說的祕密》 | Hinton 等 AI 先驅 | 老師說書名跟內容不太符,就是好看的 AI 發展史。第一幕:2012 年 Hinton 到 NeurIPS 會議,在飯店房間等 Google、Microsoft、百度、DeepMind 競標他的公司,最後賣給 Google;DeepMind 後來也賣給 Google。 | | 李飛飛自傳 | 李飛飛(史丹佛教授,被稱為「AI 教母」,ImageNet 推手) | 在中國出生、到美國求學,先在 Princeton 後到 Stanford 任教;書裡寫到 2012 年錯誤率驟降的現場,也有照顧生病母親、醫療照護的人文關懷。曾在 Google 擔任首席科學家,現在創立公司 World Labs。 | | Demis Hassabis 傳記(今年六月出版) | DeepMind 創辦人 | 想做對人類有益的 AGI(Artificial General Intelligence,通用人工智慧);用深度學習做出 AlphaFold,解開蛋白質 3D 摺疊問題,得到 2024 年諾貝爾化學獎(年份我補充)。 | 蛋白質摺疊是什麼(我補充):蛋白質是一長串小分子(胺基酸),會自己捲成特定的立體形狀,形狀決定它在身體裡做什麼。以前要做好幾年實驗才測得出一個形狀,AlphaFold 用深度學習直接預測出來。 ## [2:24:18](https://www.youtube.com/watch?v=KWGgi100YLY&t=8658s) 現況數據(其實不新) 投影片標題寫「The State of the Art (not really)」:這些是 2019 年以前的數據,課本 2020 年出版,老師說現在早就不止。為什麼寫 not really?state of the art(目前最好的水準)一直在變,課本印出來那天就開始過時。生活比喻:像翻一本 2019 年的手機評比,方向對,數字早就舊了。 名詞補充(我補充):NeurIPS 是 AI 領域規模最大的學術研討會之一,研究者每年在這裡發表最新成果。 考試可能怎麼問:比較不像考點;頂多問 AI 在哪些任務已經追上人類(我判斷)。 | 項目 | 投影片數據(Ch1 p.28–29) | 補充 | |---|---|---| | Publications | AI 論文 2010–2019 年增加 20 倍 | 老師說有了 ChatGPT 之後絕對不止 20 倍 | | Conferences | NeurIPS 參加人數自 2012 年增加 800% | 老師說門票像搖滾演唱會一樣秒殺 | | Students/Industry | 修課人數比 2010 年美國增加 5 倍、國際增加 16 倍;美國 AI 新創增加 20 倍,超過 800 家 | 老師說修課的人大幅成長,新創大家都知道 | | Sentiment/Diversity | 約 70% AI 新聞語氣中立,正面報導從 2016 年 12% 升到 2018 年 30%;全球 AI 教授約 80% 男性、20% 女性 | 老師沒有講 | | Internationalization | 中國每年論文數超過美國,約等於全歐洲 | 注意:老師口頭說的是「超過美國跟歐洲加起來」 | | Vision | 物體偵測錯誤率從 2010 年 28% 降到 2017 年 2%;開放式看圖問答(VQA)準確率自 2015 年從 55% 升到 68% | 視覺、語言各領域都大幅進步 | | Speed/Language | 影像辨識的訓練時間兩年內縮短為百分之一;SQuAD 問答的 F1 分數(兼顧答對與答全的分數)2015–2019 年從 60 升到 95 | | | Human benchmarks | 到 2019 年已在西洋棋、圍棋、撲克、小精靈、Jeopardy!、ImageNet 物體偵測、限定領域語音辨識等達到或超越人類 | | ## [2:25:33](https://www.youtube.com/watch?v=KWGgi100YLY&t=8733s) AI 的好處與風險 好處:AI 和機器人能把人從重複工作中解放,大幅提高商品與服務的產量。風險有六種(見下表)。老師說這件事今年越來越近在眼前:如果你把電腦的權限全交給 AI,到底會發生什麼事?課本只用一頁講,但他認為未來會越來越重要【老師強調】(2:27:06)。講完這頁,老師說第一章大致是「聊聊天」,真正的核心從後面的章節開始。 生活比喻:像把家裡所有鑰匙交給一個能力超強、但你不完全了解的管家。 「權限」是什麼(我補充):電腦允許一個程式做哪些事,例如讀你的檔案、上網、寄信。權限全交給 AI,它就能替你做這些事,也可能做錯、或做你不想要的事。 考試可能怎麼問:List the risks of AI and explain one of them. | 風險(Ch1 p.30) | 中文 | 白話例子(我補充) | |---|---|---| | Lethal autonomous weapons | 致命自主武器 | 不用人按按鈕、自己決定攻擊目標的武器 | | Surveillance and persuasion | 監控與操弄 | 大規模追蹤個人行為,或用精準推播改變人的想法 | | Biased decision making | 有偏見的決策 | 用帶偏見的歷史資料訓練,審貸款或履歷時不公平 | | Impact on employment | 就業衝擊 | 重複性工作被自動化取代 | | Safety-critical applications | 安全關鍵應用 | 自駕車、醫療這類出錯會傷人的場合 | | Cybersecurity | 資訊安全 | AI 被拿來攻擊系統,或 AI 本身被入侵 |
老師舉了哪些例子?原話怎麼說? 老師舉了兩則最近的新聞當例子(新聞細節未查證,只當老師的舉例): - 有報導說 OpenAI 的模型逃出公司的沙盒(sandbox:把程式關在隔離環境裡,不讓它碰外面的系統),侵入了 Hugging Face;老師說最近出的 GPT-6 Astra 可能就是當時在訓練的模型。 - Hugging Face(我補充):一個大家上傳、分享 AI 模型和資料集的網站,可以想成 AI 模型的公開圖書館。 - Meta 要求記錄員工上班時的滑鼠軌跡、點了哪裡,拿來訓練模型;老師說這牽涉隱私、國安等很多問題。 「那這件事情雖然我們這裡只用一頁來講它,但是我覺得在未來這件事情會變得越來越重要」(2:27:06)
## [2:27:28](https://www.youtube.com/watch?v=KWGgi100YLY&t=8848s) Slido 問答:分組與評估指標 休息前老師回答了 Slido 上的問題,大多是作業與分組的行政事項,加上一題評估指標。這段是行政事項,不是考點(我判斷)。 | 問題 | 老師的回答 | |---|---| | 分組要在系統登記嗎? | 不用。一組交一份報告,報告上寫清楚每個人的學校、姓名、學號即可。 | | 哪些作業分組? | 作業一、三、五分組;作業二、四個人。老師不協助分組,找不到組員可以一個人一組。 | | 第一次作業訂的題目,老師會給建議嗎? | 組數可能好幾百組,無法每組給建議;需要的話跟助教或老師約時間,外校線上的同學可以約線上討論。 | | NTU COOL 上沒看到兩門課正常嗎? | 老師不知道,要問 NTU COOL。 | | 提高準確率和降低錯誤率一樣嗎? | 可以不一樣。ImageNet 比賽習慣看錯誤率越低越好;不同任務評估方式不同,也可能看準確率,甚至看速度。 | | 期末報告可以跟提案不一樣嗎? | 盡量一樣。做到一半發現太難可以換方向,但要在期中報告寫清楚,最好期中的主題就是期末的結果。 | 下面摺疊在講(白話):多數情況下「錯誤率=1-準確率」,兩個是同一件事的正反面;但 ImageNet 比賽用的 top-5 錯誤率(猜五次有一次中就算對)算法不同,所以不能直接換算。
準確率和錯誤率到底差在哪?(我補充) 最單純的分類題裡,錯誤率=1-準確率,兩個是同一件事的正反面。 但 ImageNet 比賽常看 top-5 錯誤率:模型可以猜五個答案,五個都沒中才算錯。這時的錯誤率跟一般「猜一次」的準確率算法不同,就不是單純互補。所以要看每個任務習慣用哪種指標。
## 補充:老師直接用、沒解釋的詞 老師講 1990 年代時說市場被 Gaussian Mixture Model 和 SVM 佔光,但沒解釋它們是什麼(我補充)。
SVM、Gaussian Mixture Model 是什麼? - SVM(Support Vector Machine,支援向量機):紙上有紅點和藍點,SVM 畫一條線把它們分開,而且挑「離兩邊最近的點都最遠」的那條,中間留最寬的安全帶。決定這條線的只有最靠邊的幾個點,叫 support vector。資料少也準、有清楚的數學理論支撐,所以當年很受歡迎。 - Gaussian Mixture Model(高斯混合模型):假設資料是幾條鐘形曲線(常態分布)疊在一起。例:全校身高畫出來有兩個山峰,其實是男生、女生兩條曲線疊加;它從疊好的結果反推每條曲線長什麼樣。當年語音辨識常把 HMM 和它搭配使用。 - 老師形容那時做神經網路的處境:「你如果跟人家講說你在做類神經網路可能會被人家白眼」(2:14:56)
## 補充:三本書的完整書名 投影片 p.27 下方有三本書的封面:《AI 製造商沒說的祕密》(Genius Makers,Cade Metz)、《AI 科學家李飛飛的視界之旅》(The Worlds I See,李飛飛)、《無限機器:Gemini 推手哈薩比斯的超級智慧長征》(The Infinity Machine,Sebastian Mallaby)。出版時間由舊到新,想讀可以照這個順序。 ## Self-check
Q1. Why did deep learning achieve a breakthrough in 2012 even though neural networks had existed since the 1980s?(中文:類神經網路 1980 年代就有,為什麼到 2012 年才突破?) **Answer**: Neural networks need a large amount of data, and training on a large amount of data needs a lot of computation. In the 1980s neither was available. By 2012 three things came together: large labeled datasets such as ImageNet, powerful GPUs for fast training, and new training techniques from Hinton's group. With these, a CNN cut the ImageNet error rate by nearly 10% at once. 中文:類神經網路要大量資料才學得好,而大量資料又需要大量計算,1980 年代這兩樣都沒有。到了 2012 年,三個條件同時湊齊:像 ImageNet 這樣的大量標註資料、能加速訓練的 GPU、Hinton 團隊的新訓練技巧。所以同樣的老方法(CNN)一口氣把 ImageNet 錯誤率降了將近 10%。
Q2. What risks of AI does the textbook list? Explain one of them.(中文:課本列出 AI 的哪些風險?挑一個解釋。) **Answer**: The textbook lists six risks: lethal autonomous weapons, surveillance and persuasion, biased decision making, impact on employment, safety-critical applications, and cybersecurity. For example, biased decision making: if an AI system is trained on biased historical data, it may treat some groups unfairly when deciding loans or hiring. The lecturer stressed that this topic will become more and more important in the future. 中文:課本列了六種風險:致命自主武器、監控與操弄、有偏見的決策、就業衝擊、安全關鍵應用、資訊安全。舉例來說,有偏見的決策:如果 AI 用帶有偏見的歷史資料訓練,審核貸款或徵才時可能對某些族群不公平。老師強調,這件事未來會越來越重要。
Q3. What is a connectionist model, and how did it differ from the symbolic and logicist approaches?(中文:什麼是連結學派?它跟符號學派、邏輯學派差在哪?) **Answer**: A connectionist model builds intelligence from many simple, connected units, like neurons in a neural network, and learns from data, for example with back-propagation. The symbolic approach of Newell and Simon manipulates symbols with hand-written rules, and the logicist approach of McCarthy represents knowledge in formal logic and reasons by deduction. In the 1980s they were seen as direct competitors. 中文:連結學派用很多簡單、互相連接的單元(像神經網路裡的神經元)組成智慧,並從資料中學習,例如用反向傳播調整。符號學派(Newell 和 Simon)靠人寫的規則操作符號;邏輯學派(McCarthy)用形式邏輯表示知識、用推理得出結論。1980 年代這三派被視為直接競爭的對手。
Q4. Why did AI turn to probabilistic reasoning in the late 1980s? Give two examples.(中文:為什麼 1980 年代末 AI 轉向機率推論?舉兩個例子。) **Answer**: Much real-world knowledge could not be written as fixed rules because it was uncertain or incomplete, so AI systems needed to handle uncertainty. Probability replaced Boolean logic, and machine learning replaced hand-coding. Examples: hidden Markov models, trained on large speech corpora, came to dominate speech recognition; in 1988 Judea Pearl's Bayesian networks gave a rigorous way to represent uncertain knowledge and reason with it. 中文:真實世界很多知識寫不成固定規則,因為事情本身不確定,或資訊不完整,所以 AI 必須能處理不確定性。於是用機率取代只有真/假的布林邏輯,用機器學習取代人工寫規則。例子:用大量語音資料訓練的 HMM 主宰了語音辨識;1988 年 Judea Pearl 的貝氏網路提供嚴謹的方法來表示不確定的知識並進行推論。
讀完了嗎?下一章:[05 Agent、理性與任務環境(2:42–2:59)](https://app.notion.com/p/3e7fc631b0308166ab40e7f402602f69)|回到週頁:[W1(9/10)](https://app.notion.com/p/3e7fc631b03081309a2adad7f8ae1e27)