[自然語言處理](https://app.notion.com/p/3e6fc631b03081b4a9e8f91f3411f61f) › [W2(9/17)](https://app.notion.com/p/3e6fc631b03081a18b13fad72a8874fd) › 04|影片 [1:08:43–1:20:25](https://www.youtube.com/watch?v=MnA5KUETSg4&t=4123s)|投影片 W1_NLP_brief_v2 p.33–37|上一章 [03 LLM 之前的應用與分析層次(0:41–0:58)](https://app.notion.com/p/3e6fc631b0308187ae81c0e0fefb77f7)|下一章 [05 資訊檢索、索引與前處理(1:20–1:48)](https://app.notion.com/p/3e6fc631b0308148a521f4d07ae31526)
## 重點
- 傳統 NLP 靠 syntax(句法,研究字怎麼組成句子):先標詞性,再把句子拆成一棵語法樹(名詞片語、動詞片語、介系詞片語),從結構推出意思。這條路大約十年前就碰到天花板。
- 傳統 NLP 有四個難處:名詞片語的角色、抽象概念、同義詞、一段話有幾個概念。語言學途徑主張不要把文件當成「一袋字」(bag of words),要抽出概念;今天的 LLM 用「帶前後文的向量」做到了一部分。
- Manning 的定義:NLP 是資工、AI、語言學的交集,完美的語言理解是 AI-complete(難度等於做出通用 AI)。深度學習把整條流程重做:word2vec、GloVe、ELMo、BERT 學表示,再接模型與應用。效果好,但可解釋性差。
## Exam-ready
- **Syntax**: "the study of how words and phrases form sentences"(W1_NLP_brief p.30)
- 中文:句法研究字和片語怎麼組成句子。白話:管句子的骨架,不管字的意思(那是 semantics(語意))。
- **Syntax example**: "Ex: The Bank of Canada will curb inflation with higher interest rates."(W1_NLP_brief p.33,樹的第一層是 Noun phrase + Verb phrase)
- 中文:例句「加拿大央行將以更高的利率抑制通膨」。語法樹最上層切成名詞片語(誰)和動詞片語(做了什麼)。
- **Problems with NLP**: "Limitations of Natural Language Processing: Correctly identifying the role of noun phrases; Representing abstract concepts; Classifying synonyms; Representing the number of concepts"(W1_NLP_brief p.34)
- 中文:傳統 NLP 的四個限制:判斷名詞片語的角色(誰對誰做了什麼)、表示抽象概念、分類同義詞(synonyms)、表示一段話有幾個概念。
- **Text**: "Text is unstructured, ambiguous, and language dependent."(W1_NLP_brief p.35)
- 中文:文字是非結構化的(unstructured,沒有固定欄位)、有歧義的(ambiguous,可有多種解讀)、依語言而不同的(language dependent)。
- **The Linguistic Approach**: "Does not treat a document as a bag of words" / "Removes ambiguity by extracting structured concepts" / "Concepts are the DNA of text."(W1_NLP_brief p.35)
- 中文:語言學途徑不把文件當成一袋字,而是抽出結構化的概念來消除歧義;概念是文字的 DNA。白話:要抓意思,不是只數字。
- **What is NLP?**: "Natural language processing is a field at the intersection of computer science, artificial intelligence and linguistics."(W1_NLP_brief p.36)
- 中文:NLP 是資訊工程、人工智慧、語言學三個領域的交集(intersection)。
- **Meaning**: "Fully understanding and representing the meaning of language (or even defining it) is a difficult goal."(W1_NLP_brief p.36)
- 中文:要完全理解並表示語言的意思,甚至光是定義「意思」,都是很難的目標。
- **AI-complete**: "Perfect language understanding is AI-complete. (Christopher Manning)"(W1_NLP_brief p.36)
- 中文:完美的語言理解是 AI-complete(難度等於做出跟人一樣聰明的通用 AI),出自史丹佛的 Christopher Manning。
- **AI-enhanced NLP**: "Data Preprocessing" → "Model Building" → "Applications"; "Representation Learning: Word2Vec. GloVe. ELMo. BERT..."(W1_NLP_brief p.37)
- 中文:AI 加值的 NLP 分三段:資料前處理 → 建模 → 應用。前處理的核心是表示學習(representation learning,讓模型自己學出字的向量)。
- **Static vs contextual**: "contextual embeddings (e.g., BERT), vs. static embeddings (e.g., Word2Vec, GloVe)."(W1_NLP_brief p.94,本週未講;對應老師 1:15:53 的說法)
- 中文:前後文相關的詞向量(例如 BERT)對比靜態詞向量(例如 Word2Vec、GloVe)。白話:靜態是一個字只有一個向量;前後文相關是同一個字在不同句子有不同向量。
## [1:08:43](https://www.youtube.com/watch?v=MnA5KUETSg4&t=4123s) 續課:教材要一直更新
下課回來,老師先講今天的節奏:講得很快,只是「看故事」,看以前的人做過哪些事,不談細節。像 p.32(用深度學習把詞素變成向量)其實就是一整篇論文的技術。老師前面提過的史丹佛課程 CS224N(Natural Language Processing with Deep Learning)就是「NLP 加上深度學習」。他覺得資工系、尤其研究所的課都得跟著 AI 調整:他一半甚至三分之二的教材要一直更新;中文系教《紅樓夢》,本質就不太會變。
**比喻**:資工系的教材像手機作業系統,每年大改版;中文系的教材像經典小說,內容不變,只是讀法更新。
**考試可能怎麼問**:這段是課程導言,不太會單獨考;頂多問「深度學習出現後,NLP 的做法改變了什麼」(我判斷)。
要先懂什麼?p.32 那篇論文在做什麼?
p.32 寫 "In DL (Luong, 2013)",即 Luong、Socher、Manning 2013 年在 CoNLL 發表的論文。每個 morpheme(詞素,字裡最小、有意義的零件)有一個向量,神經網路把兩個向量合成一個:un + fortunate → unfortunate,再 + ly → unfortunately。好處是沒看過的新字,也能用看過的零件拼出向量。
老師原話是什麼?
「主要並不是要探討裡面的細節而是一個看看故事這樣以前人做過這些事」(1:08:53)
「我大概有一半甚至三分之二的教材是要一直被 update」(1:10:16)
## [1:10:27](https://www.youtube.com/watch?v=MnA5KUETSg4&t=4227s) 沒學過機器學習會不會吃力
有同學問:沒修過機器學習或 AI,上這門課會不會很吃力?老師說寫作業應該還好。但理解上課內容就不一樣:課上不講怎麼訓練,有親手訓練過模型的人,看到架構圖馬上知道在做什麼。所以這裡補最短的「訓練」入門,後面講 word2vec、BERT 都用得到。
**比喻**:訓練模型像練投籃。投一球(預測)、看偏多少(loss,損失)、調整手勢(改參數)、再投,投幾千球就準了。
**考試可能怎麼問**:不會直接考怎麼訓練,但問答題常用到 training、embedding 這些詞,要看得懂(我判斷)。
下面這張圖是一回合訓練在做的事,箭頭繞回去代表重複很多回合。
```mermaid
flowchart LR
A["模型用目前的參數預測"] --> B["跟正確答案比,算出 loss"]
B --> C["反向傳播:算出每個參數該往哪邊調"]
C --> D["梯度下降:參數往 loss 變小的方向調一點"]
D --> A
```
繞夠多圈,loss 越來越小,模型就「學會」了。每個字的詞向量(embedding)也是在這個圈裡順便學出來的。
要先懂什麼?訓練相關的五個詞
- **parameter(參數)**:模型裡的旋鈕。模型就是一個有很多旋鈕的函數,輸入文字的數字表示,輸出答案。
- **loss(損失)**:模型這次錯了多少。
- **gradient descent(梯度下降)**:算出 loss 對每個旋鈕的斜率(gradient,梯度),往讓 loss 變小的方向轉一點;轉多少由 learning rate(學習率)決定。
- **backpropagation(反向傳播)**:用連鎖律從輸出一層層往回算出每個旋鈕的梯度。
- **embedding(詞向量)**:訓練時順便學出來的「每個字的一組數字」。
動畫版:[3Blue1Brown 神經網路](https://www.youtube.com/watch?v=aircAruvnKk)。
它到底怎麼運作?手算三回合(進階,可跳過)
一個旋鈕 w,預測=w × x。資料 x=2,答案 6(理想 w=3)。loss=(預測 − 6)²,梯度=2 ×(預測 − 6)× x,新 w=w − 0.1 × 梯度。
- 第 1 回合:w=1.0,預測 2.0,loss 16,梯度 −16,新 w=2.6。
- 第 2 回合:w=2.6,預測 5.2,loss 0.64,梯度 −3.2,新 w=2.92。
- 第 3 回合:w=2.92,預測 5.84,loss 0.0256,梯度 −0.64,新 w=2.984。
loss 從 16 掉到 0.0256,w 逼近 3。語言模型只是把一個旋鈕換成幾億個。
老師原話是什麼?
「以寫作業來講我是覺得可能還好啦」(1:10:37)
「如果你有學過機器學習或是這種 Deep Learning 的學生你可能看到這個圖你就知道他們在幹什麼事情」(1:11:02)
## [1:11:22](https://www.youtube.com/watch?v=MnA5KUETSg4&t=4282s) 語法層:語法樹
以前做 syntax,是用語言學規則加一點統計:先標出每個字的詞性(part of speech,名詞、動詞這類),再組成一棵語法樹(parse tree)。有了樹,就知道句子從根要怎麼切成兩大塊、名詞片語在修飾誰,才能從 syntax 長出 semantics(語意)。這些步驟現在都能用類神經網路重做。老師說這條路曾幾乎到瓶頸:Google 出現後,大量資料的統計又推了一把,但大約十年前又停住,因為很多問題不是資料多就能解決。
**比喻**:語法樹像公司組織圖。先分成兩大部門(誰/做什麼),部門下再分小組,最底下才是每個員工(字)。看組織圖才知道誰歸誰管。
**考試可能怎麼問**:給 p.33 的句子,要你描述語法樹,並說出 Sentence 底下第一層是哪兩塊。
下面是 p.33 的樹:從最上面的 Sentence 一層層往下,最底下紅框是原句的字。

照著樹讀這句話,四步:
1. 根 Sentence 切成 Noun phrase「The Bank of Canada」(誰;再拆成 The+Bank of Canada)+ Verb phrase(做了什麼)。
2. Verb phrase 切成 will(Aux,助動詞)、curb(Verb)、inflation(Noun)和一個 Prepositional phrase(介系詞片語)。
3. Prepositional phrase=with + Noun phrase(higher(Adjective)+ interest rates(Noun))。
4. 讀出意思:誰=加拿大央行,做什麼=抑制,對象=通膨,方法=更高的利率。這就是「從 syntax 長出 semantics」。
用生活例子講,為什麼一定要有樹?
同一串字可以長出兩棵樹(我補充)。"I saw the man with the telescope.":with the telescope 掛在 saw 底下是「我用望遠鏡看到他」;掛在 the man 底下是「我看到拿望遠鏡的人」。字一樣,樹不同,意思就不同(上一章的結構歧義)。p.33 的 with higher interest rates 文法上也能掛在 inflation 底下,人一看就知道要掛在 curb 底下(用升息來抑制),電腦要靠語料和常識才分得出來。
要先懂什麼?詞性標記和中研院平衡語料庫
詞性標記(POS tagging)就是替每個詞貼上「名詞」「動詞」這類標籤。中研院平衡語料庫是現代漢語語料庫,每個詞都人工標好詞性,例如「我的書」標成 我(Nh 代名詞)、的(DE)、書(Na 普通名詞)。這要人工介入,很花成本。老師說這類語料現在多半已被大型模型當訓練資料「用掉了」,比較少直接引用,但還是有機會用到。
它到底怎麼運作?把樹寫成一行(進階,可跳過)
括號形式:(S (NP The Bank of Canada) (VP will curb inflation (PP with (NP higher interest rates))))
注意:投影片的樹是簡化版(我補充)。標準標記(例如 Penn Treebank)會把 The 標成 Determiner(限定詞),inflation 也會包成 Noun phrase。考試照投影片寫即可。
老師原話是什麼?
「以前都必須要這樣去理解句子的構造」(1:12:07)
「從 Syntax 再長出所謂的 Semantics」(1:12:12)
「有太多的是不是靠著大量資料就可以做的」(1:13:13)
## [1:13:19](https://www.youtube.com/watch?v=MnA5KUETSg4&t=4399s) NLP 的限制與語言學途徑
p.34 列出傳統 NLP 做不好的四件事(見下表)。而且語言學分析換一種語言規則就不同,研究的人少的語言(low-resource language,低資源語言)可參考的東西更少。p.35 的語言學途徑主張:不要把文件當成一袋字(bag of words),要抽出結構化的概念來消除歧義,「概念是文字的 DNA」。老師補充:LLM 雖然也用字的向量來算,但那個向量已經把前後文的概念學進去了。
**比喻**:詞袋像把一句話剪成一個個字,丟進袋子搖一搖。字都還在,但誰咬誰已經看不出來。
**考試可能怎麼問**:列出 p.34 的四個限制;或解釋語言學途徑跟 bag of words 差在哪。
詞袋的做法是三步:把句子切成字詞 → 數每個字出現幾次 → 把次數排成一個向量。順序和文法在這裡全部丟掉。
| 限制(p.34) | 例子(我補充) | 難在哪 |
| **Correctly identifying the role of noun phrases** | 「央行抑制通膨」和「通膨被央行抑制」 | 名詞位置對調,做動作的都是央行 |
| **Representing abstract concepts** | 「物價一直漲」和「通膨很嚴重」 | 沒有共同的字,卻是同一個概念 |
| **Classifying synonyms** | car 和 automobile;bank 是河岸還是銀行 | 老師把「不同字同意思」和「同字不同意思」都算進來 |
| **Representing the number of concepts** | 「新手機發表了。售價 999 美元。評論說太貴。」 | 算三個概念,還是合成一個?老師說做過摘要就知道 |
它到底怎麼運作?詞袋手算一次(進階,可跳過)
例子出自本份投影片 p.55(第 08 章會講)。「錢,不是問題」和「不,錢是問題」都切成 錢/不/是/問題,每個字各 1 次。照這個順序寫成向量,兩句都是 [1, 1, 1, 1],cosine similarity(兩向量夾角的餘弦,1=方向完全相同)= 1。電腦認為兩句一樣,意思卻相反。英文版是 dog bites man 和 man bites dog。這就是老師說的「把前後文的關係都打爛」。
用生活例子講,「概念是文字的 DNA」是什麼意思?
同一個人換衣服、換髮型,DNA 不變。同一個意思換不同的字講(「物價飛漲」「通膨嚴重」),概念也不變。語言學途徑想抓的是 DNA,不是衣服。
LLM 不也是用字的向量嗎?差在哪?
老師在 1:15:53 自問自答了這題。static embedding(靜態詞向量,例如 word2vec、GloVe)一個字只有一個向量,river bank 和 bank account 的 bank 拿到同一組數字;contextual embedding(前後文相關的詞向量,例如 ELMo、BERT、LLM)同一個字在不同句子拿到不同向量。所以 LLM 的向量代表的是「這個字在這句話裡的意思」。
老師原話是什麼?
「一句話的概念大概知道兩句話三句話這三句話如果把它變成一個概念這件事情就越來越複雜」(1:13:48)
「當一個稀少資源的語言要做的時候其實不太容易」(1:14:37)
「就把所有的語法所有的這種前後文的關係都把它打爛」(1:15:12)
「前後文的 concept 都有 embed 在那個這個他的 vector 裡面」(1:16:08)
## [1:16:17](https://www.youtube.com/watch?v=MnA5KUETSg4&t=4577s) Manning:語言理解是 AI-complete
p.36 的 NLP 定義出自史丹佛的 Christopher Manning,三個重點:NLP 是資工、AI、語言學的交集;完全理解並表示語言的意思很難,連「意思」都很難定義;「完美的語言理解是 AI-complete」。老師提醒這個詞不是正式定義,是大師的論斷。投影片右邊是老師 2023 年在 ACL(NLP 頂尖國際會議)和他的合照,老師藉此鼓勵大家念博士班,有機會出國見大師。
**比喻**:完美理解語言像當完美的口譯員。光懂單字不夠,還要懂常識、文化、對方想暗示什麼,等於要一整顆人腦。
**考試可能怎麼問**:解釋 "Perfect language understanding is AI-complete" 的意思、誰說的、為什麼成立。
下面這張圖把 p.36 的定義畫成一條線:三個領域匯成 NLP,NLP 的終點是理解語言。
```mermaid
flowchart LR
A["資訊工程"] --> D["NLP"]
B["人工智慧"] --> D
C["語言學"] --> D
D --> E["目標:完全理解並表示語言的意思"]
E --> F["完美做到=AI-complete"]
```
最後一格的意思是:這個終點難到等於做出通用 AI,所以 NLP 只能一直逼近。
用生活例子講,為什麼語言理解需要整個 AI?
AI-complete 借自演算法的 NP-complete:解出其中一題,就等於解出同一類的全部難題(我補充)。經典例子是 Winograd schema(威諾格拉德題型)(我補充):
- "The trophy doesn't fit in the suitcase because it is too big." it 是獎盃。
- 把 big 換成 small,it 就變成行李箱。
文法完全一樣,只差一個字。要答對得先知道「大的東西塞不進小的容器」。完美的語言理解需要常識、推理、世界知識,也就是整個 AI。
要先懂什麼?Manning 是誰?
- 史丹佛教授,CS224N 的主講者(老師說後面的課多由他的學生講)。
- 資訊檢索教科書 Introduction to Information Retrieval 的作者之一,所以老師說他在 IR 領域「說了算」。下一章就開始講資訊檢索。
- GloVe(2014,Pennington、Socher、Manning)出自他的實驗室。
老師原話是什麼?
「Perfect language understanding 是 AI complete」(1:16:55)
「當然這個詞並不是很 formal 去定義啊」(1:17:00)
「他以前在做資訊檢索領域是一個幾乎就是他說了算」(1:17:15)
## [1:18:28](https://www.youtube.com/watch?v=MnA5KUETSg4&t=4708s) AI 加值的 NLP
深度學習之後,斷詞、命名實體辨識(NER,找出人名、地名、機構名)這些任務還是要做,只是手法換了。以前的應用多半靠規則、人工和字典,很少用訓練;算力和資料起來之後,改成訓練模型。老師說 2019 到 2021 年幾乎所有 NLP 研究都以 BERT 為核心。代價是可解釋性很差:效果好卻說不出為什麼,模型可能只是把資料記起來,不代表真的解決了問題。
**比喻**:以前的 NLP 像照食譜做菜,每一步說得出原因;深度學習像讓學徒吃過十萬道菜再自己做,味道很好,但問他為什麼放這麼多鹽,他答不出來。
**考試可能怎麼問**:描述 AI-enhanced NLP 的三個階段,並說出訓練式方法的一個缺點(可解釋性差)。
下面是 p.37 的三段流程,由左往右走。
```mermaid
flowchart LR
A["資料前處理:表示學習+NER"] --> B["建模:Seq2Seq、Attention、GAN 等"]
B --> C["應用:摘要、情感分析、對話系統等"]
```
用文字說這三步:
1. Data Preprocessing(資料前處理):用 Word2Vec、GloVe、ELMo、BERT 把字變成向量;找出實體並統一寫法(NER and normalization,台北、臺北、Taipei 算同一個)。
2. Model Building(建模):拿向量接各種模型:Seq2Seq、AutoEncoders、Attention Mechanism、強化學習、GAN。
3. Applications(應用):新聞摘要、惡意留言分類、謠言偵測、文字/報告生成、情感分析、Latent Aspect Mining(從評論挖出服務、價格這類隱藏面向)、對話系統。
注意:老師 1:18:45 口頭說 word2vec「就是我剛才講的 GloVe」,聽起來像同一個東西。其實 word2vec 是 Google 的,GloVe 才是史丹佛的,考試別寫混。
要先懂什麼?word2vec、GloVe、ELMo、BERT 各是什麼?
- word2vec(2013,Google 的 Mikolov 等人):用周圍的字學一個字的向量,一字一向量(static)。
- GloVe(2014,史丹佛 Manning 實驗室):用「兩個字一起出現幾次」的全域統計學向量,也是一字一向量。
- ELMo(2018,Allen Institute for AI):雙向 LSTM 讀整句,同一個字在不同句子有不同向量(contextual)。老師說後來也不太用了。
- BERT(2018,Google):Transformer 讀整句,也是 contextual,老師稱它那個年代的「一代宗師」。
- 再來是 LLM 時代,老師最後帶一句:現在很多情況可能直接用 LLM。
用生活例子講,模型「記住資料」和「真的會」差在哪?
interpretability(可解釋性)是能不能說出模型為什麼這樣判斷。規則式系統的規則寫得清清楚楚;神經網路是幾百萬個數字,答不出「為什麼」。像把考古題答案背起來的學生:考古題全對,換新題就不會。示意:訓練資料 100% 全對,沒看過的新句子只對 62%,這叫 overfitting(過度擬合)。這就是老師說的「fit 得很好不代表解決了問題」,所以評估一定要用沒看過的測試資料。
它到底怎麼運作?表示學習學到了什麼(進階,可跳過)
字典只有 cat、dog、truck。one-hot(獨熱編碼,每個字只有自己的位置是 1):cat=[1, 0, 0]、dog=[0, 1, 0],任兩個字的 cosine 都是 0,看不出 cat 和 dog 比較像。
學出來的 dense vector(稠密向量,示意值,第一維像「動物」、第二維像「交通工具」):cat=[0.9, 0.1],dog=[0.8, 0.2],truck=[0.1, 0.9]。
- cos(cat, dog)=0.74 ÷ (0.906 × 0.825) ≈ 0.99,很像。
- cos(cat, truck)=0.18 ÷ (0.906 × 0.906) ≈ 0.22,不像。
word2vec、GloVe 就是從大量文字自動學出這種向量,真正有幾百維。下週從 p.64 的貓、狗、卡車圖接著講。
老師原話是什麼?
「大概在 2019 2020 2021 這三年所有做 NLP 的全部不是全部啦幾乎都是用 BERT 當成是一個大的核心的角色出發」(1:19:05)
「以前的應用比較是一個規則式的人工介入式的甚至字典的方式極少用訓練的」(1:19:29)
「厲害歸厲害但是其實它可解釋性就很差」(1:19:50)
「這個模型可以把這個問題 fit 的相當的好但是並不代表你解決這個問題而是說他記住了以前的所有的資料」(1:20:03)
## Self-check
Q1. Using "The Bank of Canada will curb inflation with higher interest rates." as an example, describe its syntax tree. What are the two constituents directly under Sentence, and what does the prepositional phrase contain?(中文:用這句話描述語法樹:Sentence 底下第一層是哪兩塊?介系詞片語裡有什麼?)
**Answer**: Sentence splits into a Noun phrase ("The Bank of Canada") and a Verb phrase. The Verb phrase contains Aux (will), Verb (curb), Noun (inflation) and a Prepositional phrase: "with" + Noun phrase (Adjective "higher" + Noun "interest rates"). The tree tells us who does what to what and how, so semantics is derived from syntax.
中文:根 Sentence 先切成名詞片語「The Bank of Canada」(誰)和動詞片語(做了什麼)。動詞片語裡有助動詞 will、動詞 curb、名詞 inflation 和一個介系詞片語;介系詞片語是 with 加一個名詞片語(形容詞 higher+名詞 interest rates)。有了樹就讀得出誰(央行)做了什麼(抑制)、對象(通膨)、方法(更高利率),也就是從句法推出語意。
Q2. List the four limitations of NLP given in the lecture. Then explain why a bag-of-words representation cannot tell "dog bites man" from "man bites dog".(中文:列出 NLP 的四個限制,再解釋詞袋為什麼分不出「狗咬人」和「人咬狗」。)
**Answer**: (1) Correctly identifying the role of noun phrases, (2) representing abstract concepts, (3) classifying synonyms, (4) representing the number of concepts. A bag of words keeps only word counts and discards word order and syntax, so both sentences become the same vector (cosine similarity = 1) although the roles are reversed. The linguistic approach instead extracts structured concepts.
中文:四個限制是:判斷名詞片語的角色、表示抽象概念、分類同義詞、表示一段話有幾個概念。詞袋只記每個字出現幾次,丟掉順序和文法,所以兩句變成完全一樣的向量(cosine similarity=1),可是誰咬誰剛好相反,這正是第一個限制的例子。語言學途徑則是抽出結構化的概念來避免這個問題。
Q3. Explain the statement "Perfect language understanding is AI-complete." Who said it, and why is it considered true?(中文:解釋「完美的語言理解是 AI-complete」:誰說的?為什麼成立?)
**Answer**: Christopher Manning (Stanford). A problem is AI-complete if solving it is as hard as building general, human-level AI. Perfect understanding of language requires world knowledge, common sense and reasoning, for example deciding what "it" refers to in "The trophy doesn't fit in the suitcase because it is too big." The term is not formally defined.
中文:出自史丹佛的 Christopher Manning。AI-complete 的意思是:要解決這個問題,難度等於做出跟人一樣聰明的通用 AI。完美的語言理解需要世界知識、常識和推理。例如「獎盃放不進行李箱,因為它太大」,「它」是獎盃;改成「太小」,「它」就變成行李箱,要懂「大東西塞不進小容器」才答得對。老師也提醒,這個詞不是正式定義。
Q4. Describe the three stages of AI-enhanced NLP and name one drawback of the model-training approach compared with rule-based methods.(中文:描述 AI 加值 NLP 的三個階段,並說出訓練模型比規則式方法多了什麼缺點。)
**Answer**: Data Preprocessing (representation learning such as Word2Vec, GloVe, ELMo, BERT; NER and normalization) → Model Building (Seq2Seq, AutoEncoders, attention, RL, GAN) → Applications (summarization, sentiment analysis, dialogue systems, etc.). Drawback: poor interpretability. A model may fit the data very well, even memorize it, without anyone knowing why, which does not mean the problem is solved.
中文:三階段是:資料前處理(用 Word2Vec、GloVe、ELMo、BERT 等表示學習把字變成向量,加上命名實體辨識與正規化)→ 建模(Seq2Seq、AutoEncoder、Attention、強化學習、GAN)→ 應用(摘要、情感分析、對話系統等)。缺點是可解釋性差:模型能把資料 fit 得很好,甚至只是背起來,卻說不出為什麼這樣判斷,所以效果好不代表真的解決了問題。
讀完了嗎?下一章:[05 資訊檢索、索引與前處理(1:20–1:48)](https://app.notion.com/p/3e6fc631b0308148a521f4d07ae31526)|回到週頁:[W2(9/17)](https://app.notion.com/p/3e6fc631b03081a18b13fad72a8874fd)