[自然語言處理](https://app.notion.com/p/3e6fc631b03081b4a9e8f91f3411f61f) › [W1(9/10)](https://app.notion.com/p/3e7fc631b0308199953aef38ee86b0ae) › 05|影片 [1:13:25–1:35:36](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=4405s)|投影片 Syllabus p.34–42|上一章 [04 課程安排、評分與同學問答(0:48–1:13)](https://app.notion.com/p/3e7fc631b0308153ba81da585f28e341)|下一章 [06 課後問答:浮水印與 AI 界線(1:35–1:47)](https://app.notion.com/p/3e7fc631b0308154af87df0a9af15134) ## 重點 - 現在做 NLP 的標準起手式是預訓練語言模型(PLM,先用海量文章訓練好、已經懂語言的通用模型)。背後的想法是轉移學習:先預訓練,再微調到自己的領域。 - 在 LLM 之前,NLP 要自己走完一條龍:收集標註語料、前處理、把文字變成向量、建領域知識。其中 TF-IDF 很簡單,但老師強調它到今天仍是很強的 baseline(比較基準)。 - 用 LLM 的方式從「接下游模型+成對資料微調」(BERT 時代,約 2019–2020)走到「不微調、直接下 prompt」。後者的限制是 context 長度,以及 lost in the middle(只記得頭尾、忘了中間)。 ## Exam-ready - **Transfer learning**: "“pre-train (預訓練), fine-tune(微調)” paradigm"(Syllabus p.35) - 中文:轉移學習的標準做法是「先預訓練,再微調」。白話:先用大量文章學會看懂語言,再用少量自己的資料調到特定任務。paradigm(做法典範)、fine-tune(微調)。 - **Text corpus (文字語料)**: "Collection, annotation, …"(Syllabus p.38) - 中文:傳統 NLP 的第一步是收集語料,並請人做標註。白話:先找資料,再一筆一筆貼標籤,這一步很貴。collection(收集)、annotation(標註)。 - **Preprocessing (前處理)**: "Segmentation, stopping word removal, stemming, parsing tree, …"(Syllabus p.38) - 中文:前處理包含斷詞、去除停用詞、詞幹還原、建剖析樹。白話:把文字切好、清掉沒意義的字、整理出句子結構。stop word(停用詞,例如「的」、the)、stemming(詞幹還原,running → run)、parsing tree(剖析樹)。 - **Preprocessing 2 (前處理 - 2)**: "NER, NEN, Relation extraction, …."(Syllabus p.38) - 中文:第二層前處理是找出句子裡的人名地名等實體、把同一實體的不同寫法統一、再找出實體之間的關係。NER(命名實體辨識)、NEN(命名實體正規化)、relation extraction(關係擷取)。 - **Operation I (text representation)**: "One-hot vector, TD-IDF, Word2Vec"(Syllabus p.38)【老師強調】(1:25:17) - 中文:把文字變成數字向量的三種方法:one-hot、TF-IDF、word2vec。老師強調 TF-IDF 簡單、萬用,而且是很強的 baseline。注意:投影片的 TD-IDF 是打錯,應為 TF-IDF(老師 1:23:49 也說打錯了)。one-hot vector(只有一格是 1 的向量)、baseline(比較基準)。 - **Operation II**: "Similarity measurement, LSI, semantics representation"(Syllabus p.38) - 中文:有了向量之後,算文字之間有多像、用 LSI 找出潛在主題、做語意表示。白話:把「意思相近」變成可以計算的距離。similarity(相似度)、LSI(潛在語意索引)、semantics(語意)。 - **LLM with fine-tune**: "Large Language Model (LLM) enabled NLP applications"(Syllabus p.39) - 中文:由大型語言模型支撐的 NLP 應用:先預訓練,再各自微調成文件摘要、問答、知識問答系統。白話:一顆通用大模型,接上不同任務再分別調整。enabled(由……驅動)。 - **Prompt usage**: "Large Language Model (LLM) enabled NLP applications (no fine-tune)"(Syllabus p.40) - 中文:不微調的 LLM 應用:直接把文件和指令一起交給模型,就得到摘要或答案。prompt(給模型的指令)、no fine-tune(不微調)。 - **Length limitation**: "Length limitation"(Syllabus p.40) - 中文:直接下 prompt 的限制是長度:一次能餵給模型的文字有上限。白話:文件太長塞不進去,塞進去了中間也可能被忽略。limitation(限制)。 - **Sequence models**: "RNN, LSTM, Seq2seq"(Syllabus p.42)【老師強調】(1:33:00) - 中文:這門課會講的序列類神經網路:RNN、LSTM、Seq2seq。老師強調它們雖然舊但很重要:RNN/LSTM 讓你懂序列資料怎麼訓練,Seq2seq(1:33:14)奠定了「輸入一段序列、輸出一段序列」的用法。sequence(序列)、Seq2seq(序列到序列)。 ## [1:13:25](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=4405s) 起手式:預訓練語言模型 老師說,經過前面講的那段歷史,現在做 NLP 的起手式都是預訓練語言模型,而且直接從 Transformer(現在幾乎所有大模型的底層架構)下手。所以他把傳統 NLP 要教的東西壓在前兩週半講完,後面全部是 PLM。他也承認這有點怪:想學語言學的人,在這門課學不太到。 投影片 p.34 用一張圖對比兩個時代:1990 年代到 2000 年代初是「基於規則的系統」(查字典、語法分析、關鍵字搜尋、簡單翻譯),現在是深度學習與大語言模型(創意寫作、翻譯、問答、寫程式、情感分析),中間隔著一次巨大的技術躍遷。 為什麼不從傳統方法慢慢學起?因為 PLM 已經帶著大量常識,從它出發比從空白開始省太多事。 比喻:像煮湯,現在大家直接用現成高湯開始調味,不再從熬骨頭開始。 考試可能怎麼問:Why is a pretrained language model now the standard starting point for NLP tasks?
要先懂什麼?預訓練語言模型是什麼? - 語言模型(language model):能判斷一句話像不像人話、能接著往下寫的模型。 - 預訓練(pre-train):先讓模型讀大量一般文章,學會語言規則和常識,還沒針對任何任務。 - Transformer:2017 年 Google 提出的架構,BERT、GPT 都是用它蓋的(我補充)。 所以對這門課的影響:前兩週半是傳統 NLP,之後十幾週都在講 PLM。
## [1:14:51](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=4491s) 轉移學習:預訓練+微調 以前從零開始(from scratch,參數一開始是空的)訓練一個空氣汙染預測模型,只要有監督式資料(每筆都附標準答案)就做得出來:它會告訴你有沒有空汙、指數多少。但它只會回答空汙;想問「對健康有沒有影響」,就得拿新資料重新訓練。轉移學習(transfer learning)的精神是:學會一件事之後,比照辦理去解決另一個沒有(或很少)標註資料的問題。LLM 也是這樣:預訓練只讓它看懂文章,要會做問答、寫報告,還需要微調(把原本的模型校正到你的領域)。 參數是什麼?模型裡面有一大堆可以調整的數字,叫參數;訓練就是不斷調這些數字,讓模型的答案越來越準。「從零開始」就是這些數字一開始是亂數,模型什麼都不會(我補充)。 下面這張圖比較的是:預訓練只做一次,之後同一顆模型可以分別微調到不同任務。 ```mermaid flowchart LR A["大量一般文章"] --> B["預訓練:學會看懂語言"] B --> C["通用的預訓練模型"] C --> D["微調:空汙資料"] C --> E["微調:健康資料"] D --> F["空汙預測"] E --> G["健康影響判斷"] ``` 如果是從零訓練,每個任務都要從最左邊重來一次,這就是轉移學習省下的成本。 比喻(老師的例子):叫學生先把一本英文字典讀一讀,讀完他就會寫英文作文了。 考試可能怎麼問:Explain the "pre-train, fine-tune" paradigm and why it beats training from scratch for each task. 下面摺疊在講預訓練和微調各自調了什麼:兩步調的是同一批參數,預訓練先調出「看懂語言」,微調只在這個基礎上小改,讓它學會你的任務,所以資料少也做得起來。
它到底怎麼運作?(進階,可跳過) - 預訓練:模型讀海量文章,調整幾十億到幾千億個參數(投影片 p.39 寫 xB ~ xxxB 參數),學會語言規律。 - 微調:拿自己的少量標註資料,在預訓練好的參數上再小幅調整,不是從隨機參數開始。 - 為什麼資料少也學得好:語言知識已經在參數裡,微調只要學「這個任務要什麼」(我補充)。 - 老師提醒轉移學習本身是很大的主題,還能依「新任務有沒有標註資料」細分,機器學習課比較後面會講(1:16:43)。
## [1:17:23](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=4643s) LLM 發展圖與台灣模型 老師秀了一張 LLM 發展圖(投影片 p.36,GitHub 上的 LLMsPracticalGuide),說圖有點舊、中國大陸的模型也不是最新的,現在像 Kimi 就蠻強。台灣沒有自己從零訓練的 PLM,TAIDE、Breeze、Bailong(白龍)都是拿開源模型(open model)做在地資料的微調或繼續預訓練(CP)。老師覺得以前台灣資源不夠自己做 PLM,但運算成本在下降,慢慢變得可行;剩下的大問題是資料量。 為什麼台灣只能「跟著開源模型跑」?從零訓練需要龐大的運算資源和大量資料,這兩樣過去都缺。 比喻:自己從零蓋工廠太貴,所以先租現成廠房,再換上在地的生產線。 考試可能怎麼問:Why do most Taiwanese LLMs build on open models instead of training from scratch?
要先懂什麼?微調和繼續預訓練(CP)差在哪? - 微調(fine-tune):用「輸入+標準答案」的成對資料,教模型做特定任務。 - 繼續預訓練(continual pretraining,CP;老師 1:34:29 說 continuous pretraining):拿大量沒有標註的在地文章,讓現成模型再多讀一些,補足在地語言和知識。 - 老師還提到另一條路:像中國大陸那樣用「蒸餾」的方式來做(1:18:45;錄音不清,「蒸餾」是推測)。蒸餾(distillation)是用大模型的輸出當教材去教小模型(我補充)。
## [1:18:56](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=4736s) LLM 家族樹:Transformer 主導 投影片 p.37 的 LLM Family Tree 網站可以拖拉,點下去還會顯示模型的詳細資料。從樹上看得到:幾乎所有模型都是從 Transformer 長出來的。Mamba 這類替代架構存在,但沒有成為主流選項;現在幾乎所有硬體加速也是針對 Transformer 特別設計。老師提醒,每一季都有新模型說自己最強,但就解決你的問題來說能力已經差不多,真正要考慮的是模型大小和 token 的 CP 值。 為什麼 Transformer 一直是主流?(我補充)硬體都為它優化,新架構就算想法好,跑起來也不一定划算,形成「越多人用、越好用」的循環。 Mamba 是什麼?一種想取代 Transformer 的新架構,主打讀很長的文字時比較省運算;但目前大模型還是以 Transformer 為主(我補充)。 比喻:像充電孔統一成 USB-C,配件都做 USB-C,別的接頭再好也難推。 考試可能怎麼問:What architecture do almost all current LLMs descend from, and what should you weigh when choosing a model?
要先懂什麼?token 的 CP 值是什麼? - token:模型切文字的最小單位。常見英文單字多半是一個 token,長字會被切成好幾塊;中文大約一個字對應一到兩個 token,依模型而定(我補充)。 - 商用模型通常按 token 數收費,所以 token 的 CP 值=每花一塊錢能換到多好的結果。 - 模型大小則決定你能不能自己架起來、跑得多快。
## [1:20:25](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=4825s) LLM 之前的一條龍流程 沒有大模型之前,NLP 要從空白開始做。先要有語料:做醫院的題目,就得跟醫院談醫囑、病歷資料,還要請人標註,只要有人工就很貴(老師舉例:現在做機器人動作模型,也要請人戴攝影機一直折衣服錄影片)。拿到資料要前處理:斷詞、去停用詞、剖析樹、詞幹、詞性,再找出實體和關係,因為整句直接丟給模型它看不懂。接著把文字向量化,最後還要建領域知識的結構,例如知識圖譜(把知識存成節點和連線的圖,讓電腦能查)。 下面這張圖是投影片 p.38 的各站,照老師講的順序串起來。 ```mermaid flowchart LR A["收集與標註語料"] --> B["前處理:斷詞、停用詞、詞幹、剖析樹"] B --> C["前處理 2:實體辨識、實體正規化、關係擷取"] C --> D["向量化:one-hot、TF-IDF、word2vec"] D --> E["相似度、LSI、語意表示"] E --> F["領域知識:知識圖譜"] ``` 現在有了 PLM,中間好幾站大多被模型自己吸收了。老師強調其中的 TF-IDF:「因為他很簡單沒錯,但是他是一個非常萬用的 Baseline」(1:25:17),而且很強,搞不好比你算老半天的 dense vector 還好。 向量是什麼?就是一排數字。電腦不會讀字、只會算數字,所以要先把每個字或每篇文章換成一排數字,才能比「兩段文字有多像」。dense vector(稠密向量)是每一格都有值的短向量,word2vec 就是做這種向量的方法,讓意思相近的字數字也相近;TF-IDF 做出來的則是大部分格子是 0 的長向量(我補充)。 比喻(老師的例子):現在回頭看這些步驟,像去博物館看原始人留下的工具。 考試可能怎麼問:Describe the traditional NLP pipeline before LLMs, and explain why TF-IDF is still useful today. 下面摺疊在算 TF-IDF:它想解決「一篇文章裡哪些字最能代表這篇」。分數越高,代表這個字在這篇常出現、在別篇少見,越能代表這篇;像「的」這種每篇都有的字,分數會變成 0。
它到底怎麼運作?(進階,可跳過) TF-IDF(詞頻-逆文件頻率)替每個字打分數(我補充): - TF:這個字在這篇文章出現幾次,越多越重要。 - IDF:這個字在多少篇文章都有出現,越常見(像「的」)越不重要。 - 小例子:共 3 篇文章。「空汙」在第 1 篇出現 3 次,而且只有第 1 篇有 → IDF=ln(3/1) ≈ 1.1,分數 3 × 1.1 ≈ 3.3。「的」在第 1 篇出現 10 次,但 3 篇都有 → IDF=ln(3/3)=0,分數是 0。 - 所以「的」雖然出現最多次,TF-IDF 還是判定它不重要。考試不考算式,懂這個想法就夠。
## [1:25:37](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=5137s) LLM 加下游模型微調 有了 LLM 之後的常見做法:把大語言模型(例如 BERT)接上一個自己設計的下游模型(downstream model,負責特定任務的小模型),再用自己的標註資料微調。這些資料一定是成對的監督式資料:做問答要有「文章+問題 → 答案」,做摘要要有「原文 → 摘要」。BERT 出來後(約 2019–2020 年),大部分 NLP 研究(老師說六七成)都走這條路,因為效果能翻上一番;研究重點變成「下游模型怎麼設計,才能搭配 BERT 做出更好的摘要和 QA」。 [[IMG: C:\D槽\TAICA課程\_work\notes-v2\nlp-w1\img\syllabus_115_p039.png | Syllabus p.39:左邊預訓練出 BERT、GPT 等大模型,右邊每個任務各自微調出一個模型]] 圖上重點:(1)標題 Large Language Model (LLM) enabled NLP applications=由大型語言模型撐起來的 NLP 應用。(2)左邊 Pre-train(預訓練):一大疊文件餵進去,練出 xB~xxxB(幾十億到幾千億)個參數的大模型,就是中間列的 BERT、GPT、ChatGPT、GPT-4。(3)右上 Fine-tune(微調)畫成「大網路+小網路」,意思是大模型接上自己的下游模型。(4)右邊橘框三個任務:doc summary(文件摘要)、doc Question/answer(文件問答)、docs Retrieval / QA(先從很多文件裡找出相關的、再回答的知識問答)。這張圖在講:一顆預訓練好的大模型,要做哪個任務就各自再微調一次。 圖的右邊橘框就是重點:文件摘要、問答、知識問答(先檢索再回答)各自需要一份資料、各自微調。Fine-tune 旁邊畫的「大網路+小網路」,就是大模型接上自己的下游模型。 為什麼一定要成對資料?因為微調是監督式學習:模型要同時看到輸入和正確輸出,才知道參數該往哪個方向調。 比喻(老師的例子):用今天的眼光看,這像鑽木取火,而現在瓦斯爐按一下就有火;不過在特定領域,這條流程還是有人在用。 考試可能怎麼問:How did NLP research typically use BERT around 2019–2020, and what kind of data did it require?
用生活例子講,「接下游模型」是什麼意思? BERT 像一顆通用引擎,下游模型像為任務訂做的車身:做摘要裝一種車身,做問答裝另一種。引擎大多不動或只小調,車身要用你自己的標註資料來訓練(我補充)。所以那幾年的研究,比的多半是誰的「車身」設計得好。
## [1:27:38](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=5258s) 不微調,直接下 prompt 模型夠強之後,很多人連微調都省了:直接用原本的 PLM,把今天的投影片餵進去,寫一句 prompt(給模型的指令)「請幫我摘要今天老師上課的重點」,它就給你一頁摘要。為什麼一顆模型能做這麼多事?老師說不全然是因為它看過大量各任務的監督式資料,而是靠預訓練時對文章的理解,加上 Instruction Fine-tuning(指令微調:用「指令+回應」的例子,教模型聽懂你要它做什麼)。限制是 context(一次能餵進模型的內容)有長度上限;就算塞得進去,還有 lost in the middle 的問題:模型只記得開頭和結尾,中間容易被忽略。 下表把這一章講的三種做法排在一起,從左到右是時間順序。 | | 傳統一條龍 | LLM+下游模型微調 | 直接下 prompt | |---|---|---|---| | 大約時期 | BERT 之前 | 約 2019–2020 起 | 模型能力變強之後 | | 你要準備什麼 | 語料、標註、前處理、特徵 | 成對的監督式資料 | 寫好 prompt、餵進文件 | | 研究重點 | 怎麼表示文字、建知識 | 下游模型怎麼設計 | 怎麼下指令、處理長文 | | 主要限制 | 人工很貴 | 每個任務都要標註資料 | 長度上限、lost in the middle | 你要自己準備的東西越來越少,但新的限制跟著出現。 比喻(老師的例子):像同學上課,剛進教室還有精神,中間體力不支睡著,快下課要吃飯又醒了,所以只記得頭尾。 考試可能怎麼問:How does prompt-only LLM usage differ from fine-tuning, and what is the "lost in the middle" problem? 下面摺疊在說為什麼長文會出問題:模型對文章每個位置的重視程度不一樣,這跟它怎麼記「每個字在第幾個位置」有關,所以長文不是塞得進去就讀得好。
它到底怎麼運作?(進階,可跳過) - 模型的說明頁通常有一欄寫 context 多長,也就是一次能處理多少內容。 - 長文處理得好不好,不只看模型大小,也看位置編碼(positional embedding,告訴模型每個字在第幾個位置的方法)怎麼設計,以及有沒有特別處理 lost in the middle(1:29:32)。 - lost in the middle:模型讀長文時不是每個位置都一樣重視(not equal weight),頭尾比較重、中間比較輕。現在改善了一些,但仍有研究在找原因。 - 這種完全不微調、只靠 prompt 或 in-context learning(在 prompt 裡放幾個範例,讓模型當場照著做)的做法,是模型變強之後自然演變出來的。
## [1:31:05](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=5465s) 這門課講什麼、不講什麼 投影片 p.41 是傳統 NLP 課會講的四塊:詞彙分析(把句子拆成詞、標上詞性)、語法分析(解析文法結構、詞和詞的關係)、語意理解(理解含義與句子間的邏輯)、情感分析(辨識情緒和作者立場)。注意:老師說前面一、二(詞彙分析、語法分析)現在不太講了。但他說這些仍然有用:他口試過一個學生,在 LLM 的輸入裡加了詞性標註(POS tagging),發現真的有用,因為多給句子結構和詞性,LLM 就知道你在意什麼、會更聚焦;看應用而定,有時效果會好很多。這門課真正的主軸在 p.42 的四塊:Transformer(含 BERT:雙向編碼器表示模型,擅長理解上下文)、序列類神經網路(RNN、LSTM、Seq2seq)、生成式 AI(T5、GPT)、LLM 系統架構流程與應用(預訓練、微調、PEFT、提示學習/in-context learning)。老師上課的順序如下圖。 ```mermaid flowchart LR A["RNN、LSTM"] --> B["Seq2seq"] B --> C["Transformer"] C --> D["BERT、T5、GPT 等模型"] D --> E["微調、繼續預訓練"] E --> F["LoRA 等 PEFT"] F --> G["Reasoning、test-time scaling"] ``` 圖從最早處理序列的模型,一路走到最新的想法。PEFT(只調少量參數、省資源的微調方法)裡會提 LoRA;test-time scaling 是不改模型、在回答時多花運算讓它變強。老師也會附一個網站,整理新開源模型的架構圖(例如位置編碼用哪一種)。注意:老師說不會教怎麼下 prompt;LoRA 本來想出作業,但需要運算資源、不好設計。Slido 助教也回覆「會講 PEFT (LoRA), 但 RL 不會講」;老師在課後問答則說 RL 會提到、但不太會叫你們做,所以理解成:不會有 RL 作業,最多概念帶過。 RL 是強化學習(reinforcement learning):不直接給標準答案,而是模型做完後給它打分數(獎勵),讓它自己學著拿高分;ChatGPT 這類模型會用它把回答調得更合人意(我補充)。 為什麼還要學舊的 RNN/LSTM?老師說它們能讓你了解序列資料怎麼訓練;Seq2seq 則奠定了現在 LLM「給一段序列、輸出一段序列」的用法。 RNN、LSTM 是什麼?它們是一個字一個字依序讀句子、邊讀邊記住前面內容的神經網路;LSTM 是 RNN 的改良版,比較記得住很前面的字。之後幾週會細講(我補充)。 比喻:像學開車先懂手排,知道齒輪怎麼咬合,開自排車遇到狀況也知道發生什麼事。 考試可能怎麼問:Why does the course still teach RNN, LSTM, and Seq2seq when Transformers dominate?
老師原話是什麼? - 「所以前面一二呢,我們現在其實不太帶了」(1:31:26) - 「但是他其實非常重要,尤其是你可以從 RNN 跟 LSTM 去了解」(1:33:00) - 「Sequence to sequence Model 其實非常重要」(1:33:14) - 「就是給你一段序列你要 output 一段序列,而且是任何的配對」(1:33:39)
## 補充:one-hot 向量,以及三種教模型的方式 這段補兩個上面只帶過的名詞,都是我補充。one-hot 向量是把字變成數字最原始的做法,它的缺點正是後來 TF-IDF、word2vec 要解決的問題。預訓練、指令微調、in-context learning 名字很像,差在「有沒有改到模型」和「誰來做」。
one-hot 向量長什麼樣?缺點是什麼? - 假設字典只有五個字:我、你、貓、狗、跑。每個字是一排五格的數字,只有自己那一格是 1,其他都是 0。例如貓=[0, 0, 1, 0, 0],狗=[0, 0, 0, 1, 0]。 - 缺點一:任兩個字的 1 都不在同一格,重疊永遠是 0,電腦看不出「貓跟狗」比「貓跟跑」更像。 - 缺點二:字典有一萬個字,每個字就是一萬格,幾乎全是 0,很浪費。 - 老師列的向量化順序是 one-hot → TF-IDF → word2vec (1:23:05),後面的方法就是在補這兩個缺點;第 07 章的 LSA 和詞向量,也是在解「貓跟狗比較像」這件事。
預訓練、指令微調、in-context learning 差在哪? - 預訓練(pre-train):讀海量文章,學會看懂語言、會接龍。會改模型參數,通常由做模型的公司做。 - 指令微調(Instruction Fine-tuning):用「指令+回應」的例子再調一次,教它分辨「這是命令,不是要你接著寫下去」。會小幅改參數,也是做模型的公司做。 - in-context learning(上下文學習):在 prompt 裡放幾個例子,讓它當場照著做,例如「這餐廳很棒 → 正面;等了一小時 → 負面;服務不錯 → ?」。完全不改參數,對話結束就不記得,這一步是你自己做。 - 順序是預訓練 → 指令微調 → 你下 prompt。老師說一顆模型什麼任務都能做,不全然是看過大量各任務的監督式資料,而是靠預訓練加上指令微調(見上面「不微調,直接下 prompt」那段)。
## Self-check
Q1. What is the "pre-train, fine-tune" paradigm, and why is it better than training a model from scratch for every task?(中文:什麼是「預訓練+微調」?為什麼比每個任務都從零訓練好?) **Answer**: Pre-training lets a model learn general language understanding from a large amount of text. Fine-tuning then adapts that model to a specific domain or task with a small amount of labeled data. A model trained from scratch (for example, an air-pollution predictor) can only answer the question it was trained on; a new question needs new labeled data and full retraining. Transfer learning reuses what was learned in pre-training, so each new task needs much less data and effort. 中文:預訓練是讓模型先讀大量文章,學會一般的語言理解;微調是再用少量自己的標註資料,把模型調到特定領域或任務。從零訓練的模型(例如空汙預測模型)只會回答它被訓練的那個問題,換一個問題就要重新收資料、重新訓練。轉移學習把預訓練學到的東西拿來重用,所以每個新任務需要的資料和功夫都少很多。
Q2. Why does the teacher say TF-IDF is still important in the LLM era?(中文:為什麼老師說在 LLM 時代 TF-IDF 仍然很重要?) **Answer**: TF-IDF scores a word by how often it appears in a document and how rare it is across all documents. It is simple and cheap, and it works for almost any text task, so it is a universal and strong baseline. It may even outperform methods that compute dense vectors. When you propose a new method, TF-IDF is a standard baseline to compare against. 中文:TF-IDF 用「這個字在這篇出現多少次」和「這個字在所有文章裡有多少見」來替字打分數。它簡單、便宜,幾乎任何文字任務都能用,所以是萬用又很強的比較基準,有時甚至比算 dense vector 的方法還好。你提出新方法時,TF-IDF 是標準的比較對象。
Q3. Compare "LLM plus downstream model fine-tuning" with "prompt-only usage". What limits the prompt-only approach?(中文:比較「LLM 接下游模型微調」和「直接下 prompt」。直接下 prompt 有什麼限制?) **Answer**: In the fine-tuning approach (common around 2019–2020 with BERT), a pretrained model is connected to a task-specific downstream model and trained on paired supervised data, such as documents with summaries or questions with answers; research focused on designing the downstream model. In the prompt-only approach, a strong pretrained model is used as it is: you feed in the document and an instruction, and it produces the summary or answer. This works because of pre-training plus instruction fine-tuning. Its limits are the context length (how much text fits in one input) and the "lost in the middle" problem, where the model pays attention to the beginning and the end but neglects the middle. 中文:微調的做法(約 2019–2020 年用 BERT 很常見)是把預訓練模型接上一個任務專用的下游模型,再用成對的監督式資料訓練,例如「文章+摘要」或「問題+答案」,研究重點在怎麼設計下游模型。直接下 prompt 則是原封不動用一顆夠強的模型:把文件和指令餵進去,它就產生摘要或答案;能這樣做是因為預訓練加上指令微調。限制有兩個:一是 context 長度,一次能放的文字有上限;二是 lost in the middle,模型重視開頭和結尾,卻忽略中間。
Q4. Why does the teacher consider RNN, LSTM, and Seq2seq important even though Transformers dominate today?(中文:現在是 Transformer 的天下,為什麼老師還說 RNN、LSTM、Seq2seq 很重要?) **Answer**: RNN and LSTM show how sequential data is fed into a network and trained, which is the basis for understanding later models. Seq2seq maps an input sequence to an output sequence for any kind of pairing, such as translation, summarization, or question answering. This "sequence in, sequence out" usage is exactly how LLMs are used today, so Seq2seq laid the foundation of the current LLM ecosystem. 中文:RNN 和 LSTM 讓你看懂序列資料怎麼送進網路、怎麼訓練,這是理解後面模型的基礎。Seq2seq 把一段輸入序列轉成一段輸出序列,而且什麼配對都行,例如翻譯、摘要、問答。現在我們用 LLM 的方式正是「輸入一段、輸出一段」,所以 Seq2seq 可以說奠定了今天 LLM 的用法。
讀完了嗎?下一章:[06 課後問答:浮水印與 AI 界線(1:35–1:47)](https://app.notion.com/p/3e7fc631b0308154af87df0a9af15134)|回到週頁:[W1(9/10)](https://app.notion.com/p/3e7fc631b0308199953aef38ee86b0ae)