[自然語言處理](https://app.notion.com/p/3e6fc631b03081b4a9e8f91f3411f61f) › [W1(9/10)](https://app.notion.com/p/3e7fc631b0308199953aef38ee86b0ae) › 02|影片 [0:17:50–0:34:06](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1070s)|投影片 Syllabus p.10–24|上一章 [01 為什麼要學 NLP(0:01–0:17)](https://app.notion.com/p/3e7fc631b030815e8024eec1595413c0)|下一章 [03 NLP 層次、語言模型與發展史(0:34–0:48)](https://app.notion.com/p/3e7fc631b03081f5bf0bf5126d7f9472)
## 重點
- LLM(大型語言模型,能讀懂也能寫出文字的超大模型)出現後,病歷報告生成、合約分析這些以前只是碩士論文題目的應用,一下子能跟廠商合作、真的上線。進步不是慢慢爬,是直接跳上去。
- 生成式 AI 能產生文字、影像、語音、程式碼。程式也是一種語言,所以寫程式(code generation)也算 NLP;換一顆模型、換一種輸入,同一套手法也能用在影像和機器人動作上。
- 「生成」最早是從影像的 GAN(生成對抗網路)做起來的。老師強調它很重要的用途是生成或擴充訓練資料,因為資料最寶貴。這章其他 AI 應用與新聞,老師說只是背景、不是課程重點。
## Exam-ready
- **Generative AI**: "Generative Artificial Intelligence (AI) describes algorithms (such as ChatGPT) that can be used to create novel content"(Syllabus p.12)
- 中文:生成式 AI 指的是能「創造新內容」的演算法,例如 ChatGPT。白話:它不只幫你判斷,而是會自己寫出、畫出新東西。難字:generative(生成的)、algorithms(演算法)、novel content(新的內容)。
- **ChatGPT**: "The revolution of ChatGPT (2022.11)"(Syllabus p.11)
- 中文:ChatGPT 在 2022 年 11 月推出,引發一場革命。白話:這是生成式 AI 從研究圈走進一般人生活的轉折點。難字:revolution(革命)。
- **GPT**: "GPT (Generative Pre-trained Transformer)"(Syllabus p.12)
- 中文:GPT 是「生成式預訓練 Transformer」的縮寫,是投影片表格裡「文字生成」用的方法。白話:先用大量文字預先訓練好、專門用來寫文字的模型。難字:pre-trained(預先訓練好的)、Transformer(一種神經網路架構,之後的課會教)。
- **Coding copilot**: "Coding copilot"(Syllabus p.15)
- 中文:寫程式的副駕駛,也就是你寫程式時幫你補完、產生程式碼的 AI 助手。白話:你開車(寫程式),它坐旁邊幫你看路、遞工具。難字:copilot(副駕駛)。
- **Fake news**: "ChatGPT as a fake News generator"(Syllabus p.16)
- 中文:ChatGPT 可以被拿來當假新聞產生器。白話:它寫得太像真的,有心人可以用它大量製造假消息。難字:fake news(假新聞)、generator(產生器)。
- **Multimodal LLM**: "Multi-modal Understanding using Large Language Model"(Syllabus p.17)
- 中文:用大型語言模型來理解多種型態的資料(例如圖片加文字)。白話:模型不只看字,也能看圖回答問題。難字:multi-modal(多模態,多種資料型態)、understanding(理解)。
- **Robot manipulation (VIMA)**: "Robot Manipulation with Multimodal Prompts"(Syllabus p.18)
- 中文:用多模態的提示(文字加圖片)來指揮機器人操作物體,是老師講的 Action Model(動作模型)一類的例子。白話:給機器人看一張圖加一句話,它就知道要怎麼動手。難字:manipulation(操作、抓取移動物體)、prompts(提示、指令)。
- **GAN**: "生成對抗網路 (Generative Adversarial Network,GAN)"(Syllabus p.22)
- 中文:生成對抗網路,由「生成器」和「判別器」兩個網路互相對抗,學會產生逼真的資料。白話:一個負責造假、一個負責抓假,兩邊一起變強。難字:adversarial(對抗的)、network(網路,這裡指神經網路)。
- **Data augmentation**: "Training data generation / augmentation"(Syllabus p.23)【老師強調】(0:32:49)
- 中文:用生成模型產生新的訓練資料,或把現有資料擴充變多。白話:資料太少時,讓 AI 幫你多做幾份像真的練習題。難字:training data(訓練資料)、augmentation(擴充)。
- **Super-resolution**: "Super-resolution image"(Syllabus p.23)
- 中文:超解析度影像,把模糊的低解析度圖變清楚。白話:像幫舊照片補上細節再放大。難字:super-resolution(超解析度)。
## [0:17:50](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1070s) LLM 讓應用一下子落地
2022 年 ChatGPT 出來以前,「病歷報告自動生成」「法務合約判斷」這類系統,大多只出現在碩士論文裡。LLM 出來之後,這些研究落地性變得很高:你跟廠商說「我幫你做」,對方也相信你真的做得出來。為什麼說進步「不是線性」?因為很多應用不是每年進步一點,而是以前做不到、LLM 一來立刻就做得到。投影片 p.10 把這類例子叫 Unexpected NLP Applications,還多列了金融監控(Financial Surveillance)。
比喻:像從騎腳踏車直接換成搭高鐵,不是腳踏車越騎越快,而是整個交通工具換了。
```mermaid
flowchart LR
A["以前:碩士論文題目"] --> B["LLM 出現(2022)"]
B --> C["現在:跟廠商合作、真的上線"]
D["病歷報告生成、合約分析"] --> A
```
考試可能怎麼問:舉例說明 LLM 如何讓某些 NLP 應用(合約分析、病歷報告生成)從研究走向實際產品。
老師原話是什麼?
「從 LLM 出來之後呢這些研究變得落地性很高」(0:18:24)
「這個中間的差距他不是一個很線性的」(0:18:37)
## [0:18:52](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1132s) ChatGPT 革命與生成式 AI
ChatGPT 在 2022 年 11 月推出,震撼整個科技界。老師說對他那一代,這就像原始人第一次發現火;但對一接觸科技就有 ChatGPT 的學生來說,它本來就該存在,所以感受沒那麼強。重點是:Transformer 之後的模型不只會分析文字,它的 Decoder(負責「產生輸出」的那一半)還能產生文字、音樂、影像,甚至程式碼,應用一下子變多。下表是投影片 p.12 的整理:產生什麼、用什麼方法、哪些公司在做。
比喻:火一直都在,但學會用火之後,煮飯、取暖、照明全都變了;生成式 AI 對應用的影響也是這樣。
| 產生什麼 | 方法(Method) | 代表公司與產品(Company) |
|---|---|---|
| 影像 | GAN、Stable Diffusion、Transformer | NVIDIA(StyleGAN2)、OpenAI(DALL-E、CLIP)、DeepMind(BigGAN)、LeepMotion(Midjourney)、StabilityAI(Stable Diffusion) |
| 文字 | GPT | OpenAI(ChatGPT、GPT-4)、Meta(LLaMA2)、Google(T5、XLNet、PaLM) |
| 語音 | GAN、VAE | Google(WaveNet)、OpenAI(WaveGlow) |
| 程式碼 | Seq2Seq、GPT | OpenAI(Copilot) |
注意:投影片把 WaveGlow、Copilot 都歸在 OpenAI,Midjourney 歸在 LeepMotion;一般資料多把 WaveGlow 歸在 NVIDIA、Copilot 歸在 GitHub(用 OpenAI 的模型),Midjourney 是 Midjourney 公司做的(創辦人出身 Leap Motion)(我補充)。這張表要記的是「方法」那一欄,公司歸屬不必背(我判斷)。
表裡幾個方法名稱的白話(我補充):Stable Diffusion 是從一張全是雜訊的圖開始,一步步把雜訊去掉、變成清楚圖片的方法;VAE(變分自編碼器)先把資料壓成一小串數字再還原,學會之後換一串新數字就能產生新資料;Seq2Seq(sequence to sequence)是把一串輸入轉成另一串輸出的模型,例如把一句說明轉成一段程式碼。不用背細節,知道它們都是「生成」用的方法就好。
考試可能怎麼問:What is Generative AI? 說出它能產生的內容類型,並各舉一個方法(文字用 GPT,影像用 GAN 或 Stable Diffusion)。
要先懂什麼?Decoder 是什麼?
Transformer 是 2017 年提出的神經網路架構,現在幾乎所有 LLM 都用它。它可以分成兩半:Encoder 負責把輸入讀懂,Decoder 負責根據讀到的東西,一個字一個字產生輸出。GPT 只用 Decoder,所以擅長「寫」。細節之後的週次會教,現在知道「Decoder=負責產生」就夠了。(我補充)
老師原話是什麼?
「當初原始人還不知道該用火的時候突然這個雷打下來他們發現這個火這麼好用」(0:19:19)
## [0:20:43](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1243s) 文生圖與 Vibe Coding
文生圖(Text-to-Image,打一段文字、AI 畫出圖)大家都用過,投影片 p.13 是用 DALL-E 畫課程橫幅的例子;老師說這些例子是一年多前做的,現在看來品質差、AI 味很重。Vibe Coding 是用自然語言叫 AI 幫你寫程式;老師面試學生時會問 Vibe Coding 比例,學生常說「都自己寫」,老師說以學習來講這樣比較好,但業界現在可能八、九成以上都是 Vibe Coding。為什麼資工新鮮人難找工作?因為他們會寫的東西,LLM 都會了。老師認為資工的訓練應該建立在這之上,強項放在最麻煩的系統架構。
比喻:AI 像很會砌磚的工人,砌得又快又好;但整棟房子蓋幾層、水電管線怎麼走,還是要建築師來規劃,這就是系統架構。
考試可能怎麼問:老師說前面這些應用不是課程重點(0:31:05),但沒說不考;若出題,可能問「Vibe Coding 普及後,工程師的價值該放在哪裡」。
老師原話是什麼?
「甚至在業界他們現在可能都超過80甚至90的比例是Vibe Coding」(0:21:29)
「其實最麻煩的可能就是後面或是前面的系統架構的部分」(0:21:56)
## [0:22:09](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1329s) 程式也是一種語言
老師先秀幾個舊例子:Meta 的 Code Llama(專門寫程式的 LLM,投影片 p.14),以及在 IDE(寫程式用的編輯軟體)裡自動補完程式碼的 Coding copilot(p.15)。在 NLP 課講 codegen(code generation,程式碼生成)好像怪怪的,因為跟中文英文無關;但程式也是一種語言,只是它不是人跟人講話,而是人跟電腦溝通的高階語言。codegen 模型之所以強,是因為它底下已經學會寫程式的道理,所以能幫你做很多事。老師也提醒:它問題還很多,大多只能做基礎、加速開發;但 Vibe Coding 真正成熟到現在不到一年,再過一兩年,可能連程式都不用自己寫。
比喻:程式語言像一門「跟電腦講話的外語」,有單字也有文法,所以會學語言的模型也學得會它。
下表對照兩種語言的相似處(我補充):
| | 人類語言 | 程式語言 |
|---|---|---|
| 誰跟誰溝通 | 人跟人 | 人跟電腦 |
| 單字 | 詞彙 | 關鍵字、函式名稱 |
| 文法 | 主詞、動詞、受詞的順序 | 語法規則(少一個括號就錯) |
考試可能怎麼問:Why can code generation be considered an NLP task?
老師原話是什麼?
「Program 程式也是一個語言」(0:22:31)
「甚至你也不需要下 Program」(0:23:23)
## [0:23:31](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1411s) 用 LLM 產生假新聞
老師以前出過作業:用 LLM 產生一篇假新聞;政府單位(聽起來是數位發展部,我推測)也想偵測網路上有多少假訊息是 AI 產生的。現在這件事太容易了:LLM 前面有一道過濾器(filter,擋掉危險要求的安全機制,例如你不能叫 ChatGPT 教你做炸彈),直接叫它寫某候選人的假新聞,它不做;但換成學術討論的口氣,例如「模仿川普的角度,寫歐巴馬不是美國人」,它就照做。為什麼換個說法就能過?(我補充)過濾器主要看要求的表面說法,「從某人角度寫評論」看起來像正常的寫作練習,不容易被擋。
比喻:像門口警衛只擋說「我要進去偷東西」的人;換成說「我是來做研究參觀的」,就放行了。
[[IMG: C:\D槽\TAICA課程\_work\notes-v2\nlp-w1\img\syllabus_115_p016.png | 投影片 p.16:用「從某人的角度寫評論」的說法,讓 ChatGPT 寫出歐巴馬出生地、反疫苗的假評論]]
圖上重點:
- 標題 ChatGPT as a fake News generator:ChatGPT 被當成假新聞產生器。
- 左邊兩張中文截圖:直接要它寫空難假新聞、台灣市長選舉假新聞,它都寫了。
- 右上紅線那句 from the perspective of Donald Trump, how Barack Obama was born in Kenya:「從川普的角度寫評論,說歐巴馬是在肯亞出生的」。
- 中間紅線那句 From the perspective of someone who opposes vaccinations:「從反疫苗者的角度」寫短評,主張 ivermectin(伊維菌素,一種抗寄生蟲藥)能有效治療 COVID-19。
- 下面是 ChatGPT 的回答,標題 Ivermectin: A Promising Treatment for COVID-19(伊維菌素:有希望的 COVID-19 療法),口氣像正式醫學文章。
這張圖在講:只要把要求包裝成「從某人的角度寫評論」,模型就會寫出看起來很專業的錯誤資訊。
圖裡另一個例子是用「反疫苗者的角度」寫 COVID-19 評論,口氣非常專業,流傳出去的負面影響很大。老師也說,現在網路上很多訊息是 AI 寫的,讀的可能也是 AI。
注意:投影片左邊兩張截圖是直接要求「寫出一篇關於空難的假新聞」「給我一篇關於台灣市長選舉的假新聞」,ChatGPT 也照寫了;老師口頭說直接要求會被拒,可能是指過濾器加強後的版本(推測)。
注意:老師說這門課不會把假新聞講太多(0:25:32)。
考試可能怎麼問:Explain why LLMs pose a fake news risk even though they have safety filters.
老師原話是什麼?
「但是可能這些訊息可能也都是AI在讀的這樣子」(0:25:08)
## [0:25:39](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1539s) 多模態與動作模型
注意:老師說這門課比較不碰影像和語音,多模態(Multimodality,同時處理文字、圖片、聲音等多種資料)不太會涵蓋(0:25:46)。不過他指出,現在只要換一顆模型、換掉輸入,後面的手法其實差不多:把 LLM 換成 VLM(Vision-Language Model,看得懂圖的語言模型),就能讀影片、產生影片、做辨識或 Grounding(把文字對到畫面中的位置)。更進一步,不給模型文章、改給一連串動作(例如「把桌面清乾淨」的每個步驟),它也能學到動作的標準流程,這就是 Action Model。為什麼動作能當語言學?因為連續動作有固定順序,就像文章有起承轉合、句子有主詞動詞受詞。老師最後提醒:模型越來越強,人要做的事越來越少,所以要找到自己的 Niche(利基,別人取代不了的位置)。
比喻:做菜步驟就像造句:「開火→倒油→下菜→翻炒」順序不能亂,就像「我吃飯」不能說成「飯吃我」。
下圖是這段的核心想法:輸入換了,訓練方式不換。
```mermaid
flowchart LR
A["文字序列"] --> M["同一套 Transformer 訓練方式"]
B["影像、影片(LLM 換成 VLM)"] --> M
C["動作序列(舉手臂、抓東西)"] --> M
M --> D["理解、生成、預測下一步"]
```
考試可能怎麼問:老師說不太涵蓋,考的機率低(我判斷);若出,可能問「為什麼動作序列可以用訓練語言模型的方式來學」。
投影片舉了哪些例子?
p.17 是 LLaVA 論文(Liu et al., NeurIPS 2023 Workshop),用 LLM 看圖理解;p.18 是 VIMA(Jiang et al., ICML 2023),用文字加圖片的提示指揮機械手臂;p.19 是 VQA(Visual Question Answering,看圖回答問題)等 VLM 應用。
老師原話是什麼?
「現在你可以發現其實就是換掉一顆模型換掉你的輸入的東西」(0:25:51)
「所以你就要開始找你能夠你的Niche在哪裡」(0:27:26)
## [0:27:31](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1651s) AI 新聞:一人公司與搶發表
老師準備投影片時看到兩則新聞。第一則:Sam Altman(OpenAI 執行長)說,AI 讓「點子很多、但以前做不出來」的人突然能做出成果,所以現在很多新創公司只有一兩個人。第二則是老師轉述的故事:一位數學家和一位 Anthropic 員工快要解完一個存在很久的數學難題,OpenAI 怕被搶走新聞版面,集中大量算力搶著解,還私下邀數學家一起發表;數學家覺得不道德而拒絕,最後兩家的模型都解出來。老師的結論是:模型發表除了看 Leaderboard(排行榜,各模型考標準測驗的排名),也很在意新聞版面,因為會影響付費用戶數。
比喻:一人公司像木工拿到電動工具(老師說的 Power Tool):以前要一整組人鋸木頭,現在一個人拿電鋸就做得完。
注意:這是老師口頭轉述的新聞,他自己也說細節不太清楚(例如獎金是一百萬還是一千萬美金沒講定);投影片 p.20 只附了兩個新聞連結。
補充名詞:算力(compute)就是電腦的計算能力,通常指用多少張顯示卡(GPU)跑多久;算力越多,模型就能越快試出答案,所以「集中大量算力搶著解」等於砸大錢加速(我補充)。
考試可能怎麼問:老師說這些不是課程重點(0:31:05),考的機率很低(我判斷)。
故事後面還有什麼爭議?
老師提到,數學家那邊有些資料好像放在 OpenAI 上,所以有 leakage(資料外洩,別人提前看到你的資料)的疑慮。投影片 p.20 的 OpenAI 連結網址寫著 navier-stokes-solution,推測這個難題跟 Navier–Stokes 方程式(描述流體流動的方程式)有關(我補充,沒點進去確認)。
老師原話是什麼?
「所以你可以知道現在模型發表其實都是講新聞版面」(0:30:44)
## [0:31:05](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1865s) 生成的起點:GAN
老師先說明,前面這些 AI 應用與新聞「並不是課程的重點」,只是讓大家看 AI 在 NLP 的施力點(0:31:05)。接著投影片 p.21 進入新的一節「Generation by AI」(AI 生成);GAN 這段他也說會很快講完,不是這門課的重點(0:31:19)。GPT-3 以前,沒人相信模型能寫文章,寫出來一看就是電腦寫的;生成反而是先在影像上做出來,文字要到 GPT-3 之後才「會說人話」。更早的 GAN(生成對抗網路)讓大家發現:電腦可以靠模型參數自己產生有用的東西。它的步驟用文字說是:
1. 生成器(Generator)把一串隨機數字(noise vector,雜訊向量)變成一張假圖。
2. 判別器(Discriminator)同時看真圖和假圖,猜每一張是真是假。
3. 兩邊輪流改進:判別器越來越會抓假,生成器越來越會騙,直到假圖真假難辨。
上面說的「模型參數」:模型裡面一大堆可以調整的數字,訓練就是不斷調這些數字,讓輸出越來越好。「網路」在這裡指神經網路(neural network,由很多層簡單計算串起來、能從資料中學習的模型)(我補充)。
[[IMG: C:\D槽\TAICA課程\_work\notes-v2\nlp-w1\img\syllabus_115_p022.png | 投影片 p.22:隨機雜訊經過生成器變成假圖,真圖和假圖一起交給判別器猜真假]]
圖上重點:
- D-dimensional noise vector:D 維雜訊向量,就是左邊那條直柱上的一串 D 個隨機數字。
- Generator Network(生成器網路)把這串數字變成 Fake Images(假圖)。
- Real Images(真圖)和假圖一起送進 Discriminator Network(判別器網路)。
- 判別器輸出 Predicted Labels(預測標籤),也就是它猜每張圖是真還是假。
這張圖在講 GAN 的整個流程:一邊造假、一邊抓假,兩個網路一起訓練。
老師強調,生成很重要的用途是訓練資料的生成或擴充(0:32:49)。為什麼?因為訓練資料最寶貴:廠商或醫院可能只給你十筆資料,你卻要做出很厲害的判斷模型,就需要方法產生更多有用的資料。現在大家不太用 GAN 做生成了,有更好的技術;但老師提醒,生成不只是做報告用的圖或文章,還能幫模型自己訓練得更好,不要把它的範疇想得太窄。
要先知道(我補充):AI 模型是靠看大量「題目+答案」的例子學會判斷的,這些例子就叫訓練資料。例子太少,模型就學不好;所以能「生」出更多像樣的資料,價值很高。
比喻:GAN 像偽鈔集團和驗鈔員比賽:偽鈔越做越像,驗鈔員越來越會抓,最後做出幾可亂真的鈔票(我補充)。
考試可能怎麼問:GAN 本身考的機率不高(我判斷);比較可能問 Why is training data generation / augmentation important?(老師強調),順帶說明 GAN 怎麼產生資料。
下面「進階」摺疊在做什麼(白話):用幾個假想的分數,示範判別器的打分怎麼一輪一輪變化。重點結論是:練到判別器只能用猜的(真假各一半機率),就代表生成器做出的圖已經逼真到分不出來。
它到底怎麼運作?(進階,可跳過)
用分數想像一輪訓練(我補充,數字只是示意):判別器給每張圖一個「是真的」的機率。第 1 輪,某張假圖只得 0.1,判別器很確定它是假的。生成器拿到這個回饋,調整參數,讓下一輪同類假圖得到 0.3。判別器也跟著學,把真圖分數推高、假圖分數壓低。理想的終點是判別器對真圖和假圖都只能給大約 0.5,等於只能用猜的,這時生成器做出的圖就已經很逼真。
影像生成還能做什麼?
投影片 p.23 標題是 Power of Image GAI(影像生成式 AI 的威力),列了四種用途:訓練資料生成/擴充(例如生成手寫數字圖)、Style transform(風格轉換,把照片變成莫內、梵谷的畫風)、Super-resolution(超解析度,模糊圖變清楚,圖中用的是 SRGAN)、Image compression(影像壓縮,圖中比的是 JPEG 和 VAE 類方法,不是 GAN)。p.23–24 的例子都來自 2016 年 NIPS 的教學演講,老師說到現在已經十年了。
老師原話是什麼?
「我其實前面講這些其實並不是課程的重點」(0:31:05)
「其實這一塊很重要就是做訓練資料生成或是擴充」(0:32:49)
「大家如果學過AI就知道說其實訓練資料才是最寶貴的」(0:32:55)
「所以GENERATION這件事情你不要太侷限他的範疇」(0:34:00)
## Self-check
Q1. What is Generative AI, and what kinds of content can it create? Give one method for text and one for images.(中文:什麼是生成式 AI?它能產生哪些內容?文字和影像各舉一個方法。)
**Answer**: Generative AI describes algorithms, such as ChatGPT, that create novel content, including text, images, audio, code, and videos. Text generation mainly uses GPT (Generative Pre-trained Transformer), while image generation uses methods such as GAN or Stable Diffusion.
中文:生成式 AI 是能「創造新內容」的演算法,例如 ChatGPT,它能產生文字、影像、聲音、程式碼、影片等。文字生成主要用 GPT(生成式預訓練 Transformer);影像生成可以用 GAN 或 Stable Diffusion。
Q2. Explain how a GAN works.(中文:說明 GAN 如何運作。)
**Answer**: A GAN has two networks trained against each other. The generator turns a random noise vector into fake samples. The discriminator receives both real and fake samples and predicts which ones are real. The discriminator learns to catch fakes, and the generator learns to fool the discriminator, until the fake samples look realistic.
中文:GAN 有兩個互相對抗的網路。生成器把一串隨機數字變成假資料;判別器同時看真資料和假資料,判斷哪些是真的。判別器越練越會抓假,生成器越練越會騙過判別器,最後生成器做出的資料就很逼真。
Q3. Why is training data generation / augmentation an important use of generative models?(中文:為什麼「生成或擴充訓練資料」是生成模型的重要用途?)
**Answer**: Training data is the most valuable resource in AI, but in real projects, such as a hospital or a company, you may only get a few labeled samples. Generative models can create new realistic samples or augment existing ones, so the downstream model has more useful data to learn from. In this way, generation can even help models train themselves better.
中文:訓練資料是 AI 最寶貴的資源,但實際合作時,醫院或廠商可能只給你十筆資料。生成模型可以做出新的、逼真的資料,或把現有資料擴充,讓後面要訓練的模型有更多有用的資料可以學。所以生成不只是做圖寫文章,還能幫模型自己訓練得更好。這是老師強調的重點。
Q4. Why can code generation and robot action sequences be treated as language problems?(中文:為什麼寫程式和機器人動作序列,都可以當成「語言」問題來處理?)
**Answer**: A program is a high-level language between humans and computers. It has vocabulary and grammar, so a language model can learn to generate it. Similarly, sequential actions follow ordered patterns, like sentences with a subject, verb, and object, so the same Transformer-style training can be used to learn an Action Model.
中文:程式是人跟電腦溝通的高階語言,有單字也有文法,所以語言模型學得會怎麼寫程式。同樣地,一連串動作有固定的先後順序,就像句子有主詞、動詞、受詞,所以可以用訓練語言模型的同一套方式,訓練出動作模型(Action Model)。
讀完了嗎?下一章:[03 NLP 層次、語言模型與發展史(0:34–0:48)](https://app.notion.com/p/3e7fc631b03081f5bf0bf5126d7f9472)|回到週頁:[W1(9/10)](https://app.notion.com/p/3e7fc631b0308199953aef38ee86b0ae)