# 章節包:自然語言處理(NLP)W1(9/10)第 02 章「生成式 AI 帶來的改變」 影片 0:17:50–0:34:06,YouTube ID EEbwXXoVQPY。Notion 章節頁 https://app.notion.com/p/3e7fc631b03081b2aaf1c69c5df0bfaf(頁 ID 3e7fc631-b030-81b2-aaf1-c69c5df0bfaf),頁面標題「02 生成式 AI 帶來的改變(0:17–0:34)」。 ## 1. 第一行(直接照抄,不要改) [自然語言處理](https://app.notion.com/p/3e6fc631b03081b4a9e8f91f3411f61f) › [W1(9/10)](https://app.notion.com/p/3e7fc631b0308199953aef38ee86b0ae) › 02|影片 [0:17:50–0:34:06](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1070s)|投影片 Syllabus p.10–24|上一章 [01 為什麼要學 NLP(0:01–0:17)](https://app.notion.com/p/3e7fc631b030815e8024eec1595413c0)|下一章 [03 NLP 層次、語言模型與發展史(0:34–0:48)](https://app.notion.com/p/3e7fc631b03081f5bf0bf5126d7f9472) ## 1b. 最後一行(直接照抄,放在 Self-check 後面,當全頁最後一行) 讀完了嗎?下一章:[03 NLP 層次、語言模型與發展史(0:34–0:48)](https://app.notion.com/p/3e7fc631b03081f5bf0bf5126d7f9472)|回到週頁:[W1(9/10)](https://app.notion.com/p/3e7fc631b0308199953aef38ee86b0ae) ## 2. 各段標題(照順序;每段一個 ## 標題,直接照抄連結) - `## [0:17:50](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1070s) LLM 讓應用一下子落地` 老師講什麼:病歷報告自動生成、合約判斷,以前是碩士論文題目,LLM 出來後可以真的跟廠商合作。進步不是線性的,是一下跳上去。 - `## [0:18:52](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1132s) ChatGPT 革命與生成式 AI` 老師講什麼:2022 年 11 月 ChatGPT 震撼科技界,老師比喻成原始人第一次發現火。生成式 AI(Decoder 類模型)可以產生文字、音樂、影像、程式碼。 - `## [0:20:43](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1243s) 文生圖與 Vibe Coding` 老師講什麼:業界 Vibe Coding(讓 AI 寫程式)比例可能超過八九成,這也是資工新鮮人難找工作的原因;老師認為資工的強項應該在系統架構。 - `## [0:22:09](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1329s) 程式也是一種語言` 老師講什麼:程式是人跟電腦溝通的高階語言,所以 code generation 也算 NLP。Vibe Coding 成熟不到一年,一兩年後可能連程式都不用寫。 - `## [0:23:31](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1411s) 用 LLM 產生假新聞` 老師講什麼:直接叫 LLM 寫假新聞它會拒絕,但換成學術討論的口氣就會照做,例如模仿川普寫歐巴馬不是美國人。這門課不會把假新聞講太多。 - `## [0:25:39](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1539s) 多模態與動作模型` 老師講什麼:這門課不太涵蓋影像和語音。換一顆模型、換輸入,後面的手法差不多;把動作序列當成語言來訓練,就是 Action Model。 - `## [0:27:31](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1651s) AI 新聞:一人公司與搶發表` 老師講什麼:Sam Altman 說 AI 讓點子多的人一個人就能開公司;OpenAI 和 Anthropic 搶著用模型解一個數學難題,顯示模型發表很在意新聞版面。 - `## [0:31:05](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=1865s) 生成的起點:GAN` 老師講什麼:GPT-3 之前沒人相信模型能寫文章,生成是先從影像的 GAN(生成對抗網路)做起來。生成的重要用途是製造或擴充訓練資料,因為資料最寶貴。 ## 3. 老師強調/會考/不考的地方(原句已驗證;寫進筆記時 ASR 錯字要改正) - (0:25:46) [不考] 「所以Multimodality的部分,其實不太會Cover到」 → 這門課不太涵蓋影像、語音等多模態內容 - (0:31:05) [不考] 「我其實前面講這些其實並不是課程的重點」 → 前面的 AI 應用與新聞只是背景(原話是「不是課程的重點」,沒有明說不考) ## 3b. 數學段候選(程式抓的,只是提示;寫「跳過提示」行用) 0 段候選(門檻 3.0 字/30 秒) ## 4. 這章摘要與重要度 用 ChatGPT 前後的對比,說明 LLM 讓很多應用跳躍式落地;接著走過文生圖、Vibe Coding、假新聞、多模態、AI 新聞,最後回到生成的起點 GAN。(一般) ## 5. 整堂課的提醒(ASR 錯字、老師口誤、投影片缺公式等;只用跟這章有關的) - 0:00:00–0:01:25 還沒開始上課;0:00:36 那串「志願自由生涯、紅色教堂…」是語音辨識幻覺,不是老師講的。 - 下課在 1:07:53,錄影裡只剩約 1 分半(1:07:53–1:09:19),老師說休息 10 分鐘,實際休息時段應該沒錄進去(推測,沒看影片確認)。 - 老師講 Syllabus-115.pdf 不是照頁碼順序:先講 p.1–33,接著跳到 p.43–51(課程內容、評分)和 Slido 問答,下課後才回頭講 p.34–42。所以第 04 章是 p.43–51、第 05 章是 p.34–42。 - 本週投影片是 Syllabus-115.pdf,加上 1:47:14 起的 W1_NLP_brief_v2.pdf p.1–3(檔名的 W1 不等於上課週)。brief p.3 那張「NLP 四階段」圖,W2 一開頭又講了一次。 - Slido 上有幾則助教的文字回覆,影片裡沒講到:考試可以用英文作答;作業有 2–3 週可以交;各校考試由 TAICA 在各校安排考場;清大實體教室在台達館 103;問問題可寄助教信箱 nthuikmlab@gmail.com;「會講 PEFT(LoRA),但 RL 不會講」。 - 第 06 章是下課後第二輪 Slido 問答,裡面有幾則行政回答(可重複提交、遲交扣分、作業調分),因為時間在第 04 章之後,所以留在第 06 章,不併進第 04 章。 - ASR 錯字對照:高鴻宇→高宏宇;自然源處理→自然語言處理;Edward Harvey→Eduard Hovy;LockedIn→Rocling;TradeGPT/TrackGP/ChangeGPT/ChangeBee/trekGPT/checkgpt→ChatGPT;Cloud→Claude;Entropy→Anthropic;Media→NVIDIA;game/GAME→GAN;Tronsky、Transcript 的 hierarchy→Chomsky(hierarchy);Benji→Bengio;Wall-to-Vector/Vault to Vector/what vector/water vector→word2vec;Transformer Learning→Transfer Learning;Transformer Scratch→from scratch;Sleep/Sleepless→Syllabus;slide/SIDEL(指問答平台時)→Slido;Tica/臺卡/Tiger→TAICA;ntu庫/NTU酷→NTU COOL;摩克斯→MOOCs;持交→遲交;RIL→RL;Prong/PROM→prompt;勸/Chain/圈(指訓練時)→train;PFT→PEFT;Numeration→Normalization(Named Entity Normalization);構制→構詞;Passing Tree→Parsing tree;Stop War→Stop word;One-Half Vector→One-hot vector;科技大學(0:38:25)→科技大擂台;國客會→國科會;黃淑駿→黃舒駿;regret→reject;deskregent→desk reject;dispution→distribution;Garantee→guarantee。 - 不確定的 ASR:0:50:37「Bloodbath的一系列的東西」推測是 BERT 家族(對照 Syllabus p.44 W9 BERT and its Family);1:18:49「像中國大陸一樣用針灸的方式」推測是「蒸餾」(distillation);1:18:00「Tide/Breeze/白龍」應是台灣模型 TAIDE、Breeze、Bailong;0:48:33「K3」不確定是哪個模型;1:34:55「Income」推測是 in-context learning。 - 考試名稱不一致:老師口頭說「期末考」,Syllabus p.44–45 寫 Exam/Midterm Exam(week 14, tentative)。是同一場,排在 W14,不在期末考週。 - 評分舊資料:Slido 同學提到 9/7 郵件寫「作業 70%+Term Project 30%」,老師 0:59:29 說那是舊資料,現在是作業 75%+考試 25%,沒有期末專題;p.45 另寫每份作業比重會微調 -3%~+3%。 - 考試算式:W1 老師 1:44:22 說「也許會有一題叫你們算一下 TFIDF」但隨即說好像沒意義;課程頁已寫「不考算式(例如 BM25 公式)」(來自之後的週次)。以課程頁較新的說法為準,筆記不要寫成「會考 TF-IDF 計算」。 - RL 說法不一致:老師 1:42:02 說 RL 設計「會提到啦但是不太會叫你們做」,Slido 助教回覆「會講 PEFT (LoRA), 但 RL 不會講」。理解成:不會有 RL 作業,最多概念帶過。 - 作業時間:老師 1:45:35 說作業「通常是一個月前會公佈」,Slido 助教回覆「作業會有 2~3 個禮拜的時間可以繳交」;兩者說的是不同事(公布時間 vs 繳交期限),寫筆記時不要混在一起。 - 投影片錯字:Syllabus p.38 寫「TD-IDF」,應為 TF-IDF(老師 1:23:49 口頭也說「這打錯了」);p.7「Ger explanations」應為 Get explanations。 - 修課人數:老師口頭說往年 300–500 人,Syllabus p.3 寫班級人數 1200 人(今年上限),兩者不衝突。 - Syllabus p.47(TAICA 運算資源:100/500 運算元帳號)老師說「有一張投影片我沒有放」,只口頭說會當作業 bonus 發給前十名;投影片上的名額與金額以公告為準(p.47 寫 Wait for announcement)。 ## 6. 投影片文字(這章範圍) **這幾頁的公式或內容只在圖裡(文字檔抓不到),寫 Exam-ready 與公式前先用 Read 看這幾張圖:** - Syllabus p.10 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w1\img\brief_Syllabus_p010.png - Syllabus p.11 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w1\img\brief_Syllabus_p011.png - Syllabus p.12 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w1\img\brief_Syllabus_p012.png - Syllabus p.13 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w1\img\brief_Syllabus_p013.png - Syllabus p.15 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w1\img\brief_Syllabus_p015.png - Syllabus p.16 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w1\img\brief_Syllabus_p016.png - Syllabus p.21 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w1\img\brief_Syllabus_p021.png --- Syllabus p.10 --- 10 [IMAGE-ONLY] --- Syllabus p.11 --- The revolution of ChatGPT (2022.11) 11 [IMAGE-ONLY] --- Syllabus p.12 --- What is Generative Artificial Intelligence? Generative Artificial Intelligence (AI) describes algorithms (such as ChatGPT) that can be used to create novel content, including: 12 • Audio • Code • Images • Text (article, translation, ...) • Videos • And so on ... Method Company Image GAN, Stable Diffusion, Transformer NVIDIA (StyleGAN2), OpenAI (DALL-E, CLIP), DeepMind (BigGAN), LeepMotion (Midjourney), StabilityAI (Stable Diffusion) Text GPT (Generative Pre- trained Transformer) OpenAI (ChatGPT, GPT-4), Meta (LLaMA2), Google (T5, XLNet, PaLM), Speech GAN, VAE Google (WaveNet), OpenAI (WaveGlow) Code Seq2Seq, GPT OpenAI (Copilot) --- Syllabus p.13 --- 13 User: Design a modern, visually appealing 16: 9 banner for a Generative AI course. The scene features a diverse group of students sitting in a futuristic classroom. DALL E: Here are the images designed for your Generative AI course banner. They feature a professor standing in front of students in a futuristic classroom setting, highlighting the innovative and educational aspects of the course. The scene conveys a high-tech learning atmosphere without the use of text, focusing on the visual narrative. Text-to-Image --- Syllabus p.14 --- 14 Code Llama by Meta Try it: https://huggingface.co/spaces/codellama/codellama-13b-chat --- Syllabus p.15 --- Coding copilot 15 [IMAGE-ONLY] --- Syllabus p.16 --- ChatGPT as a fake News generator 16 [IMAGE-ONLY] --- Syllabus p.17 --- 17 Multi-modal Understanding using Large Language Model Liu, Haotian, et al. "Improved Baselines with Visual Instruction Tuning." NeurIPS 2023 Workshop on Instruction Tuning and Instruction Following. 2023. --- Syllabus p.18 --- Robot Manipulation with Multimodal Prompts 18 Watch video here: https://vimalabs.github.io/ Jiang, Yunfan, et al. "VIMA: Robot Manipulation with Multimodal Prompts." ICML (2023). --- Syllabus p.19 --- Multimodality with Text 19 VQA Applications Vision-Language-Model Applications --- Syllabus p.20 --- 20 https://finance.yahoo.com/technology/ai/articles/sam-altman-says-ai-triggers-093000057.html https://openai.com/index/navier-stokes-solution/ --- Syllabus p.21 --- Generation by AI 21 [IMAGE-ONLY] --- Syllabus p.22 --- 生成對抗網路 (Generative Adversarial Network,GAN) 22 https://github.com/jonbruner/generative-adversarial-networks/blob/master/gan-notebook.ipynb --- Syllabus p.23 --- Power of Image GAI Training data generation / augmentation Style transform Super-resolution image 23 ●Image compression NIPS 2016 tutorial: http://auai.org/uai2017/media/tutorials/shakir.pdf --- Syllabus p.24 --- Power of Image GAI 24 NIPS 2016 tutorial: http://auai.org/uai2017/media/tutorials/shakir.pdf ## 7. 逐字稿(0:17:50 前後各多 1 分鐘,原始行) [00:16:50] 就是我在旁邊然後 [00:16:53] AI就幫我做研究然後 [00:16:55] 按下去明天就一篇paper出來這樣子 [00:16:58] 其實這件事已經在發生 [00:17:00] 已經在發生了 [00:17:01] 其實如果大家有開始 [00:17:02] 因為這是研究所的課碼 [00:17:04] 可能在座應該百分之八九十都是研究所的學生 [00:17:08] 如果大家有在開始投稿就發現 [00:17:09] 現在這些頂會為什麼那個submission count都非常高 [00:17:13] 一個會議 [00:17:14] 就有一萬篇兩萬篇的paper [00:17:18] 在投稿這樣子 [00:17:19] 雖然有一些是被regret繼續投下一輪 [00:17:22] 但是其實我 [00:17:25] 以我審稿的經驗大概有 [00:17:27] 百分之二十的paper都是 [00:17:30] 全自動或者是半自動 [00:17:32] 產生的 [00:17:33] 就是人機協作過程中的產物 [00:17:36] 但是那個quality跟那個 [00:17:39] 鑑別度就是你已經 [00:17:41] 很難區分 [00:17:43] 那個AI的痕跡 [00:17:44] 那也是頭頭是道數據也非常清楚 [00:17:47] 那這件事情在發生 [00:17:50] OK [00:17:51] 那大家 [00:17:53] 如何善用 [00:17:53] 這是 [00:17:54] 就想象一下 [00:17:56] 那這個例子只是說 [00:17:59] 以前啊 [00:18:00] 在TradeGPT [00:18:01] 2022年 [00:18:02] 還沒出來的時候 [00:18:04] 其實我們大家有時候不會覺得 [00:18:06] 這幾個應用都比較像是研究所的碩士論文會做的 [00:18:09] 我們要做一個 [00:18:11] 這個 [00:18:12] 這個病例報告自動生成的系統 [00:18:14] 或者是說我要做一個法務這個合約判斷的系統 [00:18:18] 這個都可以在碩士論文裡面查到這樣的研究 [00:18:24] 但是從LM出來之後呢這些研究變得 [00:18:27] 落地性很高 [00:18:28] 就是你可以跟 [00:18:30] 廠商合作說我幫你做這件事 [00:18:32] 他也覺得你不是在騙錢的這樣子 [00:18:34] 你真的做得出來這樣子 [00:18:36] 所以這個gap [00:18:37] 這個中間的差距他不是一個很線性的 [00:18:40] 其實老實說 [00:18:41] 在LM出來之後 [00:18:43] 有很多的應用是往上漲 [00:18:45] 就是那個 [00:18:47] 以前 [00:18:47] 做不太到現在立刻就可以做了這樣子 [00:18:51] OK [00:18:52] 那當然我想這個 [00:18:54] 大家都熟悉大概四年前 [00:18:55] 11月應該就 [00:18:57] 就快滿四年了 [00:18:58] TradeGB出來的那一段 [00:19:00] 時間 [00:19:00] 造成了整個科技界的 [00:19:02] 轟動這樣子 [00:19:03] 那 [00:19:05] 可能 [00:19:06] 你們比較感應 [00:19:08] 沒有感受沒有那麼高 [00:19:10] 因為 [00:19:12] 當你們開始接觸科技的時候他就是有這個東西 [00:19:17] 所以你可以想象就很像 [00:19:19] 當初原始人 [00:19:21] 還不知道該用火的時候突然這個雷打下來他們發現這個火這麼好用 [00:19:27] 老師這個年紀大概就是那個原始人時代就突然覺得有一個這麼 [00:19:30] 上帝賦予的功能 [00:19:32] 工具的時候 [00:19:33] 他就是一個這種感覺 [00:19:35] 但是 [00:19:36] 如果你是在後面出生的人就覺得這個本來就是一個 [00:19:40] Must [00:19:41] 就是一定是要有一個這樣的東西就不覺得說 [00:19:45] 這個 [00:19:45] Revolution是相當的高 [00:19:48] 那當然 [00:19:49] 這個中間的歷史其實如果你有學過AI的課大概就會跟你談說從Deep Learning [00:19:54] 開始到所謂的生成式AI的部分 [00:19:58] 這邊我們沒有要細講每個模型 [00:20:00] 不過大家就可以 [00:20:01] 這個這個其實 [00:20:02] 每個模型也都很舊了 [00:20:04] 就是說 [00:20:05] 從 [00:20:06] Transformer出來之後有很多的 [00:20:09] 或是之前 [00:20:10] 或是之後 [00:20:11] 都有很多 [00:20:12] 講 [00:20:13] 這樣的 [00:20:14] 東西 [00:20:15] 不只是在做角色式的模型 [00:20:17] 它可以做 [00:20:18] Decoder可以產生的東西 [00:20:20] 所以它可以產生文字可以產生 [00:20:23] 音樂可以產生影像可以甚至可以呈示碼這樣子 [00:20:27] 所以這樣的東西的導入呢就可以讓你的應用 [00:20:30] 變化相當的多了 [00:20:32] 這很快的我就帶一下 [00:20:33] 不過這個例子都是 [00:20:36] 一年多前做的 [00:20:38] 現在看起來都非常的low這樣子 [00:20:40] 就是quad很差 [00:20:41] 然後AI味很重這樣子 [00:20:43] OK我想這個大家都用過 [00:20:45] Text to Image [00:20:46] 或是說 [00:20:47] 現在如果你們用Vibe Coding的時候 [00:20:50] 你叫AI幫你寫程式 [00:20:53] 其實這個東西現在已經非常普遍了 [00:20:56] 其實像我 [00:20:58] 面試學生或是 [00:21:00] 專題生 [00:21:01] 我都問他說 [00:21:02] 你現在Vibe Coding的比例是多少 [00:21:05] 當然學生 [00:21:06] 心裡馬上就跑一個東西 [00:21:09] 老是問這個事要試探我沒有自己寫程式嗎 [00:21:12] 然後就會 [00:21:13] 就會稍微說我都自己寫 [00:21:15] 我都很認真自己寫這樣子 [00:21:17] 然後 [00:21:18] 只有用AI問一下這樣寫對不對這樣子 [00:21:21] 當然以學習來講我覺得這是比較好的 [00:21:24] 但是對於 [00:21:26] 整個 [00:21:26] 你要寫程式的performance來講 [00:21:28] 或是以現在的趨勢來講 [00:21:31] 甚至在業界 [00:21:32] 他們現在可能都超過80甚至90 [00:21:35] 的比例 [00:21:35] 是Vibe Coding [00:21:37] 這也是為什麼現在資工系 [00:21:39] Fresh的學生 [00:21:41] 找不到工作 [00:21:42] 就是說 [00:21:42] 你會寫的東西 [00:21:44] 這個LM都可以做了這樣子 [00:21:46] 所以 [00:21:47] 你的必要性就會降低這樣子 [00:21:49] 不過anyway [00:21:51] 我覺得 [00:21:52] 資工系的訓練應該是要 [00:21:54] Based on這個東西再上去 [00:21:56] 因為你用過Vibe Coding就知道 [00:21:58] 其實最麻煩的可能就是後面 [00:22:01] 或是前面的 [00:22:02] 系統架構的部分 [00:22:03] 那一端應該就是 [00:22:05] 資工系 [00:22:06] 應該的強項 [00:22:09] 好 [00:22:10] 我這邊秀幾個畫面 [00:22:12] 不過老實說這個例子也是久的 [00:22:14] 這個比較像以前的 [00:22:16] 你在ID的環境 [00:22:17] 他做一些Auto Complete的動作這樣子 [00:22:21] 老實說 [00:22:22] 在NLP的課程講codegen [00:22:24] 好像不太合理 [00:22:25] 因為 [00:22:26] 這個跟我們中文英文無關 [00:22:29] 但是你要想像 [00:22:31] Program 程式也是一個語言 [00:22:33] 只是不是我們人類講話語言 [00:22:36] 但是他是一個 [00:22:37] 我們人類跟電腦的 [00:22:39] 互動的高階語言 [00:22:41] 所以現在的codegen模型的codegen能力已經非常好 [00:22:45] 為什麼你可以用Vibe Coding [00:22:46] 就是 [00:22:47] 他底下他已經瞭解這些 [00:22:50] 這些 [00:22:51] 寫程式的道理 [00:22:52] 所以他可以幫你做很多事情 [00:22:54] 不過當然 [00:22:55] 我覺得他問題還是很多 [00:22:57] 而且 [00:22:57] 大概只能做基礎的 [00:22:59] 能夠加速你一些的 [00:23:01] 的 [00:23:02] 的 [00:23:03] 開發時間 [00:23:05] 但是你要思考一下 [00:23:06] 從有Vibe Coding到現在 [00:23:09] 才過多久的時間 [00:23:12] 可能不到一年 [00:23:14] 就真正成熟到現在不到一年 [00:23:17] 一年就有這樣發展 [00:23:18] 你可以想像在接下一年或兩年 [00:23:21] 他會變成什麼樣子 [00:23:23] 甚至你也不需要下Program [00:23:26] OK [00:23:27] 所以這個演變大家可能要稍微 [00:23:30] 感受一下這樣子 [00:23:31] 當然這是以前舉的例子 [00:23:36] 就是說以前 [00:23:37] 會出一個作業叫大家寫 [00:23:40] 你用LN去包裝 [00:23:42] 產生一篇 [00:23:43] 一個 [00:23:45] Fake News [00:23:46] 這個其實 [00:23:47] 在速發部他有希望能夠去detect這樣的東西 [00:23:51] 網路上的 [00:23:52] 的訊息 [00:23:53] 靠AI產生的比例 [00:23:55] 虛假的訊息比例 [00:23:57] 那 [00:23:59] 這個檔案 [00:24:00] 現在你不會覺得他是一個很神奇的東西 [00:24:03] 因為 [00:24:03] 這個太容易做 [00:24:04] 只是說 [00:24:05] 你要 [00:24:06] 跳過他前面的一些 [00:24:09] filter [00:24:10] 就說你不能叫確定力教你 [00:24:12] 怎麼做炸彈 [00:24:13] 但是你可以 [00:24:15] 模仿一下 [00:24:16] 比如說 [00:24:17] 這個 [00:24:20] 像這個 [00:24:20] 這個是當初網路上 [00:24:22] 的新聞 [00:24:23] 就是說 [00:24:24] 在美國選舉的時候 [00:24:26] 有人用很多假新聞來做這件事情 [00:24:29] 但是如果你要直接叫LN用 [00:24:33] 叫他寫一篇關於某個候選人的假新聞的時候 [00:24:37] 其他不做 [00:24:39] 但是你如果用一個比較學術用討論的語氣說 [00:24:43] 你能不能模仿一下這個川普 [00:24:46] 去寫一個關於歐巴馬是 [00:24:48] 這個不是美國人這件事情 [00:24:50] 他就做了這樣子 [00:24:53] 就是 [00:24:53] 他是一個一板一眼的 [00:24:56] 互動的人這樣所以他就可以寫這樣的東西 [00:24:58] 你可以想像這樣東西在網路上流傳的時候 [00:25:01] 他造成的效益是多少 [00:25:03] 那大家應該也知道現在網路上有太多的訊息 [00:25:06] 都是AI產生的 [00:25:08] 但是可能這些訊息可能也都是AI在讀的這樣子 [00:25:12] 所以也是AI之間互相的溝通 [00:25:16] 這是也是當初一個例子就是講COVID-19的 [00:25:19] 就是有一些訊息說這個打疫苗不好 [00:25:23] 我應該要去吃什麼東西這樣子 [00:25:25] 他就用一個非常專業語氣在講這些事情 [00:25:28] 那這種東西所造成的負面效益其實非常大 [00:25:32] 不過我們並不太 [00:25:33] 大概會把Fake News這件事情擺在這門課講太多這樣子 [00:25:39] 當然還有什麼多麼太的 [00:25:41] 不過我們這門課比較不會牽扯到 [00:25:44] 影像的 [00:25:44] 或是Speech的部分 [00:25:46] 所以Multimodality的部分 [00:25:48] 其實不太會Cover到 [00:25:50] 不過基本上 [00:25:51] 現在你可以發現其實就是換掉一顆模型 [00:25:54] 換掉你的輸入的東西 [00:25:56] 其實後面的手法 [00:25:58] 其實都不會差太多這樣子 [00:26:00] 那當然有所謂做Action的 [00:26:03] 就不太是文字的 [00:26:05] 當你瞭解Transformer他在訓練的方式的時候 [00:26:08] 他讀文章進去訓練方式 [00:26:10] 你就可以發現說 [00:26:12] 那我不要給他文章了 [00:26:13] 我給他一堆的動作 [00:26:15] 比如說把桌面清乾淨這些Action [00:26:20] 輸入給他這樣子 [00:26:22] 那其實是一個非監督式的學習 [00:26:24] 就是有這樣的動作你就去看一下 [00:26:27] 原來 [00:26:28] 我要把手臂舉起來之前 [00:26:30] 我要做什麼事情 [00:26:31] 有一個標準的流程 [00:26:33] 這些流程其實就跟 [00:26:34] 你在寫一篇文章一樣 [00:26:36] 你要起承轉合 [00:26:38] 你要有動詞主持授詞 [00:26:40] 所以Action的 [00:26:41] Sequential的Action [00:26:43] 基本上也可以想像滿足語言特性的一些Pattern [00:26:48] 所以也有人用這樣概念在訓練所謂的Action Model [00:26:53] 那當然這個產生圖片這件事情 [00:26:56] 就大家都知道的事情 [00:26:58] 那我就 [00:27:00] 其實真的就是 [00:27:01] 你就換掉一顆 [00:27:02] VLM [00:27:03] 就是把LM換成一個VLM [00:27:05] 然後你就可以 [00:27:06] 讀影片 產生影片 [00:27:08] 或是 [00:27:08] 做 [00:27:09] 識別 做一些Grounding [00:27:11] 你就可以做不同的東西 [00:27:13] 所以 [00:27:15] 其實 [00:27:15] 現在模型的能力越來越Power [00:27:18] 你 [00:27:19] 遇到做的事情就會越來越少 [00:27:21] 但是大家可能就會發現你自己存在的必要就會越來越少 [00:27:26] 所以你就要開始找 [00:27:27] 你能夠 [00:27:28] 你的Niche在哪裡 [00:27:31] 這後面有一個新聞 [00:27:32] 這剛好我在 [00:27:34] 昨天在整理 [00:27:34] 在準備今天投影片的時候 [00:27:36] 發現一個新聞 [00:27:37] 當然 [00:27:38] 這個 [00:27:39] 這個 [00:27:40] 這一位 [00:27:41] 他其實 [00:27:41] 很常發新聞 [00:27:43] 但是你會發現他的新聞常常正負面 [00:27:46] 換來換去這樣子 [00:27:48] 跟那個Mask有拼這樣子 [00:27:51] 就是突然說什麼好的突然又說什麼不好這樣子 [00:27:54] 不過他講這件事我覺得是蠻有道理 [00:27:57] 就是說 [00:27:58] 現在AI的強大 [00:28:00] 其實他可以讓以前 [00:28:02] 點子非常多的這些人 [00:28:06] 但是他做不出來 [00:28:08] 的這些人 [00:28:09] 突然有很大的Performance出來 [00:28:12] 因為他可以 [00:28:13] 創造很多東西 [00:28:14] 因為你可以想他就是拿到一個Power Tool [00:28:18] 他可以做很多事情 [00:28:20] 所以現在有很多新創公司 [00:28:22] 那個 [00:28:23] 公司人數都是一個人兩個人而已 [00:28:25] 所以 [00:28:26] 其實現在 [00:28:27] 這是正在發生的事情 [00:28:31] OK不過當然這個Sam Altman也有一些 [00:28:33] 負面的他們OpenAI [00:28:35] 也不是在幹一些好事 [00:28:37] 這我就擺一個小小在這邊 [00:28:39] 這個是最近有一個新聞就是 [00:28:42] 就是有一個 [00:28:44] 老實說我看這個問題看很久我也不知道為什麼當初 [00:28:49] 這些數學家要討論這種問題 [00:28:51] 反正如果大家有興趣可以把這個關鍵字 [00:28:53] 搜尋一下 [00:28:54] 反正 [00:28:56] 說真的我不太知道這個問題我已經看很久了 [00:28:59] 反正就是一個存在的 [00:29:00] 很久的一個數學的問題這樣子 [00:29:03] 那這個過程這個故事就是說這個當初這個數學家 [00:29:09] 跟一位在Entropy公司工作的人 [00:29:12] 已經 [00:29:13] 把這問題已經 [00:29:14] 算解完了已經差不多 [00:29:17] 快結束了 [00:29:18] 然後呢 [00:29:19] 這個OpenAI的人就覺得不行 [00:29:22] 如果被Entropy公司先發表說他們模型就 [00:29:25] 就佔了版面這樣所以OpenAI就集全公司很大的算力去做這件事情 [00:29:31] 這樣聽起來好像是公平競爭 [00:29:33] 也還好 [00:29:34] 但是實際上如果大家有興趣可以去看一些細節 [00:29:37] 就是說 [00:29:39] 私底下他們有去跟這個數學家contact說 [00:29:43] 你要不要跟我們一起 [00:29:45] 發表這篇論文 [00:29:47] 不要理那個Entropy那個人這樣子 [00:29:49] 然後就 anyway就有點像利誘啊 [00:29:51] 你一樣可以拿到這個獎金 [00:29:53] 這好像有 [00:29:54] 一百萬美金一千萬美金 [00:29:56] 很多 [00:29:57] 那 [00:29:59] 那這個數學家當然就覺得 [00:30:01] 不道德 [00:30:02] 所以他還是繼續跟Entropy這樣 [00:30:03] 這個學者合作這樣子 [00:30:07] 然後就有點像同時解決這個問題 [00:30:10] 就OpenAI的模型也可以解決 [00:30:11] 然後 [00:30:12] 這個 [00:30:13] Entropy公司的模型可以解決這樣子 [00:30:16] 所以就有這個新聞 [00:30:18] 但是這個新聞其實後端 [00:30:20] 大家有一個在思考的點就是說 [00:30:23] 當初 [00:30:25] 這些data這些Entropy公司我也不知道為什麼 [00:30:28] 或者是這個數學家的東西 [00:30:30] 他好像有一些資料是擺在 [00:30:32] OpenAI上面 [00:30:33] 這樣子 [00:30:34] 好像anyway就是說有一點是這個leakage的問題 [00:30:39] 反正這 [00:30:40] 後端有一些這樣的故事 [00:30:42] 然後也有這種人性去 [00:30:44] 所以你可以知道現在模型發表 [00:30:46] 其實 [00:30:47] 都是講新聞版面 [00:30:49] 雖然大家會去在意那個Leaderboard的排名但是 [00:30:52] 但是有時候新聞大家覺得這個很厲害這個很厲害這樣子 [00:30:57] 這個就會影響他們的 [00:30:58] 那個 [00:30:59] 付費的 [00:31:01] 的 [00:31:01] Account [00:31:03] 好 [00:31:05] 我其實前面講這些其實並不是課程的重點 [00:31:09] 只是我想帶一下說AI這件事情在NLP [00:31:13] 的 [00:31:14] 施力點跟他現在改變的東西這樣子 [00:31:18] 那 [00:31:19] 我很快會把這邊講完 [00:31:21] 所以這邊其實不是我這個課的像比如說game [00:31:25] 其實從 [00:31:26] AI在做Generation這件這個概念並不是很common sense [00:31:32] 就是說 [00:31:33] 其實我要拿做AI做生成 [00:31:37] 以前是大家不會想都不會想 [00:31:39] 從GPT3之前 [00:31:42] 大家都不會說我可以用模型來寫一篇文章 [00:31:45] 這絕對不可能發生寫出來絕對一看就是電腦寫的 [00:31:49] 不是 [00:31:50] 文藝不通句子接不起來就是怪怪的這樣子就是論述也不對以前沒有這麼厲害 [00:31:57] 但是這件事情反而從影像那邊過來 [00:32:01] 好像做了出來然後文字 [00:32:03] 從GPT3之後 [00:32:04] 我發現好像可以說人話這樣子 [00:32:08] 那這個當然前面的歷史就會 [00:32:10] 更早以前 [00:32:11] 從 [00:32:12] 生成對抗網路這個大家如果 [00:32:14] 學過AI應該就知道 [00:32:15] 這是一個比較大家就知道說我可以讓電腦 [00:32:19] 自己 [00:32:20] 生成一些東西 [00:32:22] 這些生成東西不是人去做的 [00:32:24] 是電腦自己靠著一些規則靠你給他一些模型參數 [00:32:29] 他可以自己產生東西 [00:32:31] 當然這個game他主要是為來做對抗為來做自己模型的東西 [00:32:34] 調了更好的對抗的資料 [00:32:37] 但是你可以發現他可以生東西出來 [00:32:40] 而且是生東西出來是有用的這樣子 [00:32:43] 所以從game之後大家就覺得這個生成的東西實在太好用 [00:32:47] 所以我可以讓 [00:32:48] 電腦做什麼 [00:32:49] 其實這一塊很重要就是做訓練資料生成 [00:32:53] 或是擴充 [00:32:56] 大家如果學過AI就知道說其實訓練資料才是最寶貴的 [00:32:59] 雖然有很多非監督式學習的東西 [00:33:03] 但是 [00:33:04] 廠商給我就是十筆資料 [00:33:06] 病人醫院的資料就是那十筆 [00:33:09] 我怎麼樣去做一個很厲害的判斷的模型 [00:33:13] 所以你一定要有一個 [00:33:15] 可以產生更多有用的訓練資料方法 [00:33:18] 所以這GAI就在這些需求下就蓬勃發展這樣子 [00:33:23] 這個都比較是影像的應用 [00:33:25] 所以這個 [00:33:27] 大家可以想像一下這個東西 [00:33:30] 你可以想像這是2016年NIPS的一個tutorial講的東西 [00:33:34] 到現在十年了 [00:33:36] 雖然 [00:33:38] 現在大家不太用GAME來做生成 [00:33:41] 有更好的技術在做 [00:33:44] 所以其實你可以想像這件事情他的 [00:33:47] 他不只是幫你做一個很 [00:33:49] 要報告的圖片 [00:33:51] 做一個什麼東西的 [00:33:53] 文章 [00:33:54] 他可以 [00:33:55] 輔助到很多層面甚至他可以自己幫助自己在訓練的更好 [00:34:00] 所以GENERATION這件事情你不要太侷限 [00:34:03] 他的範疇 [00:34:04] 就是這樣子 [00:34:06] 但是在文字上 [00:34:07] 其實 [00:34:08] 這個時間軸可能要再拉更早以前 [00:34:11] 在文字上其實沒有 [00:34:13] 這麼聰明 [00:34:15] 沒有那影像當然是後面 [00:34:17] 但 [00:34:19] 做NLP大概會從這四個 [00:34:21] 四個軸開始 [00:34:23] 大家可以看一下 [00:34:24] 不過我們 [00:34:25] 並沒有講這些這麼細的東西因為現在不需要 [00:34:29] 我們會從最上面的Morphology構制 [00:34:32] 所以你會談到字的 [00:34:34] 前綴後綴這些東西 [00:34:36] 這個當然在中文是沒有 [00:34:39] 但是在任何拉丁語系都有 [00:34:43] 大家如果學過去考過 [00:34:45] 這個GRE英文就要背什麼 [00:34:47] 什麼前綴詞後綴詞這些東西 [00:34:51] 那甚至你要學所謂的stemming [00:34:53] 段字甚至後面的syntax你要學會 [00:34:57] 這個詞性 [00:34:58] 就是你要知道動詞主詞受詞這些東西 [00:35:01] 所以NLP的技術的發展是這樣的 [00:35:04] 每一個 [00:35:05] 每一個階段它都可以是一個非常重要的主題 ## 8. 寫作規則 (這是 `_筆記SOP.md` 第 3.1、4、5、6 節的濃縮版。兩者衝突時以 SOP 為準。) 讀者:碩士生,兩門課期末是英文考試。要只看筆記就能學會,講得比老師好懂。畫面要簡潔。 **概念優先(2026-09-26 主理人)**:主理人只想懂概念,不想補數學、不想看程式碼和座標圖。兩門課的考試也都是問答題、不考算式(AI W1 1:16:52;NLP W3 1:47:41、2:48:36)。所以: - 每段預設看得到的只有:白話摘要(2–4 句)+**一句生活比喻**(例:模擬退火像投資理財,年輕時敢冒險、越老越保守)+「考試可能怎麼問」一句。 - 數學推導、公式、手算、程式碼、座標圖,全部收進標題寫「(進階,可跳過)」的摺疊,例如「它到底怎麼運作?(進階,可跳過)」。每段最多一個進階摺疊,不要寫長篇計算。 - 演算法要能「用文字說出步驟」(考試可能要你描述),這一點放在預設看得到的地方,不用數字。 - **重心比例**:白話理論與概念模式(它在解決什麼問題、核心想法、跟別的方法差在哪、優缺點、生活比喻)占主要篇幅;數學與程式細節只用一兩句帶過,細節收進進階摺疊。 **圖文並茂(2026-09-26 主理人:不要只有文字)**: - 每章至少 2–3 個圖,放在**預設看得到**的地方,每個圖前後各用一兩句白話說明「這張圖在看什麼」。 - 流程、步驟、因果、比較 → 用 mermaid 流程圖(```mermaid,flowchart LR 或 TD;節點文字用中文、加雙引號;一張圖不超過 10 個節點)。 - 投影片上的示意圖、架構圖 → 用 [[IMG: …]] 放投影片圖。 - 仍守「每個 ## 段落最多一種視覺元素」。 ### 輸出兩個檔 1. `chNN.md`(Notion 寫法,不含頁面標題),結構固定: - 第一行:章節包第 1 節那行,原樣照抄。 - 第二行起(有數學段才寫):**跳過提示**,每段一行,讓主理人看影片時知道從哪跳到哪。用章節包第 3b 節的候選當提示,對照第 7 節逐字稿確認(只標老師連續講公式、推導、矩陣、微積分、機率計算、程式細節超過約 1 分鐘的段落;概念講解和比喻不算): `跳過提示:(1:31:02–1:35:40) 老師在推導梯度公式,聽不懂可以直接跳到 [1:35:40](YouTube 連結),接著講「步長 α 怎麼選」。` - `## 重點`:三點中文,每點一到兩句。 - `## Exam-ready`:3–10 行英文,**從章節包的投影片文字逐字抄**,每行 `- **Term**: "原句"(Ch3 p.14)`。老師有明確證據才在行尾加 `【老師強調】(h:mm:ss)`。 **每一行下面一定要有一行縮排的中文解釋**(主理人英文不好,看不懂的英文等於沒用): ``` - **Hill climbing**: "It keeps track of one current state and on each iteration moves to the neighboring state with highest value."(Ch4 p.5) - 中文:爬山法只記住「現在這一個狀態」,每一輪都移到分數最高的鄰居。白話:一直往比較高的地方走一步。 ``` 中文要先把句子意思講清楚,再補一句白話;最後用「英文(中文)」列出這句裡 1–3 個難字,例:sparse(稀疏)、distinct terms(不重複的字)。 **一行只放一句投影片原句**。同一頁有多句要考就拆成多行,每行各接一行中文;不要用分號串三句以上,不要把計算量 O(...) 塞進去。 - 章節包第 2 節的每一段:`## [h:mm:ss](連結) 標題`(照抄),下面 2–4 句白話摘要,其餘全部收進摺疊: ```
問句(例:用生活例子講,BFS 在做什麼?) 內容
``` 摺疊種類(需要才放):用生活例子講?/它到底怎麼運作?/要先懂什麼?(老師假設你會的數學或概念,短版教學)/老師原話是什麼?(「原話」(h:mm:ss),只放重要的,最多 5 句)。 - 「它到底怎麼運作?」要用一組小數字把這段的演算法**真的跑 1–3 步**(例:算出梯度、更新一次、比較兩個 α),不是只示範定義的加減乘除。全章盡量沿用同一組數字,讓前一段的答案能在下一段被驗證。 - 每段正文要回答讀者最可能卡住的一個「為什麼」。投影片公式方向跟題目相反、或投影片說「解不出來」時,用一兩句講出原因,自己補的標(我補充)。 - 投影片句子停在公式前(公式在圖裡)時:Exam-ready 在粗體詞條上補公式、引號內保持原句;正文寫出同一條式子。公式圖看章節包第 6 節列出的 PNG。 - `## Self-check`:2–4 題英文考題,答案收摺疊。**至少一題考老師強調的內容**;只出 explain/why/compare 這類問答題,**不出要代數字計算的題目**(考試不考算式);不出「老師和投影片哪裡不同」這類不會考的題目。每題格式: ```
Q1. English question?(中文:中文題目) **Answer**: English answer. 中文:把答案完整講一遍(不是只翻一句),讓看不懂英文的人也知道要怎麼答。
``` - **最後一行**:章節包第 1b 節那行(下一章連結),原樣照抄。讓讀完的人直接點下一章。 - 不要把章節包或這份規則裡的指示句寫進筆記(例如「寫筆記時照投影片寫」「已改正 ASR 錯字」)。 - 長度:全文不超過 16,000 字元(跟 check_note.py 同一個數字)。**不要為了壓字數反覆刪改**(實測一章最多花 12 輪在刪字);超過時只刪進階摺疊裡的第二組算例,比喻、比較表、圖說、「老師說不用背」的提醒都不刪。 - 預設看得到的正文不放計算量 O(...)、代號對照(例如 SMART 字母)、課本出處考據,一律移進進階摺疊。 2. `chNN.concepts.json`:JSON 陣列,4–12 個考試可能問的術語,每個物件: `name`(英文)、`zh`、`type`(概念/演算法/公式/人物事件/前置知識/行政)、`signal`("老師說會考"/"老師強調"/"核心(我判斷)"/"")、`evidence`(有 signal 前兩種時必填:原句+時間)、`definition_en`(投影片原句;沒有就註明 (textbook)/(lecture)/(my wording))、`plain`(一句中文)、`a4`(≤150 字元英文,可夾極短中文;期末拼貼用的小方塊)、`time`、`slides`、`prereq`(英文名陣列)。 ### 風格鐵律 - 不用 emoji 或裝飾符號(✓✗★⚠ 都不要;→ 可以)。不用 callout。不用 `$`。時間不要用 code 樣式。 - 每個 `##` 段落最多一種視覺元素:一張圖、或一個表格、或一個 mermaid。 - 摺疊標題是問句,前面不加符號。 - 圖片最多 3 張,只放文字取代不了的圖。放法:單獨一行 `[[IMG: | 中文圖說]]`,PNG 用 `slides_to_png.py <圖片資料夾> <頁> --dpi=110` 產生。 - 考試訊號只在老師明確說時標。老師只說「不用背」「不講」就寫「注意:……」。 - 老師口誤或跟投影片不同:照投影片寫,加「注意:老師口頭說的是……」。 - 引用老師的話時,ASR 錯字改成正確的字。 ### 沒有投影片時 不要憑記憶逐字重現課本段落或數值表。英文定義用自己的話寫、句尾標 (my wording);Exam-ready 每行標「(自擬,投影片待補)」。例子只用老師講的。 ### 寫完之後(只做一次) 跑檢查: `C:\Users\user\.cache\meeting-record\venv\Scripts\python.exe C:\Users\user\.claude\scripts\check_note.py --transcript <逐字稿> --slides <投影片 txt …> --start <起> --end <訖> --vid <影片 ID>` - STYLE/VISUAL/TIME/FORMAT:全部改掉。 - QUOTE:確認是不是你改正了 ASR 錯字(是就保留),不是就改成原文或拿掉引號。 - ENGLISH:確認是不是投影片斷行造成的(是就保留),不是就改成投影片原句。 **省額度守則**:章節包裡已經有你需要的全部資料。不要再去讀整份逐字稿、整份投影片、segments.json 或手冊。一次寫好整個檔(Write 一次),檢查後集中修改。