# 章節包:自然語言處理(NLP)W1(9/10)第 01 章「為什麼要學 NLP」
影片 0:01:25–0:17:50,YouTube ID EEbwXXoVQPY。Notion 章節頁 https://app.notion.com/p/3e7fc631b030815e8024eec1595413c0(頁 ID 3e7fc631-b030-815e-8024-eec1595413c0),頁面標題「01 為什麼要學 NLP(0:01–0:17)」。
## 1. 第一行(直接照抄,不要改)
[自然語言處理](https://app.notion.com/p/3e6fc631b03081b4a9e8f91f3411f61f) › [W1(9/10)](https://app.notion.com/p/3e7fc631b0308199953aef38ee86b0ae) › 01|影片 [0:01:25–0:17:50](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=85s)|投影片 Syllabus p.1–9|上一章 無|下一章 [02 生成式 AI 帶來的改變(0:17–0:34)](https://app.notion.com/p/3e7fc631b03081b2aaf1c69c5df0bfaf)
## 1b. 最後一行(直接照抄,放在 Self-check 後面,當全頁最後一行)
讀完了嗎?下一章:[02 生成式 AI 帶來的改變(0:17–0:34)](https://app.notion.com/p/3e7fc631b03081b2aaf1c69c5df0bfaf)|回到週頁:[W1(9/10)](https://app.notion.com/p/3e7fc631b0308199953aef38ee86b0ae)
## 2. 各段標題(照順序;每段一個 ## 標題,直接照抄連結)
- `## [0:01:25](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=85s) 開場:直播、錄影與 Slido` 老師講什麼:這門課有直播和錄影,今天約上兩小時、中間休息。課堂問答統一用 Slido,NTU COOL 課程頁也找得到連結。
- `## [0:02:59](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=179s) 老師與課程定位` 老師講什麼:老師研究 NLP、資料探勘與機器學習;這門課是 TAICA 第三年開,每年 300–500 人修、約八成修完。課程偏進階,建議先修過機器學習或深度學習,因為作業會直接寫模型訓練。
- `## [0:06:21](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=381s) NLP=語言+處理` 老師講什麼:Language 是要處理的語言(中文、英文、低資源語言),Processing 是讓電腦處理。以前很多工作靠語言學家的人工知識,現在電腦的比重越來越高。
- `## [0:07:25](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=445s) Hovy:LLM 時代的焦慮` 老師講什麼:LLM 能做很多事,但沒有定理說明它為什麼做得到,也常出現幻覺、連加法都做不好。另一種人說自己不在乎 LLM,但他做的東西常常直接被 LLM 取代。
- `## [0:11:10](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=670s) 學 NLP 的三個方向` 老師講什麼:工程面:讓 LLM 更小、更便宜、好用;應用面:結合領域與在地知識,讓它真的產生價值;研究面:理解這個黑盒子,才能保證品質。老師要大家先想好自己的角色。
- `## [0:14:22](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=862s) 文字資料與搜尋引擎` 老師講什麼:2000 年網路泡沫後出現大量網頁文字,搜尋引擎讓 NLP 與資訊檢索變重要;資訊檢索以前是圖書館系在學的東西。
- `## [0:15:43](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=943s) NLP 的定義與重要性` 老師講什麼:NLP 是讓電腦「理解」和「使用」語言,這句話 30 年前沒人敢寫。老師審稿時估計約兩成投稿是全自動或半自動產生,AI 做研究已經在發生。
## 3. 老師強調/會考/不考的地方(原句已驗證;寫進筆記時 ASR 錯字要改正)
(無)
## 3b. 數學段候選(程式抓的,只是提示;寫「跳過提示」行用)
0 段候選(門檻 3.0 字/30 秒)
## 4. 這章摘要與重要度
老師介紹自己與課程定位,引用 Eduard Hovy 的演講說明 LLM 時代大家的焦慮與 NLP 的三個方向,最後定義 NLP 是讓電腦「理解」並「使用」語言。(一般)
## 5. 整堂課的提醒(ASR 錯字、老師口誤、投影片缺公式等;只用跟這章有關的)
- 0:00:00–0:01:25 還沒開始上課;0:00:36 那串「志願自由生涯、紅色教堂…」是語音辨識幻覺,不是老師講的。
- 下課在 1:07:53,錄影裡只剩約 1 分半(1:07:53–1:09:19),老師說休息 10 分鐘,實際休息時段應該沒錄進去(推測,沒看影片確認)。
- 老師講 Syllabus-115.pdf 不是照頁碼順序:先講 p.1–33,接著跳到 p.43–51(課程內容、評分)和 Slido 問答,下課後才回頭講 p.34–42。所以第 04 章是 p.43–51、第 05 章是 p.34–42。
- 本週投影片是 Syllabus-115.pdf,加上 1:47:14 起的 W1_NLP_brief_v2.pdf p.1–3(檔名的 W1 不等於上課週)。brief p.3 那張「NLP 四階段」圖,W2 一開頭又講了一次。
- Slido 上有幾則助教的文字回覆,影片裡沒講到:考試可以用英文作答;作業有 2–3 週可以交;各校考試由 TAICA 在各校安排考場;清大實體教室在台達館 103;問問題可寄助教信箱 nthuikmlab@gmail.com;「會講 PEFT(LoRA),但 RL 不會講」。
- 第 06 章是下課後第二輪 Slido 問答,裡面有幾則行政回答(可重複提交、遲交扣分、作業調分),因為時間在第 04 章之後,所以留在第 06 章,不併進第 04 章。
- ASR 錯字對照:高鴻宇→高宏宇;自然源處理→自然語言處理;Edward Harvey→Eduard Hovy;LockedIn→Rocling;TradeGPT/TrackGP/ChangeGPT/ChangeBee/trekGPT/checkgpt→ChatGPT;Cloud→Claude;Entropy→Anthropic;Media→NVIDIA;game/GAME→GAN;Tronsky、Transcript 的 hierarchy→Chomsky(hierarchy);Benji→Bengio;Wall-to-Vector/Vault to Vector/what vector/water vector→word2vec;Transformer Learning→Transfer Learning;Transformer Scratch→from scratch;Sleep/Sleepless→Syllabus;slide/SIDEL(指問答平台時)→Slido;Tica/臺卡/Tiger→TAICA;ntu庫/NTU酷→NTU COOL;摩克斯→MOOCs;持交→遲交;RIL→RL;Prong/PROM→prompt;勸/Chain/圈(指訓練時)→train;PFT→PEFT;Numeration→Normalization(Named Entity Normalization);構制→構詞;Passing Tree→Parsing tree;Stop War→Stop word;One-Half Vector→One-hot vector;科技大學(0:38:25)→科技大擂台;國客會→國科會;黃淑駿→黃舒駿;regret→reject;deskregent→desk reject;dispution→distribution;Garantee→guarantee。
- 不確定的 ASR:0:50:37「Bloodbath的一系列的東西」推測是 BERT 家族(對照 Syllabus p.44 W9 BERT and its Family);1:18:49「像中國大陸一樣用針灸的方式」推測是「蒸餾」(distillation);1:18:00「Tide/Breeze/白龍」應是台灣模型 TAIDE、Breeze、Bailong;0:48:33「K3」不確定是哪個模型;1:34:55「Income」推測是 in-context learning。
- 考試名稱不一致:老師口頭說「期末考」,Syllabus p.44–45 寫 Exam/Midterm Exam(week 14, tentative)。是同一場,排在 W14,不在期末考週。
- 評分舊資料:Slido 同學提到 9/7 郵件寫「作業 70%+Term Project 30%」,老師 0:59:29 說那是舊資料,現在是作業 75%+考試 25%,沒有期末專題;p.45 另寫每份作業比重會微調 -3%~+3%。
- 考試算式:W1 老師 1:44:22 說「也許會有一題叫你們算一下 TFIDF」但隨即說好像沒意義;課程頁已寫「不考算式(例如 BM25 公式)」(來自之後的週次)。以課程頁較新的說法為準,筆記不要寫成「會考 TF-IDF 計算」。
- RL 說法不一致:老師 1:42:02 說 RL 設計「會提到啦但是不太會叫你們做」,Slido 助教回覆「會講 PEFT (LoRA), 但 RL 不會講」。理解成:不會有 RL 作業,最多概念帶過。
- 作業時間:老師 1:45:35 說作業「通常是一個月前會公佈」,Slido 助教回覆「作業會有 2~3 個禮拜的時間可以繳交」;兩者說的是不同事(公布時間 vs 繳交期限),寫筆記時不要混在一起。
- 投影片錯字:Syllabus p.38 寫「TD-IDF」,應為 TF-IDF(老師 1:23:49 口頭也說「這打錯了」);p.7「Ger explanations」應為 Get explanations。
- 修課人數:老師口頭說往年 300–500 人,Syllabus p.3 寫班級人數 1200 人(今年上限),兩者不衝突。
- Syllabus p.47(TAICA 運算資源:100/500 運算元帳號)老師說「有一張投影片我沒有放」,只口頭說會當作業 bonus 發給前十名;投影片上的名額與金額以公告為準(p.47 寫 Wait for announcement)。
## 6. 投影片文字(這章範圍)
**這幾頁的公式或內容只在圖裡(文字檔抓不到),寫 Exam-ready 與公式前先用 Read 看這幾張圖:**
- Syllabus p.2 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w1\img\brief_Syllabus_p002.png
- Syllabus p.5 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w1\img\brief_Syllabus_p005.png
- Syllabus p.7 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w1\img\brief_Syllabus_p007.png
- Syllabus p.8 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w1\img\brief_Syllabus_p008.png
- Syllabus p.9 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w1\img\brief_Syllabus_p009.png
--- Syllabus p.1 ---
Natural Language Processing
Syllabus
Slido: 9433372
--- Syllabus p.2 ---
Hung-Yu Kao (高宏宇)
2
Data Competition Award
• BioCreative, Rank 1, 2010, 2011, 2015
• TREC Blog, Rank 3, 2010
• ACL SemEval Rumor Detection Competition, Score Rank1, 2017
• ACL SemEval Argument Reasoning Comprehension Test, Rank 2,
2018
• CIKM AnalyticCup Short Text Matching, Rank 2, 2018
• WSDM Fake News Classification, Rank 3, 2019
• ACL/Google AI Gender Bias for Natural Language Processing
Rank 4, 2019
• WSDM Visual Question Answering Challenge, Rank 4, 2022
NLP related publication (2019-2026)
•
ACLx4, EMNLPx4, AAAIx3, ICML, Coling, WSDM, TKDE,
TASLP, TAI
• 清華大學資訊工程系教授
• 清華大學計算與通訊中心主任
• 國科會人工智慧驅動藥物開發工程處召集人
• 曾任成功大學資訊工程系特聘教授
• 曾任成功大學電機資訊學院副院長
• 曾任中華民國人工智慧學會 理事長
• 曾任中華民國 計算語言學會 理事長
• 曾任人工智慧學校講師
• 曾多次獲成功大學教學傑出獎, 優良導師
• 曾獲中國電機工程學會112年度「傑出電機工程教授獎」
--- Syllabus p.3 ---
115-1 自然語言處理
開設學校:清華大學
開授教師:高宏宇
班級人數:1200人
開課級別:研究所
同步遠距上課時間:星期四9:00-12:00
課程目標:
◦本課程涵蓋自然語言處理(NLP)與大型語言模型(LLM)的基礎
與前瞻技術
◦針對生成式人工智慧技術的快速發展,探討NLP在各領域的廣泛應
用
◦提供理論基礎與實際應用,幫助學生掌握最新NLP與LLM技術
3
--- Syllabus p.4 ---
自然語言處理
課程簡介
探索自然語言處理領域的基礎知識。
了解電腦如何理解和處理人類語言。
清華大學資訊工程系高宏宇
大型語言模型時代的技術進化與挑戰 。
--- Syllabus p.5 ---
Why Study Natural
Language Processing?
[IMAGE-ONLY]
--- Syllabus p.6 ---
Worries in the LLM era, Eduard Hovy, CMU, Rocling 2024.
6
Look what an LLM can do!
Why can it do that?
I have no idea / that’s future work / I’ve never thought about it
Look what an LLM cannot do!
Why not?
I have no idea / that’s future work / I’ve never thought about it
I don’t care about LLMs – here’s what I did
Why are you doing that? Can’t an LLM do it already?
I have no idea / that’s future work / I’ve never thought about it
--- Syllabus p.7 ---
Three major directions for New NLP, Eduard Hovy, CMU,
Rocling 2024.
7
NLP engineering: make
LLMs usable
•
Build smaller and cheaper
LLMs
•
Systematize prompt
engineering
•
Integrate language,
images, and other media
and functions
NLP applications: make
LLMs useful
•
Tune LLMs to domains and
companies for enterprise
processing
•
Add functionality and
agency in the world
•
Tailor LLMs to people to be
their personal daemons /
amanuenses in everyday life
NLP Research: make LLMs
understandable
(or at least, be solid
engineering)
•
Fix the problems with LLMs
•
Ger explanations how LLMs
do what they do
•
Formalize them well enough
for autonomy, assurance,
and ethics
--- Syllabus p.8 ---
Language is the most natural way humans
communicate.
Every day, the world generates massive text: news,
social media, research papers, and customer records.
Manually processing this data is impossible and
inefficient.
8
NLP = enabling computers to
“understand” and “use” language.
--- Syllabus p.9 ---
Why Is NLP Important?
9
Everyday life: Google Translate,
Siri/ChatGPT, speech-to-text.
Industry: chatbots for customer service,
medical record analysis, market sentiment
detection.
Academia: automatic summarization,
knowledge retrieval, scientific discovery.
Future: human–AI interaction, intelligent
assistants, cross-language communication.
## 7. 逐字稿(0:01:25 前後各多 1 分鐘,原始行)
[00:00:36] 志願自由生涯、紅色教堂、青菜、甜點、黑色三文字、長調、光線、獨特、超級、威武、日常、抗流、開放、現實、靈活、 Forestry、超級純粹。
[00:00:47] 好
[00:01:25] 那個雖然還沒開始上課了
[00:01:27] 不過因為教室有點小
[00:01:31] 所以有些事情我可能就開始進行交代一下
[00:01:36] 那這個大家好
[00:01:40] 我是高鴻宇
[00:01:42] 那這門課呢是自然語言處理
[00:01:45] 那他也是TAICA的課程系列之一
[00:01:51] 那因為這門課呢
[00:01:54] 有線上直播跟錄影
[00:01:56] 大家也可以回看
[00:01:58] 所以
[00:01:59] 所以
[00:02:01] 所以學校才允許我在一百人的教室
[00:02:04] 開這麼多的學生論述
[00:02:06] 那今天呢可能就大家課那一下
[00:02:11] 或者是說等
[00:02:12] 我今天大概會上兩個小時的課
[00:02:15] 中間會休息一下
[00:02:17] 也許就可以用線上方式看
[00:02:20] 好
[00:02:22] 那我先就開始介紹這門課的內容
[00:02:26] 那這個
[00:02:27] sorry
[00:02:30] 這個是
[00:02:31] 這個是課程的slido的連結
[00:02:35] 不過如果大家有修這門課呢
[00:02:37] 應該也可以在TAICA的NTU COOL上面
[00:02:41] 課程的
[00:02:42] 那個內容上可以看到說
[00:02:46] 有一個slido連結
[00:02:47] 那這個就是做課程Q&A的地方
[00:02:51] 那
[00:02:52] 大家可以在上面問一些問題這樣子
[00:02:55] 好
[00:02:59] 那我先做個自我介紹了
[00:03:01] 那我是高鴻宇
[00:03:02] 清大至宮的
[00:03:03] 老師
[00:03:05] 那
[00:03:06] 那我以前做研究是比較
[00:03:08] 偏自然源處理
[00:03:11] 那當然也導入一些資料探勘跟機器學習的部分
[00:03:16] 這個就供大家參考
[00:03:18] 那
[00:03:19] 這門課呢
[00:03:20] 他是TAICA應該是第三年開的課程
[00:03:24] 那從以前到現在
[00:03:27] 大概
[00:03:28] 修課人數大概都維持300到500人間了
[00:03:32] 然後
[00:03:33] 我們最後完成這門課的人數
[00:03:37] 大概八成
[00:03:39] 可能有到八成五億
[00:03:43] 那他主要的目的是涵蓋自然源
[00:03:47] 那自然源處理
[00:03:50] 大概在十年前跟在十年
[00:03:52] 這近十年的內容教材會完全不太一樣
[00:03:56] 那現在我們就會放大型元模型的部分
[00:04:00] 那這個是在TAICA的
[00:04:02] 的一開始的
[00:04:03] 規劃上
[00:04:04] 他們現在可能有點調整
[00:04:06] 而且可能大家可以上TAICA的網頁上看
[00:04:09] 有每個課程的難度
[00:04:12] 那他們好像現在把難度的Range拉大
[00:04:15] 好像有到八顆星這樣子
[00:04:18] 那
[00:04:19] 這門課呢
[00:04:20] 其實是比較放在後面進階的部分
[00:04:24] 所以
[00:04:26] 好像這個同時段學校有機器學習郭老師的課
[00:04:30] 所以
[00:04:31] 其實如果你還沒有機器學習
[00:04:33] 經驗的學生
[00:04:34] 其實你可以先修一下機器學習
[00:04:37] 或是Deep Learning的課程
[00:04:40] 因為我們這堂課呢
[00:04:42] 就會直接作業
[00:04:45] 就會直接教你寫模型訓練
[00:04:48] 然後當然就是處理文字的一些問題
[00:04:50] 這樣子
[00:04:52] 好
[00:04:56] 那這個大概就是
[00:04:58] 這是這一頁是當初給教育部長看的
[00:05:02] 就是這門課在做什麼
[00:05:03] 這樣子就是介紹一下這個
[00:05:06] 自然語言處理的
[00:05:08] 這個裡面到底在講什麼這樣子
[00:05:11] 當然自然語言處理
[00:05:12] 在
[00:05:14] 在這個ChatGPT還沒出來之前
[00:05:17] 它其實是一個算普通
[00:05:20] 也有點冷門的課的學問
[00:05:23] 只是說
[00:05:23] 大家後來發現
[00:05:25] 這個處理語言的方式
[00:05:28] 用Deep Learning用AI導入之後
[00:05:31] 它可以變得這麼厲害
[00:05:32] 這麼實用
[00:05:34] 所以它現在幾乎是
[00:05:36] 所有可以解決很多問題的一個基礎
[00:05:40] 所以我們就會在自然語言處理的課程裡面
[00:05:44] 去看如何讓電腦去理解人類的語言
[00:05:48] 跟如何跟人類互相溝通
[00:05:52] 那當然大家所熟知的大型語言模型
[00:05:55] 也會在這門課裡面介紹這樣子
[00:05:59] 好
[00:06:00] 那
[00:06:02] 當然
[00:06:04] 今天的課程有點是介紹
[00:06:06] 這個主要的
[00:06:07] 這門課會涵蓋的部分
[00:06:09] 那可能也讓有些同學可能不太知道自然語言處理在上什麼
[00:06:14] 然後可能讓你有個認知
[00:06:17] 也許這個可能不是你想象中會學到的東西
[00:06:20] 這樣子
[00:06:21] 那為什麼要學NLP
[00:06:23] 那前面Nature Language就是語言
[00:06:27] 但是我們這邊語言
[00:06:29] 其實當然以前我們在做這件事情的時候
[00:06:32] 可能就處理中文
[00:06:34] 英文
[00:06:35] 或是說
[00:06:36] 你要做一點翻譯啊
[00:06:37] 或是
[00:06:38] low resource的language啊
[00:06:39] 就是也許你想做原住民語言
[00:06:42] 這個就是
[00:06:44] 你會target一個語言
[00:06:46] 那processing呢就是說
[00:06:48] 你要如何去讓電腦
[00:06:50] 其實我們現在就很focus在電腦
[00:06:52] 雖然NLP以前
[00:06:54] 有絕大部分的工作都是要人工介入
[00:06:58] 就是從語言學家來的那些domain know-how
[00:07:01] 然後再加上一點點的運算去處理這些事情
[00:07:04] 所以
[00:07:06] 但是我們現在的電腦處理比重會越來越高
[00:07:09] 甚至人已經不太需要在裡面
[00:07:11] 這些domain的knowledge
[00:07:14] 或是要跟人互動的部分會越來越減少
[00:07:17] 所以我們要講的是怎麼讓電腦去處理
[00:07:20] 怎麼讓電腦去理解這些語言的東西
[00:07:23] 好
[00:07:25] 我用這位這個Edward Harvey
[00:07:29] 他是一個
[00:07:30] 他現在是不是有在CMU
[00:07:32] 可能已經轉到別的學校
[00:07:34] 不過他是一個在NLP方面的學生
[00:07:36] 非常有名的
[00:07:37] 一個前輩
[00:07:38] 他在兩年前LockedIn的會議裡面的一個Keynote講的部分
[00:07:44] 雖然是兩年前講的部分
[00:07:46] 不過我每年去看一看覺得
[00:07:49] 他講的東西
[00:07:50] 還對
[00:07:50] 還適用這樣子
[00:07:52] 我想現在大家會來修這門課
[00:07:54] 或是說大家對
[00:07:56] 學校相關AI的課程都非常的
[00:07:59] 積極想要去聽一聽
[00:08:01] 其實大概都是因為
[00:08:04] 太多的新聞
[00:08:05] 在告訴你們AI會怎麼樣怎麼樣
[00:08:08] 你如果不會這個
[00:08:09] 就會怎麼樣怎麼樣
[00:08:10] 所以大家都非常焦慮
[00:08:12] 不只是你們
[00:08:13] 老師也都非常焦慮
[00:08:16] 當然焦慮有很多種
[00:08:18] 那我們來看一下
[00:08:19] 就是說
[00:08:20] 其實
[00:08:21] 大家會用
[00:08:22] ChangeGPT
[00:08:23] 會用這些Gemini
[00:08:24] 或是Cloud做一些事情
[00:08:26] 你會發現他怎麼這麼厲害
[00:08:28] 可以
[00:08:28] 可以做這麼多事情
[00:08:30] 那你還
[00:08:32] 就覺得他為什麼可以做
[00:08:34] 其實
[00:08:35] 當然我們這門課的目的是想
[00:08:38] 會告訴你一點說
[00:08:39] 他其實有一點線索有一點
[00:08:43] 理由
[00:08:44] 但是也沒有任何的定理
[00:08:45] 告訴你他為什麼可以做到這些事情
[00:08:48] 但是如果完全不懂
[00:08:51] Transformer完全不懂
[00:08:52] Deep Learning的話其實你可能就不知道
[00:08:55] 這個
[00:08:55] 他到底是一個
[00:08:57] 什麼神奇的東西是不是
[00:08:59] 後面有一堆的工讀生在回答你的問題這樣子
[00:09:03] 那但是有時候你可能會想一下說
[00:09:05] 其實
[00:09:06] ChangeGPT寫的報告也不是很好
[00:09:09] 有時候
[00:09:09] 我要改一大堆的Prong
[00:09:11] 他也不能出現
[00:09:13] 我想要的
[00:09:14] 而且甚至你玩久了之後你就會發現
[00:09:16] 他其實有一點笨
[00:09:18] 有一點漏洞這樣子
[00:09:20] 他為什麼做不了這些
[00:09:22] 為什麼做不到
[00:09:23] 這個當然就是比較研究範圍
[00:09:25] 我們想知道說他目前的挑戰
[00:09:28] 目前
[00:09:29] 比如說幻覺的問題啊或是說
[00:09:32] 連簡單的加法都做不好
[00:09:34] 這到底是為什麼這樣子的問題呢?
[00:09:35] 這樣子
[00:09:36] 或anyway
[00:09:37] 其實很多東西我們都是
[00:09:39] 滿腦子問號這樣子
[00:09:41] OK
[00:09:42] 那有些人當然
[00:09:43] 現在這
[00:09:45] 這個人比較少
[00:09:46] 就是覺得
[00:09:48] 大語言模型就是
[00:09:50] 就是一個
[00:09:52] 其實以後我會講到那個Tronsky
[00:09:54] 他也會說大語言模型就是一個
[00:09:58] 合法的抄襲者這樣子
[00:10:00] 就是把所有的知識背在一起
[00:10:03] 然後告訴你這些東西
[00:10:04] 理論上以他的
[00:10:07] 訓練的方式來講的確是
[00:10:09] 但是
[00:10:11] 他的確目前是現在最聰明的一個系統
[00:10:14] 就是能夠消化人類的知識跟告訴你一些東西的系統
[00:10:19] 但是有些人其實不太care
[00:10:21] 反正這個都是
[00:10:23] 過時的
[00:10:24] 不是過時啦
[00:10:25] 就以後會有新的東西取代掉
[00:10:26] 這不是一個真正的
[00:10:28] 真正的GAI的東西這樣子
[00:10:32] 但是呢
[00:10:33] 他做出來的東西
[00:10:34] 其實很容易就被LM取代
[00:10:38] 像我們常常會
[00:10:39] 會去
[00:10:40] 去跟業界
[00:10:41] 談一下他們需求
[00:10:43] 然後他們就覺得這個東西很難很難
[00:10:46] 我說這個東西好像現在你用Cloud用Gemini就可以做了
[00:10:50] 你可能只是Prong要寫的好一點
[00:10:53] Skill要設計的好一點這樣子
[00:10:55] 所以這個大語言模型的演變會使得原來大家覺得他自己做很厲害的東西
[00:11:01] 就不再這麼厲害
[00:11:02] 就是
[00:11:03] 這個
[00:11:04] istan
[00:11:06] 一般老百姓這個都可以做到的事情
[00:11:07] 不過anyway
[00:11:08] 就是這樣
[00:11:10] 那當然這個Harvey他其實有
[00:11:12] 舉出幾個方向
[00:11:14] 但
[00:11:14] 這方向當然很粗但是我覺得
[00:11:16] 好像還適用就是說我們現在學
[00:11:19] NLP
[00:11:20] 其實
[00:11:21] 你應該把自己定位好
[00:11:23] 你自己的角色
[00:11:25] 就是說ok好以工程的角度來講我們知道說這個東西讓他有用就是如果以後你去業界工作
[00:11:31] 老闆說你幫公司的工作流
[00:11:34] 加速一下
[00:11:36] 這個聽說這些
[00:11:37] 龍蝦很厲害你能不能串一下這樣子
[00:11:40] 所以你就必須導入
[00:11:42] 導入
[00:11:43] 你跟老闆說
[00:11:44] 這個我們一個月要花
[00:11:46] 這個
[00:11:46] 五萬塊買Token這樣子老闆就說就從你薪水扣這樣子
[00:11:51] 所以你要想辦法降低這個成本
[00:11:55] 就讓他變得非常的便宜非常的有效率你如何做這件事情以工程的角度
[00:12:00] 我想這個電子的學生
[00:12:02] 每天都在做這件事情
[00:12:04] 那甚至有些
[00:12:06] 其實有蠻多硬體設計的人會想說那我就做
[00:12:10] Transformer加速的部分
[00:12:12] 讓他可以在硬體上加速
[00:12:14] 就可以做一些比較
[00:12:16] 特別的一些晶片
[00:12:18] 那就不用
[00:12:19] 跟Media買這麼貴的東西這樣子
[00:12:23] 那當然我們也是希望他能夠
[00:12:25] 做的
[00:12:26] 越有用越好
[00:12:27] 就是以前可以幫我們寫報告但是這個報告好像老師一看就知道是ChangeBee寫的
[00:12:33] 能不能做出一個報告是
[00:12:34] 老師覺得是我寫然後就寫的很好的東西
[00:12:37] 這是Useful
[00:12:38] 就是他真正能夠產生價值
[00:12:41] 而不是一看就是
[00:12:43] 那個AI味很濃的東西這樣子
[00:12:46] 就是好像有講到東西但是
[00:12:48] 那個Value是相當低的東西
[00:12:51] 所以他如何跟Domain
[00:12:53] 如何跟Local跟地端的東西
[00:12:57] 或是說跟人的知識結合這一塊
[00:12:59] 其實是在Application Label是
[00:13:02] 相當重要的
[00:13:03] 當然
[00:13:03] 後面這一段
[00:13:04] 就是這個Understandable
[00:13:07] 就是說我們希望
[00:13:09] 他這麼厲害的東西
[00:13:11] 到底為什麼可以做到其實現在
[00:13:13] 有很多的很有名的學界大佬都說
[00:13:17] 這個現在AI的發展是沒有任何理論基礎
[00:13:22] 其實你大概就可以想這樣等我們教完就知道
[00:13:25] 其實就是Language Model
[00:13:27] 那你沒有什麼基礎嗎
[00:13:29] 你沒有什麼理論嗎
[00:13:30] 可以用一條式子寫出來說
[00:13:32] 他可以最佳化什麼東西嗎
[00:13:33] 其實是沒有
[00:13:35] 其實是沒有
[00:13:36] 只是說他真的可以做到一些事
[00:13:39] 但是我們就想知道說
[00:13:42] 我們如何Garantee這件事情
[00:13:44] 比如說你要做一個
[00:13:47] 飛彈
[00:13:48] 軍事
[00:13:49] 的系統
[00:13:50] 你說我導入LM
[00:13:53] 那個司令問你說這個東西
[00:13:56] 我們
[00:13:57] 會不會
[00:13:58] Garantee這個
[00:14:00] 殲滅敵人的機率是多少
[00:14:02] 你只能說
[00:14:03] 只要他在沒有幻覺情況底下
[00:14:05] 我們會成功這樣子
[00:14:07] 你就不太知道他怎麼運作
[00:14:09] 就不知道細部你如何Garantee他的Quality
[00:14:12] 所以有很多研究會在於說我們如何把這個
[00:14:16] 黑盒子這個黑科技把他
[00:14:19] 理解的更透徹一點這樣子
[00:14:22] 那當然我想回到
[00:14:24] 比較
[00:14:25] 務實一點的層面就是一般我們NLP在講這件事情的時候
[00:14:29] 我們當然就會說因為現在文字是一個很
[00:14:33] 很Popular的
[00:14:34] 的一個Data
[00:14:35] 就是你現在看到的東西你現在網路上看尤其是在
[00:14:40] 2000年網路泡沫的時候
[00:14:42] 開始有一些Webpages出來之後
[00:14:44] 其實有大量的文字
[00:14:46] 出現
[00:14:47] 那如何讓
[00:14:48] 電腦也能夠理解這些東西
[00:14:51] NLP的重要性越來越高
[00:14:53] 所以其實
[00:14:55] 你要看一個技術是否重要你可以回推到以前就是
[00:14:59] 從Google
[00:15:01] 起來那個年代
[00:15:02] 搜尋引擎起來
[00:15:03] 那個年代為什麼
[00:15:05] 這麼重要
[00:15:06] NLP或是資訊檢索以前是一個非常冷門的以前是
[00:15:11] 叫做
[00:15:12] 以前是
[00:15:13] 圖書館系的人會去學的東西
[00:15:16] 如何有效的管理知識
[00:15:19] 就是把
[00:15:20] 圖書館的館藏
[00:15:21] 鎖音好
[00:15:22] 讓大家比較有效率的找到這些東西
[00:15:25] 但是這些東西如何套用在
[00:15:29] WireWave上的Tags
[00:15:31] 就會變得更復雜更有學問
[00:15:33] 所以
[00:15:34] 就會有
[00:15:34] 大量的研究所以
[00:15:36] 搜尋引擎在2000年時候就
[00:15:38] 非常重要而且
[00:15:40] 也看到它的價值
[00:15:43] OK
[00:15:43] 所以其實我們可以說NLP其實是
[00:15:46] 讓電腦去了解跟使用
[00:15:50] 當然你現在看到這一句你會覺得
[00:15:52] 這個
[00:15:53] common sense
[00:15:54] 這個好像就是這樣
[00:15:56] 但是如果到30年前
[00:15:58] 其實大家
[00:15:59] 不會寫這句話
[00:16:00] 不敢寫這句話
[00:16:02] 因為
[00:16:02] 其實
[00:16:03] gap還非常的大這樣子
[00:16:07] 好
[00:16:07] 那為什麼很重要這個我想就
[00:16:10] 就看看就好了
[00:16:12] 因為這個你現在所有東西你現在
[00:16:15] 用的大語言模型你現在用的AI
[00:16:18] 其實後端都是因為他能夠消化人類的所有知識
[00:16:22] 那為什麼他能夠消化
[00:16:25] 其實我說消化可能也不太對了
[00:16:27] 因為他真的能消化我也不知道
[00:16:29] 但是他至少知道人類所有的文字的東西
[00:16:32] 然後如何反饋如何摘要給你東西
[00:16:36] 這個對人類來講
[00:16:37] 是有用的這樣子
[00:16:39] 所以
[00:16:39] 從你的日常生活從你的
[00:16:42] 這個業界從這個學術界
[00:16:44] 你都會看到很多的
[00:16:47] 這個需求
[00:16:48] 但我們都很希望做到這件事情
[00:16:50] 就是我在旁邊然後
[00:16:53] AI就幫我做研究然後
[00:16:55] 按下去明天就一篇paper出來這樣子
[00:16:58] 其實這件事已經在發生
[00:17:00] 已經在發生了
[00:17:01] 其實如果大家有開始
[00:17:02] 因為這是研究所的課碼
[00:17:04] 可能在座應該百分之八九十都是研究所的學生
[00:17:08] 如果大家有在開始投稿就發現
[00:17:09] 現在這些頂會為什麼那個submission count都非常高
[00:17:13] 一個會議
[00:17:14] 就有一萬篇兩萬篇的paper
[00:17:18] 在投稿這樣子
[00:17:19] 雖然有一些是被regret繼續投下一輪
[00:17:22] 但是其實我
[00:17:25] 以我審稿的經驗大概有
[00:17:27] 百分之二十的paper都是
[00:17:30] 全自動或者是半自動
[00:17:32] 產生的
[00:17:33] 就是人機協作過程中的產物
[00:17:36] 但是那個quality跟那個
[00:17:39] 鑑別度就是你已經
[00:17:41] 很難區分
[00:17:43] 那個AI的痕跡
[00:17:44] 那也是頭頭是道數據也非常清楚
[00:17:47] 那這件事情在發生
[00:17:50] OK
[00:17:51] 那大家
[00:17:53] 如何善用
[00:17:53] 這是
[00:17:54] 就想象一下
[00:17:56] 那這個例子只是說
[00:17:59] 以前啊
[00:18:00] 在TradeGPT
[00:18:01] 2022年
[00:18:02] 還沒出來的時候
[00:18:04] 其實我們大家有時候不會覺得
[00:18:06] 這幾個應用都比較像是研究所的碩士論文會做的
[00:18:09] 我們要做一個
[00:18:11] 這個
[00:18:12] 這個病例報告自動生成的系統
[00:18:14] 或者是說我要做一個法務這個合約判斷的系統
[00:18:18] 這個都可以在碩士論文裡面查到這樣的研究
[00:18:24] 但是從LM出來之後呢這些研究變得
[00:18:27] 落地性很高
[00:18:28] 就是你可以跟
[00:18:30] 廠商合作說我幫你做這件事
[00:18:32] 他也覺得你不是在騙錢的這樣子
[00:18:34] 你真的做得出來這樣子
[00:18:36] 所以這個gap
[00:18:37] 這個中間的差距他不是一個很線性的
[00:18:40] 其實老實說
[00:18:41] 在LM出來之後
[00:18:43] 有很多的應用是往上漲
[00:18:45] 就是那個
[00:18:47] 以前
[00:18:47] 做不太到現在立刻就可以做了這樣子
## 8. 寫作規則
(這是 `_筆記SOP.md` 第 3.1、4、5、6 節的濃縮版。兩者衝突時以 SOP 為準。)
讀者:碩士生,兩門課期末是英文考試。要只看筆記就能學會,講得比老師好懂。畫面要簡潔。
**概念優先(2026-09-26 主理人)**:主理人只想懂概念,不想補數學、不想看程式碼和座標圖。兩門課的考試也都是問答題、不考算式(AI W1 1:16:52;NLP W3 1:47:41、2:48:36)。所以:
- 每段預設看得到的只有:白話摘要(2–4 句)+**一句生活比喻**(例:模擬退火像投資理財,年輕時敢冒險、越老越保守)+「考試可能怎麼問」一句。
- 數學推導、公式、手算、程式碼、座標圖,全部收進標題寫「(進階,可跳過)」的摺疊,例如「它到底怎麼運作?(進階,可跳過)」。每段最多一個進階摺疊,不要寫長篇計算。
- 演算法要能「用文字說出步驟」(考試可能要你描述),這一點放在預設看得到的地方,不用數字。
- **重心比例**:白話理論與概念模式(它在解決什麼問題、核心想法、跟別的方法差在哪、優缺點、生活比喻)占主要篇幅;數學與程式細節只用一兩句帶過,細節收進進階摺疊。
**圖文並茂(2026-09-26 主理人:不要只有文字)**:
- 每章至少 2–3 個圖,放在**預設看得到**的地方,每個圖前後各用一兩句白話說明「這張圖在看什麼」。
- 流程、步驟、因果、比較 → 用 mermaid 流程圖(```mermaid,flowchart LR 或 TD;節點文字用中文、加雙引號;一張圖不超過 10 個節點)。
- 投影片上的示意圖、架構圖 → 用 [[IMG: …]] 放投影片圖。
- 仍守「每個 ## 段落最多一種視覺元素」。
### 輸出兩個檔
1. `chNN.md`(Notion 寫法,不含頁面標題),結構固定:
- 第一行:章節包第 1 節那行,原樣照抄。
- 第二行起(有數學段才寫):**跳過提示**,每段一行,讓主理人看影片時知道從哪跳到哪。用章節包第 3b 節的候選當提示,對照第 7 節逐字稿確認(只標老師連續講公式、推導、矩陣、微積分、機率計算、程式細節超過約 1 分鐘的段落;概念講解和比喻不算):
`跳過提示:(1:31:02–1:35:40) 老師在推導梯度公式,聽不懂可以直接跳到 [1:35:40](YouTube 連結),接著講「步長 α 怎麼選」。`
- `## 重點`:三點中文,每點一到兩句。
- `## Exam-ready`:3–10 行英文,**從章節包的投影片文字逐字抄**,每行 `- **Term**: "原句"(Ch3 p.14)`。老師有明確證據才在行尾加 `【老師強調】(h:mm:ss)`。
**每一行下面一定要有一行縮排的中文解釋**(主理人英文不好,看不懂的英文等於沒用):
```
- **Hill climbing**: "It keeps track of one current state and on each iteration moves to the neighboring state with highest value."(Ch4 p.5)
- 中文:爬山法只記住「現在這一個狀態」,每一輪都移到分數最高的鄰居。白話:一直往比較高的地方走一步。
```
中文要先把句子意思講清楚,再補一句白話;最後用「英文(中文)」列出這句裡 1–3 個難字,例:sparse(稀疏)、distinct terms(不重複的字)。
**一行只放一句投影片原句**。同一頁有多句要考就拆成多行,每行各接一行中文;不要用分號串三句以上,不要把計算量 O(...) 塞進去。
- 章節包第 2 節的每一段:`## [h:mm:ss](連結) 標題`(照抄),下面 2–4 句白話摘要,其餘全部收進摺疊:
```
問句(例:用生活例子講,BFS 在做什麼?)
內容
```
摺疊種類(需要才放):用生活例子講?/它到底怎麼運作?/要先懂什麼?(老師假設你會的數學或概念,短版教學)/老師原話是什麼?(「原話」(h:mm:ss),只放重要的,最多 5 句)。
- 「它到底怎麼運作?」要用一組小數字把這段的演算法**真的跑 1–3 步**(例:算出梯度、更新一次、比較兩個 α),不是只示範定義的加減乘除。全章盡量沿用同一組數字,讓前一段的答案能在下一段被驗證。
- 每段正文要回答讀者最可能卡住的一個「為什麼」。投影片公式方向跟題目相反、或投影片說「解不出來」時,用一兩句講出原因,自己補的標(我補充)。
- 投影片句子停在公式前(公式在圖裡)時:Exam-ready 在粗體詞條上補公式、引號內保持原句;正文寫出同一條式子。公式圖看章節包第 6 節列出的 PNG。
- `## Self-check`:2–4 題英文考題,答案收摺疊。**至少一題考老師強調的內容**;只出 explain/why/compare 這類問答題,**不出要代數字計算的題目**(考試不考算式);不出「老師和投影片哪裡不同」這類不會考的題目。每題格式:
```
Q1. English question?(中文:中文題目)
**Answer**: English answer.
中文:把答案完整講一遍(不是只翻一句),讓看不懂英文的人也知道要怎麼答。
```
- **最後一行**:章節包第 1b 節那行(下一章連結),原樣照抄。讓讀完的人直接點下一章。
- 不要把章節包或這份規則裡的指示句寫進筆記(例如「寫筆記時照投影片寫」「已改正 ASR 錯字」)。
- 長度:全文不超過 16,000 字元(跟 check_note.py 同一個數字)。**不要為了壓字數反覆刪改**(實測一章最多花 12 輪在刪字);超過時只刪進階摺疊裡的第二組算例,比喻、比較表、圖說、「老師說不用背」的提醒都不刪。
- 預設看得到的正文不放計算量 O(...)、代號對照(例如 SMART 字母)、課本出處考據,一律移進進階摺疊。
2. `chNN.concepts.json`:JSON 陣列,4–12 個考試可能問的術語,每個物件:
`name`(英文)、`zh`、`type`(概念/演算法/公式/人物事件/前置知識/行政)、`signal`("老師說會考"/"老師強調"/"核心(我判斷)"/"")、`evidence`(有 signal 前兩種時必填:原句+時間)、`definition_en`(投影片原句;沒有就註明 (textbook)/(lecture)/(my wording))、`plain`(一句中文)、`a4`(≤150 字元英文,可夾極短中文;期末拼貼用的小方塊)、`time`、`slides`、`prereq`(英文名陣列)。
### 風格鐵律
- 不用 emoji 或裝飾符號(✓✗★⚠ 都不要;→ 可以)。不用 callout。不用 `$`。時間不要用 code 樣式。
- 每個 `##` 段落最多一種視覺元素:一張圖、或一個表格、或一個 mermaid。
- 摺疊標題是問句,前面不加符號。
- 圖片最多 3 張,只放文字取代不了的圖。放法:單獨一行 `[[IMG: | 中文圖說]]`,PNG 用 `slides_to_png.py <圖片資料夾> <頁> --dpi=110` 產生。
- 考試訊號只在老師明確說時標。老師只說「不用背」「不講」就寫「注意:……」。
- 老師口誤或跟投影片不同:照投影片寫,加「注意:老師口頭說的是……」。
- 引用老師的話時,ASR 錯字改成正確的字。
### 沒有投影片時
不要憑記憶逐字重現課本段落或數值表。英文定義用自己的話寫、句尾標 (my wording);Exam-ready 每行標「(自擬,投影片待補)」。例子只用老師講的。
### 寫完之後(只做一次)
跑檢查:
`C:\Users\user\.cache\meeting-record\venv\Scripts\python.exe C:\Users\user\.claude\scripts\check_note.py --transcript <逐字稿> --slides <投影片 txt …> --start <起> --end <訖> --vid <影片 ID>`
- STYLE/VISUAL/TIME/FORMAT:全部改掉。
- QUOTE:確認是不是你改正了 ASR 錯字(是就保留),不是就改成原文或拿掉引號。
- ENGLISH:確認是不是投影片斷行造成的(是就保留),不是就改成投影片原句。
**省額度守則**:章節包裡已經有你需要的全部資料。不要再去讀整份逐字稿、整份投影片、segments.json 或手冊。一次寫好整個檔(Write 一次),檢查後集中修改。