# 章節包:自然語言處理(NLP)W2(9/17)第 03 章「LLM 之前的應用與分析層次」
影片 0:41:29–0:58:52,YouTube ID MnA5KUETSg4。Notion 章節頁 https://app.notion.com/p/3e6fc631b0308187ae81c0e0fefb77f7(頁 ID 3e6fc631-b030-8187-ae81-c0e0fefb77f7),頁面標題「03 LLM 之前的應用與分析層次(0:41–0:58)」。
## 1. 第一行(直接照抄,不要改)
[自然語言處理](https://app.notion.com/p/3e6fc631b03081b4a9e8f91f3411f61f) › [W2(9/17)](https://app.notion.com/p/3e6fc631b03081a18b13fad72a8874fd) › 03|影片 [0:41:29–0:58:52](https://www.youtube.com/watch?v=MnA5KUETSg4&t=2489s)|投影片 W1_NLP_brief_v2 p.20–32|上一章 [02 語言的歧義與理解難題(0:21–0:41)](https://app.notion.com/p/3e6fc631b030815e805aead9c729a0d1)|下一章 [04 語法層次與深度學習時代(1:08–1:20)](https://app.notion.com/p/3e6fc631b03081768161d6716089043a)
## 1b. 最後一行(直接照抄,放在 Self-check 後面,當全頁最後一行)
讀完了嗎?下一章:[04 語法層次與深度學習時代(1:08–1:20)](https://app.notion.com/p/3e6fc631b03081768161d6716089043a)|回到週頁:[W2(9/17)](https://app.notion.com/p/3e6fc631b03081a18b13fad72a8874fd)
## 2. 各段標題(照順序;每段一個 ## 標題,直接照抄連結)
- `## [0:41:29](https://www.youtube.com/watch?v=MnA5KUETSg4&t=2489s) Siri 與小冰` 老師講什麼:微軟小冰大約十年前很紅,深夜陪大學生聊天;記者問它這輩子最期待什麼,它回答「活著」。當時靠大量網路對話語料訓練,現在用 LLM 包一層 API 就做得到。
- `## [0:43:51](https://www.youtube.com/watch?v=MnA5KUETSg4&t=2631s) LLM 之前的應用清單` 老師講什麼:假新聞偵測、情緒分析、翻譯、醫療建議、股票、摘要、Deep Web Mining(例如寫程式搶高鐵票、撈出網站背後的資料庫)、資訊擷取。
- `## [0:45:10](https://www.youtube.com/watch?v=MnA5KUETSg4&t=2710s) Twitter 文字探勘` 老師講什麼:用推文的時間和地點追颱風路徑;推文情緒和蓋洛普民調對得起來;Science 論文發現星期一大家心情最差;還有股票分析。用推文和 Google Trends 偵測流感,比疾管局公告更早。
- `## [0:50:26](https://www.youtube.com/watch?v=MnA5KUETSg4&t=3026s) 美食評論與臉書按讚` 老師講什麼:日本美食的情緒探勘;PNAS 研究用臉書按讚預測宗教、性別傾向等個人特質,很多項準到八成以上。
- `## [0:52:24](https://www.youtube.com/watch?v=MnA5KUETSg4&t=3144s) 醫療文字探勘` 老師講什麼:可以輔助判讀病歷、找出相似病患。最難的是症狀和醫學名詞有很多種寫法,要把它們對起來。
- `## [0:53:30](https://www.youtube.com/watch?v=MnA5KUETSg4&t=3210s) 非結構化資料` 老師講什麼:前面這些應用都是在管理非結構化資料。結構化資料可以用 SQL 查欄位;非結構化資料沒有 metadata(描述資料的欄位資訊),就需要 NLP 來處理。
- `## [0:55:02](https://www.youtube.com/watch?v=MnA5KUETSg4&t=3302s) NLP 的分析層次` 老師講什麼:構詞、語法、語意、語用一層一層往上做,詞性標註、剖析樹屬於語法層。老師自己也發表過用 LLM 概念做中文斷詞的論文(p.29)。
- `## [0:56:08](https://www.youtube.com/watch?v=MnA5KUETSg4&t=3368s) 深度學習把每一層重做:構詞` 老師講什麼:深度學習出來後,每一層都用大型神經網路重做一遍。構詞從字首字尾的統計表,變成把每個詞素學成向量(例如 un- 帶反向的意思),很好用,但說不出那些數字代表什麼。
## 3. 老師強調/會考/不考的地方(原句已驗證;寫進筆記時 ASR 錯字要改正)
(無)
## 4. 這章摘要與重要度
回顧 LLM 出現前的 NLP 應用(聊天機器人、社群文字探勘、醫療),再介紹 NLP 的分析層次,以及深度學習怎麼把每一層重做一遍。(一般)
## 5. 整堂課的提醒(ASR 錯字、老師口誤、投影片缺公式等;只用跟這章有關的)
- 老師 0:04:39 才開始講課,前面約 4 分半逐字稿沒有內容。
- 兩次下課:0:58:52–1:08:43、2:07:15–2:16:39。
- 2:18:33–2:19:11 逐字稿有約 40 秒空白,老師說「沒有抓到畫面」,2:20:21 又問「現在投影是對的吧」。這段錄影可能暫時沒拍到投影片(沒看影片,不確定)。
- 本週投影片是 W1_NLP_brief_v2.pdf(檔名的 W1 不等於上課週),實際講的範圍是 p.3–64;p.2 目錄老師說跳過。
- 投影片起點和已知事實不同:已知事實寫從 p.5 開始,但老師 0:07:25 說跳過 p.2 目錄,接著簡短講了 p.3(以前和現在做法差別的圖),0:09:31 講 p.4「What is NLP」。所以實際範圍是 p.3–64。
- 舊筆記(Notion 封存頁)記的時間和本逐字稿差約 1 分鐘。舊筆記寫下課 0:57:28、2:06:15,續課 1:09:37;本逐字稿是 0:58:52 下課、1:08:43 續課、2:07:15 下課、2:16:39 續課。這份計畫以本逐字稿為準。舊筆記寫的投影片檔是 W1_NLP_brief.pdf,不是 v2。
- 音檔長度 2:59:56,YouTube 是 3:00:07,差 11 秒。逐字稿時間和 YouTube 播放時間有沒有對齊,我沒有逐一驗證(不確定)。
- 2:18:33–2:19:11 逐字稿有約 40 秒空白,老師說「沒有抓到畫面」,這段錄影可能沒拍到投影片(不確定)。
- 2:24:56 老師說 BM25 的引言在「這一份投影片的最後一頁」,實際是 p.94(p.95 是 Summary),而且不在本週講的範圍。
- p.19 是 AI 仿作的《詩師食獅史》(同音字例子)。Strawberry 那段(0:39:43)沒有對應的投影片。
- 有 4 則 emphasis 標成「不考」,但老師原話是「公式不用記」(2:24:31、2:28:40)或「不會提到 GloVe」(2:58:06),不是明說「不考」。寫章節時建議用「老師說不用背/不講」,不要寫成【老師說不考】。
- 第 4 章(約 12 分鐘)和第 7 章(約 13 分鐘)比 15 分鐘短一點。因為兩章都緊貼下課分界,主題也各自獨立,所以沒有併章。
- 逐字稿常見的語音辨識錯字(引用時要改成正確寫法,也可以補進 fix_transcript 的錯字表):小平→小冰、Crystal→Chris(Manning)、STARBOARD→stop words、Wall Embedding/World Embedded→word embedding、World Reputation→word representation、構制學→構詞學、磁→詞、One-Half/One Heart→one-hot、Palsymy→Polysemy、RuCode→recall、O2Bect→word2vec、Bangio→Bengio、imprtindex/Import index→inverted index、Portal→Porter、REG→RAG、Patch rank→PageRank、Uptractive→Abstractive、Passing Tree→parsing tree、WSA→WSD、Tornazion→Tokenization、三國字→三國志、宇步→呂布、Facial Splash→feature space。1:37:48 的「Lesson」可能是 lexical processing(不確定);0:34:4x 的「VirusDM」推測是某種機率模型,可能是 HMM(不確定),所以 NER 那段我只寫 CRF。
## 6. 投影片文字(這章範圍)
**這幾頁的公式或內容只在圖裡(文字檔抓不到),寫 Exam-ready 與公式前先用 Read 看這幾張圖:**
- W1_NLP_brief p.21 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p021.png
- W1_NLP_brief p.22 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p022.png
- W1_NLP_brief p.25 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p025.png
- W1_NLP_brief p.27 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p027.png
- W1_NLP_brief p.31 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p031.png
--- W1_NLP_brief p.20 ---
20
NLP Based Applications (before LLM)
UGC based predication
e.g., stock, voting, …
Representation
Semantics Understanding
Event/Trend Detection
Event alarm…
Breaking News Detection
重要新聞偵測
Language Translation
Knowledge Base
Construction
IBM Watson
Sentiment Mining
Depression detection…
Event Threading
News recommendation…
Summarization
Search Engine
Information Extraction
Price comparisons…
Hot keyword Extraction
Deep Web Mining
Auto ticketing…
Siri, 小冰
Medical Suggestion
Fake News Detection
/ Conclusion
Opinion / Sentiment Mining
Competitor product opinion comparison…
--- W1_NLP_brief p.21 ---
Text mining in Twitter
21
[IMAGE-ONLY]
--- W1_NLP_brief p.22 ---
Flu Prediction from Twitter
22
[IMAGE-ONLY]
--- W1_NLP_brief p.23 ---
More applications
Japan FOODMOOD
23
2.
ramen
1. curry
4.sushi
--- W1_NLP_brief p.24 ---
Powerful application
Facbook PNAS paper
◦Private traits and attributes are predictable from digital records of human behavior
◦http://www.pnas.org/content/early/2013/03/06/1218772110
24
--- W1_NLP_brief p.25 ---
A medical text mining example
Research objective:
◦Follow chains of causal implication to discover a relationship between migraines and
biochemical levels.
Data:
◦medical research papers, medical news (unstructured text information)
Key concept types:
◦symptoms, drugs, diseases, chemicals…
25
--- W1_NLP_brief p.26 ---
Example Application: Medical Research
stress is associated with migraines
stress can lead to loss of magnesium
calcium channel blockers prevent some migraines
magnesium is a natural calcium channel blocker
spreading cortical depression (SCD) is implicated in some migraines
high levels of magnesium inhibit SCD
migraine patients have high platelet aggregability
magnesium can suppress platelet aggregability
(source: Swanson and Smalheiser, 1994)
26
--- W1_NLP_brief p.27 ---
Unstructured Data Management
Natural language processing is a subset of Unstructured Data Management.
UDM can be broken down into:
◦Content and Document Management
◦Search and Retrieval
◦XML database and tools
◦Categorization, Classification, and Visualization
80%-90% of Data is Unstructured
27
--- W1_NLP_brief p.28 ---
Data Warehouse vs. Document Warehouse
Data warehouse
◦Who, what, when, where, how much
◦Internally focused
◦Operational information
◦Rarely include external information
28
Document warehouse
◦Why
◦May not be internally focused
◦May contain a range of information
◦Often integrate external information
--- W1_NLP_brief p.29 ---
NLP Levels
29
• Prefix / Suffix
• Lemmatization / Stemming
• Spelling Checking
Morphology
• Part-of-Speech Tagging
• Syntax trees
• Dependency Trees
Syntax
• Named Entity Recognition / Normalization
• Relation Extraction
• Word Sense Disambiguation
Semantics
• Co-reference resolution
• Topic Segmentation
• Summarization
Pragmatics
“Advancing Multi-
Criteria Chinese
Word Segmentation
Through Criterion
Classification and
Denoising”, ACL
2023
--- W1_NLP_brief p.30 ---
The Building Blocks of Language
Morphology
◦the study of the structure and form of words
Syntax
◦the study of how words and phrases form sentences
Semantics
◦relates to the meaning of words and statements
Phonology
◦the study of sounds in the language
Pragmatics
◦the study of idiomatic phrases that cannot be analyzed with strict semantic analysis
30
--- W1_NLP_brief p.31 ---
Morphology
Understanding words
◦Stems
◦Affixes
◦Prefix
◦Suffix
◦Inflectional elements
31
▪
Reducing complexity of analysis
▪
Reduces complexity of
representation
▪
Supports text mining
Noun
Prefix
Noun
Stem
Suffix
- able
dispute
in -
--- W1_NLP_brief p.32 ---
Morphology level representation
Traditional: Words are made of morphemes
◦“unfortunately” = un + fortunate + ly (prefix + stem + suffix)
In DL (Luong, 2013)
◦every morpheme is a vector
◦A neural network combines two vectors into one vector
Extend to word, parsing, semantics level representations
32
## 7. 逐字稿(0:41:29 前後各多 1 分鐘,原始行)
[00:40:31] 但是他可以回答出Strawberry這個字
[00:40:34] 裡面有三個R
[00:40:35] 是不是Strawberry
[00:40:37] 你可以自己算算看
[00:40:38] 他可以自己回去再推這樣子
[00:40:41] 那當你去理解
[00:40:43] 前面的LM
[00:40:45] 或是BERT這種東西他裡面前面那一端的Token Relation的步驟之後你就覺得
[00:40:50] 他怎麼會知道裡面有幾個R
[00:40:53] 那其實有很大的
[00:40:54] 原因
[00:40:55] 有很大的
[00:40:57] 可能性是來自於
[00:40:58] 有很多的資料
[00:41:00] 本來就會把
[00:41:02] Strawberry這個字
[00:41:03] 一個一個字母的寫出來
[00:41:05] 就是他在
[00:41:07] 訓練資料或是他在
[00:41:08] 在人類的文章中有看過說原來
[00:41:11] Strawberry就是第一個字母是S
[00:41:13] 然後第二個字母是T這樣一路的寫下去
[00:41:17] 所以他就有這樣的東西啊所以你可以想像他其實是看過非常多的東西然後把他記錄下來
[00:41:26] 那這是另外的例子
[00:41:29] 那我們再回過頭來看一下說以前的應用就是你會覺得說那以前
[00:41:35] 這個
[00:41:36] 能力這麼弱那以前都在幹什麼
[00:41:38] 以前能夠做什麼事情
[00:41:40] 我們先來看這個Siri跟小平
[00:41:43] 以前這一塊其實是相當難做就是一個
[00:41:46] 像對話機器人一樣
[00:41:48] 這個是微軟當初做的一個
[00:41:51] 一個對話機器其實那個年代
[00:41:54] 差不多十年前
[00:41:56] 相當的紅因為
[00:41:57] 非常的人性化他可以跟你對話可以跟你
[00:42:00] 那個
[00:42:01] 這個當初是
[00:42:03] 被選為這個
[00:42:05] 這個
[00:42:06] 大學生的最佳的
[00:42:08] 讀書伴侶
[00:42:09] 因為
[00:42:10] 他會統計那個使用的頻率就是在
[00:42:13] 晚上10點到半夜2點這之間使用率非常高
[00:42:17] 就是一堆的大學生
[00:42:18] 就會跟他聊天
[00:42:20] 就聊一些
[00:42:21] 功課上啊
[00:42:23] 一些生活上啊
[00:42:24] 甚至還會跟他說這個
[00:42:25] 跟女朋友吵架啊那怎麼辦啊
[00:42:28] 小平的人設是一個女生啊他會跟他安慰幹嘛幹嘛幹嘛
[00:42:33] 那以前就可以做這麼厲害他的做法是什麼他其實就靠著大量的
[00:42:38] 網路上的對話語料
[00:42:41] 去訓練出來的
[00:42:43] 至於細節可能有很多的是模型有很多的是字典的方式去做
[00:42:49] 那以前他鬧了非常多新聞啊因為
[00:42:51] 我這邊沒有擺喔他以前
[00:42:53] 因為被他哄嘛
[00:42:54] 然後就有記者去
[00:42:56] 直接跟他對談
[00:42:57] 就跟他說一些話這樣
[00:43:00] 那
[00:43:01] 就問他說
[00:43:02] 你這你這輩子最
[00:43:04] 最
[00:43:04] 期待的事情是什麼
[00:43:06] 然後小平就回答
[00:43:08] 活著這樣子
[00:43:10] 就聽起來毛骨悚然
[00:43:11] 我看記者趕快把電腦關掉這樣子
[00:43:14] 就是
[00:43:15] 當然
[00:43:16] 當然
[00:43:17] 這個
[00:43:17] 猜測都是說因為網路上有這樣的
[00:43:20] Q跟A的
[00:43:21] 的對應啊所以他就這樣
[00:43:23] 回復但是
[00:43:24] 他是不是能他是不是有自己思考能力
[00:43:27] 或是他
[00:43:28] 回答出來這個答案真的很符合他是一個
[00:43:31] 對話機器人的角色
[00:43:33] 這個
[00:43:34] 相當厲害
[00:43:35] 我10年前的一個作品
[00:43:36] 當然
[00:43:37] 當然以前
[00:43:38] 以前要做出那樣東西
[00:43:39] 你可以想像現在用大語言模型來做非常容易直接包起來
[00:43:43] 不叫ABI就做做好了這樣子
[00:43:45] 所以這個10年人類的變化
[00:43:48] 技術變化其實相當高
[00:43:51] 那以前我們在NLB會做相當多這樣的比如說
[00:43:54] 把資料抓來然後去分析啊比如說
[00:43:57] 做
[00:43:58] 假新聞偵測啊情緒的偵測啊翻譯啊
[00:44:02] 或者是說在醫療上的建議啊或是
[00:44:04] 股票這種東西摘要這種東西或者說
[00:44:07] 這個
[00:44:08] Deep Web Mining就是你們
[00:44:10] 這個
[00:44:10] 接下來中秋節
[00:44:12] 這個
[00:44:13] 國慶假日要去搶
[00:44:14] 高鐵票就是寫一個程式去去抓
[00:44:17] 抓那個買票的東西啊其實就就是用Deep Web Mining
[00:44:21] 探討的東西啊就是
[00:44:23] 你怎麼靠著這種Clouding的技術去了解這家公司後面的資料庫是什麼這樣子
[00:44:29] 你可以自動下一堆查詢啊然後去
[00:44:31] 把整個資料庫撈出來這樣子
[00:44:35] 其實有很多各式各樣的應用像我剛才前面
[00:44:38] 舉到那個新聞
[00:44:39] 的
[00:44:40] 切取就是公司啊
[00:44:42] 然後一些數字啊這些東西就是屬於
[00:44:45] 資訊擷取的範疇
[00:44:48] 那這些東西也許你現在覺得那用大語言模型其實
[00:44:53] 這個非常容易啊這個
[00:44:55] 隨便就可以做出來這樣子
[00:44:56] 沒錯
[00:44:57] 因為我們不太需要像以前
[00:45:00] 從
[00:45:01] 段字詞性
[00:45:02] 然後做NER NEN這個步驟做下來
[00:45:05] 所以其實
[00:45:07] 整個模型
[00:45:08] 做掉很多事情
[00:45:10] 那以前這些應用啊大家可以
[00:45:12] 想像一下看看
[00:45:13] 就像看
[00:45:14] 去博物館看看以前
[00:45:16] 這些人都在幹什麼這樣子
[00:45:19] 以前
[00:45:20] 我們會有很多資料來源來自於Twitter
[00:45:22] 那我們會做Tax Mining
[00:45:24] 這是一個很有趣的應用啊就去預測
[00:45:27] 颱風的走勢啊
[00:45:29] 你怎麼預測颱風的走勢就去看Twitter
[00:45:32] 誰在發布說現在目前外面風很大雨開始下很大就知道說颱風中心目前到他那邊了
[00:45:38] 爆風圈已經到他那邊了這樣子
[00:45:43] 所以他就根據Twitter的這些敘述
[00:45:45] 描述這些颱風的敘述
[00:45:48] 然後呢去因為Twitter有
[00:45:50] 位置跟時間
[00:45:51] 他就把這個做出來這樣子
[00:45:53] 那這個紅色是代表
[00:45:55] 那是
[00:45:56] 真正颱風的路徑
[00:45:58] 那這個兩條綠色跟紫色是不同的方法
[00:46:02] 發現
[00:46:03] 至少方向一致
[00:46:05] 至少方向一致
[00:46:07] 因為不會有人在海上發Twitter所以他這邊沒辦法做
[00:46:10] 但是陸地上的軌跡其實還蠻合的這樣子
[00:46:15] 就說當你有了這些文章資料之後
[00:46:18] 其實要做什麼事情是你的想像
[00:46:21] 你其實現在也可以叫大語言模型來做這一個研究這樣子
[00:46:25] 雖然現在你可能
[00:46:26] Twitter可能比較少你可能要來自不同的資料來源可能要
[00:46:31] IG或是shred這樣子
[00:46:34] OK
[00:46:35] 那
[00:46:37] ,這件事情其實你就要去判斷情境
[00:46:40] 在描述風雨的情境這樣子
[00:46:43] 那這件事情臺灣那時候也有人繼續做
[00:46:46] 但是
[00:46:47] 臺灣因為區域範圍小然後資料來源
[00:46:51] 少
[00:46:52] 而且臺灣
[00:46:53] 其實Twitter用的人比較不多
[00:46:56] 在Twitter那時候有另外一個叫
[00:47:00] 叫撲浪
[00:47:01] 在座我聽過撲浪
[00:47:04] 可能都有用過但是後來就消失了這樣子
[00:47:07] 那
[00:47:09] 那就是
[00:47:10] 這種東西用的人少的時候你其實能夠做到的事情就
[00:47:14] 就少很多這樣子
[00:47:15] 不過
[00:47:16] 其實你現在可以來自不同的Data Source你都可以做類似這樣很有趣的應用
[00:47:22] 那這是他們做
[00:47:25] 這個蓋洛普調查
[00:47:26] 蓋洛普調查
[00:47:28] 現在這怎麼做我可能不太清楚但以前是真的去打電話
[00:47:32] 用電話直接
[00:47:34] 這個訪談這樣子
[00:47:35] 不過現在你可以想像
[00:47:37] 然後那個
[00:47:38] 那個機器人的語音說要做什麼
[00:47:40] 問卷調查大概就立刻掛掉這樣子
[00:47:43] 不過他們用Twitter的Sentiment跟蓋洛普調查做個align
[00:47:47] 發現其實是蠻可以
[00:47:49] 蠻可以align在一起的這樣子
[00:47:52] 不過這個
[00:47:53] 這可能在臺灣不太準
[00:47:55] 因為
[00:47:56] 臺灣很多這種
[00:47:57] 韓類投票的情況這樣子
[00:47:59] 就是你不喜歡這個但是你還是會投給他這樣子
[00:48:03] 這是一篇
[00:48:04] 這樣看不出什麼啦不過
[00:48:06] 他就是
[00:48:07] 這是一篇發表在Science的paper
[00:48:10] 他就是去分析所有
[00:48:13] 網路上的文章然後根據他的
[00:48:17] 發佈的時間
[00:48:19] 從禮拜一到禮拜天
[00:48:21] 然後工作什麼時間
[00:48:24] 然後看他的情緒
[00:48:26] 他就是情緒
[00:48:27] 他得到一個結論
[00:48:28] 其實大家都知道結論星期一大家心情都不太好因為要上班這樣子
[00:48:34] 那這篇paper他做的這樣
[00:48:36] 你會覺得到底幹了什麼事
[00:48:38] 這麼簡單的事情
[00:48:40] 只是說他因為他資料來源很多
[00:48:42] 他有去分析
[00:48:43] 不同的
[00:48:45] 人種吧
[00:48:46] 就是
[00:48:47] 那他paper是這樣寫白種人黃種人
[00:48:50] 這種不同的人種
[00:48:52] 不同的區域啊
[00:48:53] 大家都同樣的這個所謂的
[00:48:56] 這個Boundary Blue的這種
[00:48:57] 狀況這樣
[00:49:00] 那這是股票的分析啊這個
[00:49:03] 這個搞不好現在還有這個app
[00:49:05] 不過現在可能更厲害了
[00:49:06] 就是靠著
[00:49:07] 情緒靠著
[00:49:09] 財報做
[00:49:10] 股票的分析
[00:49:12] 跟建議這樣子
[00:49:14] 那這是
[00:49:15] 也是用Twitter然後去分析所謂的流感
[00:49:18] 當他們做流感
[00:49:19] 就是去
[00:49:21] 去看說這個
[00:49:22] 跟剛才那個
[00:49:23] 颱風很像就是
[00:49:25] 你可以去放他說這個他的症狀啊
[00:49:28] 他的症狀
[00:49:29] 是什麼接近的重感冒症狀
[00:49:32] 是多少
[00:49:33] 然後標出這些這樣子
[00:49:35] 因為
[00:49:36] 會做這個其實是
[00:49:39] 當初
[00:49:40] Google就有用他們的一些
[00:49:43] Query的資料
[00:49:44] 去
[00:49:45] 去做一些
[00:49:46] 趨勢
[00:49:47] Google有一個叫Google Trend
[00:49:49] 我不知道現在這個服務還在不在就是你可以看到現在大家查詢的趨勢
[00:49:54] 然後就發現在一個時間點一個區域
[00:49:57] 大家在查的一些跟感冒有關跟流感有關的字
[00:50:01] 變多了
[00:50:02] 然後就是推論說那邊已經有
[00:50:05] 這個
[00:50:05] 這個
[00:50:06] ,這個流感的
[00:50:10] 的這個
[00:50:12] 已經開始大量的發生了
[00:50:14] 那那這件事情的公告比
[00:50:17] 真的
[00:50:18] 這個
[00:50:19] 疾病管制局公告的還要早
[00:50:21] 我就是用統計的方式可以做到更更快速的部分
[00:50:26] 那這是網路的評論啊就是這個
[00:50:29] 這個他也是用Twitter啊
[00:50:31] 也是用日本的食物的
[00:50:33] 那就是大家對食物的好評
[00:50:36] 這樣子
[00:50:37] 這是一個
[00:50:38] 也是這樣情緒的Mining
[00:50:41] 那這是一個
[00:50:42] 也蠻早的是臉書剛開始有個研究啊就是在
[00:50:46] 這個更久了大概
[00:50:48] 14 15年
[00:50:50] PNS是一個很好期刊
[00:50:52] 他就去研究臉書的使用者
[00:50:56] 的
[00:50:57] 按讚
[00:50:58] 就是那個那個
[00:51:00] Sounds of那個那個動作
[00:51:03] 他的
[00:51:04] 表示就是說你這個人
[00:51:06] 對這件事情同意
[00:51:08] 那你代表
[00:51:09] 代表是什麼
[00:51:10] 所以他就用這些資料呢
[00:51:12] 就可以做這幾種的分類
[00:51:15] 這幾種分類甚至他可以知道你的
[00:51:18] 你的
[00:51:19] 宗教傾向啊你的性別傾向
[00:51:24] 這個gender猜的蠻準
[00:51:25] 他就可以預測就可以根據你在按讚的過程中他就可以知道你是
[00:51:30] 你有這些東西
[00:51:33] 那這些東西當然你覺得
[00:51:34] 我有大量的資料
[00:51:37] 因為臉書有些人還是會
[00:51:38] 挺蠻多仔細的資料
[00:51:41] 我就可以做一個
[00:51:42] Supervised Training
[00:51:43] 我就可以去勸這樣的東西
[00:51:45] 但是今天發現在這種
[00:51:48] Big Data情況底下
[00:51:49] 這些東西其實
[00:51:51] 可以做的蠻準
[00:51:52] 其實很多都到八成以上
[00:51:55] 當然
[00:51:56] 可能
[00:51:57] 有些東西還蠻好猜的
[00:51:59] 但是有些東西其實你會嚇到說
[00:52:02] 這個也都猜得出來
[00:52:03] 所以
[00:52:04] 當年我看完這邊Paper的時候
[00:52:06] 我就去網路上隨便按讚
[00:52:08] 就是破壞我的個人資料這樣子
[00:52:11] 就讓他搞不懂我這個人這樣子
[00:52:13] 所以
[00:52:14] 這個
[00:52:15] 反正走過必留下痕跡啊
[00:52:17] 所以很多的網路上的Tracing
[00:52:19] 你都要知道你已經把你的資料送出去了
[00:52:24] 那當然我們現在很希望做到很多Medical的部分
[00:52:27] 就是
[00:52:28] 做
[00:52:29] 這種
[00:52:30] 可以輔助醫生做
[00:52:32] 這個病例的判斷啊或者是
[00:52:35] 診斷
[00:52:36] 的一些預測或者是
[00:52:37] 看看醫生寫的有沒有錯誤啊
[00:52:40] 這個是一些Medical
[00:52:42] 不過這個可能有更細的資料我再放在這邊
[00:52:45] 因為這是以前的一個比賽資料
[00:52:49] 那
[00:52:51] 以前我們會希望
[00:52:52] 拿到這個東西
[00:52:53] 然後就要電腦去判斷說這個裡面
[00:52:56] 你要怎麼檢索
[00:52:57] 我有一堆這個
[00:53:00] 以前的
[00:53:02] 病例啊以前的醫組東西然後我現在要做一個病人來問我這些事情
[00:53:06] 你要找相關的病患出來這樣子
[00:53:09] 這樣的以前這樣的研究其實最難的地方就是這些專有名詞
[00:53:14] 這些症狀這些醫學上名詞
[00:53:17] 他其實有很多種寫法
[00:53:19] 然後你要怎麼對得起來這樣子
[00:53:21] 這一切都在搞這些事情
[00:53:23] 但這些事情其實現在LM
[00:53:26] 他對這種專有的醫學名字其實瞭解是蠻夠的
[00:53:30] 好
[00:53:31] 那
[00:53:32] 其實你可以想像我們剛才從這邊講了
[00:53:35] 講這麼多的應用其實都是一些做非結構化的資料管理的方式
[00:53:41] 就是
[00:53:43] 結構化的東西我們很好做因為我就知道這個column這個資料
[00:53:47] 數字什麼意思
[00:53:49] 但是非結構化的東西出來的時候他有各式各樣的解釋
[00:53:53] 這個我可以這樣解釋可以這樣解釋並不是說他沒切好而已是說他有
[00:53:58] 千奇百怪的解釋
[00:54:00] 那而且這個coverage又很大
[00:54:03] 很多資料其實都是說
[00:54:05] 非結構化
[00:54:06] 所以
[00:54:07] 當你要把非結構化資料去做到結構化資料能夠做的應用時候
[00:54:12] 你就需要做這樣的nlp的一個process
[00:54:18] 那這個其實也會面對到說
[00:54:21] 你是做
[00:54:22] 資料
[00:54:23] 你可以想像這個是結構化資料這是非結構化資料
[00:54:27] 那在結構化資料我們可以說我可以下C code
[00:54:31] 問他說這個資料欄位是什麼
[00:54:34] 這個班上
[00:54:35] 這個
[00:54:36] 這個住在臺北市然後
[00:54:38] 怎麼樣
[00:54:39] 的人是哪些這樣子
[00:54:41] 你就可以用C code的方式去查出這些東西
[00:54:44] 但是
[00:54:46] 如果是一個非結構化沒有建立這些metadata或是根本不瞭解裡面東西的時候
[00:54:51] 你其實不太有這樣的action可以做
[00:54:54] 所以你可能要處理或者說
[00:54:57] 你可能要面對的
[00:54:58] 應用是不太一樣的
[00:55:02] 這張圖其實我之前有show過
[00:55:05] 就是在Silibus有show過我們在做nlp的分析的結構
[00:55:10] 是這樣的一個步驟從構制學
[00:55:12] 語法
[00:55:13] 語意這樣做下來
[00:55:15] 那
[00:55:16] 這是以前我們在做nlp分析的步驟所以你可以看到前面的這些
[00:55:21] PoStagging
[00:55:22] 或是這些Passing Tree就是在Syntax Label的東西
[00:55:26] 那
[00:55:27] 你可以想像當這些Deep Learning出來之後
[00:55:30] 我們還是這樣的一個process在做這件事情只是
[00:55:34] 每一塊
[00:55:35] 每一個步驟
[00:55:36] 他其實
[00:55:37] 做的事情
[00:55:38] 方法都跟以前不一樣
[00:55:40] 所以這些
[00:55:42] 大家都把它重做一遍
[00:55:44] NER也把它重做一遍
[00:55:46] 這些Relational Extraction也把它做一遍這樣子
[00:55:49] 甚至Tagging也重做一遍但是後來做的時候發現LM其實不太需要Tagging
[00:55:55] 所以有很多研究都繼續在做
[00:55:58] 像我自己也有在做斷字
[00:56:01] 在兩年前也有發表一個斷字的
[00:56:03] 用這種LM的概念來做
[00:56:05] 做斷字的
[00:56:08] 那接下來我就很快秀一下說這個每個步驟
[00:56:11] 其實在
[00:56:12] Deep Learning之後其實就很快的
[00:56:15] 其實LM的出來並不是
[00:56:18] 最
[00:56:20] 最讓研究學者
[00:56:22] 感到很大差別其實在Deep Learning出來之後
[00:56:26] 大家就突然如獲自保就覺得這個工具非常厲害所以我們就把
[00:56:31] 所有的這樣的問題
[00:56:32] 都用
[00:56:33] 都用大型的NN
[00:56:35] 再做一次這樣那時候其實還沒有所謂的Pretrained Language Model
[00:56:39] 可能就是一個
[00:56:41] 其實已經有但是可能是比較BERT或之前的東西
[00:56:45] 但是並沒有像LM這麼厲害的東西但是我們有很大的
[00:56:50] NN的模型
[00:56:52] 我們可以讓這些東西做得更好
[00:56:56] 那比如說
[00:56:57] 構制學
[00:56:58] 構制學其實基本上就可以拆解這樣的東西以前我們會說啊那我們就學會
[00:57:03] 所謂的PRE
[00:57:05] 學會IN學會ABLE的概念
[00:57:08] 那怎麼去學
[00:57:09] 怎麼去學這些東西
[00:57:11] 以前就是用統計的方式
[00:57:14] 就是你前面看到
[00:57:15] 或是後面看到ABLE它其實就是一個形容詞
[00:57:18] 或者是什麼
[00:57:19] 所以我們會去建所謂這種Prefix
[00:57:22] Surface
[00:57:23] 這種
[00:57:24] 這種的Table跟它的一些統計或是機率的關係
[00:57:28] 來做這樣的事情
[00:57:30] 那
[00:57:33] 但是呢後來我們瞭解說
[00:57:34] 那我就讓他學會說
[00:57:37] 你就把它變成一塊向量
[00:57:40] 然後去學
[00:57:41] 它的表示
[00:57:42] 比如說前面加UN的
[00:57:45] 他可能在學的過程
[00:57:47] 最後這個
[00:57:48] 這個字所表達的意思
[00:57:50] 通常帶有所謂的負面或者是反向的意思的時候
[00:57:53] 那我就學會了這個UN的表示應該是要怎麼做
[00:57:58] 這個就
[00:57:59] 就回應到我們剛才
[00:58:01] 這份投影片的第一頁那個例子
[00:58:03] 就是說
[00:58:04] 直到後來
[00:58:05] 我們雖然學會這裡面的數字
[00:58:07] 而且很好用我把這個append進去的時候發現我就可以把這個字呢
[00:58:12] 原來原來這個字的意思我加這個embedding之後它就變成反向的意思
[00:58:17] 但是我都不知道我們不知道說這些數字為什麼可以讓它變成一個反向的概念
[00:58:23] 基本上
[00:58:24] 就是訓練出來
[00:58:26] 就是用這樣的表示這樣的表示
[00:58:29] 去
[00:58:30] 組出來這個字的時候然後進去整個訓練
[00:58:33] 所以就知道說
[00:58:35] 為什麼
[00:58:36] 為什麼NVIDIA的
[00:58:38] 股價這麼高因為我們就需要大量的算力去算出這些東西
[00:58:45] 好我想我們就先休息一下
[00:58:48] 我們10分鐘後再回來這樣子就先到這邊
[00:58:52] 下課
## 8. 寫作規則
(這是 `_筆記SOP.md` 第 3.1、4、5、6 節的濃縮版。兩者衝突時以 SOP 為準。)
讀者:碩士生,兩門課期末是英文考試。要只看筆記就能學會,講得比老師好懂。畫面要簡潔。
**概念優先(2026-09-26 主理人)**:主理人只想懂概念,不想補數學、不想看程式碼和座標圖。兩門課的考試也都是問答題、不考算式(AI W1 1:16:52;NLP W3 1:47:41、2:48:36)。所以:
- 每段預設看得到的只有:白話摘要(2–4 句)+**一句生活比喻**(例:模擬退火像投資理財,年輕時敢冒險、越老越保守)+「考試可能怎麼問」一句。
- 數學推導、公式、手算、程式碼、座標圖,全部收進標題寫「(進階,可跳過)」的摺疊,例如「它到底怎麼運作?(進階,可跳過)」。每段最多一個進階摺疊,不要寫長篇計算。
- 演算法要能「用文字說出步驟」(考試可能要你描述),這一點放在預設看得到的地方,不用數字。
- **重心比例**:白話理論與概念模式(它在解決什麼問題、核心想法、跟別的方法差在哪、優缺點、生活比喻)占主要篇幅;數學與程式細節只用一兩句帶過,細節收進進階摺疊。
**圖文並茂(2026-09-26 主理人:不要只有文字)**:
- 每章至少 2–3 個圖,放在**預設看得到**的地方,每個圖前後各用一兩句白話說明「這張圖在看什麼」。
- 流程、步驟、因果、比較 → 用 mermaid 流程圖(```mermaid,flowchart LR 或 TD;節點文字用中文、加雙引號;一張圖不超過 10 個節點)。
- 投影片上的示意圖、架構圖 → 用 [[IMG: …]] 放投影片圖。
- 仍守「每個 ## 段落最多一種視覺元素」。
### 輸出兩個檔
1. `chNN.md`(Notion 寫法,不含頁面標題),結構固定:
- 第一行:章節包第 1 節那行,原樣照抄。
- `## 重點`:三點中文,每點一到兩句。
- `## Exam-ready`:3–10 行英文,**從章節包的投影片文字逐字抄**,每行 `- **Term**: "原句"(Ch3 p.14)`。老師有明確證據才在行尾加 `【老師強調】(h:mm:ss)`。
**每一行下面一定要有一行縮排的中文解釋**(主理人英文不好,看不懂的英文等於沒用):
```
- **Hill climbing**: "It keeps track of one current state and on each iteration moves to the neighboring state with highest value."(Ch4 p.5)
- 中文:爬山法只記住「現在這一個狀態」,每一輪都移到分數最高的鄰居。白話:一直往比較高的地方走一步。
```
中文要先把句子意思講清楚,再補一句白話;難的英文單字括號附中文(例:neighboring state(鄰近狀態))。
- 章節包第 2 節的每一段:`## [h:mm:ss](連結) 標題`(照抄),下面 2–4 句白話摘要,其餘全部收進摺疊:
```
問句(例:用生活例子講,BFS 在做什麼?)
內容
```
摺疊種類(需要才放):用生活例子講?/它到底怎麼運作?/要先懂什麼?(老師假設你會的數學或概念,短版教學)/老師原話是什麼?(「原話」(h:mm:ss),只放重要的,最多 5 句)。
- 「它到底怎麼運作?」要用一組小數字把這段的演算法**真的跑 1–3 步**(例:算出梯度、更新一次、比較兩個 α),不是只示範定義的加減乘除。全章盡量沿用同一組數字,讓前一段的答案能在下一段被驗證。
- 每段正文要回答讀者最可能卡住的一個「為什麼」。投影片公式方向跟題目相反、或投影片說「解不出來」時,用一兩句講出原因,自己補的標(我補充)。
- 投影片句子停在公式前(公式在圖裡)時:Exam-ready 在粗體詞條上補公式、引號內保持原句;正文寫出同一條式子。公式圖看章節包第 6 節列出的 PNG。
- `## Self-check`:2–4 題英文考題,答案收摺疊。**至少一題考老師強調的內容**;不出「老師和投影片哪裡不同」這類不會考的題目。每題格式:
```
Q1. English question?(中文:中文題目)
**Answer**: English answer.
中文:把答案完整講一遍(不是只翻一句),讓看不懂英文的人也知道要怎麼答。
```
- **最後一行**:章節包第 1b 節那行(下一章連結),原樣照抄。讓讀完的人直接點下一章。
- 不要把章節包或這份規則裡的指示句寫進筆記(例如「寫筆記時照投影片寫」「已改正 ASR 錯字」)。
- 長度 8,000–14,000 字元。
2. `chNN.concepts.json`:JSON 陣列,4–12 個考試可能問的術語,每個物件:
`name`(英文)、`zh`、`type`(概念/演算法/公式/人物事件/前置知識/行政)、`signal`("老師說會考"/"老師強調"/"核心(我判斷)"/"")、`evidence`(有 signal 前兩種時必填:原句+時間)、`definition_en`(投影片原句;沒有就註明 (textbook)/(lecture)/(my wording))、`plain`(一句中文)、`a4`(≤150 字元英文,可夾極短中文;期末拼貼用的小方塊)、`time`、`slides`、`prereq`(英文名陣列)。
### 風格鐵律
- 不用 emoji 或裝飾符號(✓✗★⚠ 都不要;→ 可以)。不用 callout。不用 `$`。時間不要用 code 樣式。
- 每個 `##` 段落最多一種視覺元素:一張圖、或一個表格、或一個 mermaid。
- 摺疊標題是問句,前面不加符號。
- 圖片最多 3 張,只放文字取代不了的圖。放法:單獨一行 `[[IMG: | 中文圖說]]`,PNG 用 `slides_to_png.py <圖片資料夾> <頁> --dpi=110` 產生。
- 考試訊號只在老師明確說時標。老師只說「不用背」「不講」就寫「注意:……」。
- 老師口誤或跟投影片不同:照投影片寫,加「注意:老師口頭說的是……」。
- 引用老師的話時,ASR 錯字改成正確的字。
### 沒有投影片時
不要憑記憶逐字重現課本段落或數值表。英文定義用自己的話寫、句尾標 (my wording);Exam-ready 每行標「(自擬,投影片待補)」。例子只用老師講的。
### 寫完之後(只做一次)
跑檢查:
`C:\Users\user\.cache\meeting-record\venv\Scripts\python.exe C:\Users\user\.claude\scripts\check_note.py --transcript <逐字稿> --slides <投影片 txt …> --start <起> --end <訖> --vid <影片 ID>`
- STYLE/VISUAL/TIME/FORMAT:全部改掉。
- QUOTE:確認是不是你改正了 ASR 錯字(是就保留),不是就改成原文或拿掉引號。
- ENGLISH:確認是不是投影片斷行造成的(是就保留),不是就改成投影片原句。
**省額度守則**:章節包裡已經有你需要的全部資料。不要再去讀整份逐字稿、整份投影片、segments.json 或手冊。一次寫好整個檔(Write 一次),檢查後集中修改。