# 章節包:自然語言處理(NLP)W2(9/17)第 01 章「課程定位與傳統 NLP 流程」
影片 0:04:39–0:21:17,YouTube ID MnA5KUETSg4。Notion 章節頁 https://app.notion.com/p/3e6fc631b03081e3872cf295fcfe1eaa(頁 ID 3e6fc631-b030-81e3-872c-f295fcfe1eaa),頁面標題「01 課程定位與傳統 NLP 流程(0:04–0:21)」。
## 1. 第一行(直接照抄,不要改)
[自然語言處理](https://app.notion.com/p/3e6fc631b03081b4a9e8f91f3411f61f) › [W2(9/17)](https://app.notion.com/p/3e6fc631b03081a18b13fad72a8874fd) › 01|影片 [0:04:39–0:21:17](https://www.youtube.com/watch?v=MnA5KUETSg4&t=279s)|投影片 W1_NLP_brief_v2 p.3–7(p.2 目錄跳過)|上一章 無|下一章 [02 語言的歧義與理解難題(0:21–0:41)](https://app.notion.com/p/3e6fc631b030815e805aead9c729a0d1)
## 1b. 最後一行(直接照抄,放在 Self-check 後面,當全頁最後一行)
讀完了嗎?下一章:[02 語言的歧義與理解難題(0:21–0:41)](https://app.notion.com/p/3e6fc631b030815e805aead9c729a0d1)|回到週頁:[W2(9/17)](https://app.notion.com/p/3e6fc631b03081a18b13fad72a8874fd)
## 2. 各段標題(照順序;每段一個 ## 標題,直接照抄連結)
- `## [0:04:39](https://www.youtube.com/watch?v=MnA5KUETSg4&t=279s) 開場:三小時濃縮半學期` 老師講什麼:三節課連續上,照原本的課堂時間下課。今天把以前這門課大約一半的內容濃縮成三小時,細節不必會做,但名詞要聽過。
- `## [0:06:29](https://www.youtube.com/watch?v=MnA5KUETSg4&t=389s) 課程定位:深度學習時代的 NLP` 老師講什麼:這門課像 Stanford 的 NLP+Deep Learning 課,會直接跳進深度學習。p.3 的圖說明以前靠人訂規則、現在靠資料訓練;模型越大越難解釋,例如 BERT 每層的參數、word embedding 裡的數字。
- `## [0:09:31](https://www.youtube.com/watch?v=MnA5KUETSg4&t=571s) 什麼是 NLP:拿到新聞能做什麼` 老師講什麼:NLP 是用計算的方式理解人類語言,以前最紅的應用是翻譯和資訊檢索。拿到一批新聞,可以做索引、分類、事件偵測、影響力分析、摘要、情緒分析。
- `## [0:12:59](https://www.youtube.com/watch?v=MnA5KUETSg4&t=779s) 非監督式訓練語料` 老師講什麼:監督式資料要成對標註,成本很高。LLM 先靠大量沒標註的語料學人類知識,老師用「學英語不背文法、用聽的」來比喻。
- `## [0:14:55](https://www.youtube.com/watch?v=MnA5KUETSg4&t=895s) 示範:叫 Claude 整理股市報表` 老師講什麼:老師請 AI 找出外資買賣超前十名、抓相關新聞、整理成報表,現在一句話就做得到。但要知道它背後做了哪些步驟,才知道哪裡可能出錯。
- `## [0:16:43](https://www.youtube.com/watch?v=MnA5KUETSg4&t=1003s) 傳統 NLP 的一條龍流程` 老師講什麼:以前要自己串起斷詞與詞性標註、NER、關鍵字權重、摘要、情緒分析、主題分群。前三步到大約四年前都還是標準 SOP,只要一步沒做好,後面幾乎都沒用。
## 3. 老師強調/會考/不考的地方(原句已驗證;寫進筆記時 ASR 錯字要改正)
- (0:06:05) [強調] 「不過你大概要知道這些東西」 → 今天講的傳統做法現在不一定要自己做,但名詞和概念要知道
## 4. 這章摘要與重要度
老師說明這門課是「深度學習時代的 NLP」,再用新聞和股市報表的例子,對比以前要一步一步串起來的傳統流程,和現在 LLM 一次做完。(一般)
## 5. 整堂課的提醒(ASR 錯字、老師口誤、投影片缺公式等;只用跟這章有關的)
- 老師 0:04:39 才開始講課,前面約 4 分半逐字稿沒有內容。
- 兩次下課:0:58:52–1:08:43、2:07:15–2:16:39。
- 2:18:33–2:19:11 逐字稿有約 40 秒空白,老師說「沒有抓到畫面」,2:20:21 又問「現在投影是對的吧」。這段錄影可能暫時沒拍到投影片(沒看影片,不確定)。
- 本週投影片是 W1_NLP_brief_v2.pdf(檔名的 W1 不等於上課週),實際講的範圍是 p.3–64;p.2 目錄老師說跳過。
- 投影片起點和已知事實不同:已知事實寫從 p.5 開始,但老師 0:07:25 說跳過 p.2 目錄,接著簡短講了 p.3(以前和現在做法差別的圖),0:09:31 講 p.4「What is NLP」。所以實際範圍是 p.3–64。
- 舊筆記(Notion 封存頁)記的時間和本逐字稿差約 1 分鐘。舊筆記寫下課 0:57:28、2:06:15,續課 1:09:37;本逐字稿是 0:58:52 下課、1:08:43 續課、2:07:15 下課、2:16:39 續課。這份計畫以本逐字稿為準。舊筆記寫的投影片檔是 W1_NLP_brief.pdf,不是 v2。
- 音檔長度 2:59:56,YouTube 是 3:00:07,差 11 秒。逐字稿時間和 YouTube 播放時間有沒有對齊,我沒有逐一驗證(不確定)。
- 2:18:33–2:19:11 逐字稿有約 40 秒空白,老師說「沒有抓到畫面」,這段錄影可能沒拍到投影片(不確定)。
- 2:24:56 老師說 BM25 的引言在「這一份投影片的最後一頁」,實際是 p.94(p.95 是 Summary),而且不在本週講的範圍。
- p.19 是 AI 仿作的《詩師食獅史》(同音字例子)。Strawberry 那段(0:39:43)沒有對應的投影片。
- 有 4 則 emphasis 標成「不考」,但老師原話是「公式不用記」(2:24:31、2:28:40)或「不會提到 GloVe」(2:58:06),不是明說「不考」。寫章節時建議用「老師說不用背/不講」,不要寫成【老師說不考】。
- 第 4 章(約 12 分鐘)和第 7 章(約 13 分鐘)比 15 分鐘短一點。因為兩章都緊貼下課分界,主題也各自獨立,所以沒有併章。
- 逐字稿常見的語音辨識錯字(引用時要改成正確寫法,也可以補進 fix_transcript 的錯字表):小平→小冰、Crystal→Chris(Manning)、STARBOARD→stop words、Wall Embedding/World Embedded→word embedding、World Reputation→word representation、構制學→構詞學、磁→詞、One-Half/One Heart→one-hot、Palsymy→Polysemy、RuCode→recall、O2Bect→word2vec、Bangio→Bengio、imprtindex/Import index→inverted index、Portal→Porter、REG→RAG、Patch rank→PageRank、Uptractive→Abstractive、Passing Tree→parsing tree、WSA→WSD、Tornazion→Tokenization、三國字→三國志、宇步→呂布、Facial Splash→feature space。1:37:48 的「Lesson」可能是 lexical processing(不確定);0:34:4x 的「VirusDM」推測是某種機率模型,可能是 HMM(不確定),所以 NER 那段我只寫 CRF。
## 6. 投影片文字(這章範圍)
**這幾頁的公式或內容只在圖裡(文字檔抓不到),寫 Exam-ready 與公式前先用 Read 看這幾張圖:**
- W1_NLP_brief p.6 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p006.png
- W1_NLP_brief p.7 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p007.png
--- W1_NLP_brief p.2 ---
Outline
NLP Applications
General Text Processing
◦Indexing
◦Lexical processing
◦Document representation
Latent semantic analysis
Word Embedding
2
--- W1_NLP_brief p.3 ---
3
“Knowledgeable Machine Learning for Natural Language Processing”, H. Han, Communications of the ACM, 2021.
--- W1_NLP_brief p.4 ---
What is Natural Language Processing (NLP, 自然語言處理)?
Natural language processing (NLP) is the use of human languages by a
computer and is viewed as a branch of machine learning.
4
Translation
Information Retrieval
Chatbot
Information Verification
--- W1_NLP_brief p.5 ---
An example
5
Indexing / Search
Classification
Event detection
News influence
Summarization
Article relationship
Sentiment
Unsupervised Training Corpus
--- W1_NLP_brief p.6 ---
6
[IMAGE-ONLY]
--- W1_NLP_brief p.7 ---
7
[IMAGE-ONLY]
## 7. 逐字稿(0:04:39 前後各多 1 分鐘,原始行)
[00:04:39] 然後,我開始錄字了,可以了,要嗎?
[00:04:58] OK,好,我們這堂課是九點開始上課了,所以我們就開始。
[00:05:07] 上次其實忘記講就是說,因為是三節課連續,
[00:05:13] 本來研究所課我大概會以中間休息一段時間,
[00:05:17] 不過因為好像
[00:05:19] 有蠻多同學有Xclass的關係,所以
[00:05:23] 我還是照著
[00:05:25] 原來的這個課堂的時間去下課這樣子。
[00:05:31] 好,那我們今天就進行這個介紹的部分,就是簡介。
[00:05:38] 那這理論上應該是在上禮拜要帶一些,不過
[00:05:43] 這部分會主要涵蓋在
[00:05:46] 整個自然語言處理,以前在上這門課的時候會講的大概
[00:05:52] maybe一半的東西這樣子。
[00:05:54] 那我們大概用
[00:05:56] 三小時的時間把它濃縮這樣子。
[00:05:58] 那主要也是說有些細節大概
[00:06:02] 你大概知道,或是聽過那些名詞。
[00:06:05] 但是你現在的做法可能不太需要這樣子去做這樣子,不過你大概要知道
[00:06:12] 這些東西,而且
[00:06:14] 有些技術
[00:06:15] 可能現在
[00:06:16] 你在用
[00:06:17] 大型語言模型,你要做
[00:06:19] 在地的model去做
[00:06:21] IG的時候,你可能也會用到這樣子。
[00:06:29] 對,我上次也忘記提,這門課的設計的概念比較像是自然語言處理
[00:06:36] 跟
[00:06:37] Deep Learning,就是說在Deep Learning時代的自然語言處理該怎麼做,而不是
[00:06:43] 就是在
[00:06:45] 唇講
[00:06:46] 自然語言處理。所以它其實會跳
[00:06:48] 直接就跳進
[00:06:50] Deep Learning的部分。
[00:06:52] 那大家也可以看一下那個Stanford的
[00:06:56] 這樣的一個課程。
[00:06:57] 那其實
[00:06:58] NLP
[00:07:00] 這個跟Deep Learning結合的時候,他們的
[00:07:03] 設計
[00:07:04] 課程的內容這樣子。
[00:07:06] 對,這的確對電子學院來講,很多課程其實
[00:07:10] 在
[00:07:11] AI在Deep Learning的年代,其實都會需要有點這樣的調整。
[00:07:16] 尤其是一些研究所的課。
[00:07:18] 他大概可能一半內容都要換掉這樣子。
[00:07:22] 這是我們上次有提到的第一個
[00:07:25] Week 1的投影片的Outline,那我就skip掉。這上次有提到這個進程。
[00:07:31] 就是
[00:07:32] 以前的做法跟現在做法的差別。
[00:07:36] 那再提示一下就是說這個
[00:07:40] 這個
[00:07:41] 後面的這樣的概念比較像是說
[00:07:44] 我們
[00:07:45] 我們擁有了自己的
[00:07:46] 資料越來越多的時候,所以
[00:07:48] 我們就希望能夠用
[00:07:50] 訓練的方式
[00:07:51] 用
[00:07:52] 用AI,用機器學習訓練的方式,讓模型去理解這些東西,而不是
[00:07:57] 我們告訴他一些規則
[00:07:59] 告訴他一些我們人類看得懂的一些知識的表示。
[00:08:04] 所以其實
[00:08:05] 這個圖的一些
[00:08:07] 一個很大差別就是說
[00:08:10] 這以前的東西其實做出來,even他是有統計有
[00:08:14] 計算過的東西
[00:08:15] 但是其實
[00:08:17] 這些人
[00:08:18] 都比較容易理解
[00:08:19] 但是越來越到後面的資料量越大,模型越來越大,參數越來越大
[00:08:24] 做出來的關係越來越複雜的時候
[00:08:26] 其實
[00:08:27] 人其實
[00:08:28] 不太能夠理解
[00:08:29] 比如說
[00:08:30] 你能夠打開
[00:08:32] 這個BERT的模型,每一層的Transformer的參數
[00:08:36] 你知道它是什麼嗎?
[00:08:38] 你能
[00:08:39] 你能夠把Wall Embedding的每一個字的向量
[00:08:42] 的數字拿出來解釋嗎?
[00:08:44] 其實是不太行的
[00:08:45] 就是當然也有類似的研究
[00:08:47] 但是
[00:08:48] 那部分的一些量化的表示其實
[00:08:51] 比較是讓機器去看
[00:08:53] 已經不是人可以
[00:08:55] 很容易去
[00:08:57] 理解說他這個向量為什麼長這個樣子
[00:09:01] 當然現在我們也是有希望能夠去
[00:09:05] 看懂說
[00:09:06] 這個
[00:09:07] 這麼大的幾個B列的參數到底哪些是代表什麼
[00:09:11] 不過
[00:09:12] 這個不太容易
[00:09:15] 那今天主要會以
[00:09:18] 介紹的角度就是有點像
[00:09:21] 讓大家看看以前的做法然後看看一些歷史一些故事
[00:09:25] 所以比較
[00:09:26] 不見得會牽扯到太多的技術的細節
[00:09:31] 好那我想這個
[00:09:33] 什麼是NLP?那基本上就是把
[00:09:36] Human Language
[00:09:38] 然後用
[00:09:39] 這個
[00:09:41] 電腦的運算的角度因為我們要所謂的要處理它
[00:09:45] 要
[00:09:45] 要去整個去
[00:09:47] 計算要去
[00:09:49] 讓用
[00:09:50] Computational的方式去理解
[00:09:53] 這件事情
[00:09:54] 那當然我們會希望能夠從以前的
[00:09:57] 語言學的這種Linguistic的角度
[00:10:00] 來切入
[00:10:02] 然後靠著一些更
[00:10:03] 更
[00:10:04] 多的大量的運算能力的
[00:10:08] 導入能夠讓這些應用
[00:10:10] 能夠做得更落地這樣子
[00:10:12] 我想這個大概
[00:10:14] 大家都
[00:10:15] 可以理解
[00:10:15] 好
[00:10:16] 那我先舉一個例子啊比如說以前在
[00:10:19] 在這個做
[00:10:21] 剛剛你說的NLP
[00:10:23] 那時候最紅的應用可能是
[00:10:26] 這個做翻譯呀
[00:10:27] 或是做這個資訊檢索
[00:10:30] 那大概就像搜尋引信
[00:10:32] 那資訊檢索主要有點像你要管理這個大量的文字的
[00:10:37] 資料
[00:10:38] 比如說你現在拿到這個
[00:10:40] 這個新聞的資料
[00:10:42] 那你拿到這些資料你要做什麼事
[00:10:44] 其實非常多事情
[00:10:45] 以NLP的角度
[00:10:47] 你可能要做縮影
[00:10:49] 因為你沒辦法把它存在
[00:10:51] 一個
[00:10:52] 檔案然後要的時候再去找
[00:10:54] 你一定要知道說這個每一篇新聞裡面
[00:10:57] 到底包含哪些字
[00:10:59] 這樣你才能以後快速的找到你要的東西
[00:11:03] 那當然我們也希望對我們的來源資料做一些分類呀或者是說
[00:11:08] 我能夠找到
[00:11:10] 現在發生什麼事情
[00:11:12] 今天發生什麼是重要的事情
[00:11:14] 那或者是說這些東西
[00:11:15] 他的影響力是什麼
[00:11:17] 這個新聞發佈出去他造成什麼樣影響
[00:11:21] 因為現在
[00:11:22] 這個也快要選舉了
[00:11:23] 所以這個
[00:11:24] 這樣的東西其實
[00:11:25] 大家都
[00:11:26] 很想做
[00:11:27] 但是其實這邊通常都會加入所謂的
[00:11:30] 這種
[00:11:31] Social的
[00:11:32] 這些分析這樣子
[00:11:34] 當然現在
[00:11:36] 可能摘要這件事情
[00:11:38] 可能大家不覺得他是一個重要功能
[00:11:40] 因為好像
[00:11:42] Trivial
[00:11:42] 但是以前在做摘要就一篇很大文章
[00:11:45] 你不用
[00:11:46] 三句話告訴我這樣子
[00:11:48] 或是說幫我畫重點
[00:11:50] 這個以前做Summarization
[00:11:52] 還是非常重要大概在五年前還是一個重要題目
[00:11:57] OK
[00:11:58] 那這個
[00:11:59] 資料跟資料之間的相關性
[00:12:02] 或是說我們常常想
[00:12:04] 知道說
[00:12:05] 這個上面的Sentiment
[00:12:07] 情緒的表達到底是什麼
[00:12:09] 這個情緒的表達有各式各樣的應用尤其是
[00:12:13] 有時候會做到醫學領域
[00:12:15] 希望能夠網路上看到一些是不是有些人
[00:12:19] 的
[00:12:21] 言論
[00:12:22] 已經有一些特殊情緒的表達
[00:12:25] 像
[00:12:26] 之前
[00:12:30] 就有人去研究那個
[00:12:33] 犯罪者
[00:12:35] 他在做他的這個犯罪之前他其實有PO一些文章那些文章其實如果能夠
[00:12:41] 事先能夠detect出來的時候
[00:12:43] 其實是能夠
[00:12:44] 有機會能夠
[00:12:45] 去
[00:12:46] 遏止一些犯罪的行為
[00:12:48] 所以這種東西的研究其實一直都還有
[00:12:51] 只是說現在可能
[00:12:53] 他就是靠著
[00:12:54] AI靠著大語言模型的
[00:12:56] 導入能夠讓他更厲害這樣子
[00:12:59] 那這邊最後一項是這個非監督式的訓練語料庫
[00:13:03] 這個我們可能以後再講
[00:13:05] 大語言模型訓練的時候你就會發現說
[00:13:08] 這個
[00:13:10] 是一個非常重要的部分
[00:13:11] 就是說
[00:13:13] 以前大家學機器學習
[00:13:15] 當然就說
[00:13:15] 我們一定要有訓練資料
[00:13:17] 訓練資料
[00:13:18] 通常指的是監督式訓練
[00:13:21] 學習的資料
[00:13:23] 就是你一定要有
[00:13:25] input跟output
[00:13:26] 所以你才能做所謂的supervised training
[00:13:30] 但是呢其實
[00:13:31] 大家做過機器學就知道那個成本相當高而且
[00:13:35] 當你的訓練資料有一些雜訊的時候其他效果
[00:13:39] 就會受到影響
[00:13:41] 但是在大語言模型他怎麼靠著
[00:13:44] 這種
[00:13:45] 我不太可能
[00:13:45] 去標註東西啊
[00:13:47] 所以他一定是用一些
[00:13:49] 非監督式的方式
[00:13:50] 讓
[00:13:51] 整個模型先了解所謂的人類的知識人類的語料
[00:13:55] 那這件事情呢其實也跟
[00:14:00] 前陣子一個
[00:14:02] 臺大英語系的教授說這個學英語啊這個不能背
[00:14:06] 不能背文法背文法就是學不好
[00:14:09] 這有點這道理有點相信就是背文法有點像是說你一定要能去標註一些訓練資料
[00:14:15] 用聽的就對了
[00:14:17] 你不管你聽得懂聽不懂你用聽的聽久你就會這個語言
[00:14:22] 沒有人告訴你那句話是什麼意思沒有人告訴你那個主持動詞授詞是什麼
[00:14:27] 但是你聽久了就是一個
[00:14:30] 非監督式的學習
[00:14:31] 他就可以告訴你這個語言就是
[00:14:33] 會是這個樣子
[00:14:34] 應付第一個新的語要進來有時候新的說法出來之後
[00:14:39] 你那個字典就out of that
[00:14:42] 那另外說你跨語要怎麼辦
[00:14:44] 那另外一個就是說
[00:14:45] 同樣的說法他其實有可能很多種寫法說那個字典
[00:14:49] 要怎麼涵蓋
[00:14:51] 這樣所懂
[00:14:52] 這其實問題都
[00:14:54] OK
[00:14:55] 我我們現在就是想用那我們用大語言模型
[00:14:58] 來做
[00:15:00] 這個老師都在講
[00:15:01] 就的東西我們用新的東西新的方法做看看比如說我就
[00:15:05] 叫Cloud做這件事情
[00:15:07] 就
[00:15:08] 就
[00:15:09] 叫他做你去
[00:15:11] 收集今天的這些股市的資料外資買超
[00:15:15] 買賣資料
[00:15:15] 超前大
[00:15:16] 前10名然後
[00:15:18] 剛好去抓他的新聞
[00:15:20] 然後整理報表給我
[00:15:21] 這件事情是非常容易的對現在AI來講雖然他
[00:15:25] 他會一直去網路上找資料然後會
[00:15:29] 會要你授權一些東西啊他能夠去SS
[00:15:32] 不過基本上他都做的
[00:15:34] 做得到
[00:15:35] 那如果
[00:15:36] 你不太清楚他做什麼事
[00:15:38] 你可以
[00:15:39] 你可以控制他的
[00:15:41] action然後一步一步的去做這樣子
[00:15:44] 那
[00:15:44] 你可以瞭解他他做這些東西的過程以前在沒有大語言模型的時候
[00:15:51] 我們必須自己做
[00:15:53] 我們必須自己把這些流程串起來
[00:15:56] 然後這流程的只要有一個步驟做不好
[00:15:59] 後面
[00:16:00] 幾乎都免談這樣子
[00:16:02] 那這些事情的現在的AI大概沒有問題
[00:16:06] 他去
[00:16:07] 抓資料幫你整理幫你彙整幫你排序
[00:16:11] 找到重要的東西整理報告
[00:16:13] 這件事情
[00:16:14] 他現在其實做得非常好
[00:16:16] 其實
[00:16:17] 這要跑出來的結果
[00:16:18] 那
[00:16:19] 我是沒有去驗證他的
[00:16:21] 結果好壞啦不過這種比較數字型的而且有
[00:16:25] 有資料可以reference
[00:16:27] 他的錯誤機率是
[00:16:28] 蠻低的這樣子
[00:16:31] 好
[00:16:31] 那只是說
[00:16:34] 現在有人就會做這些那我們還去管他怎麼做嗎
[00:16:39] 有時候的確你要知道他怎麼做你才知道說哪邊他可能會出問題
[00:16:43] 那我
[00:16:44] 我用
[00:16:45] 這個整理一下叫AI幫我畫一個圖
[00:16:48] 就是以前的做法
[00:16:49] 其實大概就這個流程
[00:16:51] 這個流程其實
[00:16:55] 現階段你大概要先了解一下才知道說原來大語言模型其實幫我做掉哪些部分
[00:17:01] 比如說
[00:17:02] 像他剛才去抓所謂的這個買賣超差距的前10名他一定要去網路上的
[00:17:08] 網頁啊去Cloud Information
[00:17:11] 然後
[00:17:12] 他還要知道這些
[00:17:14] 買超賣超的值在哪裡
[00:17:17] 單單這些事情以前
[00:17:19] 以前就不太容易做
[00:17:22] 如果你不是人
[00:17:23] 告訴他去抓這些東西讓他自己去判斷
[00:17:26] 這個過程其實就很難
[00:17:28] 那
[00:17:29] 當然他排序完資料排序完之後他就知道我死家公司拿去抓新聞
[00:17:34] 所以當一個新聞進來之後呢
[00:17:37] 我們要做什麼事
[00:17:38] 其實
[00:17:38] 你可能
[00:17:39] 需要以前啦
[00:17:41] 以前的做法是你需要做段子
[00:17:43] 做token action
[00:17:44] 做詞性的tagging
[00:17:47] 會說這個新聞裡面的到底
[00:17:49] 主持在哪裡
[00:17:50] 這個形容詞是什麼這樣子
[00:17:53] 然後呢你還需要做所謂的NER
[00:17:56] 就是我要切出臺積電這三個字
[00:17:59] 這三個字我不能把它變成這個積電這兩個字因為積電其實頻率也很高
[00:18:05] 所以
[00:18:07] 我必須把臺積電切出來這樣子
[00:18:09] 那切出來之後呢我要算一些權重啊就這邊文章裡面講了這麼多字
[00:18:14] 哪些字才是重要
[00:18:16] 其實這個
[00:18:17] 盜墓這這前三個步驟其實在以前做
[00:18:21] 在這個
[00:18:23] 應該說在bert還沒出來之前甚至在bert
[00:18:27] 出來的後面的一兩年
[00:18:29] 其實都還是很重要
[00:18:30] 還是很重要所以大概你可以想像大概在
[00:18:33] 四年前
[00:18:34] 這三個步驟其實還是
[00:18:37] 一個標準的動作SOP
[00:18:39] 後面就比較像是應用就說好吧那這個文章
[00:18:43] 我算完全重之後
[00:18:44] 我能不能做一些應用
[00:18:46] 我做摘要
[00:18:47] 那摘要這邊其實有兩個
[00:18:49] 兩個
[00:18:51] 這邊沒有改到
[00:18:53] 就是
[00:18:54] 一般我們會摘要會有所謂的畫重點式的摘要跟
[00:18:58] 跟這個
[00:18:59] 這個所謂的
[00:19:02] Uptractive Summary
[00:19:04] 就是他會濃縮他會以三句話來表示這樣子
[00:19:08] 那這樣的摘要其實
[00:19:11] 以前有些方法
[00:19:12] 但是現在大語言模型做得非常好
[00:19:14] 那你也可以做情緒分析啊
[00:19:17] 然後你也可以做所謂的topic modeling
[00:19:19] 就是說
[00:19:20] 好吧今天跟臺積電有關的新聞
[00:19:23] 怎麼分成兩大群一個可能是他的財務報表
[00:19:27] 另外一個可能是他要去哪裡建廠的事情
[00:19:31] 你就可以把新聞分成
[00:19:32] 分群然後去看說這兩群所造成的影響是什麼
[00:19:37] 然後再做一些一些BI的
[00:19:39] 系統出來這樣子
[00:19:41] 我想這件事情其實以前的
[00:19:44] SOP就是這樣然後每一個步驟其實都有一些
[00:19:47] 研究的議題可以切入
[00:19:51] 但是你要想像這些東西
[00:19:53] 他就是一條龍這樣子
[00:19:55] 所以其中
[00:19:57] 有一個步驟沒做好
[00:19:58] 後面就很爛
[00:20:00] 比如說
[00:20:01] 你這個新聞根本沒把公式都tag好
[00:20:03] 時間也沒tag出來
[00:20:05] 該有的東西你沒有把它標示出來的時候
[00:20:08] 後面幾乎沒有用
[00:20:11] 所以以前就是一步一步
[00:20:13] 把好好的一個一個模組做好然後串起來這樣子
[00:20:17] 但是你現在可以想像大語言模型進來之後
[00:20:20] 其實
[00:20:21] 他就是把中間的這些整個做掉了
[00:20:24] 包含其中的理解的部分
[00:20:28] 包含深層的部分他就一次做掉
[00:20:31] 當然這中間為什麼這麼厲害
[00:20:34] 這個我們以後看一看
[00:20:36] 你可能
[00:20:38] 還是不會知道為什麼這麼厲害
[00:20:40] 因為其實不太容易瞭解
[00:20:42] 但是你可以想像
[00:20:44] 如果我現在叫LM
[00:20:46] 做這些事情
[00:20:48] 其實我自己人工要做這麼多的事情
[00:20:51] 但這麼多事情當然不見得是
[00:20:54] 最佳解
[00:20:55] 但是是我們人類理解的應該是要這樣做
[00:20:59] 但是大語言模型為什麼靠著
[00:21:02] 幾十個b連的參數
[00:21:04] 他就有辦法把這件事情
[00:21:06] 一次做到為
[00:21:07] 中間的過程是什麼
[00:21:09] 你可以好好思考說
[00:21:11] 這個
[00:21:12] 原來他只是運氣好還是
[00:21:14] 真的有他的道理
[00:21:17] 好
[00:21:18] 那這件事情當然你會覺得說好像
[00:21:20] 詞性就詞性嘛反正都有一些工具
[00:21:23] 好像也不會太難
[00:21:24] 那我們就來解析一下每個步驟他其實可能會遇到一些困難
[00:21:29] 那
[00:21:29] 當然說這個
[00:21:31] 我把
[00:21:31] 這個
[00:21:32] 這個文章切成句子
[00:21:34] 然後找到一些
[00:21:35] POS tagging的工具去切
[00:21:38] 然後可以切到一些子句啊然後去算一些
[00:21:42] 就是該有的關鍵字
[00:21:44] 這些工具套一套好像人去看一看
[00:21:47] 非常容易但是其實電腦來做這件事情
[00:21:51] 挺複雜的
[00:21:52] 挺複雜因為你會發現
[00:21:54] 我這邊列一個詞性表
[00:21:57] 這詞性表
[00:22:00] 就是說
[00:22:00] 以我們學英語來講
[00:22:02] 我們知道所謂動詞
[00:22:04] 主詞
[00:22:05] 名詞
[00:22:05] 受詞
[00:22:06] 這些東西看起來
[00:22:08] 想想大概不會超過10種
[00:22:11] 但是真的
[00:22:12] 你要去細分
[00:22:14] 他所代表的意義
[00:22:15] 或者是說他能夠影響
[00:22:17] 其他字的範圍
## 8. 寫作規則
(這是 `_筆記SOP.md` 第 3.1、4、5、6 節的濃縮版。兩者衝突時以 SOP 為準。)
讀者:碩士生,兩門課期末是英文考試。要只看筆記就能學會,講得比老師好懂。畫面要簡潔。
**概念優先(2026-09-26 主理人)**:主理人只想懂概念,不想補數學、不想看程式碼和座標圖。兩門課的考試也都是問答題、不考算式(AI W1 1:16:52;NLP W3 1:47:41、2:48:36)。所以:
- 每段預設看得到的只有:白話摘要(2–4 句)+**一句生活比喻**(例:模擬退火像投資理財,年輕時敢冒險、越老越保守)+「考試可能怎麼問」一句。
- 數學推導、公式、手算、程式碼、座標圖,全部收進標題寫「(進階,可跳過)」的摺疊,例如「它到底怎麼運作?(進階,可跳過)」。每段最多一個進階摺疊,不要寫長篇計算。
- 演算法要能「用文字說出步驟」(考試可能要你描述),這一點放在預設看得到的地方,不用數字。
- **重心比例**:白話理論與概念模式(它在解決什麼問題、核心想法、跟別的方法差在哪、優缺點、生活比喻)占主要篇幅;數學與程式細節只用一兩句帶過,細節收進進階摺疊。
**圖文並茂(2026-09-26 主理人:不要只有文字)**:
- 每章至少 2–3 個圖,放在**預設看得到**的地方,每個圖前後各用一兩句白話說明「這張圖在看什麼」。
- 流程、步驟、因果、比較 → 用 mermaid 流程圖(```mermaid,flowchart LR 或 TD;節點文字用中文、加雙引號;一張圖不超過 10 個節點)。
- 投影片上的示意圖、架構圖 → 用 [[IMG: …]] 放投影片圖。
- 仍守「每個 ## 段落最多一種視覺元素」。
### 輸出兩個檔
1. `chNN.md`(Notion 寫法,不含頁面標題),結構固定:
- 第一行:章節包第 1 節那行,原樣照抄。
- `## 重點`:三點中文,每點一到兩句。
- `## Exam-ready`:3–10 行英文,**從章節包的投影片文字逐字抄**,每行 `- **Term**: "原句"(Ch3 p.14)`。老師有明確證據才在行尾加 `【老師強調】(h:mm:ss)`。
**每一行下面一定要有一行縮排的中文解釋**(主理人英文不好,看不懂的英文等於沒用):
```
- **Hill climbing**: "It keeps track of one current state and on each iteration moves to the neighboring state with highest value."(Ch4 p.5)
- 中文:爬山法只記住「現在這一個狀態」,每一輪都移到分數最高的鄰居。白話:一直往比較高的地方走一步。
```
中文要先把句子意思講清楚,再補一句白話;難的英文單字括號附中文(例:neighboring state(鄰近狀態))。
- 章節包第 2 節的每一段:`## [h:mm:ss](連結) 標題`(照抄),下面 2–4 句白話摘要,其餘全部收進摺疊:
```
問句(例:用生活例子講,BFS 在做什麼?)
內容
```
摺疊種類(需要才放):用生活例子講?/它到底怎麼運作?/要先懂什麼?(老師假設你會的數學或概念,短版教學)/老師原話是什麼?(「原話」(h:mm:ss),只放重要的,最多 5 句)。
- 「它到底怎麼運作?」要用一組小數字把這段的演算法**真的跑 1–3 步**(例:算出梯度、更新一次、比較兩個 α),不是只示範定義的加減乘除。全章盡量沿用同一組數字,讓前一段的答案能在下一段被驗證。
- 每段正文要回答讀者最可能卡住的一個「為什麼」。投影片公式方向跟題目相反、或投影片說「解不出來」時,用一兩句講出原因,自己補的標(我補充)。
- 投影片句子停在公式前(公式在圖裡)時:Exam-ready 在粗體詞條上補公式、引號內保持原句;正文寫出同一條式子。公式圖看章節包第 6 節列出的 PNG。
- `## Self-check`:2–4 題英文考題,答案收摺疊。**至少一題考老師強調的內容**;不出「老師和投影片哪裡不同」這類不會考的題目。每題格式:
```
Q1. English question?(中文:中文題目)
**Answer**: English answer.
中文:把答案完整講一遍(不是只翻一句),讓看不懂英文的人也知道要怎麼答。
```
- **最後一行**:章節包第 1b 節那行(下一章連結),原樣照抄。讓讀完的人直接點下一章。
- 不要把章節包或這份規則裡的指示句寫進筆記(例如「寫筆記時照投影片寫」「已改正 ASR 錯字」)。
- 長度 8,000–14,000 字元。
2. `chNN.concepts.json`:JSON 陣列,4–12 個考試可能問的術語,每個物件:
`name`(英文)、`zh`、`type`(概念/演算法/公式/人物事件/前置知識/行政)、`signal`("老師說會考"/"老師強調"/"核心(我判斷)"/"")、`evidence`(有 signal 前兩種時必填:原句+時間)、`definition_en`(投影片原句;沒有就註明 (textbook)/(lecture)/(my wording))、`plain`(一句中文)、`a4`(≤150 字元英文,可夾極短中文;期末拼貼用的小方塊)、`time`、`slides`、`prereq`(英文名陣列)。
### 風格鐵律
- 不用 emoji 或裝飾符號(✓✗★⚠ 都不要;→ 可以)。不用 callout。不用 `$`。時間不要用 code 樣式。
- 每個 `##` 段落最多一種視覺元素:一張圖、或一個表格、或一個 mermaid。
- 摺疊標題是問句,前面不加符號。
- 圖片最多 3 張,只放文字取代不了的圖。放法:單獨一行 `[[IMG: | 中文圖說]]`,PNG 用 `slides_to_png.py <圖片資料夾> <頁> --dpi=110` 產生。
- 考試訊號只在老師明確說時標。老師只說「不用背」「不講」就寫「注意:……」。
- 老師口誤或跟投影片不同:照投影片寫,加「注意:老師口頭說的是……」。
- 引用老師的話時,ASR 錯字改成正確的字。
### 沒有投影片時
不要憑記憶逐字重現課本段落或數值表。英文定義用自己的話寫、句尾標 (my wording);Exam-ready 每行標「(自擬,投影片待補)」。例子只用老師講的。
### 寫完之後(只做一次)
跑檢查:
`C:\Users\user\.cache\meeting-record\venv\Scripts\python.exe C:\Users\user\.claude\scripts\check_note.py --transcript <逐字稿> --slides <投影片 txt …> --start <起> --end <訖> --vid <影片 ID>`
- STYLE/VISUAL/TIME/FORMAT:全部改掉。
- QUOTE:確認是不是你改正了 ASR 錯字(是就保留),不是就改成原文或拿掉引號。
- ENGLISH:確認是不是投影片斷行造成的(是就保留),不是就改成投影片原句。
**省額度守則**:章節包裡已經有你需要的全部資料。不要再去讀整份逐字稿、整份投影片、segments.json 或手冊。一次寫好整個檔(Write 一次),檢查後集中修改。