# 章節包:自然語言處理(NLP)W2(9/17)第 04 章「語法層次與深度學習時代」 影片 1:08:43–1:20:25,YouTube ID MnA5KUETSg4。Notion 章節頁 https://app.notion.com/p/3e6fc631b03081768161d6716089043a(頁 ID 3e6fc631-b030-8176-8161-d6716089043a),頁面標題「04 語法層次與深度學習時代(1:08–1:20)」。 ## 1. 第一行(直接照抄,不要改) [自然語言處理](https://app.notion.com/p/3e6fc631b03081b4a9e8f91f3411f61f) › [W2(9/17)](https://app.notion.com/p/3e6fc631b03081a18b13fad72a8874fd) › 04|影片 [1:08:43–1:20:25](https://www.youtube.com/watch?v=MnA5KUETSg4&t=4123s)|投影片 W1_NLP_brief_v2 p.33–37|上一章 [03 LLM 之前的應用與分析層次(0:41–0:58)](https://app.notion.com/p/3e6fc631b0308187ae81c0e0fefb77f7)|下一章 [05 資訊檢索、索引與前處理(1:20–1:48)](https://app.notion.com/p/3e6fc631b0308148a521f4d07ae31526) ## 1b. 最後一行(直接照抄,放在 Self-check 後面,當全頁最後一行) 讀完了嗎?下一章:[05 資訊檢索、索引與前處理(1:20–1:48)](https://app.notion.com/p/3e6fc631b0308148a521f4d07ae31526)|回到週頁:[W2(9/17)](https://app.notion.com/p/3e6fc631b03081a18b13fad72a8874fd) ## 2. 各段標題(照順序;每段一個 ## 標題,直接照抄連結) - `## [1:08:43](https://www.youtube.com/watch?v=MnA5KUETSg4&t=4123s) 續課:教材要一直更新` 老師講什麼:今天只是看故事,不談細節。資工系到了 AI 時代,一半以上的教材都要跟著更新。 - `## [1:10:27](https://www.youtube.com/watch?v=MnA5KUETSg4&t=4227s) 沒學過機器學習會不會吃力` 老師講什麼:寫作業應該還好;但理解上課內容時,有訓練過模型的人感受會不太一樣。 - `## [1:11:22](https://www.youtube.com/watch?v=MnA5KUETSg4&t=4282s) 語法層:語法樹` 老師講什麼:用詞性分析出語法樹,從 root 往下切出名詞片語、動詞片語,再從語法推出語意。中研院做了很多這類語料,但這條路大約十年前就碰到瓶頸。 - `## [1:13:19](https://www.youtube.com/watch?v=MnA5KUETSg4&t=4399s) NLP 的限制與語言學途徑` 老師講什麼:名詞片語的角色、抽象概念、同義詞都很難處理,換一種語言規則又不同。語言學途徑不把文件當成一袋字,而是要抽出概念;現在 LLM 的 embedding 已經把前後文的概念學進去了。 - `## [1:16:17](https://www.youtube.com/watch?v=MnA5KUETSg4&t=4577s) Manning:語言理解是 AI-complete` 老師講什麼:NLP 是資工、AI、語言學的交集,完美的語言理解是 AI-complete(跟做出通用 AI 一樣難)。老師介紹 Christopher Manning(GloVe 出自他的實驗室),並秀出自己在 ACL 2023 和他的合照。 - `## [1:18:28](https://www.youtube.com/watch?v=MnA5KUETSg4&t=4708s) AI 加值的 NLP` 老師講什麼:資料處理換成 word2vec、GloVe、ELMo、BERT(2019–2021 年幾乎人人都用 BERT),後面再接各種模型與應用。模型訓練效果好,但可解釋性差,可能只是記住了資料。 ## 3. 老師強調/會考/不考的地方(原句已驗證;寫進筆記時 ASR 錯字要改正) (無) ## 4. 這章摘要與重要度 接著講語法與語意層的限制、Manning 對 NLP 的定義,以及深度學習時代怎麼用 word2vec、BERT 這類表示學習把 NLP 重做一遍。(一般) ## 5. 整堂課的提醒(ASR 錯字、老師口誤、投影片缺公式等;只用跟這章有關的) - 老師 0:04:39 才開始講課,前面約 4 分半逐字稿沒有內容。 - 兩次下課:0:58:52–1:08:43、2:07:15–2:16:39。 - 2:18:33–2:19:11 逐字稿有約 40 秒空白,老師說「沒有抓到畫面」,2:20:21 又問「現在投影是對的吧」。這段錄影可能暫時沒拍到投影片(沒看影片,不確定)。 - 本週投影片是 W1_NLP_brief_v2.pdf(檔名的 W1 不等於上課週),實際講的範圍是 p.3–64;p.2 目錄老師說跳過。 - 投影片起點和已知事實不同:已知事實寫從 p.5 開始,但老師 0:07:25 說跳過 p.2 目錄,接著簡短講了 p.3(以前和現在做法差別的圖),0:09:31 講 p.4「What is NLP」。所以實際範圍是 p.3–64。 - 舊筆記(Notion 封存頁)記的時間和本逐字稿差約 1 分鐘。舊筆記寫下課 0:57:28、2:06:15,續課 1:09:37;本逐字稿是 0:58:52 下課、1:08:43 續課、2:07:15 下課、2:16:39 續課。這份計畫以本逐字稿為準。舊筆記寫的投影片檔是 W1_NLP_brief.pdf,不是 v2。 - 音檔長度 2:59:56,YouTube 是 3:00:07,差 11 秒。逐字稿時間和 YouTube 播放時間有沒有對齊,我沒有逐一驗證(不確定)。 - 2:18:33–2:19:11 逐字稿有約 40 秒空白,老師說「沒有抓到畫面」,這段錄影可能沒拍到投影片(不確定)。 - 2:24:56 老師說 BM25 的引言在「這一份投影片的最後一頁」,實際是 p.94(p.95 是 Summary),而且不在本週講的範圍。 - p.19 是 AI 仿作的《詩師食獅史》(同音字例子)。Strawberry 那段(0:39:43)沒有對應的投影片。 - 有 4 則 emphasis 標成「不考」,但老師原話是「公式不用記」(2:24:31、2:28:40)或「不會提到 GloVe」(2:58:06),不是明說「不考」。寫章節時建議用「老師說不用背/不講」,不要寫成【老師說不考】。 - 第 4 章(約 12 分鐘)和第 7 章(約 13 分鐘)比 15 分鐘短一點。因為兩章都緊貼下課分界,主題也各自獨立,所以沒有併章。 - 逐字稿常見的語音辨識錯字(引用時要改成正確寫法,也可以補進 fix_transcript 的錯字表):小平→小冰、Crystal→Chris(Manning)、STARBOARD→stop words、Wall Embedding/World Embedded→word embedding、World Reputation→word representation、構制學→構詞學、磁→詞、One-Half/One Heart→one-hot、Palsymy→Polysemy、RuCode→recall、O2Bect→word2vec、Bangio→Bengio、imprtindex/Import index→inverted index、Portal→Porter、REG→RAG、Patch rank→PageRank、Uptractive→Abstractive、Passing Tree→parsing tree、WSA→WSD、Tornazion→Tokenization、三國字→三國志、宇步→呂布、Facial Splash→feature space。1:37:48 的「Lesson」可能是 lexical processing(不確定);0:34:4x 的「VirusDM」推測是某種機率模型,可能是 HMM(不確定),所以 NER 那段我只寫 CRF。 ## 6. 投影片文字(這章範圍) **這幾頁的公式或內容只在圖裡(文字檔抓不到),寫 Exam-ready 與公式前先用 Read 看這幾張圖:** - W1_NLP_brief p.33 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p033.png - W1_NLP_brief p.35 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p035.png - W1_NLP_brief p.36 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p036.png --- W1_NLP_brief p.33 --- Syntax Ex: The Bank of Canada will curb inflation with higher interest rates. 33 Prepositional phrase Adjective Sentence Noun phrase Verb phrase Noun Verb Aux Noun phrase Noun Adjective Noun The Bank of Canada inflation curb will Interest rates higher with 中研院平衡語料庫詞類標記集 --- W1_NLP_brief p.34 --- Problems with NLP Limitations of Natural Language Processing ◦Correctly identifying the role of noun phrases ◦Representing abstract concepts ◦Classifying synonyms ◦Representing the number of concepts 34 --- W1_NLP_brief p.35 --- Underlying Technology is Based on Linguistics The Linguistic Approach: ◦Does not treat a document as a bag of words ◦Removes ambiguity by extracting structured concepts Concepts are the DNA of text. 35 Text is unstructured, ambiguous, and language dependent. --- W1_NLP_brief p.36 --- What is NLP? Natural language processing is a field at the intersection of ◦computer science ◦artificial intelligence ◦and linguistics. Fully understanding and representing the meaning of language (or even defining it) is a difficult goal. Perfect language understanding is AI-complete. (Christopher Manning) 36 Christopher @ACL2023 --- W1_NLP_brief p.37 --- AI-enhanced Natural Language Processing 37 Data Preprocessing ● Representation Learning ○ Word2Vec. GloVe. ELMo. BERT... ● Named Entity Recognition and Normalization ● ... Model Building ● Seq2Seq ● AutoEncoders ● Attention Mechanism ● Reinforcement Learning ● Generative Adversarial Networks (GAN) ● ... Applications ● News/Document Summarization ● Toxic Comment Classification ● Rumor Detection ● Text/Report Generation ● Sentiment Analysis ● Latent Aspect Mining ● Dialogue System ## 7. 逐字稿(1:08:43 前後各多 1 分鐘,原始行) [01:08:43] 好那個就繼續上課 [01:08:47] 說實在我今天講的東西都非常的 [01:08:50] 簡略啦而且 [01:08:52] 非常快 [01:08:53] 主要並不是要 [01:08:54] 探討裡面的細節 [01:08:55] 而是 [01:08:56] 一個 [01:08:58] 看看故事這樣以前人做過這些事這樣子 [01:09:01] 不然老實說 [01:09:03] 像每一個這樣的東西比如說這一頁的東西它其實就是一片paper的技術 [01:09:07] 那當然有興趣的你可以自己找一下這個paper [01:09:10] 做看一下裡面的 [01:09:12] 不過這都是還蠻久以前的 [01:09:15] 就是deep learning出來之後 [01:09:17] 大家怎麼導入這種 [01:09:20] 大量一點的 [01:09:21] 的表示 [01:09:22] 然後去學會這個語彙的東西 [01:09:26] 那這個其實也是做這個研究的 [01:09:29] 的痛苦 [01:09:30] 因為 [01:09:31] 我剛才講那個Stanford那門課其實就是 [01:09:35] 就是NLP [01:09:37] 然後後面加deep learning這樣子 [01:09:39] 那我們 [01:09:40] 這個 [01:09:42] 我覺得志工系很多尤其是研究所課應該 [01:09:45] 都需要做一點這樣的變化就是 [01:09:48] 你原來主題在 [01:09:50] 在AI或是在deep learning的情況之下 [01:09:52] 該重視什麼這樣子 [01:09:55] 對啊這個其實是 [01:09:56] 我覺得志工系 [01:09:58] 蠻可憐的地方就是這樣 [01:09:59] 像如果是 [01:10:01] 如果是中文系可能就不需要去說什麼 [01:10:04] 紅羅夢在深度學習下的 [01:10:07] 的分析與探討那個可能 [01:10:09] 也許啊也許有另外一種角度來分析但是 [01:10:13] 課程內容的本質是不太會變的 [01:10:16] 但是我大概有一半甚至三分之二的教材是 [01:10:20] 要一直被update這樣子 [01:10:22] 好 [01:10:25] 那 [01:10:27] 之前也有同學有問說這門課如果他沒有學過機器學習或是 [01:10:33] AI相關課會不會很吃力 [01:10:37] 以寫作業來講我是覺得可能 [01:10:40] 還好啦 [01:10:42] 但是以這種的 [01:10:43] 課程內容理解來講可能你沒有學過機器學習 [01:10:47] 或是AI [01:10:48] 你可能體會到部分就跟有學過的 [01:10:52] 或是有做過Training的人可能感受會不太一樣 [01:10:56] 這個 [01:10:57] 這個大概是這樣因為 [01:10:58] 這個因為這邊都沒有講到細節怎麼Train這個東西但是 [01:11:02] 如果你有 [01:11:03] 學過 [01:11:04] 機器學習或是這種 [01:11:07] Deep Learning的 [01:11:08] 學生你可能 [01:11:09] 看到這個圖 [01:11:10] 你就知道他們在幹什麼事情這樣子 [01:11:15] 好不過我想就 [01:11:17] 這邊就比較像是一個 [01:11:19] Overview的介紹了 [01:11:22] 那Syntax的部分其實詞性的部分 [01:11:27] 以前的做法比較是Linguistic的做法 [01:11:30] 然後再加一些統計的方式 [01:11:32] 那當然這些東西都可以用 [01:11:35] 類成金網路 [01:11:37] 然後用訓練的方式再重做這樣子 [01:11:41] 那像 [01:11:42] 底下這個紅色框起來是原來的句子 [01:11:45] 這個Tree的結構就是它的 [01:11:48] 這個詞性 [01:11:49] 所分析出來這個語法的結構 [01:11:51] 這構成了Tree這樣子 [01:11:53] 它有了Tree的結構我就比較知道說這個從 [01:11:57] 最Top的Root下來我應該怎麼切 [01:12:00] 會有兩塊的重點 [01:12:02] 然後 [01:12:03] 那裡面這個 [01:12:04] 名詞片語的形容的方式是什麼 [01:12:07] 以前都必須要這樣去理解句子的構造 [01:12:10] 去理解才能知道它 [01:12:12] 從Syntax [01:12:13] 再長出所謂的Semantics [01:12:16] 不過這個 [01:12:18] 有時候需要人工一些介入 [01:12:20] 所以當時 [01:12:21] 其實中研院有蠻多在做這一塊的語料 [01:12:25] 那 [01:12:26] 這個大家可以去看一下 [01:12:28] 不過Anyway這個其實 [01:12:30] 挺複雜挺多的這樣子 [01:12:32] 那因為現在的整個 [01:12:34] 技術的翻新 [01:12:36] 所以 [01:12:36] 這樣的語料集 [01:12:38] 它通常都會在 [01:12:40] 前面的訓練資料就看過就用掉了 [01:12:44] 所以你大概不太會再去 [01:12:45] Reference這樣的東西 [01:12:47] 是還是有機會的 [01:12:48] 只是說這個現在比較少用 [01:12:51] 那這樣做法其實以前 [01:12:57] 老實說 [01:12:58] 幾乎到一個瓶頸 [01:12:59] 雖然 [01:13:00] Google出來之後有一些用統計大量資料的方式統計做法又可以往上推了一把 [01:13:06] 但是一直到這個10年前大概那個 [01:13:10] 那個等級大概又停在那裡 [01:13:12] 大概 [01:13:13] 有太多的是 [01:13:15] 不是靠著大量資料就可以做的 [01:13:19] 那這邊 [01:13:21] 講幾個就是說 [01:13:22] 怎麼去 [01:13:25] 去 [01:13:26] Identify是這個名詞片語的角色 [01:13:29] 這個名詞片語它到底是 [01:13:32] 是形容哪個東西的 [01:13:34] 或它整個句子所代表的意思 [01:13:36] 那整個句子的這種concept [01:13:40] 這個抽象的概念到底是什麼 [01:13:42] 這個其實 [01:13:43] 如果你有做過摘要就知道說 [01:13:46] 一句話 [01:13:48] 一句話的概念大概知道 [01:13:50] 兩句話三句話這三句話如果把它變成 [01:13:52] 一個概念 [01:13:54] 這件事情就越來越複雜 [01:13:57] 然後另外當然一些 [01:13:58] 混淆很久這種同義字 [01:14:01] 同義字怎麼做 [01:14:02] 就一個字 [01:14:04] 有相同的意思不同的意思或是不同的字有相同的意思這樣子 [01:14:11] OK [01:14:12] 那 [01:14:13] 那這個 [01:14:17] 我們其實當然還是based on所謂的語法學 [01:14:20] 但是 [01:14:22] 但是這個東西其實 [01:14:24] 你換一個語言 [01:14:25] 其實概念又不一樣 [01:14:27] 這整個 [01:14:29] 整個的解釋方式整個的分析 [01:14:32] 不同語言學家就是 [01:14:33] 會做不同的語言 [01:14:35] 所以有時候 [01:14:37] 當一個稀少資源的語言要做的時候其實不太容易 [01:14:41] 因為比較少人研究的時候 [01:14:43] 可以reference的東西就 [01:14:44] 相對的少這樣子 [01:14:47] OK [01:14:48] 那 [01:14:49] 從linguistic的角度的時候呢我們其實就 [01:14:54] 不會去把一個文章試成是 [01:14:57] 所謂的back of word [01:14:59] back of word後面會再提 [01:15:00] 就是以前 [01:15:01] 在做搜尋以前的時候會把 [01:15:03] 一篇句子 [01:15:04] 一個句子或是一篇文章當成一堆的字 [01:15:06] 詞袋 [01:15:08] 就是如果你聽過一個中文叫做詞袋 [01:15:10] 就把一堆的詞放在一個袋子裡這樣子 [01:15:12] 因為就把所有的 [01:15:16] 語法所有的這種前後文的關係都把它打爛這樣子 [01:15:20] 語法學就不會這樣做 [01:15:22] 統計的比較會這樣做了 [01:15:24] 但是 [01:15:25] 那是基本的統計 [01:15:27] 複雜一點其實你還是會有前後文的關係這樣子 [01:15:32] OK [01:15:32] 所以其實 [01:15:33] 那時候的研究到後來大家都覺得說 [01:15:36] 我們要去 [01:15:38] 擷取出所謂的 [01:15:40] text的 [01:15:41] concept [01:15:42] 就是你這句話講的 [01:15:44] 的意思到底是什麼 [01:15:46] 而不是隻是靠著這個幾個字 [01:15:49] 所構成的向量來表示這樣子 [01:15:52] 當然你會說 [01:15:53] 老師現在 [01:15:54] 大語言模型不就是靠著字的embedding的向量來算嗎 [01:15:58] 那重點就在於是說 [01:16:00] 他那個字的embedding [01:16:02] 其實 [01:16:02] 都把這些學進去 [01:16:05] 不再只是單字上的方式 [01:16:08] 而是所謂的前後文的concept都有embed在那個 [01:16:12] 這個他的 [01:16:13] vector裡面 [01:16:16] 好 [01:16:17] 這句話其實是 [01:16:19] 是從Stanford的 [01:16:21] 那個 [01:16:22] 結錄出來的啦 [01:16:23] Stanford那個課程 [01:16:24] 就是Crystal [01:16:26] 他的 [01:16:27] 他其實是主講但是他其實後面的課程都是他學生在講 [01:16:30] 就是說 [01:16:31] 現在NLP其實是一個 [01:16:34] 需要結合 [01:16:35] CS [01:16:36] AI跟Linguistic [01:16:38] 語言學的一個重要的領域 [01:16:40] 當然 [01:16:41] 重點是把AI放進去 [01:16:43] 就是 [01:16:44] 你要完全的去 [01:16:46] Fully understanding跟 [01:16:48] 怎麼去表示這個語言的意思 [01:16:50] 其實是個困難的事情 [01:16:53] 那當然他 [01:16:53] 他下一個結論 [01:16:55] 就是Perfect language understanding是AI complete [01:17:00] 當然這個詞並不是很formal去定義啊 [01:17:02] 只是說 [01:17:04] 他有去 [01:17:06] 講這些事情 [01:17:08] 然後通常大師講的 [01:17:10] 就 [01:17:10] 有道理這樣子 [01:17:11] 而且 [01:17:12] 因為Crystal是一個 [01:17:14] 是一個蠻有名的 [01:17:15] 他以前在做資訊檢索領域是一個 [01:17:18] 幾乎就是 [01:17:19] 他說了算這樣子 [01:17:21] 而且他也非常厲害有很多系統這樣子 [01:17:23] 如果 [01:17:25] 如果大家有用過 [01:17:28] 以前啦就是word2vec的時候 [01:17:31] 或是用所謂的 [01:17:34] 這個 [01:17:35] Grow Vector [01:17:36] 有一個做Wall Embedding的Grow Vector非常有名的 [01:17:39] 這個 [01:17:41] Wall Embedding的一個做法 [01:17:43] 就是他們實驗室做的這樣子 [01:17:45] 當然他的 [01:17:46] 他是非常厲害在 [01:17:48] IR領域在NLP領域非常厲害的一個 [01:17:52] 對忘記了 [01:17:54] 我擺一個照片在這裡 [01:17:55] 這是 [01:17:56] 我跟Crystal在 [01:17:57] 2023年 [01:17:59] 的 [01:18:00] 中間是我學生啦 [01:18:01] 對我不知道為什麼他 [01:18:02] 跑到我們中間去 [01:18:03] 所以把他臉遮掉 [01:18:06] 我不知道沒有爭取他的同意這樣雖然我也沒爭取Crystal的同意 [01:18:10] OK [01:18:12] 不過他是一個很 [01:18:14] Friendly的一個人 [01:18:15] OK [01:18:17] 所以 [01:18:18] 鼓勵大家 [01:18:20] 念博士班就是 [01:18:21] 常常可以出國這樣子 [01:18:23] 可以 [01:18:23] 見見這些大師的風采這樣子 [01:18:27] OK好 [01:18:28] 那其實 [01:18:30] AI的加值之後我們就發現以前我們做這些應用了 [01:18:34] 你說老師以前要做斷字啊做 [01:18:36] NE啊這些東西 [01:18:38] 也是要做啦 [01:18:40] 只是說手法換 [01:18:42] 手法換 [01:18:43] 在資料處理上手法換 [01:18:45] 我們會用 [01:18:45] Wall-to-Vector [01:18:46] 這個就是我剛才講的Grow Vector [01:18:48] 就是史丹佛拉姆做的 [01:18:50] 當然在後期一點的就會用到 [01:18:53] 這AIRMOD可能 [01:18:54] 可能大家有聽過後來 [01:18:56] 其實也不太用了 [01:18:57] BERT就是 [01:18:58] 這個 [01:18:59] 一代 [01:19:00] 一代宗師啊就是那個年代 [01:19:03] 非常重要的 [01:19:05] 大概在2019 [01:19:06] 2020 [01:19:07] 2021這三年 [01:19:09] 所有做NLP的 [01:19:11] 全部 [01:19:12] 不是全部啦 [01:19:13] 幾乎都是用 [01:19:14] BERT當成是一個大的 [01:19:16] 核心的角色出發 [01:19:18] 那當然這些東西都可以在 [01:19:21] 在這些NDR年上去 [01:19:23] 去發揮這樣子 [01:19:25] 他只是說中間我們會在嫁接一些模型 [01:19:27] 有點像是說 [01:19:29] 以前的應用比較是一個規則式的 [01:19:32] 人工介入式的甚至 [01:19:34] 字典的方式 [01:19:36] 極少用訓練的 [01:19:38] 但是後來我們就是 [01:19:40] 還是覺得因為算力起來 [01:19:42] 資料起來了 [01:19:44] 我們就用Model Training的方式來做這件事情 [01:19:49] 那但是用Model Training [01:19:50] 厲害歸厲害但是其實它可解釋性就 [01:19:53] 很差 [01:19:54] 雙方學生做出來說老師我這個效果起來 [01:19:58] 那我說為什麼 [01:19:59] 不知道這樣子 [01:20:00] 反正就是模型的功勞 [01:20:02] 這樣子就是 [01:20:03] 這個模型可以把這個問題 [01:20:05] fit的相當的好 [01:20:06] 但是並不代表你解決這個問題 [01:20:09] 而是說他 [01:20:10] 記住了以前的所有的資料這樣子 [01:20:14] 不過這大概是一個抽象的概念的一個flow [01:20:17] 當然你現在 [01:20:19] 現在可能也不用全部就是 [01:20:22] LM這樣子 [01:20:24] 好 [01:20:25] 那接下來我可能會花 [01:20:28] 一個小時到 [01:20:29] Maybe今天就把 [01:20:30] 時間花在這裡就是我們來看一下文字啊 [01:20:33] 怎麼去做就是說 [01:20:35] 我們現在先不要拿出厲害的武器不要用LM [01:20:38] 就是說以前用 [01:20:40] 在做 [01:20:41] 文字的時候 [01:20:42] 會做 [01:20:43] 怎麼樣的步驟 [01:20:45] 怎麼去處理這樣子 [01:20:47] 那 [01:20:48] 你可以想像以前NLP [01:20:50] 雖然 [01:20:51] 翻譯很重要啊 [01:20:53] 雖然這個好像做一個對話機器的很重要 [01:20:56] 但是他的需求性跟他 [01:20:59] 他所看的問題 [01:21:02] 一直到 [01:21:03] 所謂internet起來 [01:21:05] 這個World Wide Web起來之後那個時候 [01:21:08] 才被 [01:21:09] 重視 [01:21:10] 大概在 [01:21:12] 1998 99的時候真的蓬勃發展起來之後大家覺得這一塊非常重要 [01:21:18] 然後到2000年2000年大概 [01:21:21] 可能各位 [01:21:22] 剛出生吧 [01:21:24] 就是那時候網路泡沫化 ## 8. 寫作規則 (這是 `_筆記SOP.md` 第 3.1、4、5、6 節的濃縮版。兩者衝突時以 SOP 為準。) 讀者:碩士生,兩門課期末是英文考試。要只看筆記就能學會,講得比老師好懂。畫面要簡潔。 **概念優先(2026-09-26 主理人)**:主理人只想懂概念,不想補數學、不想看程式碼和座標圖。兩門課的考試也都是問答題、不考算式(AI W1 1:16:52;NLP W3 1:47:41、2:48:36)。所以: - 每段預設看得到的只有:白話摘要(2–4 句)+**一句生活比喻**(例:模擬退火像投資理財,年輕時敢冒險、越老越保守)+「考試可能怎麼問」一句。 - 數學推導、公式、手算、程式碼、座標圖,全部收進標題寫「(進階,可跳過)」的摺疊,例如「它到底怎麼運作?(進階,可跳過)」。每段最多一個進階摺疊,不要寫長篇計算。 - 演算法要能「用文字說出步驟」(考試可能要你描述),這一點放在預設看得到的地方,不用數字。 - **重心比例**:白話理論與概念模式(它在解決什麼問題、核心想法、跟別的方法差在哪、優缺點、生活比喻)占主要篇幅;數學與程式細節只用一兩句帶過,細節收進進階摺疊。 **圖文並茂(2026-09-26 主理人:不要只有文字)**: - 每章至少 2–3 個圖,放在**預設看得到**的地方,每個圖前後各用一兩句白話說明「這張圖在看什麼」。 - 流程、步驟、因果、比較 → 用 mermaid 流程圖(```mermaid,flowchart LR 或 TD;節點文字用中文、加雙引號;一張圖不超過 10 個節點)。 - 投影片上的示意圖、架構圖 → 用 [[IMG: …]] 放投影片圖。 - 仍守「每個 ## 段落最多一種視覺元素」。 ### 輸出兩個檔 1. `chNN.md`(Notion 寫法,不含頁面標題),結構固定: - 第一行:章節包第 1 節那行,原樣照抄。 - `## 重點`:三點中文,每點一到兩句。 - `## Exam-ready`:3–10 行英文,**從章節包的投影片文字逐字抄**,每行 `- **Term**: "原句"(Ch3 p.14)`。老師有明確證據才在行尾加 `【老師強調】(h:mm:ss)`。 **每一行下面一定要有一行縮排的中文解釋**(主理人英文不好,看不懂的英文等於沒用): ``` - **Hill climbing**: "It keeps track of one current state and on each iteration moves to the neighboring state with highest value."(Ch4 p.5) - 中文:爬山法只記住「現在這一個狀態」,每一輪都移到分數最高的鄰居。白話:一直往比較高的地方走一步。 ``` 中文要先把句子意思講清楚,再補一句白話;難的英文單字括號附中文(例:neighboring state(鄰近狀態))。 - 章節包第 2 節的每一段:`## [h:mm:ss](連結) 標題`(照抄),下面 2–4 句白話摘要,其餘全部收進摺疊: ```
問句(例:用生活例子講,BFS 在做什麼?) 內容
``` 摺疊種類(需要才放):用生活例子講?/它到底怎麼運作?/要先懂什麼?(老師假設你會的數學或概念,短版教學)/老師原話是什麼?(「原話」(h:mm:ss),只放重要的,最多 5 句)。 - 「它到底怎麼運作?」要用一組小數字把這段的演算法**真的跑 1–3 步**(例:算出梯度、更新一次、比較兩個 α),不是只示範定義的加減乘除。全章盡量沿用同一組數字,讓前一段的答案能在下一段被驗證。 - 每段正文要回答讀者最可能卡住的一個「為什麼」。投影片公式方向跟題目相反、或投影片說「解不出來」時,用一兩句講出原因,自己補的標(我補充)。 - 投影片句子停在公式前(公式在圖裡)時:Exam-ready 在粗體詞條上補公式、引號內保持原句;正文寫出同一條式子。公式圖看章節包第 6 節列出的 PNG。 - `## Self-check`:2–4 題英文考題,答案收摺疊。**至少一題考老師強調的內容**;不出「老師和投影片哪裡不同」這類不會考的題目。每題格式: ```
Q1. English question?(中文:中文題目) **Answer**: English answer. 中文:把答案完整講一遍(不是只翻一句),讓看不懂英文的人也知道要怎麼答。
``` - **最後一行**:章節包第 1b 節那行(下一章連結),原樣照抄。讓讀完的人直接點下一章。 - 不要把章節包或這份規則裡的指示句寫進筆記(例如「寫筆記時照投影片寫」「已改正 ASR 錯字」)。 - 長度 8,000–14,000 字元。 2. `chNN.concepts.json`:JSON 陣列,4–12 個考試可能問的術語,每個物件: `name`(英文)、`zh`、`type`(概念/演算法/公式/人物事件/前置知識/行政)、`signal`("老師說會考"/"老師強調"/"核心(我判斷)"/"")、`evidence`(有 signal 前兩種時必填:原句+時間)、`definition_en`(投影片原句;沒有就註明 (textbook)/(lecture)/(my wording))、`plain`(一句中文)、`a4`(≤150 字元英文,可夾極短中文;期末拼貼用的小方塊)、`time`、`slides`、`prereq`(英文名陣列)。 ### 風格鐵律 - 不用 emoji 或裝飾符號(✓✗★⚠ 都不要;→ 可以)。不用 callout。不用 `$`。時間不要用 code 樣式。 - 每個 `##` 段落最多一種視覺元素:一張圖、或一個表格、或一個 mermaid。 - 摺疊標題是問句,前面不加符號。 - 圖片最多 3 張,只放文字取代不了的圖。放法:單獨一行 `[[IMG: | 中文圖說]]`,PNG 用 `slides_to_png.py <圖片資料夾> <頁> --dpi=110` 產生。 - 考試訊號只在老師明確說時標。老師只說「不用背」「不講」就寫「注意:……」。 - 老師口誤或跟投影片不同:照投影片寫,加「注意:老師口頭說的是……」。 - 引用老師的話時,ASR 錯字改成正確的字。 ### 沒有投影片時 不要憑記憶逐字重現課本段落或數值表。英文定義用自己的話寫、句尾標 (my wording);Exam-ready 每行標「(自擬,投影片待補)」。例子只用老師講的。 ### 寫完之後(只做一次) 跑檢查: `C:\Users\user\.cache\meeting-record\venv\Scripts\python.exe C:\Users\user\.claude\scripts\check_note.py --transcript <逐字稿> --slides <投影片 txt …> --start <起> --end <訖> --vid <影片 ID>` - STYLE/VISUAL/TIME/FORMAT:全部改掉。 - QUOTE:確認是不是你改正了 ASR 錯字(是就保留),不是就改成原文或拿掉引號。 - ENGLISH:確認是不是投影片斷行造成的(是就保留),不是就改成投影片原句。 **省額度守則**:章節包裡已經有你需要的全部資料。不要再去讀整份逐字稿、整份投影片、segments.json 或手冊。一次寫好整個檔(Write 一次),檢查後集中修改。