# 章節包:自然語言處理(NLP)W2(9/17)第 02 章「語言的歧義與理解難題」 影片 0:21:17–0:41:29,YouTube ID MnA5KUETSg4。Notion 章節頁 https://app.notion.com/p/3e6fc631b030815e805aead9c729a0d1(頁 ID 3e6fc631-b030-815e-805a-ead9c729a0d1),頁面標題「02 語言的歧義與理解難題(0:21–0:41)」。 ## 1. 第一行(直接照抄,不要改) [自然語言處理](https://app.notion.com/p/3e6fc631b03081b4a9e8f91f3411f61f) › [W2(9/17)](https://app.notion.com/p/3e6fc631b03081a18b13fad72a8874fd) › 02|影片 [0:21:17–0:41:29](https://www.youtube.com/watch?v=MnA5KUETSg4&t=1277s)|投影片 W1_NLP_brief_v2 p.8–19|上一章 [01 課程定位與傳統 NLP 流程(0:04–0:21)](https://app.notion.com/p/3e6fc631b03081e3872cf295fcfe1eaa)|下一章 [03 LLM 之前的應用與分析層次(0:41–0:58)](https://app.notion.com/p/3e6fc631b0308187ae81c0e0fefb77f7) ## 1b. 最後一行(直接照抄,放在 Self-check 後面,當全頁最後一行) 讀完了嗎?下一章:[03 LLM 之前的應用與分析層次(0:41–0:58)](https://app.notion.com/p/3e6fc631b0308187ae81c0e0fefb77f7)|回到週頁:[W2(9/17)](https://app.notion.com/p/3e6fc631b03081a18b13fad72a8874fd) ## 2. 各段標題(照順序;每段一個 ## 標題,直接照抄連結) - `## [0:21:17](https://www.youtube.com/watch?v=MnA5KUETSg4&t=1277s) 詞性標註沒那麼簡單` 老師講什麼:人覺得詞性不超過十種,但真的細分下去非常多。用過 CKIP、結巴就知道,工具會吐出一大堆詞性標籤。 - `## [0:22:55](https://www.youtube.com/watch?v=MnA5KUETSg4&t=1375s) 詞義歧義:Watch for kids` 老師講什麼:watch 當名詞或動詞,意思就不同,要靠前後文判斷,這也是 LLM 的 context window(一次能讀進的文字長度)很重要的原因。AI 要被問對角度才答得好。 - `## [0:25:27](https://www.youtube.com/watch?v=MnA5KUETSg4&t=1527s) 前後文歧義:Siri 與規則式對話` 老師講什麼:問「要不要帶傘」,Siri 知道是在查天氣。但以前的聊天機器人本質是字典比對加一點情境,規則顧此失彼,隨便問幾句就答不出來。 - `## [0:28:23](https://www.youtube.com/watch?v=MnA5KUETSg4&t=1703s) 閱讀理解題` 老師講什麼:老師建議做完前兩個作業後,自己試試用 embedding 算選項和文章的相似度來答題。要解釋答案就得靠生成,拿掉 LLM 幾乎做不到。 - `## [0:29:15](https://www.youtube.com/watch?v=MnA5KUETSg4&t=1755s) 英文句法歧義:望遠鏡句` 老師講什麼:I saw a man on a hill with a telescope 有好幾種解讀。把句子翻成別的語言再翻回來(回譯),可以產生多樣化的語料;剖析樹(parsing tree)取決於用哪種統計基礎,所以不是唯一的。 - `## [0:33:13](https://www.youtube.com/watch?v=MnA5KUETSg4&t=1993s) NER:抓出財經新聞的關鍵實體` 老師講什麼:財經新聞只要標出公司、日期、數字,就能拿來分類、分群。以前要靠 CRF 這類機率模型加上標註資料,老師實驗室曾有兩位博士生靠這個題目畢業。 - `## [0:34:55](https://www.youtube.com/watch?v=MnA5KUETSg4&t=2095s) 推理、情境與同音字` 老師講什麼:舅舅偷錢的推理題、冬天夏天「能穿多少穿多少」的情境、趙元任《季姬擊雞記》和 AI 仿作的《詩師食獅史》。LLM 解得出來,但老師認為多半是看過相關語料。 - `## [0:39:43](https://www.youtube.com/watch?v=MnA5KUETSg4&t=2383s) Strawberry 有幾個 R` 老師講什麼:依照 LLM 切 token 的設計,它理論上不知道一個字怎麼拼。會答對,很可能是訓練資料裡本來就有人把 strawberry 一個字母一個字母拼出來。這段沒有對應投影片。 ## 3. 老師強調/會考/不考的地方(原句已驗證;寫進筆記時 ASR 錯字要改正) (無) ## 4. 這章摘要與重要度 用詞性、歧義、閱讀理解、推理等例子,說明語言對電腦為什麼難,並討論 LLM 是真的懂,還是只是看過類似的資料。(一般) ## 5. 整堂課的提醒(ASR 錯字、老師口誤、投影片缺公式等;只用跟這章有關的) - 老師 0:04:39 才開始講課,前面約 4 分半逐字稿沒有內容。 - 兩次下課:0:58:52–1:08:43、2:07:15–2:16:39。 - 2:18:33–2:19:11 逐字稿有約 40 秒空白,老師說「沒有抓到畫面」,2:20:21 又問「現在投影是對的吧」。這段錄影可能暫時沒拍到投影片(沒看影片,不確定)。 - 本週投影片是 W1_NLP_brief_v2.pdf(檔名的 W1 不等於上課週),實際講的範圍是 p.3–64;p.2 目錄老師說跳過。 - 投影片起點和已知事實不同:已知事實寫從 p.5 開始,但老師 0:07:25 說跳過 p.2 目錄,接著簡短講了 p.3(以前和現在做法差別的圖),0:09:31 講 p.4「What is NLP」。所以實際範圍是 p.3–64。 - 舊筆記(Notion 封存頁)記的時間和本逐字稿差約 1 分鐘。舊筆記寫下課 0:57:28、2:06:15,續課 1:09:37;本逐字稿是 0:58:52 下課、1:08:43 續課、2:07:15 下課、2:16:39 續課。這份計畫以本逐字稿為準。舊筆記寫的投影片檔是 W1_NLP_brief.pdf,不是 v2。 - 音檔長度 2:59:56,YouTube 是 3:00:07,差 11 秒。逐字稿時間和 YouTube 播放時間有沒有對齊,我沒有逐一驗證(不確定)。 - 2:18:33–2:19:11 逐字稿有約 40 秒空白,老師說「沒有抓到畫面」,這段錄影可能沒拍到投影片(不確定)。 - 2:24:56 老師說 BM25 的引言在「這一份投影片的最後一頁」,實際是 p.94(p.95 是 Summary),而且不在本週講的範圍。 - p.19 是 AI 仿作的《詩師食獅史》(同音字例子)。Strawberry 那段(0:39:43)沒有對應的投影片。 - 有 4 則 emphasis 標成「不考」,但老師原話是「公式不用記」(2:24:31、2:28:40)或「不會提到 GloVe」(2:58:06),不是明說「不考」。寫章節時建議用「老師說不用背/不講」,不要寫成【老師說不考】。 - 第 4 章(約 12 分鐘)和第 7 章(約 13 分鐘)比 15 分鐘短一點。因為兩章都緊貼下課分界,主題也各自獨立,所以沒有併章。 - 逐字稿常見的語音辨識錯字(引用時要改成正確寫法,也可以補進 fix_transcript 的錯字表):小平→小冰、Crystal→Chris(Manning)、STARBOARD→stop words、Wall Embedding/World Embedded→word embedding、World Reputation→word representation、構制學→構詞學、磁→詞、One-Half/One Heart→one-hot、Palsymy→Polysemy、RuCode→recall、O2Bect→word2vec、Bangio→Bengio、imprtindex/Import index→inverted index、Portal→Porter、REG→RAG、Patch rank→PageRank、Uptractive→Abstractive、Passing Tree→parsing tree、WSA→WSD、Tornazion→Tokenization、三國字→三國志、宇步→呂布、Facial Splash→feature space。1:37:48 的「Lesson」可能是 lexical processing(不確定);0:34:4x 的「VirusDM」推測是某種機率模型,可能是 HMM(不確定),所以 NER 那段我只寫 CRF。 ## 6. 投影片文字(這章範圍) **這幾頁的公式或內容只在圖裡(文字檔抓不到),寫 Exam-ready 與公式前先用 Read 看這幾張圖:** - W1_NLP_brief p.9 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p009.png - W1_NLP_brief p.10 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p010.png - W1_NLP_brief p.13 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p013.png - W1_NLP_brief p.14 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p014.png - W1_NLP_brief p.16 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p016.png - W1_NLP_brief p.17 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p017.png - W1_NLP_brief p.19 → C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\brief_W1_NLP_brief_p019.png --- W1_NLP_brief p.8 --- How? Splitting text into sentences. Find the part-of-speech for words inside a sentence. Determine different types of subclauses. Determine the subject and the direct object of a sentence. Easy for human, hard for computer 8 https://aclanthology.org/W09-3410.pdf, ACL-IJCNLP, 2009. --- W1_NLP_brief p.9 --- Word sense ambiguity 9 Watch for kids ? [IMAGE-ONLY] --- W1_NLP_brief p.10 --- Context Ambiguity 10 [IMAGE-ONLY] --- W1_NLP_brief p.11 --- How teach computer to understand this? Q:曾有一項調查發現,很多員工生病的時候不敢請假,因為他們擔心老闆 會不高興,覺得他們沒有責任感。有人認為,員工會這麼想是公司的責任。 一個好的公司應該能照顧員工,而不是讓他們拿健康去換錢。因此,讓員工 有幸福感,應該是未來企業努力的方向。 這篇文章說了什麼內容? 1. 老闆應該給員工多一點兒假 2. 常關心別人的人更有責任感 3. 對公司有意見要勇敢說出來 4. 照顧身體比認真工作更重要 11 科技大擂台, 2017 --- W1_NLP_brief p.12 --- English is difficult I saw a man on a hill with a telescope.  There’s a man on a hill, and I’m watching him with my telescope. (山上有一個人,我正用望遠鏡觀察他。) There’s a man on a hill, who I’m seeing, and he has a telescope. (我看到山上有一個人,他有一架望遠鏡。) There’s a man, and he’s on a hill that also has a telescope on it. (有一個男人,他在一座山上,山上也有一架望遠鏡。) I’m on a hill, and I saw a man using a telescope. (我在一座山上,看到一個男人正在使用望遠鏡。) There’s a man on a hill, and I’m sawing him with a telescope. (山上有一個男人,我用望遠鏡觀察他。) 12 (ROOT (S (NP (PRP I)) (VP (VBD saw) (NP (DT a) (NN man)) (PP (IN on) (NP (DT a) (NN hill))) (PP (IN with) (NP (DT a) (NN telescope)))) (. .))) 我用望遠鏡在山上看到一個男人 --- W1_NLP_brief p.13 --- syntactic ambiguity 13 [IMAGE-ONLY] --- W1_NLP_brief p.14 --- 14 [IMAGE-ONLY] --- W1_NLP_brief p.15 --- Is reasoning difficult for LLM? 大舅去二舅家找三舅說四舅被五舅騙去六舅家偷七舅放在八舅櫃子裡九舅借十舅發給十一 舅的1000元薪水。 ◦問:1.究竟誰是小偷? 2.錢本來是誰的? 15 1 2 3 --- W1_NLP_brief p.16 --- Is reasoning difficult for LLM? 16 4 5 [IMAGE-ONLY] --- W1_NLP_brief p.17 --- 情境理解 冬天:能穿多少穿多少;夏天:能穿多少穿多少。 17 [IMAGE-ONLY] --- W1_NLP_brief p.18 --- 《季姬擊雞記》 18 幾乎所有字都是聲母「j」、韻母「i」的音(拼音如 ji, ji, ji...) 字義不同,但發音非常類似,靠上下文推敲邏輯 季姬寂,雞棲笈。笈既棄,姬擊雞。雞既棄,姬寂,既擊既棄。 趙元任, Yuen Ren Chao --- W1_NLP_brief p.19 --- more 19 [IMAGE-ONLY] ## 7. 逐字稿(0:21:17 前後各多 1 分鐘,原始行) [00:20:17] 但是你現在可以想像大語言模型進來之後 [00:20:20] 其實 [00:20:21] 他就是把中間的這些整個做掉了 [00:20:24] 包含其中的理解的部分 [00:20:28] 包含深層的部分他就一次做掉 [00:20:31] 當然這中間為什麼這麼厲害 [00:20:34] 這個我們以後看一看 [00:20:36] 你可能 [00:20:38] 還是不會知道為什麼這麼厲害 [00:20:40] 因為其實不太容易瞭解 [00:20:42] 但是你可以想像 [00:20:44] 如果我現在叫LM [00:20:46] 做這些事情 [00:20:48] 其實我自己人工要做這麼多的事情 [00:20:51] 但這麼多事情當然不見得是 [00:20:54] 最佳解 [00:20:55] 但是是我們人類理解的應該是要這樣做 [00:20:59] 但是大語言模型為什麼靠著 [00:21:02] 幾十個b連的參數 [00:21:04] 他就有辦法把這件事情 [00:21:06] 一次做到為 [00:21:07] 中間的過程是什麼 [00:21:09] 你可以好好思考說 [00:21:11] 這個 [00:21:12] 原來他只是運氣好還是 [00:21:14] 真的有他的道理 [00:21:17] 好 [00:21:18] 那這件事情當然你會覺得說好像 [00:21:20] 詞性就詞性嘛反正都有一些工具 [00:21:23] 好像也不會太難 [00:21:24] 那我們就來解析一下每個步驟他其實可能會遇到一些困難 [00:21:29] 那 [00:21:29] 當然說這個 [00:21:31] 我把 [00:21:31] 這個 [00:21:32] 這個文章切成句子 [00:21:34] 然後找到一些 [00:21:35] POS tagging的工具去切 [00:21:38] 然後可以切到一些子句啊然後去算一些 [00:21:42] 就是該有的關鍵字 [00:21:44] 這些工具套一套好像人去看一看 [00:21:47] 非常容易但是其實電腦來做這件事情 [00:21:51] 挺複雜的 [00:21:52] 挺複雜因為你會發現 [00:21:54] 我這邊列一個詞性表 [00:21:57] 這詞性表 [00:22:00] 就是說 [00:22:00] 以我們學英語來講 [00:22:02] 我們知道所謂動詞 [00:22:04] 主詞 [00:22:05] 名詞 [00:22:05] 受詞 [00:22:06] 這些東西看起來 [00:22:08] 想想大概不會超過10種 [00:22:11] 但是真的 [00:22:12] 你要去細分 [00:22:14] 他所代表的意義 [00:22:15] 或者是說他能夠影響 [00:22:17] 其他字的範圍 [00:22:19] 非常多這個詞性非常多 [00:22:21] 所以 [00:22:22] 如果你以前用過所謂的CKIP [00:22:25] 或是 [00:22:26] 或是結巴這種斷字或是算Pos tagging的工具的時候你會發現他怎麼出來一堆 [00:22:32] 這到底是 [00:22:33] 不是動詞就動詞 [00:22:35] 為什麼還有這麼多種 [00:22:36] 不一這樣子 [00:22:38] OK好 [00:22:39] 那個當然是說我們可以做得更細 [00:22:41] 那效果就會更好 [00:22:43] 以前的 [00:22:43] 以前的做法會是這樣 [00:22:45] 所以 [00:22:46] 你就知道以前我們從語言學角度來切入的時候 [00:22:50] 我們都要care這些東西 [00:22:55] 那 [00:22:55] 其實就算找到詞性的時候其實有很多的問題 [00:23:00] 一直是 [00:23:01] 困擾的 [00:23:01] 做NLP的人 [00:23:03] 那我這邊就舉幾個例子 [00:23:04] 第一個是這個 [00:23:06] 這個 [00:23:07] 磁 [00:23:07] 這叫詞性起義 [00:23:09] 就是 [00:23:10] 這個 [00:23:11] 有不同的 [00:23:12] 解釋的方式 [00:23:14] 就是WSA這樣的一個問題 [00:23:16] 那我常舉這個例子 [00:23:18] WATCH FOR KIDS [00:23:19] 這三個字是 [00:23:20] 你把WATCH當然是名詞 [00:23:23] 還是動詞 [00:23:24] 其他的解釋是不太一樣的 [00:23:26] 這是一個名詞的解釋 [00:23:28] 這是一個動詞的解釋 [00:23:30] 那你說那我是不是要看前後文 [00:23:33] 這三個字如果在文章的前後文 [00:23:36] 我才能知道說這個原來WATCH FOR KIDS這三個字其實在講什麼 [00:23:42] 沒錯 [00:23:43] 做 [00:23:44] 語言處理其實你重點就是要看 [00:23:47] 所有的東西 [00:23:48] 你看到前後文 [00:23:49] 所以為什麼 [00:23:50] 大語言模型的context window這麼重要 [00:23:54] 那現在的這些LM尤其是雲端上的LM [00:23:57] 它的context window其實都相當的大 [00:24:01] 相當大就是 [00:24:02] 足夠把你一篇paper丟進去或是把你一篇報告丟進去都有辦法 [00:24:07] 所以它可以看的全部的東西 [00:24:09] 它可以全部東西一起算一些attention [00:24:10] 所以它比較能 [00:24:13] 比較不會出錯 [00:24:14] 但是大語言模型其實在做 [00:24:16] context很大的時候其實它有 [00:24:19] 其他的缺陷 [00:24:20] 以後我們有機會再講 [00:24:23] 那 [00:24:24] 這個三個字如果你現在問 [00:24:26] AI其實他 [00:24:27] 他不知道在幹什麼他其實已經不太懂我的問題 [00:24:30] 不過這個其實他就是我問得不夠好 [00:24:33] 所以如果我用 [00:24:35] 你要用這個角度詞性奇異的角度來解釋這三個字的時候他就知道了 [00:24:40] 就像一個 [00:24:41] 學生 [00:24:43] 知道說老師在講這個考古題我知道 [00:24:46] 他其實應該有讀過相關的文獻 [00:24:50] 就是知道說這個你要從磁力奇異的角度來看這件事情 [00:24:55] 所以他就分析的非常透徹這樣子 [00:24:58] 好 [00:24:59] 那當然 [00:25:01] 這個例子我覺得他是應該有看過相關的解釋文獻 [00:25:07] 並不是他真正 [00:25:09] 去 [00:25:10] reasoning出來自己去trump soul去推出來的 [00:25:14] 不過他其實是有機會可以做這件事情 [00:25:17] 就是在他沒有看過 [00:25:19] 相關解釋的情況底下他是有辦法做這件事情 [00:25:24] 所以這是AI可以做的事 [00:25:27] 那 [00:25:27] 這個 [00:25:29] 前後文的模糊度其實也會造成 [00:25:32] 你的問題的理解 [00:25:34] 我通常會舉這個例子不過這例子其實有點久了 [00:25:38] 一般我們以前在做聊天機前面的 [00:25:40] 文獻的時候 [00:25:43] 其實 [00:25:44] 以前都是規則式的方式 [00:25:46] 就是Lure Bass [00:25:48] 就是這個問什麼我就去FAQ找 [00:25:51] 然後找到相對應的答案再回答這樣子 [00:25:55] 那像這個是在Siri上的一個例子 [00:25:57] 就是這個 [00:25:58] 我並沒有問他任何天氣的事情 [00:26:01] 但是他知道傘 [00:26:03] 傘其實是跟下雨有關下雨就跟天氣有關 [00:26:07] 那你在手機上問要不要帶傘 [00:26:09] 其實就是一個天氣 [00:26:10] 的一個查詢 [00:26:11] 所以他就把這個歸類在這樣的情境底下 [00:26:14] 他就找到對應的資訊 [00:26:16] OK [00:26:17] 所以 [00:26:18] 這件事情你的你以前如果在大語言模型還沒出來之前 [00:26:23] 你能夠做到這個地步 [00:26:25] 就非常厲害 [00:26:26] 就是你能夠瞭解使用者的意圖 [00:26:29] 你能知道他想要幹什麼 [00:26:32] 所以這個 [00:26:33] 這個 [00:26:35] 必須要知道 [00:26:36] 在什麼地方什麼應用做什麼事情 [00:26:39] 他所要表達是什麼 [00:26:41] 所以這個會差很多 [00:26:43] 當然你在手機上問這個大概不外乎就是天氣 [00:26:47] 或是說他 [00:26:48] 他大概也只有天氣可以查 [00:26:51] OK [00:26:52] 但是呢其實你可以發現他其實是也是規則只是他的規則是比較聰明一點 [00:26:58] 所以 [00:26:59] 比如說我就亂問 [00:27:00] 就是 [00:27:01] 明天學生的口是有點擔心我沒有問他任何情形我也沒告訴他我現在要幹嘛 [00:27:06] 但是呢 [00:27:07] 他其實是看到明天 [00:27:08] 他覺得這是一個 [00:27:09] 時間 [00:27:10] 所以他就去我的行事曆裡面去找 [00:27:13] 跟時間有關的任務 [00:27:14] 應該要做什麼事情 [00:27:16] 所以他其實也是相當複雜他也是說我要找到情境 [00:27:21] 然後跟時間有關情境的應該對應到什麼樣的 [00:27:24] 的Tour use [00:27:25] 做這件事情 [00:27:27] 所以他會說你的schedule裡面 [00:27:29] 沒有這件事情 [00:27:31] 他甚至不太管後面是什麼 [00:27:33] 所以這個是 [00:27:35] 當然 [00:27:36] 我舉這個例子對思域是不太公平因為這例子很久了 [00:27:39] 這個搞不好是五年前 [00:27:41] 舉的例子 [00:27:42] 不過 [00:27:43] 以前設計的應用的精神就是這樣 [00:27:46] 就是 [00:27:47] 幾乎是一個字典比對 [00:27:49] 他聰明一點有稍微在情境的這種 [00:27:52] 融入這樣子 [00:27:54] 但是還是 [00:27:56] 這個掛一漏腕 [00:27:57] 就是你把一條規則做好 [00:28:00] 隨便問就掛掉 [00:28:02] 所以在大語言模型還沒出來之前的所有這種線上的 [00:28:08] AI curve [00:28:09] 或是聊天 [00:28:09] 機器人通常 [00:28:10] 大家都不太愛用 [00:28:12] 因為 [00:28:12] 因為就問個兩三句就 [00:28:15] 就不 [00:28:16] 就覺得他沒有什麼用這樣子 [00:28:19] OK [00:28:23] 那這個應該我有舉過這個例子 [00:28:25] 就是說閱讀理解 [00:28:26] 那閱讀理解其實 [00:28:29] 等我們 [00:28:32] 第一個第二個作業做完之後也許你們可以回過頭來自己 [00:28:35] 做這件事情 [00:28:36] 就是我們來做做閱讀理解這件事你把這個東西轉成 [00:28:41] 項鍊 [00:28:42] 四個選項轉成項鍊然後跟原來這個文章的項鍊去算算相似度 [00:28:47] 說用你你不要用大語言模型你用這種比較 [00:28:51] embedding的方式直接去算這種 [00:28:54] 語意相似度看你能不能找到正確答案 [00:28:58] 那重點你要能夠解釋的話這個 [00:29:01] 這個就要做生成的部分那又是不一樣的 [00:29:04] 所以這件事情其實是 [00:29:06] 以 [00:29:07] 你把大語言模型的角色拿掉之後 [00:29:10] 你會發現你根本做不出來這件事情 [00:29:14] 好 [00:29:15] 那 [00:29:17] 大家可能覺得說那詞性剛才列出來的詞性很多都好像是很複雜而且是中文比較會 [00:29:23] 遇到問題 [00:29:25] 但是英文其實 [00:29:27] 也是很難做 [00:29:28] 那 [00:29:29] 像這一句話 [00:29:30] 這句話是個英文非常簡 [00:29:33] 簡潔但是省略掉很多一些 [00:29:37] 這個let [00:29:39] 或是什麼東西的 [00:29:40] 這些詞 [00:29:42] 所以 [00:29:43] 很難去 [00:29:44] 知道他原來到底想表達什麼 [00:29:47] 所以 [00:29:48] 以前英文老師都告訴我們啊這個學生你們開始學英語的時候了不要一開始就把英文寫得非常簡單 [00:29:55] 因為別人會看不懂在說什麼 [00:29:57] 所以盡量複雜 [00:29:59] 所謂盡量複雜你就發現底下這些句子都 [00:30:01] 變得比較長 [00:30:03] 但是比較知道他在說什麼 [00:30:06] 而且非常精確這樣子 [00:30:08] 那為什麼會有這麼多句子呢 [00:30:10] 其實 [00:30:10] 我就把它丟到 [00:30:12] Google的翻譯 [00:30:14] 翻成中文 [00:30:16] 然後再用中文再把它翻回英文 [00:30:18] 它就會產生不同的 [00:30:20] 翻譯 [00:30:20] 或是說 [00:30:21] 我把這句英文翻成 [00:30:23] 比如說 [00:30:24] 什麼烏克蘭語 [00:30:26] 再把烏克蘭語翻回英文 [00:30:28] 它就會產生多樣性的翻譯 [00:30:31] 這個動作 [00:30:32] 這個動作 [00:30:34] 這個以前在做NLP的人非常常用 [00:30:37] 因為 [00:30:37] 用這種方式我就可以產生 [00:30:39] 如果這個翻譯是 [00:30:40] 功能是好的 [00:30:42] 我就可以產生同樣的 [00:30:44] 意義但是說法不同的句子 [00:30:47] 對做NLP來講這個就是一個 [00:30:49] 多樣性的語調 [00:30:51] 不過這樣的做法你會發現 [00:30:55] 我把它 [00:30:56] 翻成中文 [00:30:57] 就發現好像意思都不太一樣 [00:31:00] 那你說當然就是要看這個 [00:31:03] 這個Telescope到底是 [00:31:05] 形容 [00:31:07] 前面的I還是形容這個man [00:31:09] 這個不同的形容 [00:31:10] 形容的方式呢 [00:31:11] 它其實就是代表不同的東西 [00:31:13] 所以就是去算它的詞性 [00:31:16] 做這個Dependence Tree出來 [00:31:18] 這就是那個 [00:31:20] 那個詞性的Tree [00:31:22] 做出來之後我就知道它形容誰的這樣子 [00:31:25] 然後就覺得這個應該很容易 [00:31:28] 但是你要想像 [00:31:29] 做這個Tree呢就跟你要去理解這個句子的意思 [00:31:34] 其實是同樣的道理 [00:31:36] 它一樣不知道你在講什麼 [00:31:39] 所以它只能跟 [00:31:40] 根據它的語料它的 [00:31:42] 計算的方式 [00:31:43] 統計的Base或者是一些語言學的Base [00:31:46] 做出這個Tree [00:31:48] 所以這個Tree呢 [00:31:49] 不唯一啊 [00:31:51] 不唯一 [00:31:52] 就是它換一個統計的基底之後 [00:31:55] 做出來的Tree就不一樣 [00:31:58] 所以會有不同的表示啊 [00:32:00] 就是這個 [00:32:03] 長出來的Tree [00:32:04] 長得不一樣 [00:32:05] 它其實就不一樣 [00:32:07] 這是AI幫我畫其實 [00:32:08] 這個人應該站在山上 [00:32:10] 但是我 [00:32:10] 不知道這一張就把它放在下面的這樣子 [00:32:14] 就是山上那個人拿著望遠鏡還是我在看他拿著望遠鏡 [00:32:17] 是不一樣 [00:32:18] 這個這兩個 [00:32:20] 字有點小 [00:32:21] 這兩個所形成的這個 [00:32:23] Passing Tree [00:32:25] 或者是磁跟磁之間的Dependency就不一樣 [00:32:30] 那你說 [00:32:30] 那是不是這個Passing的工具不好 [00:32:34] 也不是 [00:32:35] 因為你的句子就是長這個樣子 [00:32:38] 不管什麼Pass [00:32:39] 這幾種說法 [00:32:40] 都不能說錯 [00:32:43] OK [00:32:45] 那你可以想像我們一般讀到文章或是 [00:32:49] 一般的對話來講 [00:32:50] 其實就都充斥著這種 [00:32:53] 模糊啊 [00:32:54] 這個你到底想表達什麼 [00:32:56] 但是 [00:32:57] 你跟人對話你不會跟他說 [00:32:59] 那你這個 [00:33:00] 你這個字是形容什麼 [00:33:01] 你可不可以再講一下 [00:33:02] 不太會這樣 [00:33:04] 我們就會根據更多的前後文去理解這件事情 [00:33:08] 但是也許有些理解會是錯誤的 [00:33:10] 好 [00:33:13] 那這個就是前面那個例子我把它拉到後面 [00:33:15] 就是其實有一些是 [00:33:17] Tagging的問題 [00:33:19] NER的Tagging就是除了詞性之外 [00:33:21] 你還要知道這是一個財經新聞 [00:33:24] 所以我要知道這個Media Tag [00:33:26] 是一個公式名稱是一個組織名稱 [00:33:29] 然後日期名稱相當重要 [00:33:31] 然後裡面一些相關的數字 [00:33:34] 就是說 [00:33:34] 整篇文章我可以 [00:33:36] 只看這三個東西我就知道他想要表達的概念 [00:33:40] 跟他所要論述或是說我要把它做分類分群 [00:33:44] 我就知道應該放在哪裡 [00:33:46] 但是 [00:33:47] 我不用看其他字 [00:33:49] 我不用看其他字因為其他字可能就在描述細節或是一些 [00:33:54] Redundant的東西 [00:33:56] 那我除了Tag這些之外說老師這很簡單啊我只要設計規則這個 [00:34:02] 這個跟Compiler一樣把這些路寫出來之後我就知道了 [00:34:06] 但是你怎麼知道 [00:34:07] 這些公司名稱是什麼 [00:34:09] 你如果有去判斷 [00:34:10] 這些東西 [00:34:12] 那他的邦德率也是一個 [00:34:14] 問題 [00:34:15] 這以前 [00:34:17] 這個老師的實驗室有 [00:34:19] 兩位博士生都靠著做這樣的題目然後博士學位 [00:34:23] 所以你就知道以前 [00:34:25] 我們 [00:34:26] 人類的 [00:34:27] 有點以現在角度來看真的是 [00:34:30] 井底之蛙這樣 [00:34:32] 在這樣的問題裡面搞那麼久 [00:34:34] 不過在那個年代這的確是一個很難的問題 [00:34:38] 以前 [00:34:39] 我們就只有 [00:34:40] 這種 [00:34:41] VirusDM啊 [00:34:43] 或是這種機率模型的CRF的方式來做這件事情 [00:34:47] 但這個通常都需要一點supervised training data [00:34:51] 才能做得好 [00:34:54] 好那 [00:34:55] 另外這些還有所謂的推理的問題 [00:34:57] 就是他看懂意識之後他到底能不能理解他到底能不能推理 [00:35:01] 這是一個 [00:35:03] 做 [00:35:04] 做這個語言 [00:35:07] 讓這個 [00:35:08] 華語文能力測驗的題目啦 [00:35:11] 那我不知道這個 [00:35:12] 這個其實 [00:35:13] 可能要找一下不過我覺得好像不可考 [00:35:16] 我覺得 [00:35:17] 考外國人 [00:35:19] 看這種中文字有點 [00:35:21] 有點那個 [00:35:22] 很故意這樣子 [00:35:23] 就這件事情其實你要怎麼去pass [00:35:26] 找到這兩個答案 [00:35:27] 那 [00:35:30] 當然你會說那我就把passing tree做出來然後好好的去看 [00:35:34] 他的子句的部分 [00:35:36] 這件事情其實LM [00:35:38] 做得很好這是LM [00:35:40] 告訴我的推理的過程 [00:35:42] 所以他會去推理但是我覺得他其實應該是有看過 [00:35:47] 考古題 [00:35:48] 所以還可以分析的這麼透徹這樣子 [00:35:52] 所以他可以做出最後的推理的過程 [00:35:55] 當然你現在你也可以自己重新設計然後你用類似 [00:35:59] 叫他推理或是說 [00:36:01] 你給他一些Chain of thought的Rule [00:36:03] 然後你就他有辦法做這件事情 [00:36:08] OK [00:36:09] 然後還有情境理解 [00:36:10] 同樣的一句話當然他必須要知道前後文在描述什麼東西 [00:36:15] 他的概念就不一樣 [00:36:16] 這件事情其實以前 [00:36:19] 我們都做不好 [00:36:20] 所以我們都只能拿來當成笑話來說這個同樣的句子其實概念不同這樣子 [00:36:27] 網路上你都可以找到這些例子 [00:36:28] 有非常多種 [00:36:30] 同樣的 [00:36:31] 同樣的敘述但是在講不同的事情 [00:36:36] 這是AI的解釋 [00:36:37] 所以他知道這個是有一點諷刺的位置 [00:36:40] 但他知道情境 [00:36:43] 他知道不同的情境 [00:36:45] 所以你可以想像在大語言模型裡面 [00:36:48] 他對冬天的理解跟夏天的理解 [00:36:51] 不是隻有兩個不同的Token [00:36:53] 他後面還跟隨著當初他透過Pretrend Data [00:36:58] 學到的 [00:36:59] 冬天 [00:37:00] 相關的詞彙 [00:37:01] 什麼東西跟冬天會一起出現的 [00:37:04] 的詞 [00:37:05] 他就把這樣的情境 [00:37:07] 濃縮在冬天這個概念裡面 [00:37:10] 所以他知道這兩個情境其實 [00:37:13] 他所代表的含義是 [00:37:15] 很大差別 [00:37:16] 所以 [00:37:16] 這個句子在不同情境下的解釋是會完全不同 [00:37:22] 當然這個這樣解釋是很合理但是當你回去 [00:37:26] 當我們講完Transform [00:37:28] 講完這個 [00:37:29] 他怎麼Pretrend之後就覺得說 [00:37:32] 難道做做褐漏字就能夠理解 [00:37:35] 冬天跟夏天的情境嗎 [00:37:37] 這個 [00:37:37] 也是蠻神奇的 [00:37:40] 那最後這個這是另外做語音的都會講這個例子 [00:37:45] 就是叫記記記記記 [00:37:48] 那 [00:37:48] 這五個字呢 [00:37:51] 其實我這樣一念你大概知道什麼意思 [00:37:53] 就是 [00:37:54] 這個 [00:37:55] 這其實是 [00:37:57] 來自於這位 [00:37:59] 語言大師 [00:38:00] 這個 [00:38:01] 當然 [00:38:02] 網路上也有人一些說法說這個不可考 [00:38:05] 好像不見得是來自於他但是 [00:38:08] 大部分人都覺得是從他的一個 [00:38:10] 一個例子來 [00:38:11] 就是 [00:38:12] 他當時就是因為有一些人希望把中文改成比較拉丁拼音的方法 [00:38:17] 因為中文實在太難學了 [00:38:20] 所以用拉丁的拼音的做法來改這個 [00:38:23] 把文字改成那個樣子 [00:38:25] 但是他就說當我們要描述一段 [00:38:28] 一段敘述 [00:38:29] 這一段敘述 [00:38:31] 如果都是這樣如果你沒有文字 [00:38:33] 你只用拼音的方式 [00:38:36] 你根本不知道 [00:38:37] 這句話在講什麼 [00:38:38] 這個當然是很 [00:38:43] 很特意的去設計這樣的句子 [00:38:45] 但是這樣的句子其實 [00:38:47] 也可以想像 [00:38:49] 當我要做語音識別 [00:38:50] 或是說甚至文言文的理解其實也非常困難 [00:38:54] 但是 [00:38:56] 大語言模型知道 [00:38:57] 這些字都有所謂的生母育母 [00:39:00] 這些東西所以他不是隻是文字本身Token的東西 [00:39:03] 他有所謂的 [00:39:05] 唸的東西他的概念也進去了 [00:39:08] 當然 [00:39:08] 他可以理解這件事情呢 [00:39:11] 並不是他真的知道這個念音 [00:39:14] 而是他有讀過相關的語料 [00:39:17] 在解釋生母育母這些東西 [00:39:20] 哪些字是生母哪些字是育母 [00:39:22] 所以他反而能夠推敲出來他並不是真正知道這個念法是這樣 [00:39:28] 以我目前的解釋 [00:39:30] 會是這個樣子 [00:39:33] 這是叫他再重做一個例子他其實做得出來他可以做這樣的推演 [00:39:38] 他可以做得出來 [00:39:40] 拿來給解釋 [00:39:42] 那 [00:39:43] 這件事情其實我剛才有一個解釋其實 [00:39:47] 通常我們都想知道說大語言模型為什麼會知道這件事情 [00:39:51] 當他回答這樣的時候 [00:39:53] 我們會覺得說他好像知道什麼叫生母什麼叫育母 [00:39:57] 其實 [00:39:58] 不盡然 [00:39:59] 不盡然 [00:40:00] 就像以前 [00:40:02] LM剛出來的時候就有人 [00:40:05] 用 [00:40:06] 問他因為 [00:40:07] 你知道大語言模型前面我還沒有問過他 [00:40:08] 會有所謂的 [00:40:09] 這個Token Relation [00:40:12] 所以我就問他說這個Strawberry [00:40:15] 就是英文這個Strawberry這個字呢 [00:40:17] 裡面有幾個R [00:40:19] 裡面有幾個字母R這樣子 [00:40:22] 那如果以大語言模型的設計概念 [00:40:26] 他理論上應該不懂的這個字裡面的每個字母的拼法 [00:40:31] 但是他可以回答出Strawberry這個字 [00:40:34] 裡面有三個R [00:40:35] 是不是Strawberry [00:40:37] 你可以自己算算看 [00:40:38] 他可以自己回去再推這樣子 [00:40:41] 那當你去理解 [00:40:43] 前面的LM [00:40:45] 或是BERT這種東西他裡面前面那一端的Token Relation的步驟之後你就覺得 [00:40:50] 他怎麼會知道裡面有幾個R [00:40:53] 那其實有很大的 [00:40:54] 原因 [00:40:55] 有很大的 [00:40:57] 可能性是來自於 [00:40:58] 有很多的資料 [00:41:00] 本來就會把 [00:41:02] Strawberry這個字 [00:41:03] 一個一個字母的寫出來 [00:41:05] 就是他在 [00:41:07] 訓練資料或是他在 [00:41:08] 在人類的文章中有看過說原來 [00:41:11] Strawberry就是第一個字母是S [00:41:13] 然後第二個字母是T這樣一路的寫下去 [00:41:17] 所以他就有這樣的東西啊所以你可以想像他其實是看過非常多的東西然後把他記錄下來 [00:41:26] 那這是另外的例子 [00:41:29] 那我們再回過頭來看一下說以前的應用就是你會覺得說那以前 [00:41:35] 這個 [00:41:36] 能力這麼弱那以前都在幹什麼 [00:41:38] 以前能夠做什麼事情 [00:41:40] 我們先來看這個Siri跟小平 [00:41:43] 以前這一塊其實是相當難做就是一個 [00:41:46] 像對話機器人一樣 [00:41:48] 這個是微軟當初做的一個 [00:41:51] 一個對話機器其實那個年代 [00:41:54] 差不多十年前 [00:41:56] 相當的紅因為 [00:41:57] 非常的人性化他可以跟你對話可以跟你 [00:42:00] 那個 [00:42:01] 這個當初是 [00:42:03] 被選為這個 [00:42:05] 這個 [00:42:06] 大學生的最佳的 [00:42:08] 讀書伴侶 [00:42:09] 因為 [00:42:10] 他會統計那個使用的頻率就是在 [00:42:13] 晚上10點到半夜2點這之間使用率非常高 [00:42:17] 就是一堆的大學生 [00:42:18] 就會跟他聊天 [00:42:20] 就聊一些 [00:42:21] 功課上啊 [00:42:23] 一些生活上啊 [00:42:24] 甚至還會跟他說這個 [00:42:25] 跟女朋友吵架啊那怎麼辦啊 [00:42:28] 小平的人設是一個女生啊他會跟他安慰幹嘛幹嘛幹嘛 ## 8. 寫作規則 (這是 `_筆記SOP.md` 第 3.1、4、5、6 節的濃縮版。兩者衝突時以 SOP 為準。) 讀者:碩士生,兩門課期末是英文考試。要只看筆記就能學會,講得比老師好懂。畫面要簡潔。 **概念優先(2026-09-26 主理人)**:主理人只想懂概念,不想補數學、不想看程式碼和座標圖。兩門課的考試也都是問答題、不考算式(AI W1 1:16:52;NLP W3 1:47:41、2:48:36)。所以: - 每段預設看得到的只有:白話摘要(2–4 句)+**一句生活比喻**(例:模擬退火像投資理財,年輕時敢冒險、越老越保守)+「考試可能怎麼問」一句。 - 數學推導、公式、手算、程式碼、座標圖,全部收進標題寫「(進階,可跳過)」的摺疊,例如「它到底怎麼運作?(進階,可跳過)」。每段最多一個進階摺疊,不要寫長篇計算。 - 演算法要能「用文字說出步驟」(考試可能要你描述),這一點放在預設看得到的地方,不用數字。 - **重心比例**:白話理論與概念模式(它在解決什麼問題、核心想法、跟別的方法差在哪、優缺點、生活比喻)占主要篇幅;數學與程式細節只用一兩句帶過,細節收進進階摺疊。 **圖文並茂(2026-09-26 主理人:不要只有文字)**: - 每章至少 2–3 個圖,放在**預設看得到**的地方,每個圖前後各用一兩句白話說明「這張圖在看什麼」。 - 流程、步驟、因果、比較 → 用 mermaid 流程圖(```mermaid,flowchart LR 或 TD;節點文字用中文、加雙引號;一張圖不超過 10 個節點)。 - 投影片上的示意圖、架構圖 → 用 [[IMG: …]] 放投影片圖。 - 仍守「每個 ## 段落最多一種視覺元素」。 ### 輸出兩個檔 1. `chNN.md`(Notion 寫法,不含頁面標題),結構固定: - 第一行:章節包第 1 節那行,原樣照抄。 - `## 重點`:三點中文,每點一到兩句。 - `## Exam-ready`:3–10 行英文,**從章節包的投影片文字逐字抄**,每行 `- **Term**: "原句"(Ch3 p.14)`。老師有明確證據才在行尾加 `【老師強調】(h:mm:ss)`。 **每一行下面一定要有一行縮排的中文解釋**(主理人英文不好,看不懂的英文等於沒用): ``` - **Hill climbing**: "It keeps track of one current state and on each iteration moves to the neighboring state with highest value."(Ch4 p.5) - 中文:爬山法只記住「現在這一個狀態」,每一輪都移到分數最高的鄰居。白話:一直往比較高的地方走一步。 ``` 中文要先把句子意思講清楚,再補一句白話;難的英文單字括號附中文(例:neighboring state(鄰近狀態))。 - 章節包第 2 節的每一段:`## [h:mm:ss](連結) 標題`(照抄),下面 2–4 句白話摘要,其餘全部收進摺疊: ```
問句(例:用生活例子講,BFS 在做什麼?) 內容
``` 摺疊種類(需要才放):用生活例子講?/它到底怎麼運作?/要先懂什麼?(老師假設你會的數學或概念,短版教學)/老師原話是什麼?(「原話」(h:mm:ss),只放重要的,最多 5 句)。 - 「它到底怎麼運作?」要用一組小數字把這段的演算法**真的跑 1–3 步**(例:算出梯度、更新一次、比較兩個 α),不是只示範定義的加減乘除。全章盡量沿用同一組數字,讓前一段的答案能在下一段被驗證。 - 每段正文要回答讀者最可能卡住的一個「為什麼」。投影片公式方向跟題目相反、或投影片說「解不出來」時,用一兩句講出原因,自己補的標(我補充)。 - 投影片句子停在公式前(公式在圖裡)時:Exam-ready 在粗體詞條上補公式、引號內保持原句;正文寫出同一條式子。公式圖看章節包第 6 節列出的 PNG。 - `## Self-check`:2–4 題英文考題,答案收摺疊。**至少一題考老師強調的內容**;不出「老師和投影片哪裡不同」這類不會考的題目。每題格式: ```
Q1. English question?(中文:中文題目) **Answer**: English answer. 中文:把答案完整講一遍(不是只翻一句),讓看不懂英文的人也知道要怎麼答。
``` - **最後一行**:章節包第 1b 節那行(下一章連結),原樣照抄。讓讀完的人直接點下一章。 - 不要把章節包或這份規則裡的指示句寫進筆記(例如「寫筆記時照投影片寫」「已改正 ASR 錯字」)。 - 長度 8,000–14,000 字元。 2. `chNN.concepts.json`:JSON 陣列,4–12 個考試可能問的術語,每個物件: `name`(英文)、`zh`、`type`(概念/演算法/公式/人物事件/前置知識/行政)、`signal`("老師說會考"/"老師強調"/"核心(我判斷)"/"")、`evidence`(有 signal 前兩種時必填:原句+時間)、`definition_en`(投影片原句;沒有就註明 (textbook)/(lecture)/(my wording))、`plain`(一句中文)、`a4`(≤150 字元英文,可夾極短中文;期末拼貼用的小方塊)、`time`、`slides`、`prereq`(英文名陣列)。 ### 風格鐵律 - 不用 emoji 或裝飾符號(✓✗★⚠ 都不要;→ 可以)。不用 callout。不用 `$`。時間不要用 code 樣式。 - 每個 `##` 段落最多一種視覺元素:一張圖、或一個表格、或一個 mermaid。 - 摺疊標題是問句,前面不加符號。 - 圖片最多 3 張,只放文字取代不了的圖。放法:單獨一行 `[[IMG: | 中文圖說]]`,PNG 用 `slides_to_png.py <圖片資料夾> <頁> --dpi=110` 產生。 - 考試訊號只在老師明確說時標。老師只說「不用背」「不講」就寫「注意:……」。 - 老師口誤或跟投影片不同:照投影片寫,加「注意:老師口頭說的是……」。 - 引用老師的話時,ASR 錯字改成正確的字。 ### 沒有投影片時 不要憑記憶逐字重現課本段落或數值表。英文定義用自己的話寫、句尾標 (my wording);Exam-ready 每行標「(自擬,投影片待補)」。例子只用老師講的。 ### 寫完之後(只做一次) 跑檢查: `C:\Users\user\.cache\meeting-record\venv\Scripts\python.exe C:\Users\user\.claude\scripts\check_note.py --transcript <逐字稿> --slides <投影片 txt …> --start <起> --end <訖> --vid <影片 ID>` - STYLE/VISUAL/TIME/FORMAT:全部改掉。 - QUOTE:確認是不是你改正了 ASR 錯字(是就保留),不是就改成原文或拿掉引號。 - ENGLISH:確認是不是投影片斷行造成的(是就保留),不是就改成投影片原句。 **省額度守則**:章節包裡已經有你需要的全部資料。不要再去讀整份逐字稿、整份投影片、segments.json 或手冊。一次寫好整個檔(Write 一次),檢查後集中修改。