# 章節包:自然語言處理(NLP)W3(9/24)第 05 章「作業一說明」
影片 1:46:39–2:02:06,YouTube ID g0QE6O17BWE。Notion 章節頁 https://app.notion.com/p/3e6fc631b03081e59d87d1d5fa01e936(頁 ID 3e6fc631b03081e59d87d1d5fa01e936),頁面標題「05 作業一說明(1:46–2:02)」。
## 1. 第一行(直接照抄,不要改)
[自然語言處理](https://app.notion.com/p/3e6fc631b03081b4a9e8f91f3411f61f) › [W3(9/24)](https://app.notion.com/p/3e6fc631b03081ff9776f36fab3e6e50) › 05|影片 [1:46:39–2:02:06](https://www.youtube.com/watch?v=g0QE6O17BWE&t=6399s)|投影片 作業一說明 NLP_HW1_word_emb.pdf(不在投影片文字檔內)|上一章 [04 GloVe、FastText 與向量檢索(1:28–1:46)](https://app.notion.com/p/3e6fc631b03081c5b27ce6cbad0d3d3a)|下一章 [06 N-gram 語言模型(2:12–2:33)](https://app.notion.com/p/3e6fc631b03081588140d7f6a95e5bb4)
## 1b. 最後一行(直接照抄,放在 Self-check 後面,當全頁最後一行)
讀完了嗎?下一章:[06 N-gram 語言模型(2:12–2:33)](https://app.notion.com/p/3e6fc631b03081588140d7f6a95e5bb4)|回到週頁:[W3(9/24)](https://app.notion.com/p/3e6fc631b03081ff9776f36fab3e6e50)
## 2. 各段標題(照順序;每段一個 ## 標題,直接照抄連結)
- `## [1:46:39](https://www.youtube.com/watch?v=g0QE6O17BWE&t=6399s) 作業變難,今年有閉書考試` 老師講什麼:主題跟去年一樣,但因為修課人數變多,要求也變多。今年有實體閉書考試,不考 BM25 公式這種題目,而是考你從作業和上課抓到的 insight。
- `## [1:48:10](https://www.youtube.com/watch?v=g0QE6O17BWE&t=6490s) 作業在做什麼:類比資料集` 老師講什麼:用 Google 的 word analogy 資料集,分成語意(king/queen)和語法(形容詞、副詞)兩大類,底下還有子類別。題目給 A、B、C,要你猜出 D。
- `## [1:49:50](https://www.youtube.com/watch?v=g0QE6O17BWE&t=6590s) 程式模板、Colab、助教影片` 老師講什麼:雖然把投影片丟給 GPT 也寫得出來,還是給了模板當規範。程式碼放在 GitHub,在 Colab 上跑,細節另有助教錄的說明影片。
- `## [1:51:30](https://www.youtube.com/watch?v=g0QE6O17BWE&t=6690s) 評分:程式 TODO 加報告` 老師講什麼:作業分程式和報告兩塊,每個 TODO 都有配分。評分像考作文,不要計較一兩分;被扣分,就是有人做得比你好。
- `## [1:52:32](https://www.youtube.com/watch?v=g0QE6O17BWE&t=6752s) TODO 內容:現成向量與 wiki 自己訓練` 老師講什麼:前面幾個 TODO 用已經訓練好的向量做預測、畫 t-SNE(也可以再比較其他降維方法);後面四個用 wiki dump 自己訓練,工具是 Gensim。只抽 20% 的資料,不要整份載入再抽;Colab 記憶體不夠,多半是程式寫法的問題。
- `## [1:56:53](https://www.youtube.com/watch?v=g0QE6O17BWE&t=7013s) 報告 45%:可以用 AI,但要附實驗` 老師講什麼:報告題目列得很細,是為了給方向。可以用 AI,但要自己消化。今年額外實驗要附 notebook 連結,證明真的做過。可以做得很深(老師用天才兒童漫畫比喻),但一定要照格式,因為有一部分會用 AI 初審。
- `## [2:00:00](https://www.youtube.com/watch?v=g0QE6O17BWE&t=7200s) 格式、抄襲與期限` 老師講什麼:一定要照格式要求。可以一起討論,但要分開寫;兩份一樣的話,雙方都 0 分。今天公布、三週後交,拖到最後一週才寫會很趕。
## 3. 老師強調/會考/不考的地方(原句已驗證;寫進筆記時 ASR 錯字要改正)
- (1:47:30) [強調] 「我們這門課的作業難度會稍微比以前稍微再多加一點東西」 → 老師特別強調:作業一的要求比往年多
- (1:47:41) [會考] 「然後重點是我們今年的課會有一個實體的closed-book考試」 → 今年有實體閉書考試
- (1:47:47) [不考] 「那那個考試其實當然不會不會考作比如說叫你寫出BM25的公式,不會這麼低級的題目這樣子」 → 不考 BM25 公式這類背算式的題目
- (1:47:57) [會考] 「但是至少會我覺得可以考出你做這些作業或者是說你在聽這些內容你到底有catch到什麼樣的insight,我覺得那個是要能夠寫出來的這樣子」 → 考你從作業和上課抓到的 insight,而且要寫得出來
- (2:01:17) [強調] 「我們是兩份一樣全都是0分這樣子」 → 抄襲規定:兩份一樣,被抄的人也是 0 分
## 4. 這章摘要與重要度
公布作業一 Word Analogy:用現成的詞向量和自己拿 wiki 訓練的詞向量做類比題,再寫報告,三週後交;也首次說明今年有實體閉書考試。(行政)
## 5. 整堂課的提醒(ASR 錯字、老師口誤、投影片缺公式等;只用跟這章有關的)
- 0:00:00 那句「有任何疑問或感想,歡迎留言…點讚、訂閱、分享」是語音辨識幻覺,不是老師講的;0:01:21–0:02:30 是設定畫面,0:02:31 才開始上課。
- 0:42:31–0:43:48 疑似麥克風干擾(老師先問「有帶電池嗎」,接著說「為什麼幹擾」),逐字稿變成重複的「這個是電」加亂碼,約 1 分多鐘的內容遺失,大約是 brief p.74 的前半段。
- 作業一說明(1:46:39–2:02:06)用的是 NLP_HW1_word_emb.pdf,不在兩份投影片文字檔裡。本機有原檔(自然語言處理\NTHU_Natural_Language_Processing\2026\Assignments\Assignment1\),也有整理好的 自然語言處理\HW1\HW1_Word_Analogy_規定.md。
- W2 投影片這堂實際講到 p.17(困惑度),不只「開頭幾頁」;W2 p.4 跟 brief p.66(Markov/Shannon)是同一張,老師 2:16:45 自己說兩份投影片有重疊。
- YouTube 影片標題寫「Fall 2025」,實際是 2026-09-24 這堂(以網址為準)。
- brief p.68、p.69、p.89 是純圖頁(只有標題或 [IMAGE-ONLY]),0:26:48–0:36:38 那幾張類比圖各在 p.68 還是 p.69,從文字檔確認不了,寫章節時要轉成 PNG 看圖。
- 0:42:31–0:43:48 逐字稿是亂碼(重複「這個是電」加日文、俄文字元),約 1 分多鐘內容遺失,大概是老師在講 p.74「有出現不見得是相關」的前半;需要的話回去看影片。
- 作業一說明 PDF(NLP_HW1_word_emb.pdf)沒有 _text 文字版,第 5 章的 slides 欄無法標頁碼;需要的話先跑 slides_to_text.py。
- SOP 第 1 節寫 NLP-W3 用 W2 投影片的「開頭幾頁」,實際講到 W2 p.17(困惑度),建議改成 W2 p.1–17。
- 老師兩次說詞向量預設「700 多維」(1:04:34、1:22:11),可能跟 BERT 的 768 維混在一起;就我所知,Gensim word2vec 預設 vector_size 是 100,Google News 預訓練向量是 300 維。寫筆記前要再查證。
- 1:28:38 老師先說 GloVe 是 2013 年、又改口說 2014;投影片 p.91 寫 2014,考試照投影片寫。1:32:25 老師說「一般認為 GloVe 比 word2vec 好」,但投影片 p.93 寫「It depends」,Exam-ready 照投影片寫。
- 逐字稿裡 property/priority/publicity 大多是 probability(例:2:34:56「一串字的priority」),但 0:23:03「在算publicity的時候」比較像 perplexity,要看上下文,不能一律取代。
- 新發現的語音辨識錯字(建議加進 fix_transcript.py):WATTO VECTOR/what-to-vector/Wall-to-back/VoltoVector/waterbath/photo vector=word2vec;GrowVac/grow back=GloVe;Fosting=WordSim;Categor Label=character level;angry/engram=n-gram;CBUS=syllabus;基礎學習跟深入學習=機器學習跟深度學習;GPT ISO=GPTZero;turn in=Turnitin;Tica=TAICA;biblicoding=vibe coding;Contactual=contextual;Cross Entry=cross entropy;Wall-Embedded=word embedding;ntu庫=NTU COOL;Chanon=Shannon;Markup=Markov;annual p=NLP;Geno=genome;多利養=Dolly 羊;絞交=繳交;超習=抄襲;1:06:15「到Fur以後」可能是 BERT(不確定)。
## 6. 投影片文字(這章範圍)
(這章沒有對應的投影片文字;如果規劃裡寫了頁碼但這裡是空的,代表那幾頁只有圖,需要時用 slides_to_png.py 轉圖看。)
## 7. 逐字稿(1:46:39 前後各多 1 分鐘,原始行)
[01:45:39] 這個一年前這麼的critical
[01:45:41] 就是說這些一定要用RAG來做這樣子
[01:45:44] 你要做RAG
[01:45:46] 一定要用IR
[01:45:47] 你這邊就逃不掉
[01:45:48] 就是比對
[01:45:49] 就是比對你
[01:45:50] 你的語料的東西
[01:45:51] 因為你沒辦法叫模型重新學這些東西
[01:45:54] 重新看這些東西
[01:45:58] 好
[01:45:59] 這是這個introduction的summary
[01:46:01] 就是我們大概勾數一下
[01:46:03] 很快的勾數一下這個
[01:46:05] 這個傳統NLP的SLP這樣子
[01:46:07] 但其實很多細節我們都沒有講這樣子
[01:46:09] 那
[01:46:10] 但是只留下一個
[01:46:12] 很
[01:46:12] 後面會用到的東西
[01:46:14] 我們要怎麼去學字的表示
[01:46:16] 怎麼樣學這個
[01:46:17] 這個讓電腦瞭解這個字的意識
[01:46:20] 用這樣的Valve vector去看
[01:46:21] 帶這樣的概念
[01:46:22] 那我們的
[01:46:24] W2的投影片就會從這個概念繼續接起來這樣子
[01:46:29] 那這也是
[01:46:30] 在做NLP的那個年代大家想
[01:46:32] 知道的
[01:46:33] 東西這樣子
[01:46:36] 好
[01:46:37] 這個
[01:46:37] 第一個部分到這邊
[01:46:39] 那我先秀一下
[01:46:41] 我們的第一個assignment
[01:46:43] 其實
[01:46:44] 已經放上去
[01:46:46] 我不知道
[01:46:49] 我又找不到
[01:46:55] PDF
[01:47:03] OK
[01:47:04] 這樣看得到
[01:47:06] 好
[01:47:06] 其實我們的作業
[01:47:08] 沒有變
[01:47:09] 主題還是一樣這樣子
[01:47:10] 他只是說我們有稍微要求
[01:47:12] 一點東西
[01:47:13] 跟去年不一樣這樣子
[01:47:16] 那
[01:47:17] 對這個可能要再強調一下因為
[01:47:21] 我不知道是Tica辦公室看到我們這門課好像現在人數比以前多
[01:47:26] 我就覺得
[01:47:27] 高老師你應該要嚴格把關一下這樣子
[01:47:30] 對我們
[01:47:32] 這門課的作業難度會稍微比以前稍微再多加一點東西
[01:47:36] 就是讓大家不要
[01:47:38] 好像一句話就把作業做完了這樣子
[01:47:41] 然後重點是我們
[01:47:43] 今年的課會有一個實體的closed-book考試
[01:47:47] 那那個考試其實
[01:47:49] 當然不會
[01:47:51] 不會考作比如說叫你寫出BM25的公式
[01:47:55] 不會這麼低級的題目這樣子
[01:47:57] 但是
[01:47:58] 至少會
[01:47:59] 我覺得可以考出你
[01:48:00] 做這些作業或者是說
[01:48:02] 你在聽這些內容你到底有
[01:48:04] catch到什麼樣的insight
[01:48:06] 我覺得
[01:48:07] 那個是要能夠寫出來的這樣子
[01:48:10] 我們來看第1個assignment
[01:48:13] 做這個world knowledge
[01:48:14] 這個對比
[01:48:16] 其實就是我們剛才那個
[01:48:18] man woman king queen那樣的概念
[01:48:20] 就是做這樣的事情
[01:48:22] 那這個對比的事情呢就是其實當初在做
[01:48:26] 這種thematic或者是學embedding的時候我們
[01:48:29] 最想
[01:48:30] 知道
[01:48:31] 或是說
[01:48:32] 如果
[01:48:33] 我們可以
[01:48:35] 沒辦法知道這種
[01:48:36] 絕對的向量表示
[01:48:37] 至少我們可以知道相對的向量的概念
[01:48:40] 我們可以算得出來的時候
[01:48:42] 有這樣的東西出來的時候對我們來講還蠻有用
[01:48:46] 好
[01:48:47] 那我們這邊呢會有一個
[01:48:50] 這個有點像也不像test
[01:48:52] test dataset就是拿這個Google的
[01:48:55] 有一個
[01:48:56] Dataset
[01:48:57] world knowledge的Dataset
[01:48:58] 那它這Dataset呢
[01:48:59] 有分一些的
[01:49:00] 這些category
[01:49:02] 它這個
[01:49:03] 最主要是兩大類的
[01:49:04] 一個是比較
[01:49:06] 語義上的觀念
[01:49:07] 像king queen這種的
[01:49:08] 就是語義上的觀念
[01:49:10] 那有一種是比較synthetic
[01:49:13] 語法上就是有什麼
[01:49:14] 形容詞副詞這種的relations
[01:49:18] 然後它有定義幾個subcategory
[01:49:20] 你下載之後你就可以去看一下這樣子
[01:49:23] 那其實就是要問你給你
[01:49:25] 給你ABC然後你要比較低這樣子
[01:49:28] 其實就是要做這樣一件事情
[01:49:30] 那
[01:49:32] 這是Dataset的長相
[01:49:34] 這是Symmetric的例子
[01:49:35] 它的category有一個Premary
[01:49:37] 就是這樣一句話四個字
[01:49:40] 這是Synthetic的
[01:49:42] 的例子
[01:49:43] 就是語法上的東西這樣子
[01:49:46] OK
[01:49:48] 然後
[01:49:49] 這也是
[01:49:50] 我們一直在猶豫的啦就是
[01:49:53] 因為實在
[01:49:54] 如果完全沒給你code
[01:49:58] 現在其實難度也不高
[01:50:00] 就是
[01:50:00] 我們就把這個
[01:50:03] 這個投影片丟給
[01:50:05] 丟給GPT傢伙幫你寫
[01:50:07] 他自己都寫出來了
[01:50:09] 但是我們還是希望有一個規範
[01:50:11] 有一個規範就希望有一個Template
[01:50:13] 你可以照這個做這樣子
[01:50:15] 雖然有Template
[01:50:16] 你一樣也是可以Vibe Coding
[01:50:19] 那當然你要自己重寫
[01:50:22] 也可以這樣子
[01:50:23] 那這個後面就有一些在
[01:50:26] Colab上的一些例子
[01:50:28] 那
[01:50:28] 這個課程
[01:50:30] 這個作業的資料
[01:50:32] 我們會有另外一段
[01:50:35] 錄影是助教錄的
[01:50:37] 會比較細一點
[01:50:38] 我大概就很簡單的
[01:50:40] 帶一下而已這樣子
[01:50:42] 這是Colab介紹
[01:50:44] 我想如果
[01:50:46] 你應該都用過的話
[01:50:47] 應該都知道
[01:50:49] 那我們
[01:50:50] 這個在Github的
[01:50:53] 上面有這個code
[01:50:55] 這個作業的code這樣子
[01:50:57] 那你要先做整個
[01:51:00] 這個Google這個Data的
[01:51:03] 下載這樣子
[01:51:05] 其實code都幫你寫好了啦
[01:51:07] 所以
[01:51:08] 有一點
[01:51:09] 也不像手把手但是
[01:51:11] 就是
[01:51:12] 比較不會那麼無助在做這件事情
[01:51:16] 那
[01:51:17] 那這是Data長這個樣子
[01:51:21] OK
[01:51:22] 那
[01:51:23] 怎麼怎麼載Data
[01:51:25] 怎麼去做這件事情啊
[01:51:27] 這個都有code
[01:51:29] 那
[01:51:30] 這個作業大概會分兩塊
[01:51:32] 一個是
[01:51:33] 程式的部分一個是報告的部分
[01:51:35] 那程式部分我們就會列出幾個to do
[01:51:38] 然後有
[01:51:39] 百分比這樣子
[01:51:40] 這個當然以前
[01:51:42] 在同學都會有一些問題說
[01:51:45] 我做到你講這個怎麼被扣分這樣子
[01:51:49] 這個
[01:51:51] 說實在的雖然這個好像
[01:51:54] 蠻像選擇題就一板一眼就是有就有沒有就沒有但是其實還是有一點
[01:52:00] 有一點模糊啊但是就是
[01:52:04] 就像你
[01:52:04] 你考
[01:52:05] 考聯考一樣嘛你作文
[01:52:07] 你沒有得到滿分你總不會說我都有寫啊我這個作文他會寫為什麼我沒有滿分這樣子
[01:52:12] 概念是這樣子
[01:52:13] 所以
[01:52:15] 不要再太去在意啊
[01:52:17] 就是不要去計較說這個分數為什麼你被扣了一分兩分這樣子
[01:52:23] 那
[01:52:24] 你被扣了一分一定是有人
[01:52:26] 有做
[01:52:27] 然後比你好
[01:52:27] 然後拿到滿分這樣子
[01:52:29] 所以
[01:52:30] 這個大概概念是這樣
[01:52:32] 那我們會給你幾個action
[01:52:34] 幾個action
[01:52:35] 那前面
[01:52:36] 很簡單的有送分題啊然後也有用
[01:52:39] 簡單的
[01:52:40] 已經trend好的model
[01:52:43] 已經trend好的embedding來做一些
[01:52:45] 呃
[01:52:46] 呈現啊分析啊預測啊
[01:52:48] 然後後面四個是你自己trend
[01:52:51] 拿wikidump的data
[01:52:53] 自己trend一個embedding
[01:52:55] 然後再做同樣的事情這樣子
[01:52:58] OK
[01:52:58] 後面有幾個
[01:53:00] 這個這個檔案有幾個to do的
[01:53:03] sample code
[01:53:04] 就是那個temporary
[01:53:06] 那
[01:53:08] 這個Gensim呢是一般
[01:53:11] 在做nlp還蠻常用的一個套件
[01:53:14] 這是
[01:53:16] 他有現成的很多做nlp的套件這樣子
[01:53:19] 像這邊你直接可以
[01:53:21] 可以呼叫這growback的model這樣子
[01:53:27] OK
[01:53:28] 然後
[01:53:29] 就一步一步啊其實
[01:53:30] 真的很手把手
[01:53:32] 就是
[01:53:33] 就可以這樣子
[01:53:34] 當然有以前有同學問說他沒學過python
[01:53:38] 會不會很辛苦
[01:53:41] 可能會有點辛苦
[01:53:42] 如果
[01:53:43] 你用c的想法來想python
[01:53:46] 一開始會很不習慣這樣子
[01:53:48] 但是
[01:53:50] 做久了你就會
[01:53:52] 就會
[01:53:53] 就還好
[01:53:54] 我覺得應該還好
[01:53:54] 因為邏輯都差不多
[01:53:57] 那這個是可能
[01:53:59] 畫出來的
[01:54:00] 就是第3個to do
[01:54:02] 就是畫出整個
[01:54:03] work vector
[01:54:04] 你就是
[01:54:05] 你拿那個
[01:54:06] task的data去把它做
[01:54:09] tsne這樣子
[01:54:11] 當然你說老師tsne不好這樣我要拿別的
[01:54:14] 來做也可以
[01:54:15] 但是至少你要tsne這樣子
[01:54:17] 你可以做別的然後比較這樣子
[01:54:20] 因為它本身
[01:54:22] 就
[01:54:22] 因為降維的東西本身就會有點誤差
[01:54:25] 所以你也可以比較這種
[01:54:27] 降維的方法的差距這樣子
[01:54:30] 然後另外做自己train
[01:54:34] 這個是我們有一個wikidump的data
[01:54:37] 這是公開的
[01:54:39] 那
[01:54:40] 它長相長這樣
[01:54:42] 那也不要擔心這個
[01:54:44] 怎麼處理
[01:54:44] 其實
[01:54:45] 我們都有幫你處理的這樣子
[01:54:47] 那
[01:54:51] 這個
[01:54:53] 你要自己下載
[01:54:54] 以前會遇到一些問題就是
[01:54:57] 我記得第一年遇到一個問題就是大家載不完了
[01:54:59] 因為
[01:55:00] 好像擺在
[01:55:01] 擺在哪裡
[01:55:02] 然後
[01:55:03] 繫上的頻寬怎麼樣這樣子
[01:55:05] 然後
[01:55:07] 不知道
[01:55:08] 剛來對這邊的網路不是很滿意
[01:55:10] 對
[01:55:11] 因為現在我自己在管網路我就不會講不好這樣子
[01:55:14] 反正
[01:55:15] 就
[01:55:16] 可以改進這樣
[01:55:17] OK
[01:55:17] 但是現在應該不會有下載的問題
[01:55:19] 就是
[01:55:22] 我們
[01:55:23] 對
[01:55:23] 你做這個
[01:55:25] Gdown應該都還OK這樣子
[01:55:29] 做下載下來
[01:55:32] 這邊會有一個問題
[01:55:33] 因為我們只叫你sample20%的
[01:55:36] 這個wikidump的data
[01:55:38] 那
[01:55:40] 我們的作業的設計都是在你個人的college的運算的quota可以跑得完的
[01:55:46] 我們並沒有叫你做很大量的東西
[01:55:49] 所以以前有同學說老師我college
[01:55:52] 根本memory不夠
[01:55:53] 那
[01:55:55] 通常都是你的
[01:55:56] 程式寫法有問題
[01:55:58] 你不要把百分之二的東西做出來
[01:55:59] 你不要把百分之二的東西做出來
[01:55:59] 你不要把百分之百的wikidump都載入
[01:56:00] 你不要把百分之百的wikidump都載入
[01:56:01] 然後自己再選百分之二
[01:56:03] 那個好像就是因為這樣常常就是跑不前
[01:56:07] anyway你就是叫自己有一些比較有效率的寫法這樣子
[01:56:12] 這個是
[01:56:13] 後面的兩個to do就是叫你用
[01:56:16] 現成的模型
[01:56:18] 去做這樣子
[01:56:20] 你要拿這個data去train
[01:56:23] 當然這邊並沒有到
[01:56:25] 這邊是前處理
[01:56:27] 怎麼train這個water vector
[01:56:29] 並沒有太多的
[01:56:32] 條件或是限制
[01:56:35] 也就是說
[01:56:36] 你可以自己有一些變形
[01:56:38] 也可以自己有一些
[01:56:40] 看看
[01:56:41] 我這樣給他亂搞一下
[01:56:44] 你可以自己做這樣的事情
[01:56:47] ok
[01:56:48] 然後train完之後
[01:56:49] 就把所有tutu做完
[01:56:51] 然後寫這個報告
[01:56:53] 報告佔45%
[01:56:55] 這個報告其實
[01:56:58] 為什麼要分
[01:56:59] 這麼細呢
[01:57:00] 就是
[01:57:01] 因為報告太發散了
[01:57:03] 我們總要給大家一些方向
[01:57:05] 方向就是
[01:57:06] 你至少minimum requirement
[01:57:08] 至少要能夠做這些要能夠寫這些回答這些
[01:57:13] 當然這有點像是
[01:57:15] 幫你把要餵給AI的prong都寫好了
[01:57:18] ok就把這個丟給
[01:57:20] AI他就幫你寫
[01:57:22] 但是
[01:57:23] 我希望
[01:57:25] 就是雖然其實我們是
[01:57:27] 允許啦
[01:57:28] 其實也沒有辦法進來
[01:57:29] 就大家可以用AI來輔助
[01:57:32] 但是你一定要消化你
[01:57:35] 這個AI做了哪些事情
[01:57:37] 他的實驗的分析是什麼
[01:57:40] 甚至呢我們這邊
[01:57:41] 今年多了一個是希望你能夠把你的
[01:57:44] 額外的
[01:57:45] 實驗的code
[01:57:46] 都放上去
[01:57:48] 我不知道是放連結嗎
[01:57:50] 就放
[01:57:51] notebook連結這樣子
[01:57:54] 對就是
[01:57:55] 因為以前會發生一些事情啊就是
[01:57:59] 你就把這些
[01:58:00] 丟進
[01:58:01] 丟進AI然後他就告訴你說啊這個
[01:58:03] 做wall embedding
[01:58:05] 容易遇到什麼什麼什麼
[01:58:07] 然後
[01:58:08] 那有些人又多問了一些什麼然後就做出一些漂亮的分析圖
[01:58:12] 但是我根本不知道他有沒有做這個實驗
[01:58:15] 當然你要做這個實驗你一樣可以把coding去做沒錯但是至少
[01:58:20] 你會更深入一點
[01:58:22] 你會跟AI互動更多一點
[01:58:24] 然後你會
[01:58:25] 知道
[01:58:26] AI到底幫你做什麼
[01:58:28] 我
[01:58:29] 我是希望你能夠這個過程能夠更
[01:58:32] 更多亂一點然後你可以知道
[01:58:34] 哦原來我跑這個
[01:58:37] 我給他的不同的參數不同的想法或是甚至語料我給他少一點
[01:58:41] 或是我們剛才討論的OOV的問題
[01:58:44] 你做做看
[01:58:45] 也許就
[01:58:46] 就你可以看出一些東西
[01:58:50] 當然你也可以問問AI說這個我要得高分
[01:58:53] 我要做什麼實驗這樣
[01:58:55] 也許你就
[01:58:57] 寫了一個
[01:58:58] 100頁的報告這樣子
[01:59:03] 每次講這個我都想到一個以前小時候看到漫畫那個叫做天才兒童
[01:59:07] 他們是一個小學生
[01:59:09] 那小學生的
[01:59:11] 的那個
[01:59:13] 運動會呢越野障礙就是
[01:59:16] 不同
[01:59:17] 不同
[01:59:18] 不同年級的考試體
[01:59:20] 這樣子我就從小一小二講一直這樣越野障礙這樣一直
[01:59:24] 他們到最後一關是什麼
[01:59:26] 就是寫博士論文
[01:59:28] 就是什麼用印度文寫出印度的未來農業的發展這樣
[01:59:32] 我就看到那些
[01:59:33] 漫畫看起來很有趣
[01:59:35] 小學生在那邊寫
[01:59:36] 寫這些論文這樣子
[01:59:38] 就是他可以很深入啊就是在這個作業其實也可以很深入就是
[01:59:42] 你也可以去探討一些東西
[01:59:45] 甚至
[01:59:46] 越搞越大就把剛才的MTEB的DataSet拿來
[01:59:50] 去跑跑看這樣子
[01:59:52] 就是
[01:59:53] 我們會有一個Range會有一些Range在這邊
[01:59:57] 希望還是可以拉開來看的
[01:59:58] 大家的插曲這樣子
[02:00:00] 那只是說因為人數有點多所以我們還是有一些格式要求
[02:00:05] 就一定要照這個格式要求
[02:00:07] 那我們
[02:00:08] 因為
[02:00:10] 中間有一些部分還是會用AI來做簡單的review
[02:00:14] 所以你如果不符合這個規格
[02:00:17] 其實很容易就沒有分數
[02:00:18] 那
[02:00:19] 這個我們都有寫在這上面
[02:00:21] 那
[02:00:22] 當然
[02:00:24] 這個比較麻煩的就是
[02:00:28] 超習
[02:00:29] 那當然同學會說我們有討論啊
[02:00:32] 討論
[02:00:33] 但討論總要寫的時候要分開寫對不對至少
[02:00:38] Prong也改一下吧
[02:00:39] 就是報告也不要長得一模一樣這樣子
[02:00:42] 心得也不要一模一樣
[02:00:45] 討論只是技術的討論
[02:00:46] 心得討論
[02:00:48] 對不對你總要有點差距
[02:00:50] 就是
[02:00:51] 不要這麼像
[02:00:53] 其實
[02:00:56] 就不要太像了
[02:00:57] 因為
[02:00:58] 因為以前真的發生過
[02:00:59] 幾乎一樣
[02:01:00] 這個不是OK
[02:01:02] 那不是
[02:01:03] 這個其實我們為了要
[02:01:06] 讓有些同學不得已被人家抄
[02:01:08] 我們
[02:01:09] 給他一個條件是你被抄你一樣是0分這樣
[02:01:12] 所以你就可以跟同學說
[02:01:14] 不行
[02:01:14] 你這樣太危險了
[02:01:17] 我們是
[02:01:19] 兩份一樣全都是0分這樣子
[02:01:21] 所以
[02:01:23] 這麼簡單的作業就不要再抄了這樣子
[02:01:25] OK這大概是作業我們已經放上去
[02:01:28] 然後
[02:01:29] 我們的作業就是今天announce
[02:01:32] 我們就三週的時間
[02:01:33] 三週的時間其實時間很夠啦
[02:01:36] 但是
[02:01:37] 學生通常是最後一週寫
[02:01:39] 如果你最後一週再開始寫
[02:01:41] 會有一點趕
[02:01:42] 會有點趕
[02:01:43] 那
[02:01:44] 那不過就看你自己的程度這樣
[02:01:46] 如果
[02:01:46] 有些人覺得這很簡單
[02:01:48] 那其實
[02:01:50] 他的
[02:01:51] loading沒有到太多
[02:01:52] 但是如果你要寫出一個好的報告多一點分析
[02:01:56] 是的確要花一些時間
[02:01:58] 好
[02:02:00] 這是我們的assignment 1
[02:02:01] 那
[02:02:02] 大家如果還有問題呢
[02:02:03] 可以在slido上問
[02:02:05] 那我們先休息一下
[02:02:06] 我們10分鐘後再回來
## 8. 寫作規則
(這是 `_筆記SOP.md` 第 3.1、4、5、6 節的濃縮版。兩者衝突時以 SOP 為準。)
讀者:碩士生,兩門課期末是英文考試。要只看筆記就能學會,講得比老師好懂。畫面要簡潔。
**概念優先(2026-09-26 主理人)**:主理人只想懂概念,不想補數學、不想看程式碼和座標圖。兩門課的考試也都是問答題、不考算式(AI W1 1:16:52;NLP W3 1:47:41、2:48:36)。所以:
- 每段預設看得到的只有:白話摘要(2–4 句)+**一句生活比喻**(例:模擬退火像投資理財,年輕時敢冒險、越老越保守)+「考試可能怎麼問」一句。
- 數學推導、公式、手算、程式碼、座標圖,全部收進標題寫「(進階,可跳過)」的摺疊,例如「它到底怎麼運作?(進階,可跳過)」。每段最多一個進階摺疊,不要寫長篇計算。
- 演算法要能「用文字說出步驟」(考試可能要你描述),這一點放在預設看得到的地方,不用數字。
- **重心比例**:白話理論與概念模式(它在解決什麼問題、核心想法、跟別的方法差在哪、優缺點、生活比喻)占主要篇幅;數學與程式細節只用一兩句帶過,細節收進進階摺疊。
**圖文並茂(2026-09-26 主理人:不要只有文字)**:
- 每章至少 2–3 個圖,放在**預設看得到**的地方,每個圖前後各用一兩句白話說明「這張圖在看什麼」。
- 流程、步驟、因果、比較 → 用 mermaid 流程圖(```mermaid,flowchart LR 或 TD;節點文字用中文、加雙引號;一張圖不超過 10 個節點)。
- 投影片上的示意圖、架構圖 → 用 [[IMG: …]] 放投影片圖。
- 仍守「每個 ## 段落最多一種視覺元素」。
### 輸出兩個檔
1. `chNN.md`(Notion 寫法,不含頁面標題),結構固定:
- 第一行:章節包第 1 節那行,原樣照抄。
- `## 重點`:三點中文,每點一到兩句。
- `## Exam-ready`:3–10 行英文,**從章節包的投影片文字逐字抄**,每行 `- **Term**: "原句"(Ch3 p.14)`。老師有明確證據才在行尾加 `【老師強調】(h:mm:ss)`。
**每一行下面一定要有一行縮排的中文解釋**(主理人英文不好,看不懂的英文等於沒用):
```
- **Hill climbing**: "It keeps track of one current state and on each iteration moves to the neighboring state with highest value."(Ch4 p.5)
- 中文:爬山法只記住「現在這一個狀態」,每一輪都移到分數最高的鄰居。白話:一直往比較高的地方走一步。
```
中文要先把句子意思講清楚,再補一句白話;難的英文單字括號附中文(例:neighboring state(鄰近狀態))。
- 章節包第 2 節的每一段:`## [h:mm:ss](連結) 標題`(照抄),下面 2–4 句白話摘要,其餘全部收進摺疊:
```
問句(例:用生活例子講,BFS 在做什麼?)
內容
```
摺疊種類(需要才放):用生活例子講?/它到底怎麼運作?/要先懂什麼?(老師假設你會的數學或概念,短版教學)/老師原話是什麼?(「原話」(h:mm:ss),只放重要的,最多 5 句)。
- 「它到底怎麼運作?」要用一組小數字把這段的演算法**真的跑 1–3 步**(例:算出梯度、更新一次、比較兩個 α),不是只示範定義的加減乘除。全章盡量沿用同一組數字,讓前一段的答案能在下一段被驗證。
- 每段正文要回答讀者最可能卡住的一個「為什麼」。投影片公式方向跟題目相反、或投影片說「解不出來」時,用一兩句講出原因,自己補的標(我補充)。
- 投影片句子停在公式前(公式在圖裡)時:Exam-ready 在粗體詞條上補公式、引號內保持原句;正文寫出同一條式子。公式圖看章節包第 6 節列出的 PNG。
- `## Self-check`:2–4 題英文考題,答案收摺疊。**至少一題考老師強調的內容**;不出「老師和投影片哪裡不同」這類不會考的題目。每題格式:
```
Q1. English question?(中文:中文題目)
**Answer**: English answer.
中文:把答案完整講一遍(不是只翻一句),讓看不懂英文的人也知道要怎麼答。
```
- **最後一行**:章節包第 1b 節那行(下一章連結),原樣照抄。讓讀完的人直接點下一章。
- 不要把章節包或這份規則裡的指示句寫進筆記(例如「寫筆記時照投影片寫」「已改正 ASR 錯字」)。
- 長度 8,000–14,000 字元。
2. `chNN.concepts.json`:JSON 陣列,4–12 個考試可能問的術語,每個物件:
`name`(英文)、`zh`、`type`(概念/演算法/公式/人物事件/前置知識/行政)、`signal`("老師說會考"/"老師強調"/"核心(我判斷)"/"")、`evidence`(有 signal 前兩種時必填:原句+時間)、`definition_en`(投影片原句;沒有就註明 (textbook)/(lecture)/(my wording))、`plain`(一句中文)、`a4`(≤150 字元英文,可夾極短中文;期末拼貼用的小方塊)、`time`、`slides`、`prereq`(英文名陣列)。
### 風格鐵律
- 不用 emoji 或裝飾符號(✓✗★⚠ 都不要;→ 可以)。不用 callout。不用 `$`。時間不要用 code 樣式。
- 每個 `##` 段落最多一種視覺元素:一張圖、或一個表格、或一個 mermaid。
- 摺疊標題是問句,前面不加符號。
- 圖片最多 3 張,只放文字取代不了的圖。放法:單獨一行 `[[IMG: | 中文圖說]]`,PNG 用 `slides_to_png.py <圖片資料夾> <頁> --dpi=110` 產生。
- 考試訊號只在老師明確說時標。老師只說「不用背」「不講」就寫「注意:……」。
- 老師口誤或跟投影片不同:照投影片寫,加「注意:老師口頭說的是……」。
- 引用老師的話時,ASR 錯字改成正確的字。
### 沒有投影片時
不要憑記憶逐字重現課本段落或數值表。英文定義用自己的話寫、句尾標 (my wording);Exam-ready 每行標「(自擬,投影片待補)」。例子只用老師講的。
### 寫完之後(只做一次)
跑檢查:
`C:\Users\user\.cache\meeting-record\venv\Scripts\python.exe C:\Users\user\.claude\scripts\check_note.py --transcript <逐字稿> --slides <投影片 txt …> --start <起> --end <訖> --vid <影片 ID>`
- STYLE/VISUAL/TIME/FORMAT:全部改掉。
- QUOTE:確認是不是你改正了 ASR 錯字(是就保留),不是就改成原文或拿掉引號。
- ENGLISH:確認是不是投影片斷行造成的(是就保留),不是就改成投影片原句。
**省額度守則**:章節包裡已經有你需要的全部資料。不要再去讀整份逐字稿、整份投影片、segments.json 或手冊。一次寫好整個檔(Write 一次),檢查後集中修改。