# 章節包:自然語言處理(NLP)W1(9/10)第 06 章「課後問答:浮水印與 AI 界線」 影片 1:35:36–1:47:14,YouTube ID EEbwXXoVQPY。Notion 章節頁 https://app.notion.com/p/3e7fc631b0308154af87df0a9af15134(頁 ID 3e7fc631-b030-8154-af87-df0a9af15134),頁面標題「06 課後問答:浮水印與 AI 界線(1:35–1:47)」。 ## 1. 第一行(直接照抄,不要改) [自然語言處理](https://app.notion.com/p/3e6fc631b03081b4a9e8f91f3411f61f) › [W1(9/10)](https://app.notion.com/p/3e7fc631b0308199953aef38ee86b0ae) › 06|影片 [1:35:36–1:47:14](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=5736s)|投影片 無投影片(Slido 問答)|上一章 [05 預訓練模型改變 NLP 做法(1:13–1:35)](https://app.notion.com/p/3e7fc631b03081c69424e055b260badc)|下一章 [07 NLP 的四個發展階段(1:47–1:59)](https://app.notion.com/p/3e7fc631b030812c8099fdb235641816) ## 1b. 最後一行(直接照抄,放在 Self-check 後面,當全頁最後一行) 讀完了嗎?下一章:[07 NLP 的四個發展階段(1:47–1:59)](https://app.notion.com/p/3e7fc631b030812c8099fdb235641816)|回到週頁:[W1(9/10)](https://app.notion.com/p/3e7fc631b0308199953aef38ee86b0ae) ## 2. 各段標題(照順序;每段一個 ## 標題,直接照抄連結) - `## [1:35:36](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=5736s) 作業可重交、不講 SLM` 老師講什麼:截止前可以重複上傳,沒有次數限制;作業不是靠排行榜評分,但可能設最低表現門檻。小型語言模型(SLM)不會特別講。 - `## [1:37:14](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=5834s) 遲交扣分與 MOOCs` 老師講什麼:遲交按天扣百分比,不會直接零分,老師希望大家都補交、不要因一次沒交就放棄。清大 MOOCs 版本是這門課前半、比較簡單的子集。 - `## [1:38:34](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=5914s) 文字浮水印:保護訓練資料` 老師講什麼:資料授權廠商擔心資料被盜用,所以要在訓練資料加浮水印。影像浮水印比較直覺,文字以前的做法是插入平常不會出現的特殊符號。 - `## [1:39:12](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=5952s) 研討會抓 AI 審稿` 老師講什麼:某研討會在論文裡藏人看不到、模型讀得到的文字,把論文丟給 ChatGPT 審的人就會寫出不尋常的字眼,被抓到直接 desk reject。老師說用 AI 輔助可以,但要自己消化重點。 - `## [1:40:40](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=6040s) 用選字機率做浮水印` 老師講什麼:語言模型不一定每次選機率最高的字,可以設計規則讓它偏好某些字,模型輸出就帶有公司資料的特徵。但這在法律上不一定站得住;RL 會提到,但不會出 RL 作業。 - `## [1:42:24](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=6144s) 研究用 AI 輔助的界線` 老師講什麼:老師說看個人道德。有用的成果不是一兩次 prompt 做得出來,跟 AI 頻繁互動、問出重點,你就有貢獻;不要把 AI 的東西直接交上去,要消化、調整。 - `## [1:44:09](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=6249s) 考試偏概念、作業會調分` 老師講什麼:考試不偏理論也不偏計算,以回答概念為主,也許有一題小計算。作業約一個月前公布;成績會做 normalization,通常只往上調。 ## 3. 老師強調/會考/不考的地方(原句已驗證;寫進筆記時 ASR 錯字要改正) - (1:44:16) [會考] 「可能是比較深論啦就是回答一些概念的啦我不太可能叫你們算,但也許會有一題叫你們算一下,TFIDF」 → 考題以概念問答為主,也許有一題小計算(老師舉 TF-IDF,但隨即說「好像不太有意義」) ## 3b. 數學段候選(程式抓的,只是提示;寫「跳過提示」行用) 0 段候選(門檻 3.0 字/30 秒) ## 4. 這章摘要與重要度 第二輪 Slido 問答:老師補充文字浮水印的做法(研討會抓 AI 審稿、用選字機率標記訓練資料)、研究用 AI 輔助的界線,以及重交、遲交、考試型態與作業調分。(一般) ## 5. 整堂課的提醒(ASR 錯字、老師口誤、投影片缺公式等;只用跟這章有關的) - 0:00:00–0:01:25 還沒開始上課;0:00:36 那串「志願自由生涯、紅色教堂…」是語音辨識幻覺,不是老師講的。 - 下課在 1:07:53,錄影裡只剩約 1 分半(1:07:53–1:09:19),老師說休息 10 分鐘,實際休息時段應該沒錄進去(推測,沒看影片確認)。 - 老師講 Syllabus-115.pdf 不是照頁碼順序:先講 p.1–33,接著跳到 p.43–51(課程內容、評分)和 Slido 問答,下課後才回頭講 p.34–42。所以第 04 章是 p.43–51、第 05 章是 p.34–42。 - 本週投影片是 Syllabus-115.pdf,加上 1:47:14 起的 W1_NLP_brief_v2.pdf p.1–3(檔名的 W1 不等於上課週)。brief p.3 那張「NLP 四階段」圖,W2 一開頭又講了一次。 - Slido 上有幾則助教的文字回覆,影片裡沒講到:考試可以用英文作答;作業有 2–3 週可以交;各校考試由 TAICA 在各校安排考場;清大實體教室在台達館 103;問問題可寄助教信箱 nthuikmlab@gmail.com;「會講 PEFT(LoRA),但 RL 不會講」。 - 第 06 章是下課後第二輪 Slido 問答,裡面有幾則行政回答(可重複提交、遲交扣分、作業調分),因為時間在第 04 章之後,所以留在第 06 章,不併進第 04 章。 - ASR 錯字對照:高鴻宇→高宏宇;自然源處理→自然語言處理;Edward Harvey→Eduard Hovy;LockedIn→Rocling;TradeGPT/TrackGP/ChangeGPT/ChangeBee/trekGPT/checkgpt→ChatGPT;Cloud→Claude;Entropy→Anthropic;Media→NVIDIA;game/GAME→GAN;Tronsky、Transcript 的 hierarchy→Chomsky(hierarchy);Benji→Bengio;Wall-to-Vector/Vault to Vector/what vector/water vector→word2vec;Transformer Learning→Transfer Learning;Transformer Scratch→from scratch;Sleep/Sleepless→Syllabus;slide/SIDEL(指問答平台時)→Slido;Tica/臺卡/Tiger→TAICA;ntu庫/NTU酷→NTU COOL;摩克斯→MOOCs;持交→遲交;RIL→RL;Prong/PROM→prompt;勸/Chain/圈(指訓練時)→train;PFT→PEFT;Numeration→Normalization(Named Entity Normalization);構制→構詞;Passing Tree→Parsing tree;Stop War→Stop word;One-Half Vector→One-hot vector;科技大學(0:38:25)→科技大擂台;國客會→國科會;黃淑駿→黃舒駿;regret→reject;deskregent→desk reject;dispution→distribution;Garantee→guarantee。 - 不確定的 ASR:0:50:37「Bloodbath的一系列的東西」推測是 BERT 家族(對照 Syllabus p.44 W9 BERT and its Family);1:18:49「像中國大陸一樣用針灸的方式」推測是「蒸餾」(distillation);1:18:00「Tide/Breeze/白龍」應是台灣模型 TAIDE、Breeze、Bailong;0:48:33「K3」不確定是哪個模型;1:34:55「Income」推測是 in-context learning。 - 考試名稱不一致:老師口頭說「期末考」,Syllabus p.44–45 寫 Exam/Midterm Exam(week 14, tentative)。是同一場,排在 W14,不在期末考週。 - 評分舊資料:Slido 同學提到 9/7 郵件寫「作業 70%+Term Project 30%」,老師 0:59:29 說那是舊資料,現在是作業 75%+考試 25%,沒有期末專題;p.45 另寫每份作業比重會微調 -3%~+3%。 - 考試算式:W1 老師 1:44:22 說「也許會有一題叫你們算一下 TFIDF」但隨即說好像沒意義;課程頁已寫「不考算式(例如 BM25 公式)」(來自之後的週次)。以課程頁較新的說法為準,筆記不要寫成「會考 TF-IDF 計算」。 - RL 說法不一致:老師 1:42:02 說 RL 設計「會提到啦但是不太會叫你們做」,Slido 助教回覆「會講 PEFT (LoRA), 但 RL 不會講」。理解成:不會有 RL 作業,最多概念帶過。 - 作業時間:老師 1:45:35 說作業「通常是一個月前會公佈」,Slido 助教回覆「作業會有 2~3 個禮拜的時間可以繳交」;兩者說的是不同事(公布時間 vs 繳交期限),寫筆記時不要混在一起。 - 投影片錯字:Syllabus p.38 寫「TD-IDF」,應為 TF-IDF(老師 1:23:49 口頭也說「這打錯了」);p.7「Ger explanations」應為 Get explanations。 - 修課人數:老師口頭說往年 300–500 人,Syllabus p.3 寫班級人數 1200 人(今年上限),兩者不衝突。 - Syllabus p.47(TAICA 運算資源:100/500 運算元帳號)老師說「有一張投影片我沒有放」,只口頭說會當作業 bonus 發給前十名;投影片上的名額與金額以公告為準(p.47 寫 Wait for announcement)。 ## 6. 投影片文字(這章範圍) (這章沒有對應的投影片文字;如果規劃裡寫了頁碼但這裡是空的,代表那幾頁只有圖,需要時用 slides_to_png.py 轉圖看。) ## 7. 逐字稿(1:35:36 前後各多 1 分鐘,原始行) [01:34:36] 你做得動這樣子 [01:34:37] 當然會提一下Lora [01:34:39] 像這種PFT的方式 [01:34:42] 但是這個其實也都需要資源 [01:34:44] 所以 [01:34:45] 以前本來希望有一些Lora的 [01:34:47] Homework [01:34:49] 但是後來發現 [01:34:52] 需要一點Resource [01:34:53] 就是比較不容易設計 [01:34:55] 那或是Income但是這個可能就會牽扯到 [01:35:02] 不會教你做Prong但是可能會帶你說現在大家重視像Reasoning [01:35:07] 或是Test Time Scaling的想法 [01:35:09] 他們怎麼去 [01:35:11] 不再 [01:35:12] 調整模型的情況下讓模型變厲害 [01:35:15] 的概念這樣子 [01:35:18] 好 [01:35:19] 這個就介紹我們 [01:35:20] 上一節課講的部分 [01:35:23] 好 [01:35:24] 那我們Sleepless大概就帶到這邊了那這個這個投影片其實都在這兩個網站 [01:35:30] 那 [01:35:31] 這個大家可以去assets [01:35:36] 有沒有問題 [01:35:39] 好 [01:35:41] 作業可以反覆提交優化嗎 [01:35:45] 應該是可以只要在截止之前 [01:35:48] 可以在截止之前 [01:35:50] 我們應該 [01:35:51] 沒有限制上傳次數 [01:35:54] 我們的作業比較沒有 [01:35:57] 不像有一些沒有 [01:36:00] 沒有標準單 [01:36:01] 然後就用Leaderboard去排這樣子 [01:36:03] 所以 [01:36:03] 通常是 [01:36:05] 還好但的確也會有一些Performance的數據 [01:36:08] 那我們會有一個 [01:36:10] 可能會有一個 [01:36:11] 標準告訴你一定要做到多少以上這樣子 [01:36:16] SLM [01:36:17] 你講的是small language model嗎 [01:36:20] 應該是不會 [01:36:21] 應該是不會 [01:36:22] 不會特別講啦 [01:36:24] 不會特別講 [01:36:28] 通常我們講SLM的情況底下是希望說 [01:36:32] 探討說怎麼做出這個SLM [01:36:35] 或是說 [01:36:36] 怎麼用一個比較笨的 [01:36:38] 模型來做 [01:36:40] 比較厲害的事情 [01:36:42] 大概這樣但是我們這堂課目前是沒有 [01:36:48] 這是同一位學生嗎 [01:36:50] 難度要再拉高的話 [01:36:56] 怎麼跳掉 [01:36:59] 所以應該是另外一位學生 [01:37:13] 好 [01:37:14] 我只能說這個同學加油 [01:37:19] 持交扣分我們會有一個那個penalty的一個list [01:37:23] 就幾天 [01:37:24] 扣百分之多少 [01:37:26] 那 [01:37:28] 不會是直接零分啦但是我也不希望說你說 [01:37:32] 我已經扣到百分之百那我要不要交 [01:37:36] 那 [01:37:37] 其實我是希望 [01:37:38] 你都能夠補交但是補交應該 [01:37:41] 最後會有一個基本的分數因為你 [01:37:43] 你不交就是沒有分數但是我又不希望學生 [01:37:46] 一次沒交後來就放棄這樣子我覺得是很可惜 [01:37:50] 很可惜 [01:38:01] 摩克斯喔 [01:38:02] 摩克斯很可惜 [01:38:02] 摩克斯 [01:38:03] 是當初拿 [01:38:05] 這邊的課程的前半 [01:38:07] 應該是前半然後 [01:38:09] 好像是比較簡單的部分我記得是比較簡單因為 [01:38:13] 我們摩克斯上面有做一些 [01:38:16] 課堂練習但是 [01:38:18] 我是覺得那邊 [01:38:20] 有啊那個教材 [01:38:22] 是subset的樣子我記得是subset [01:38:27] 我可以這個這個比較境界這個老實說我也不是很熟不過我可以去看看 [01:38:34] 的確我們現在有做所謂的watermarking的研究 [01:38:37] 就是說 [01:38:39] 尤其是我們要找 [01:38:41] 授權廠商要讓他拿出資料 [01:38:44] 來讓我們訓練的時候他們說那我們的好處是什麼 [01:38:48] 那我們訓練完之後對手會不會拿去這個東西他們都很在意這些東西所以 [01:38:53] 會希望把 [01:38:54] training的data加上一些watermark [01:38:57] 影像的東西抓watermark [01:38:59] 反而比較直覺 [01:39:01] 文字的東西以前其實有做watermark [01:39:03] 就是說 [01:39:05] 我會加一些特殊的符號 [01:39:07] 就是這邊不太可能會出現這個符號我這邊出現這個字 [01:39:12] 其實在今年 [01:39:14] 去年 [01:39:16] ICML還是什麼 [01:39:18] 那個會議呢因為他他覺得審稿的人都 [01:39:21] 都沒有認真審都把paper [01:39:24] 丟給trekGPT然後叫他提供這個審稿意見然後就上傳 [01:39:28] 所以他們就在 [01:39:30] 論文的內容上加上一些特殊的文件 [01:39:33] 但是實際上看不到的 [01:39:36] 但這些文字呢 [01:39:37] 模型的會識別 [01:39:40] 模型讀到之後呢他在 [01:39:42] 做de-coding的時候呢他就會 [01:39:44] 對那些文字 [01:39:46] 特別敏感然後就會產生出一些 [01:39:49] 不太可能在一般review [01:39:51] 出現的文字 [01:39:52] 所以那次就抓到一堆就是使用 [01:39:55] AI審稿的 [01:39:57] 的人這樣子 [01:39:59] 就是 [01:40:00] 好險沒有被抓到這樣子 [01:40:02] OK [01:40:04] 所以 [01:40:04] 處罰非常嚴重喔 [01:40:06] 你被抓到你的submission是被直接deskregent [01:40:12] 但我覺得現在大家還是會多少用AI模型去輔助啦 [01:40:16] 就畢竟 [01:40:18] 這麼短時間內那個paper都做了非常多怎麼可能去看出重點 [01:40:23] 其實 [01:40:23] 都會用AI輔助但是 [01:40:26] 的確我們都還是得消化一下到底 [01:40:28] AI的summary跟 [01:40:30] 他到底重點是什麼 [01:40:31] 而不是直接把 [01:40:32] 這種東西 [01:40:33] 直接教他產生review然後上傳這樣子 [01:40:36] 所以他會有所謂的這個也 [01:40:37] 某種程度叫watermarking [01:40:40] 但現在的確有很多watermarking研究是說 [01:40:44] 他會讓 [01:40:46] 因為如果你們勸過 [01:40:47] 勸過這些人或是 [01:40:49] 勸過language model知道說 [01:40:51] 我不見得每次都要選機率最高的嗎 [01:40:54] 他就 [01:40:55] 他就有一個選項 [01:40:56] 是會有一個table [01:40:58] 或是一個機率的演算法 [01:41:00] 他會去選擇 [01:41:02] 他的分部內的 [01:41:03] 字 [01:41:04] 去讓他說你這次就不要選這個字要選那個字 [01:41:08] 讓他學完之後呢這個模型 [01:41:11] 做出來東西就 [01:41:12] 比較像A公司的資料會講的話 [01:41:15] 所以以後如果這個模型被盜用了 [01:41:18] 他就說你這個 [01:41:21] 你這個模型的dispution [01:41:23] 是我用我公司的資料 [01:41:26] 勸出來的模型 [01:41:28] 但這件事情也不是100%在法律上站得住腳 [01:41:32] 因為畢竟 [01:41:33] 很多東西都可以mask [01:41:35] 但是的確 [01:41:36] 現在有很多的判例 [01:41:38] 不過很多的判例是 [01:41:40] 當你這公司賺錢的時候你就會被告 [01:41:42] 沒有賺錢他也不再想理你這樣子 [01:41:45] 就是他知道說你有拿他們的資料去Chain這樣子 [01:41:51] 那 [01:41:52] watermarking [01:41:54] 可能也許可以補充一下因為 [01:41:56] 有一些在做Pretraining會用到這些東西 [01:42:00] 會做到fine-tune [01:42:02] 然後後續的RIL設計 [01:42:04] 會提到啦但是不太會叫你們做RIL [01:42:07] 因為要叫你們做RIL [01:42:09] 如果只是講RIL那也沒什麼好講的話 [01:42:12] 畫一張圖就好了 [01:42:14] 如果要練習 [01:42:15] 那你們 [01:42:16] 沒有資源可以Chain RIL這樣子 [01:42:24] 研究上使用AI輔助的界限在哪裡 [01:42:28] 這看個人的道德吧 [01:42:32] 說實在的 [01:42:34] 說實在的 [01:42:35] AI現在越來越強沒錯 [01:42:38] 但是 [01:42:39] 實際上你要做出有用的東西 [01:42:42] 不是靠簡單的 [01:42:43] 一次性兩次性的Prong就可以解決的 [01:42:47] 這個學校老師也沒那麼笨 [01:42:49] 你把這個結果給老師看老師一定會 [01:42:53] 問題很多這樣子 [01:42:55] 但是你如果善用你如果跟他互動非常頻繁而且你能夠問出 [01:43:00] 問題的重點 [01:43:02] 我覺得他的確給你一些 [01:43:04] 方向或是意見 [01:43:05] 甚至告訴你一個 [01:43:07] 也許不是你Final solution的樣子 [01:43:11] 但他的確是有幫助的 [01:43:14] 但這件事情的確有點 [01:43:18] 那個 [01:43:19] 說這到底 [01:43:20] 是AI做的還是你做的這樣子 [01:43:23] 這個 [01:43:25] 有點 [01:43:25] 有點難界定 [01:43:27] 說真的有點難界定因為畢竟你是跟他互動 [01:43:30] 你是跟他 [01:43:31] 討論 [01:43:32] 後的而且如果沒有你的這些feedback [01:43:34] 他是做不出來的 [01:43:36] 所以 [01:43:37] 其實 [01:43:38] 其實上理論上你是有contribution的這樣子 [01:43:42] 但是現在的確 [01:43:44] 你 [01:43:45] 不太會去標註說我百分之多少是AI協助的 [01:43:51] 對 [01:43:52] 如果以學習上或是 [01:43:54] 基本的研究上 [01:43:55] 我覺得 [01:43:57] 你不要只是把AI給你東西直接交上去就好了 [01:44:01] 我覺得你要消化要調整 [01:44:04] 我覺得 [01:44:04] 那樣我覺得是還OK的這樣子 [01:44:09] 考試比較偏理論還是計算 [01:44:13] 我覺得都不是吧 [01:44:16] 可能是比較深論啦就是回答一些概念的啦我不太可能叫你們算 [01:44:22] 但也許會有一題叫你們算一下 [01:44:25] TFIDF [01:44:26] 好像 [01:44:27] 不太有意義 [01:44:28] 有點low [01:44:32] 那個NTU酷的問題呢可能我會請辦公室那邊加速處理啦因為 [01:44:37] 老師說真的很麻煩因為每個學校的修課系統啊名單匯入系統又不一樣啊 [01:44:44] 其實他們Tiger真的很辛苦 [01:44:46] 要Sync [01:44:47] 所有的學校 [01:44:48] 就是很麻煩 [01:44:50] 因為每個學校的行政流程都不太一樣 [01:44:54] 現在還好現在 [01:44:56] 每個大學開學日期都差不多了 [01:44:59] 我們第1次開課的時候 [01:45:01] 有些學校就晚一週甚至還兩週那個我們已經都快要寫第1個作業他還沒有NTU酷的賬號這樣子 [01:45:07] 好啦大家怎麼很擔心考試的奇怪 [01:45:15] 好啦我大概會 [01:45:18] 真的是 [01:45:23] 會跟你們講一下可能會考什麼 [01:45:33] 作業會給多少時間完成 [01:45:35] 助教有回啊通常是一個月前會公佈啦 [01:45:40] 但是你們你們通常是前一週才會開始做嗎 [01:45:43] 不過 [01:45:44] 我們就是提早公佈你要你要前一天做 [01:45:46] 我們也沒有意見 [01:45:48] 這門課作業會調分 [01:45:51] 好問題 [01:45:52] 因為 [01:45:53] 因為有學生反應說 [01:45:55] 這個 [01:45:56] 我的學習成績跟我當初作業老師公佈的百分比算出來不太一樣這樣子 [01:46:01] 但是通常是會往上嘛對不對 [01:46:05] 本來80分我給你85分你不會來抗議嘛對不對 [01:46:08] 那 [01:46:09] 可能會調啦因為就是做一個Normalization這樣子 [01:46:14] 但是會不會調低 [01:46:16] 通常不會 [01:46:18] 因為 [01:46:20] 調高你們就 [01:46:21] 比較不會有怨氣嘛 [01:46:22] 所以我們都會把作業弄難一點 [01:46:25] 然後把它調高這樣你們會覺得 [01:46:27] 老師的恩澤這樣子 [01:46:28] 但是如果本來都很高分然後最後把它調低你們 [01:46:32] 大概低卡我就看不完 [01:46:36] 重點都還是在於鑑別度跟 [01:46:39] 這個整個 [01:46:41] 比重 [01:46:43] 好啦應該 [01:46:44] 沒有有些我可能就 [01:46:46] 有些我們就是 [01:46:53] offline再回一下好了 [01:46:57] 大概是這樣 [01:47:00] S一點 [01:47:14] 我秀一下我們 [01:47:15] 第一張內容前面一點點就好了 [01:47:19] 畢竟 [01:47:21] 畢竟是 [01:47:24] 直播錄影的 [01:47:26] 有沒有啊 [01:47:28] 嗯? [01:47:34] 關了嗎 [01:47:41] 好 [01:47:42] 這個就是另外一份投影片喔就是我標W1的 [01:47:48] 就通常 [01:47:49] 那個投影片的前面那個week [01:47:51] W就是通常會是上課的週數 [01:47:54] 不過後來也不太準 [01:47:55] 所以大概就是照這個這個編號的順序 [01:47:59] 上下來 [01:48:01] 好 [01:48:02] 那我只秀一下這個 [01:48:06] 好可以嗎 [01:48:07] 好 ## 8. 寫作規則 (這是 `_筆記SOP.md` 第 3.1、4、5、6 節的濃縮版。兩者衝突時以 SOP 為準。) 讀者:碩士生,兩門課期末是英文考試。要只看筆記就能學會,講得比老師好懂。畫面要簡潔。 **概念優先(2026-09-26 主理人)**:主理人只想懂概念,不想補數學、不想看程式碼和座標圖。兩門課的考試也都是問答題、不考算式(AI W1 1:16:52;NLP W3 1:47:41、2:48:36)。所以: - 每段預設看得到的只有:白話摘要(2–4 句)+**一句生活比喻**(例:模擬退火像投資理財,年輕時敢冒險、越老越保守)+「考試可能怎麼問」一句。 - 數學推導、公式、手算、程式碼、座標圖,全部收進標題寫「(進階,可跳過)」的摺疊,例如「它到底怎麼運作?(進階,可跳過)」。每段最多一個進階摺疊,不要寫長篇計算。 - 演算法要能「用文字說出步驟」(考試可能要你描述),這一點放在預設看得到的地方,不用數字。 - **重心比例**:白話理論與概念模式(它在解決什麼問題、核心想法、跟別的方法差在哪、優缺點、生活比喻)占主要篇幅;數學與程式細節只用一兩句帶過,細節收進進階摺疊。 **圖文並茂(2026-09-26 主理人:不要只有文字)**: - 每章至少 2–3 個圖,放在**預設看得到**的地方,每個圖前後各用一兩句白話說明「這張圖在看什麼」。 - 流程、步驟、因果、比較 → 用 mermaid 流程圖(```mermaid,flowchart LR 或 TD;節點文字用中文、加雙引號;一張圖不超過 10 個節點)。 - 投影片上的示意圖、架構圖 → 用 [[IMG: …]] 放投影片圖。 - 仍守「每個 ## 段落最多一種視覺元素」。 ### 輸出兩個檔 1. `chNN.md`(Notion 寫法,不含頁面標題),結構固定: - 第一行:章節包第 1 節那行,原樣照抄。 - 第二行起(有數學段才寫):**跳過提示**,每段一行,讓主理人看影片時知道從哪跳到哪。用章節包第 3b 節的候選當提示,對照第 7 節逐字稿確認(只標老師連續講公式、推導、矩陣、微積分、機率計算、程式細節超過約 1 分鐘的段落;概念講解和比喻不算): `跳過提示:(1:31:02–1:35:40) 老師在推導梯度公式,聽不懂可以直接跳到 [1:35:40](YouTube 連結),接著講「步長 α 怎麼選」。` - `## 重點`:三點中文,每點一到兩句。 - `## Exam-ready`:3–10 行英文,**從章節包的投影片文字逐字抄**,每行 `- **Term**: "原句"(Ch3 p.14)`。老師有明確證據才在行尾加 `【老師強調】(h:mm:ss)`。 **每一行下面一定要有一行縮排的中文解釋**(主理人英文不好,看不懂的英文等於沒用): ``` - **Hill climbing**: "It keeps track of one current state and on each iteration moves to the neighboring state with highest value."(Ch4 p.5) - 中文:爬山法只記住「現在這一個狀態」,每一輪都移到分數最高的鄰居。白話:一直往比較高的地方走一步。 ``` 中文要先把句子意思講清楚,再補一句白話;最後用「英文(中文)」列出這句裡 1–3 個難字,例:sparse(稀疏)、distinct terms(不重複的字)。 **一行只放一句投影片原句**。同一頁有多句要考就拆成多行,每行各接一行中文;不要用分號串三句以上,不要把計算量 O(...) 塞進去。 - 章節包第 2 節的每一段:`## [h:mm:ss](連結) 標題`(照抄),下面 2–4 句白話摘要,其餘全部收進摺疊: ```
問句(例:用生活例子講,BFS 在做什麼?) 內容
``` 摺疊種類(需要才放):用生活例子講?/它到底怎麼運作?/要先懂什麼?(老師假設你會的數學或概念,短版教學)/老師原話是什麼?(「原話」(h:mm:ss),只放重要的,最多 5 句)。 - 「它到底怎麼運作?」要用一組小數字把這段的演算法**真的跑 1–3 步**(例:算出梯度、更新一次、比較兩個 α),不是只示範定義的加減乘除。全章盡量沿用同一組數字,讓前一段的答案能在下一段被驗證。 - 每段正文要回答讀者最可能卡住的一個「為什麼」。投影片公式方向跟題目相反、或投影片說「解不出來」時,用一兩句講出原因,自己補的標(我補充)。 - 投影片句子停在公式前(公式在圖裡)時:Exam-ready 在粗體詞條上補公式、引號內保持原句;正文寫出同一條式子。公式圖看章節包第 6 節列出的 PNG。 - `## Self-check`:2–4 題英文考題,答案收摺疊。**至少一題考老師強調的內容**;只出 explain/why/compare 這類問答題,**不出要代數字計算的題目**(考試不考算式);不出「老師和投影片哪裡不同」這類不會考的題目。每題格式: ```
Q1. English question?(中文:中文題目) **Answer**: English answer. 中文:把答案完整講一遍(不是只翻一句),讓看不懂英文的人也知道要怎麼答。
``` - **最後一行**:章節包第 1b 節那行(下一章連結),原樣照抄。讓讀完的人直接點下一章。 - 不要把章節包或這份規則裡的指示句寫進筆記(例如「寫筆記時照投影片寫」「已改正 ASR 錯字」)。 - 長度:全文不超過 16,000 字元(跟 check_note.py 同一個數字)。**不要為了壓字數反覆刪改**(實測一章最多花 12 輪在刪字);超過時只刪進階摺疊裡的第二組算例,比喻、比較表、圖說、「老師說不用背」的提醒都不刪。 - 預設看得到的正文不放計算量 O(...)、代號對照(例如 SMART 字母)、課本出處考據,一律移進進階摺疊。 2. `chNN.concepts.json`:JSON 陣列,4–12 個考試可能問的術語,每個物件: `name`(英文)、`zh`、`type`(概念/演算法/公式/人物事件/前置知識/行政)、`signal`("老師說會考"/"老師強調"/"核心(我判斷)"/"")、`evidence`(有 signal 前兩種時必填:原句+時間)、`definition_en`(投影片原句;沒有就註明 (textbook)/(lecture)/(my wording))、`plain`(一句中文)、`a4`(≤150 字元英文,可夾極短中文;期末拼貼用的小方塊)、`time`、`slides`、`prereq`(英文名陣列)。 ### 風格鐵律 - 不用 emoji 或裝飾符號(✓✗★⚠ 都不要;→ 可以)。不用 callout。不用 `$`。時間不要用 code 樣式。 - 每個 `##` 段落最多一種視覺元素:一張圖、或一個表格、或一個 mermaid。 - 摺疊標題是問句,前面不加符號。 - 圖片最多 3 張,只放文字取代不了的圖。放法:單獨一行 `[[IMG: | 中文圖說]]`,PNG 用 `slides_to_png.py <圖片資料夾> <頁> --dpi=110` 產生。 - 考試訊號只在老師明確說時標。老師只說「不用背」「不講」就寫「注意:……」。 - 老師口誤或跟投影片不同:照投影片寫,加「注意:老師口頭說的是……」。 - 引用老師的話時,ASR 錯字改成正確的字。 ### 沒有投影片時 不要憑記憶逐字重現課本段落或數值表。英文定義用自己的話寫、句尾標 (my wording);Exam-ready 每行標「(自擬,投影片待補)」。例子只用老師講的。 ### 寫完之後(只做一次) 跑檢查: `C:\Users\user\.cache\meeting-record\venv\Scripts\python.exe C:\Users\user\.claude\scripts\check_note.py --transcript <逐字稿> --slides <投影片 txt …> --start <起> --end <訖> --vid <影片 ID>` - STYLE/VISUAL/TIME/FORMAT:全部改掉。 - QUOTE:確認是不是你改正了 ASR 錯字(是就保留),不是就改成原文或拿掉引號。 - ENGLISH:確認是不是投影片斷行造成的(是就保留),不是就改成投影片原句。 **省額度守則**:章節包裡已經有你需要的全部資料。不要再去讀整份逐字稿、整份投影片、segments.json 或手冊。一次寫好整個檔(Write 一次),檢查後集中修改。