[自然語言處理](https://app.notion.com/p/3e6fc631b03081b4a9e8f91f3411f61f) › [W1(9/10)](https://app.notion.com/p/3e7fc631b0308199953aef38ee86b0ae) › 06|影片 [1:35:36–1:47:14](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=5736s)|投影片 無投影片(Slido 問答)|上一章 [05 預訓練模型改變 NLP 做法(1:13–1:35)](https://app.notion.com/p/3e7fc631b03081c69424e055b260badc)|下一章 [07 NLP 的四個發展階段(1:47–1:59)](https://app.notion.com/p/3e7fc631b030812c8099fdb235641816)
## 重點
- 文字浮水印(藏在文字裡、只有擁有者認得出來的記號)有兩種做法:以前是插入平常不會出現的特殊符號;現在的研究是讓模型選字時偏好某些字,留下統計上的習慣。
- 有研討會在論文裡藏了「人看不到、模型讀得到」的文字,抓出把論文丟給 ChatGPT 代寫審稿意見的人,被抓到的人自己的投稿直接 desk reject(不送審就退件)。老師的立場:用 AI 輔助可以,但要自己消化、調整。
- 行政:截止前作業可重複上傳;遲交按天扣百分比、不會直接零分;作業成績可能做 normalization(依全班狀況整體調分),通常只往上調;考試以概念問答為主。
## Exam-ready
- **Text watermarking**: A text watermark is a hidden signal placed in text so that its owner can later prove where the text, or a model trained on it, came from.(自擬,投影片待補)
- 中文:文字浮水印是藏在文字裡的記號,讓擁有者之後能證明這段文字(或用它訓練出來的模型)是從哪裡來的。白話:在文章裡偷偷蓋一個只有自己看得出來的章。難字:hidden signal(隱藏的訊號)、prove(證明)。
- **Rare-symbol watermark**: An older method inserts special symbols that almost never appear in normal text, so finding them points back to the source.(自擬,投影片待補)
- 中文:比較早期的做法是插入一般文字幾乎不會出現的特殊符號,之後看到這些符號,就知道文字是從哪裡來的。白話:在自己的資料裡埋幾個怪符號當暗號。難字:insert(插入)、source(來源)。
- **Hidden-prompt trap**: Text that humans cannot see but a model can read makes an AI-written review contain unusual words, which reveals that the reviewer used AI.(自擬,投影片待補)
- 中文:人看不到、模型讀得到的隱藏文字,會讓 AI 寫出來的審稿意見出現奇怪的字眼,於是就能看出審稿人用了 AI。白話:在論文裡埋一個只有 AI 會踩的陷阱。難字:reveal(揭露)、reviewer(審稿人)。
- **Decoding**: During decoding, a language model turns its probabilities for the next word into an actual word choice, and it does not always have to pick the most probable word.(自擬,投影片待補)
- 中文:解碼時,語言模型把「下一個字各有多少機率」變成真正選出的一個字,而且不一定每次都要選機率最高的那個。白話:模型心裡有一張候選字排行榜,但不一定都挑第一名。難字:decoding(解碼)、probable(可能性高的)。
- **Sampling-based watermark**: A rule nudges the model toward certain candidate words, leaving a statistical pattern that can be detected later.(自擬,投影片待補)
- 中文:用一條規則讓模型在候選字裡偏好某些字,文字就會留下統計上的特徵,之後可以被檢查出來。白話:刻意養成一種選字的口頭禪。難字:nudge(輕推)、statistical pattern(統計上的規律)。
- **Training-data watermark**: A model trained on watermarked data tends to inherit the same word-choice pattern, which can be used as evidence that the data was used.(自擬,投影片待補)
- 中文:用帶浮水印的資料訓練出來的模型,往往會學到同樣的選字習慣,這可以當作「這個模型用了我的資料」的證據。白話:學生抄了你的筆記,連你的口頭禪都一起抄走。難字:inherit(繼承)、evidence(證據)。
## [1:35:36](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=5736s) 作業可重交、不講 SLM
有同學問作業能不能反覆提交、慢慢優化。老師說只要在截止前都可以,應該沒有限制上傳次數。這門課的作業不是「沒有標準答案、只靠 leaderboard(把大家分數排名次的榜)分高下」的那種,但會看一些表現數據,可能訂一條「至少要做到多少」的門檻。另一位同學問會不會講 SLM(small language model,小型語言模型),老師說不會特別講。
為什麼有門檻卻不排名?(我補充)門檻是確認你真的做出來了,排行榜才是拿來比高低;老師要的是前者。
生活比喻:像汽車路考,過了標準線就及格,不必跟其他考生比誰開得最好。
考試可能怎麼問:不會考,這段是行政資訊。
SLM 的研究通常在做什麼?
老師說,講到 SLM 時通常是在探討兩件事:怎麼把這種小模型做出來,或怎麼用一個比較笨的模型做到比較厲害的事。這門課目前沒有安排這個主題。
## [1:37:14](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=5834s) 遲交扣分與 MOOCs
遲交會照一張扣分表處理:晚幾天就扣百分之多少,不會直接變零分。老師真正在意的是「不要放棄」:補交最後還是會留一個基本分,不交就是零分,他不希望有人一次沒交就整門課放棄。另一個問題是清大 MOOCs(大規模開放線上課程)上的版本:老師記得那是這門課前半、比較簡單的部分,是子集(subset),上面有一些課堂練習。
為什麼扣很多還是要交?因為補交至少有基本分,不交就是零分;差距永遠是正的。
生活比喻:像圖書館逾期還書,晚越多天罰越多,但書還是要還。
考試可能怎麼問:不會考,這段是行政資訊。
老師原話是什麼?
- 「不會是直接零分啦」(1:37:28)
- 「一次沒交後來就放棄這樣子我覺得是很可惜」(1:37:46)
## [1:38:34](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=5914s) 文字浮水印:保護訓練資料
老師的實驗室正在做 watermarking(浮水印)研究。起因是找廠商授權資料來訓練模型時,廠商會問:我有什麼好處?訓練完的模型會不會被對手拿去用?所以他們希望在訓練資料裡加上浮水印。圖片的浮水印很直覺,文字比較難;以前文字的做法是插入平常不太可能出現的特殊符號,看到這個符號就知道是這份資料。
要先知道的背景:訓練資料就是拿來「教」模型的大量文字,模型讀越多某種寫法,就越會模仿那種寫法(本週[第 05 章](https://app.notion.com/p/3e7fc631b03081c69424e055b260badc)講過:預訓練模型先讀大量文字學會語言)。所以資料裡藏了記號,模型學完後也可能帶著記號。
下面這張圖是廠商希望浮水印做到的事:從資料交出去,到有一天能證明「你用了我的資料」。
```mermaid
flowchart LR
A["廠商提供訓練資料"] --> B["資料先加上浮水印"]
B --> C["拿來訓練模型"]
C --> D["模型被別人盜用"]
D --> E["在模型輸出裡找到浮水印"]
E --> F["證明用了這份資料"]
```
重點在最後兩格:浮水印要「跟著模型走」,模型被拿走後還查得到,廠商才敢把資料交出來。
為什麼文字比圖片難藏記號?(我補充)圖片有幾百萬個像素,每個偷偷改一點點,人眼看不出來;文字每個字都看得到,改一個字意思就可能變,能藏記號的空間小很多。
生活比喻:像地圖公司在自家地圖上畫一條不存在的小巷,別家地圖也出現這條巷子,就知道是抄的。
考試可能怎麼問:Why do data providers want watermarks on training data, and why is text harder to watermark than images?
老師原話是什麼?
- 「的確我們現在有做所謂的watermarking的研究」(1:38:34)
- 「會希望把training的data加上一些watermark」(1:38:52)
- 「我會加一些特殊的符號」(1:39:05)
## [1:39:12](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=5952s) 研討會抓 AI 審稿
老師說去年 ICML(國際機器學習會議)或某個研討會(老師自己也不確定是哪一場),覺得審稿人沒認真審,只把論文丟給 ChatGPT 產生審稿意見就上傳。主辦方就在論文裡加了人看不到、模型讀得到的文字;模型讀到後寫出的意見會出現一般 review 不太會有的字眼,因此抓到一批用 AI 審稿的人,他們自己的投稿直接被 desk reject。老師認為大家多少都會用 AI 輔助看論文,但要自己消化重點,不能叫 AI 直接產生 review 就上傳。
名詞白話:LLM(large language model,大型語言模型)就是 ChatGPT 這類讀過大量文字、能接著寫文章的模型;review(審稿意見)是研討會請專家看完投稿論文後寫的評語,用來決定論文收不收。
下面這張圖是整個陷阱怎麼運作,從藏字到被抓。
```mermaid
flowchart LR
A["論文裡藏入隱形文字"] --> B["審稿人把論文丟給 ChatGPT"]
B --> C["模型讀到隱形文字"]
C --> D["審稿意見出現怪字眼"]
D --> E["主辦方比對抓到"]
E --> F["該審稿人的投稿 desk reject"]
```
關鍵在第三格:人看不到的字,模型照樣讀進去,所以只有「交給 AI 寫」的人會掉進陷阱。
為什麼人看不到、模型卻讀得到?(我補充)例如白色字或極小的字,人在畫面上看不到,但模型讀的是檔案裡的文字,不管顏色和大小,會把它當成內容甚至指令。這類「藏在內容裡、讓模型照做的文字」一般稱為 prompt injection(提示注入)。老師說這某種程度上也算 watermarking。
生活比喻:像考卷裡用隱形墨水寫「請在答案裡寫香蕉」,只有用作弊工具作答的人會照做,交卷時寫了香蕉的人就被抓到。
考試可能怎麼問:Explain how hidden text in a paper can reveal reviewers who used an LLM to write their reviews.
老師原話是什麼?
- 「但是實際上看不到的」(1:39:33)
- 「不太可能在一般review出現的文字」(1:39:49)
- 「你被抓到你的submission是被直接desk reject」(1:40:06)
- 「的確我們都還是得消化一下」(1:40:26)
## [1:40:40](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=6040s) 用選字機率做浮水印
語言模型產生文字時,不一定每次都選機率最高的字。研究者利用這一點:用一張表或一個機率演算法,在「本來也說得通的候選字」裡指定這次選哪個,讓文字帶有特定的選字習慣。模型用這種資料訓練後,說話會比較像 A 公司的資料;日後模型被盜用,A 公司就能主張這個模型的 distribution(分布,各個字被選中的機率)是用自家資料訓練出來的。不過老師提醒,這在法律上不是百分之百站得住,因為很多痕跡可以被遮掉(mask),而且實際判例常常是公司賺錢了才會被告。
下面這張圖是「選字習慣」怎麼從資料傳到盜用者的模型上。
```mermaid
flowchart LR
A["模型算出下一個字的機率"] --> B["規則:候選字中偏好某些字"]
B --> C["產生帶選字習慣的資料"]
C --> D["別人拿這些資料訓練模型"]
D --> E["新模型也學到這個習慣"]
E --> F["檢查選字比例,主張資料來源"]
```
看圖時注意:浮水印不是某一個字,而是「很多字加起來的比例」,所以要看夠長的文字才驗得出來。
為什麼選字可以當浮水印?同一句話有很多種說法(「很好」「非常好」都通),選哪個不影響意思,卻會累積成統計上的習慣;一兩個字看不出來,幾百個字就很明顯。
下面進階摺疊「它到底怎麼運作?」在做什麼(白話):用三個候選字示範,給某幾個字「加分」之後,它們被選中的機會從六成升到七成五;檢查時只要數一段文字裡這些字占多少比例,明顯超過一半就代表帶浮水印。看不懂數字也沒關係,記住「加分 → 比例偏高 → 被認出來」就夠了。
生活比喻:像一個人的口頭禪,單看一句話分不出來,聽他講十分鐘就認得出是誰。
考試可能怎麼問:How can biased word choice during decoding act as a watermark, and why is it not complete legal proof?
注意:老師說 pre-training、fine-tune(微調)之後的 RL(reinforcement learning,強化學習)設計會提到,但不會叫大家做 RL,因為沒有資源訓練;Slido 上助教也回覆「會講 PEFT(LoRA),但 RL 不會講」。所以不會有 RL 作業。
這行名詞的白話:pre-training(預訓練,先讓模型讀大量文字學會語言,本週[第 05 章](https://app.notion.com/p/3e7fc631b03081c69424e055b260badc)講過);fine-tune(微調,再用少量特定資料把模型調成專做某件事);RL(強化學習,讓模型試著回答、答得好就給分數,照分數慢慢調整);PEFT/LoRA(只調模型裡一小部分參數、比較省資源的微調方法);Slido 是上課時同學匿名打字提問的網站。
要先懂什麼?模型「不選機率最高的字」是什麼意思?
模型每一步都會給所有候選字一個機率。greedy decoding(貪婪解碼)是每次都挑機率最高的字;sampling(抽樣)是照機率抽一個,所以同一個問題問兩次,答案可能不同。浮水印就是在「抽哪一個」這一步動手腳。
它到底怎麼運作?(進階,可跳過)
(我補充)研究界常見的做法叫 green list(綠色名單),老師沒講名稱,概念相同。用一組小數字跑一遍:
1. 下一個字的候選:「很」0.40、「非常」0.35、「超」0.25。一般抽樣時,選到「非常」或「超」的機會是 0.35 + 0.25 = 0.60。
2. 規則把「非常」「超」列為綠色字、「很」列為紅色字,再給綠色字加分。調整後變成「很」0.25、「非常」0.45、「超」0.30,選到綠色字的機會從 0.60 升到 0.75。意思幾乎不變,但習慣變了。
3. 檢查:假設綠色名單占全部字的一半,一般人寫的文字大約一半的字會落在綠色名單。如果一段 200 字的文字有 150 字(75%)是綠色,遠高於一半,就很可能帶浮水印。
老師講的是再往前一步:用這種資料訓練出來的模型,輸出的綠色字比例也會偏高,這就是「用了我的資料」的線索。
## [1:42:24](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=6144s) 研究用 AI 輔助的界線
有同學問研究上用 AI 輔助的界線在哪,老師說看個人道德。AI 越來越強,但做出有用的東西不是一兩次 prompt 就行;如果你跟 AI 頻繁互動、問得出重點,它給的方向和意見確實有幫助,而且沒有你的 feedback 它做不出來,所以理論上你有貢獻,只是很難界定「是 AI 做的還是你做的」。老師的底線是:學習和基本研究上,不要把 AI 給的東西直接交上去,要消化、要調整。
名詞白話:prompt(提示詞)就是你打給 AI 的那段指令或問題;feedback(回饋)是你看完 AI 的回答後,告訴它哪裡對、哪裡要改。
下面這張表把老師說的「可以」和「不行」並排。
| 老師覺得可以 |
老師覺得不行 |
| 用 AI 摘要論文,再自己確認重點 |
叫 AI 直接產生審稿意見就上傳 |
| 跟 AI 多輪討論,問出問題的重點 |
一兩次 prompt 的結果直接交給老師 |
| 拿 AI 給的方向,自己消化、調整 |
沒看懂就原封不動交上去 |
兩欄的差別只有一個:中間有沒有經過你的判斷。
為什麼「互動很多」就算你的貢獻?問題怎麼問、哪個答案要留、哪裡要改,都是你的判斷;AI 只是把你的判斷加速。
生活比喻:像跟學長討論作業,討論完自己寫是學習,直接抄他的答案就不是。
考試可能怎麼問:不會考,這段是研究倫理的討論。
老師原話是什麼?
- 「這看個人的道德吧」(1:42:28)
- 「如果沒有你的這些feedback他是做不出來的」(1:43:32)
- 「你不要只是把AI給你東西直接交上去就好了」(1:43:57)
- 「我覺得你要消化要調整」(1:44:01)
## [1:44:09](https://www.youtube.com/watch?v=EEbwXXoVQPY&t=6249s) 考試偏概念、作業會調分
有同學問考試偏理論還是計算,老師說都不是,比較偏申論,以回答概念為主,不太可能叫大家算;他提到也許一題算 TF-IDF,但馬上說好像沒什麼意義。作業方面,老師說通常提早約一個月公布;成績可能做 normalization,通常只往上調,重點在鑑別度和比重。老師也說 NTU COOL 帳號的問題會請辦公室加速處理,因為各校修課和名單匯入系統都不一樣,TAICA 要跟所有學校同步很辛苦。
名詞白話:TF-IDF 是衡量一個字對某篇文章有多重要的方法(本週[第 05 章](https://app.notion.com/p/3e7fc631b03081c69424e055b260badc)講過:在這篇常出現、在其他篇很少出現的字,分數就高);NTU COOL 是這門課看公告、交作業的線上教學平台;TAICA 是臺灣大專院校人工智慧學程聯盟,讓各校學生可以跨校修這門課。
下面這張表整理這段和 Slido 上跟考試、作業有關的回答。
| 問題 |
答案 |
| 考試型態 |
概念問答(申論)為主,不考算式 |
| 考試語言 |
可以用英文作答(Slido 助教回覆) |
| 作業什麼時候公布 |
老師說通常提早約一個月公布 |
| 作業可以做多久 |
有 2–3 週可以繳交(Slido 助教回覆) |
| 成績會不會調 |
可能做 normalization,通常只往上調 |
「公布時間」和「繳交期限」是兩件事,不要混在一起看。
注意:老師這裡隨口提到「也許算一題 TF-IDF」,之後第 3 週的課老師明確說不考算式,以後者為準。準備方向是能用英文把概念講清楚。
為什麼只往上調?老師說調高大家比較不會有怨氣,所以作業會出難一點再往上調;如果本來很高分又調低,抗議信會多到看不完。
生活比喻:像期末的「開根號乘以十」,只會把分數拉高,不會拉低。
考試可能怎麼問:這段本身不考,但它告訴你準備方向是「用文字解釋概念」。
老師原話是什麼?
- 「就是回答一些概念的啦我不太可能叫你們算」(1:44:16)【老師說會考】
- 「會跟你們講一下可能會考什麼」(1:45:23)
- 「可能會調啦因為就是做一個Normalization這樣子」(1:46:09)
- 「重點都還是在於鑑別度跟這個整個比重」(1:46:36)
## Self-check
Q1. How can a conference use hidden text to catch reviewers who let an LLM write their reviews, and why does it work?(中文:研討會怎麼用隱藏文字抓出讓 LLM 代寫審稿意見的人?為什麼有效?)
**Answer**: The organizers add text to the paper that humans cannot see but a model still reads. If a reviewer pastes the paper into an LLM, the model reacts to the hidden text, so the generated review contains unusual words that a normal human review would not include. Finding those words reveals AI-written reviews. It works because the model reads the raw text no matter how it is displayed, while a human reviewer never sees it.
中文:主辦方在論文裡加入人看不到、但模型讀得到的文字。審稿人如果把論文丟給 LLM,模型會對這段隱藏文字起反應,寫出的審稿意見就會出現一般人不會寫的怪字眼;主辦方找到這些字眼,就知道是 AI 寫的。有效的原因是:模型讀的是檔案裡的原始文字,不管它怎麼顯示,而真的自己讀論文的人根本看不到那段字,不會中招。
Q2. Explain how biasing word choice during decoding can serve as a watermark for training data, and why it is not complete legal proof.(中文:說明在解碼時偏好某些字,為什麼能當訓練資料的浮水印?為什麼它不是完整的法律證據?)
**Answer**: A language model does not have to pick the most probable word, so a rule can push it toward certain equally reasonable words. Over many words this creates a statistical pattern. If another model is trained on this data, it tends to inherit the same pattern, so the data owner can check the model's word distribution and argue that their data was used. It is not complete proof because the pattern can be masked or weakened, and the evidence is statistical rather than certain.
中文:語言模型不一定要選機率最高的字,所以可以用規則讓它在意思差不多的候選字裡偏好某些字;字一多,就形成統計上的選字習慣。別人用這份資料訓練模型,新模型也會學到同樣的習慣,資料擁有者就能檢查那個模型的選字分布,主張「你用了我的資料」。但這不是完整證據,因為痕跡可以被遮掉或變弱,而且它只是統計上的線索,不是百分之百確定。
Q3. Compare the older rare-symbol method with the newer word-choice method of text watermarking.(中文:比較文字浮水印的舊做法「特殊符號」和新做法「選字習慣」。)
**Answer**: The rare-symbol method inserts special characters that almost never appear in normal text; it is simple and easy to detect, but it is also easy to find and delete. The word-choice method hides the mark in which words are chosen, so the text still reads normally and there is no single symbol to remove. However, it needs a long enough text to detect, and the result is a statistical judgment rather than a clear yes or no.
中文:舊做法是插入一般文字幾乎不會出現的特殊符號,簡單、好檢查,但別人也很容易找到並刪掉。新做法把記號藏在「選了哪個字」裡,文字讀起來完全正常,也沒有單一符號可以刪。缺點是文字要夠長才驗得出來,而且結果是統計上的判斷,不是明確的有或沒有。
Q4. The instructor said the exam focuses on concepts rather than calculation. Explain in words, without a formula, what TF-IDF measures.(中文:老師說考試以概念為主、不考計算。不用公式,用文字說明 TF-IDF 在衡量什麼。)
**Answer**: TF-IDF gives a word a high weight when it appears often in a particular document (term frequency) but rarely across the whole collection (inverse document frequency). Common words such as "the" appear everywhere, so they get low weights, while words that are distinctive for that document get high weights. This helps represent documents and rank search results.
中文:TF-IDF 衡量一個字對某一篇文件有多重要:這個字在這篇出現得多(TF,詞頻),而在所有文件裡很少出現(IDF,逆文件頻率),權重就高。像 "the" 這種到處都有的字權重很低,只在這篇特別常出現的字權重很高。它可以用來表示文件內容、幫搜尋結果排序(TF-IDF 在第 05 章講過)。答題時照這個方向用文字講清楚即可,不用寫公式。
讀完了嗎?下一章:[07 NLP 的四個發展階段(1:47–1:59)](https://app.notion.com/p/3e7fc631b030812c8099fdb235641816)|回到週頁:[W1(9/10)](https://app.notion.com/p/3e7fc631b0308199953aef38ee86b0ae)