9 報告第 2 題:讀 5%、10%、20%,差多少?(配分 10%)

結論:教材越多,整體正確率越高,但教材字數每多一倍,正確率只多約 1 個百分點(46.12% → 47.15% → 48.39%)。語法類的進步超過雜訊;語意類加總的進步比雜訊小,分不出來。

先學會一把尺:雜訊

為什麼要先有這把尺:同樣的教材、同樣的設定,只換亂數種子重新訓練,正確率也不會一模一樣(第 6 節例外 2)。如果兩個結果的差,比「換種子造成的差」還小,就分不出是真的有差、還是換種子造成的。

定義(照做):5% 教材、設定全同,只換種子(42、1、2、3)各訓練一次,共 4 次。4 個正確率的最高 − 最低,就叫「雜訊」。

手算一次(數字來自 In [34])

⟦IMG:noise_ruler⟧

第 1 小步:4 次的整體正確率是 46.12、46.05、47.10、46.34。最高 47.10,最低 46.05。

第 2 小步:相減:雜訊 = 47.10 − 46.05 = 1.05 個百分點。

第 3 小步:拿來比:5% → 20% 整體差 48.39 − 46.12 = 2.27。2.27 > 1.05,所以算「超過雜訊」。

反例(語意類):4 次是 55.35、54.18、55.98、54.72,雜訊 = 55.98 − 54.18 = 1.80。5% → 20% 只差 56.70 − 55.35 = 1.35。1.35 < 1.80,所以不算。

規則:兩個結果的差(不管變好或變壞),要比雜訊大,才說「超過雜訊」。每個小類各有自己的雜訊(In [34] 最右欄)。

看成績之前的前提:三份教材不只差在字數

5%、10%、20% 是同一批文章抽出來的(第 5 節),但有兩個附帶差異,也會影響正確率:

  1. 收錄門檻不同:9 次、16 次、30 次(第 6 節例外 1)。
  2. 5% 有 107 題查不到字,直接算答錯;10%、20% 是 0 題。107 題佔 19,544 題的 0.55%,所以 +2.27 個百分點裡,最多 0.55 個百分點可能來自「查得到的字變多」(推算的上限:假設這 107 題到了 20% 全部答對)。

成績(全部 14 個小類都列出來)

⟦R:q2_rows⟧
5%10%20%5%→20%雜訊判斷
教材字數1.66 億3.33 億6.66 億
收錄門檻9 次16 次30 次
訓練時間9.1 分19.7 分37.9 分
查不到字的題目10700

判斷欄的讀法:「超過雜訊」=差距至少是雜訊的 1.5 倍;「超過,只當參考」=有超過雜訊,但不到 1.5 倍(雜訊只用 4 個種子、只在 5% 量過,剛好超過的不太可靠);「沒超過」=分不出來。這條 1.5 倍是本說明額外加的保守讀法,變好、變壞一律照同一條;筆記本的 beyond noise? 欄只看有沒有超過。數字來自 In [31]、In [34]。

報告要點:數字 → 觀察 → 原因

觀察原因
教材每多一倍,整體約多 1 個百分點(+1.03、+1.24),訓練時間卻跟著加倍。(推論)常見的字在 5% 就出現很多次了,多出來的教材主要幫到少見的字。
語法類超過雜訊:+3.03,比雜訊 1.26 大;最高級 +7.31、反義字首 +4.19 也明顯超過。(推論)biggest、worst、unaware 這些字形本來就少見,要多讀一點才學得穩。
語意類加總沒超過雜訊:+1.35,比雜訊 1.80 小。五個語意小類都超過各自的雜訊,但方向不一:家人/性別、全世界首都、貨幣上升,常見國家首都、美國城市在哪州下降,加總後互相抵消。其中只有貨幣超過 1.5 倍,其他四個(不管上升或下降)都只當參考。
5% 有 107 題查不到字,10% 以後沒有。有些考題的字在 5% 裡出現不到 9 次(收錄門檻),沒收進字典。
要誠實寫的限制
雜訊是用 5% 量的,20% 的雜訊可能不一樣。所以報告只說「在 5% 量到的雜訊下」。而且每份教材只訓練了一次(單次實驗)。
考試可能問
「教材變多,結果一定變好嗎?」→ 整體會小幅變好,但要跟雜訊比;語法類超過雜訊;語意類加總沒超過雜訊,小類有升有降。
「什麼叫實驗的雜訊?怎麼量?」→ 同設定換亂數種子重跑幾次,看最高與最低正確率差多少。
所以對你的影響是:報告第 2 題一定要寫「跟雜訊比」。只寫「越多越好」,會被問倒。

11 報告第 4 題:挑字,各找最像的 5 個字(配分 10%)

結論:「最像的字」(鄰居)常常不是人想的那樣,原因可以分成四種(下面觀察 ①~④)。

挑字的原則(這也是加分點)

字為什麼挑它
king考卷裡的字,當基準
cat老師說做完作業會發現熟悉的字附近不是你想的(W3 00:04:34–00:05:27),驗證看看
apple、bank一字多義(水果/公司;銀行/河岸)
good看反義詞會不會跑進來
taiwan專有名詞
computer一般名詞,當比較基準

結果

字GloVe 字典Wiki 20% 字典
kingprince, queen, son, brother, monarchnangklao, chlothar, queen, suryavarman, bodawpaya
catdog, rabbit, cats, monkey, petrabbit, dog, sourpuss, mouse, pet
applemicrosoft, ibm, intel, software, dellblackberry, iphone, goldieblox, tvos, raspberry
bankbanks, banking, credit, investment, financialguaranty, savings, ameriprise, indymac, onewest
goodbetter, sure, really, kind, verysure, decent, lovely, bad, thankful
taiwanmainland, china, taiwanese, taipei, hongtaipei, china, guangdong, hainan, fujian
computercomputers, software, technology, pc, hardwarecomputing, computers, software, mainframe, hardware

兩本字典的相似度尺度不同,只能比「各自的排名」,不能拿相似度互相比大小。

觀察 ①:冷門字會擠進鄰居名單

筆記本印出了每個鄰居在 20% 維基裡出現幾次:

字鄰居(出現次數)
kingnangklao(34,泰國國王,外部知識)、chlothar(76)、queen(92,609)、suryavarman(53)、bodawpaya(77)
bankguaranty(330)、savings(8,467)、ameriprise(49)、indymac(86)、onewest(38)

其中 nangklao、chlothar、suryavarman、bodawpaya、ameriprise、indymac、onewest 只出現 34~86 次,在 30 萬字的字典裡屬於最冷門的一群(收錄門檻是 30 次)。(推論)一個字只出現幾十次,而且幾乎每次都在國王或銀行的文章裡,它的詞向量就被拉到 king、bank 旁邊。

證據:只在「最常見的 5 萬個字」裡找鄰居,冷門字被排除,king 變成 queen, throne, prince, reigned, ruler;bank 變成 savings, bancorp, banking, lenders, jpmorgan——合理多了。

觀察 ②:反義詞很近

good 的鄰居有 bad,相似度 0.70(In [33])。「這部電影很 ___」兩個字都能填,前後文相似,詞向量分不出正反(推論)。

觀察 ③:一字多義被常見的意思蓋掉

這就是「一個字只有一個詞向量」的限制。老師投影片 W1 p60 正是用 bank 舉例;要解決要用上下文詞向量(BERT,W2 p39)。

觀察 ④:鄰居反映教材內容

先講 cat 的驗證結果:cat 的鄰居大多還是動物(rabbit、dog、mouse、pet),只有 sourpuss 一個怪字。所以老師說的現象在 cat 身上不明顯,在 king、bank 身上比較明顯(觀察 ①)。

那 sourpuss 是什麼?筆記本回到教材搜尋,印出的前 5 處前後文裡,有 2 處是卡通角色名單(「toon characters including … gandy goose sourpuss dinky duck …」),其餘是字源說明、電視集名、樂團名。(Sourpuss 是老卡通 Terrytoons 裡的一隻貓——這點是外部知識,教材裡沒寫。)它只出現 64 次、而且(推論)5 處裡有 2 處和動物卡通角色並列,可能因此被拉到 cat 旁邊。

觀察 ⑤:taiwan 和 computer

taiwan 在兩本字典的鄰居都是中國的地名與省份(taipei、china、guangdong、fujian),可能反映教材中的地理與歷史脈絡(推論)。computer 的鄰居兩邊都是同類詞(computers、software、hardware),是 7 個字裡最「乖」的一組——一般名詞、用法單一時,詞向量最符合直覺。

考試可能問
「為什麼 good 跟 bad 會很像?」→ 前後文相似;詞向量學的是分布,不是意思。
「一個字兩種意思,詞向量怎麼處理?」→ 只有一個詞向量,兩種意思混在一起,常見的意思主導排名(推論:少見的意思可能還在,例如 bank–river 0.49 高於 bank–money 0.40)。
「鄰居名單出現怪字,可能的原因?」→ 冷門字只出現幾十次、前後文單一,詞向量被拉到特定字旁邊。
所以對你的影響是:報告第 4 題要「挑字有理由、每個觀察有證據」;冷門字那條要附出現次數,cat 這種不支持預期的結果也要照實寫。