結論:教材越多,整體正確率越高,但教材字數每多一倍,正確率只多約 1 個百分點(46.12% → 47.15% → 48.39%)。語法類的進步超過雜訊;語意類加總的進步比雜訊小,分不出來。
為什麼要先有這把尺:同樣的教材、同樣的設定,只換亂數種子重新訓練,正確率也不會一模一樣(第 6 節例外 2)。如果兩個結果的差,比「換種子造成的差」還小,就分不出是真的有差、還是換種子造成的。
定義(照做):5% 教材、設定全同,只換種子(42、1、2、3)各訓練一次,共 4 次。4 個正確率的最高 − 最低,就叫「雜訊」。
⟦IMG:noise_ruler⟧
第 1 小步:4 次的整體正確率是 46.12、46.05、47.10、46.34。最高 47.10,最低 46.05。
第 2 小步:相減:雜訊 = 47.10 − 46.05 = 1.05 個百分點。
第 3 小步:拿來比:5% → 20% 整體差 48.39 − 46.12 = 2.27。2.27 > 1.05,所以算「超過雜訊」。
反例(語意類):4 次是 55.35、54.18、55.98、54.72,雜訊 = 55.98 − 54.18 = 1.80。5% → 20% 只差 56.70 − 55.35 = 1.35。1.35 < 1.80,所以不算。
規則:兩個結果的差(不管變好或變壞),要比雜訊大,才說「超過雜訊」。每個小類各有自己的雜訊(In [34] 最右欄)。
5%、10%、20% 是同一批文章抽出來的(第 5 節),但有兩個附帶差異,也會影響正確率:
| 5% | 10% | 20% | 5%→20% | 雜訊 | 判斷 | |
|---|---|---|---|---|---|---|
| 教材字數 | 1.66 億 | 3.33 億 | 6.66 億 | |||
| 收錄門檻 | 9 次 | 16 次 | 30 次 | |||
| 訓練時間 | 9.1 分 | 19.7 分 | 37.9 分 | |||
| 查不到字的題目 | 107 | 0 | 0 |
判斷欄的讀法:「明顯超過」=差距至少是雜訊的 1.5 倍;「超過,只當參考」=有超過雜訊,但不到 1.5 倍(雜訊只用 4 個種子、只在 5% 量過,剛好超過的不太可靠);「沒超過」=分不出來。這條 1.5 倍是本說明額外加的保守讀法,變好、變壞一律照同一條;第 10、12 節的表照筆記本的 beyond noise?,只看有沒有超過;剛好超過(不到 1.5 倍)的,會在文中註明「只當參考」。數字來自 In [31]、In [34]。(邊界例:動詞第三人稱 3.10 ÷ 2.07 = 1.498,差一點才到 1.5 倍,所以判「只當參考」。)
| 觀察 | 原因 |
|---|---|
| 教材每多一倍,整體約多 1 個百分點(+1.03、+1.24),訓練時間卻跟著加倍。 | (推論)常見的字在 5% 就出現很多次了,多出來的教材主要幫到少見的字。 |
| 語法類超過雜訊:+3.03,比雜訊 1.26 大;最高級 +7.31、反義字首 +4.19 也明顯超過。 | (推論)biggest、worst、unaware 這些字形本來就少見,要多讀一點才學得穩。 |
| 語意類加總沒超過雜訊:+1.35,比雜訊 1.80 小。 | 五個語意小類都超過各自的雜訊,但方向不一:家人/性別、全世界首都、貨幣上升,常見國家首都、美國城市在哪州下降,加總後互相抵消。其中只有貨幣超過 1.5 倍,其他四個(不管上升或下降)都只當參考。 |
| 5% 有 107 題查不到字,10% 以後沒有。 | 有些考題的字在 5% 裡出現不到 9 次(收錄門檻),沒收進字典。 |
結論:「最像的字」(鄰居)常常不是人想的那樣,原因可以分成四種(下面觀察 ①~④);觀察 ⑤ 是兩個比較「正常」的字,當對照。
| 字 | 為什麼挑它 |
|---|---|
| king | 考卷裡的字,當比較的起點 |
| cat | 老師說做完作業會發現熟悉的字附近不是你想的(W3 00:04:34–00:05:43),驗證看看 |
| apple、bank | 一字多義(水果/公司;銀行/河岸) |
| good | 看反義詞會不會跑進來 |
| taiwan | 專有名詞 |
| computer | 一般名詞,當比較基準 |
| 字 | GloVe 字典 | Wiki 20% 字典 |
|---|---|---|
| king | prince, queen, son, brother, monarch | nangklao, chlothar, queen, suryavarman, bodawpaya |
| cat | dog, rabbit, cats, monkey, pet | rabbit, dog, sourpuss, mouse, pet |
| apple | microsoft, ibm, intel, software, dell | blackberry, iphone, goldieblox, tvos, raspberry |
| bank | banks, banking, credit, investment, financial | guaranty, savings, ameriprise, indymac, onewest |
| good | better, sure, really, kind, very | sure, decent, lovely, bad, thankful |
| taiwan | mainland, china, taiwanese, taipei, hong | taipei, china, guangdong, hainan, fujian |
| computer | computers, software, technology, pc, hardware | computing, computers, software, mainframe, hardware |
兩本字典的相似度尺度不同,只能比「各自的排名」,不能拿相似度互相比大小。
筆記本印出了每個鄰居在 20% 維基裡出現幾次:
| 字 | 鄰居(出現次數) |
|---|---|
| king | nangklao(34,泰國國王,外部知識)、chlothar(76)、queen(92,609)、suryavarman(53)、bodawpaya(77) |
| bank | guaranty(330)、savings(8,467)、ameriprise(49)、indymac(86)、onewest(38) |
其中 nangklao、chlothar、suryavarman、bodawpaya、ameriprise、indymac、onewest 只出現 34~86 次,在 30 萬字的字典裡屬於最冷門的一群(收錄門檻是 30 次)。(推論)一個字只出現幾十次,而且幾乎每次都在國王或銀行的文章裡,它的詞向量就被拉到 king、bank 旁邊。
證據:只在「最常見的 5 萬個字」裡找鄰居,冷門字被排除,king 變成 queen, throne, prince, reigned, ruler;bank 變成 savings, bancorp, banking, lenders, jpmorgan——合理多了。
good 的鄰居有 bad,相似度 0.70(In [33])。「這部電影很 ___」兩個字都能填,前後文相似,詞向量分不出正反(推論)。
這就是「一個字只有一個詞向量」的限制。老師投影片 W1 p60 正是用 bank 舉例;要解決要用上下文詞向量(BERT,W2 p39)。
先講 cat 的驗證結果:cat 的鄰居大多還是動物(rabbit、dog、mouse、pet),只有 sourpuss 一個怪字。所以老師說的現象在 cat 身上不明顯,在 king、bank 身上比較明顯(觀察 ①)。
那 sourpuss 是什麼?筆記本回到教材搜尋,印出的前 5 處前後文裡,有 2 處是卡通角色名單(「toon characters including … gandy goose sourpuss dinky duck …」),其餘是字源說明、電視集名、樂團名。(Sourpuss 是老卡通 Terrytoons 裡的一隻貓——這點是外部知識,教材裡沒寫。)它只出現 64 次、而且(推論)5 處裡有 2 處和動物卡通角色並列,可能因此被拉到 cat 旁邊。
taiwan 的鄰居兩本字典都有 taipei、china;GloVe 字典另外是 mainland、taiwanese、hong,Wiki 20% 字典另外是 guangdong、hainan、fujian 三個中國沿海省份(省份是外部知識)。(推論)教材常把台灣和兩岸、華南地區放在同樣的前後文裡寫,所以詞向量很近。computer 的鄰居兩邊都是同類詞(computers、software、hardware),是 7 個字裡最「乖」的一組(推論:一般名詞、用法單一時,詞向量比較符合直覺;這裡只看了 computer 一個字)。