9 報告第 2 題:讀 5%、10%、20%,差多少?(10%)

結論:資料越多,整體越好,但每多一倍只多約 1 分(46.12 → 47.15 → 48.39)。語法類的進步是真的(超過雜訊),語意類的進步太小、分不出是不是雜訊。

先學會一把尺:雜訊

同樣的設定、只換亂數種子,訓練 4 次,結果不會一模一樣(第 12 節實驗 ①)。最高和最低差多少,就叫「雜訊範圍」。

規則:兩個結果的差距,要比雜訊範圍大,才能說「真的有差」。比雜訊小的,可能只是運氣。

成績

5%10%20%5%→20%雜訊範圍算數嗎?
教材字數1.66 億3.33 億6.66 億
實際字典門檻9 次16 次30 次
訓練時間9.1 分19.7 分37.9 分
整體46.1247.1548.39+2.271.05算
語意55.3555.6056.70+1.351.80不算
語法38.4540.1341.48+3.031.26算
最高級17.0222.3724.33+7.312.76算
反義字首11.8214.2916.01+4.192.22算
家人68.7773.3274.31+5.544.74勉強
常見國家首都81.8276.4877.87−3.952.77勉強
查不到字的題目10700

報告要點:數字 → 觀察 → 原因

觀察原因
每多一倍資料,整體約多 1 分(+1.03、+1.24),訓練時間卻跟著加倍。常見的字在 5% 就出現夠多次了,多出來的資料主要幫到少見的字。
語法類進步是真的:+3.03,比雜訊 1.26 大;最高級 +7.31、反義字首 +4.19 也都超過雜訊。(推論)biggest、worst、unaware 這些字形本來就少見,要多讀一點才學得穩。
語意類進步不能算:+1.35,比雜訊 1.80 還小。首都、國家這些字很常見,5% 就學得差不多了,再加資料的差別被雜訊蓋過。
5% 有 107 題查不到字,10% 以後沒有。有些考題的字在 5% 裡出現不到 9 次(門檻),沒收進字典。
常見國家首都反而降了 3.95。只比雜訊 2.77 大一點,而且這類只有 506 題,不當成「資料多反而變差」的證據。
要誠實寫的限制
雜訊是用 5% 量的,20% 的雜訊可能不一樣。所以報告只說「在 5% 量到的雜訊下」。
考試可能問
「資料變多,結果一定變好嗎?」→ 整體會小幅變好,但要跟雜訊比;語法類(少見字形)受益比較多,語意類(常見字)幾乎沒差。
「什麼叫實驗的雜訊?怎麼量?」→ 同設定換亂數種子重跑幾次,看結果晃多大。

11 報告第 4 題:挑字,各找最像的 5 個字(10%)

結論:「最像的字」常常不是人想的那樣。四個最重要的觀察:①冷門字會擠進鄰居名單(king 的第一名是只出現 34 次的泰國國王);②反義詞很近(good 的鄰居有 bad);③一字多義被常見意思蓋掉(apple 前 15 名全是科技);④鄰居反映教材內容(cat 的鄰居是卡通貓)。

挑字的原則(這也是加分點)

字為什麼挑它
king考卷裡的字,當基準
cat老師上課說「貓的鄰居常常不是貓」,驗證看看
apple、bank一字多義(水果/公司;銀行/河岸)
good看反義詞會不會跑進來
taiwan專有名詞
computer一般名詞,對照組

結果

字GloVe(現成)自己的 Wiki 20%
kingprince, queen, son, brother, monarchnangklao, chlothar, queen, suryavarman, bodawpaya
catdog, rabbit, cats, monkey, petrabbit, dog, sourpuss, mouse, pet
applemicrosoft, ibm, intel, software, dellblackberry, iphone, goldieblox, tvos, raspberry
bankbanks, banking, credit, investment, financialguaranty, savings, ameriprise, indymac, onewest
goodbetter, sure, really, kind, verysure, decent, lovely, bad, thankful
taiwanmainland, china, taiwanese, taipei, hongtaipei, china, guangdong, hainan, fujian
computercomputers, software, technology, pc, hardwarecomputing, computers, software, mainframe, hardware

兩個模型的相似度分數尺度不同,只能比「各自的排名」,不能拿分數互相比大小。

觀察 ①:冷門字會擠進鄰居名單

筆記本印出了每個鄰居在 20% 維基裡出現幾次:

字鄰居(出現次數)
kingnangklao(34,泰國國王)、chlothar(76)、queen(92,609)、suryavarman(53)、bodawpaya(77)
bankguaranty(330)、savings(8,467)、ameriprise(49)、indymac(86)、onewest(38)

字典門檻是 30 次,這些冷門字剛好卡在門檻上方。(推論)一個字只出現幾十次,而且幾乎每次都在國王或銀行的文章裡,它的座標就被拉到 king、bank 旁邊。

證據:只在「最常見的 5 萬個字」裡找鄰居,冷門字被排除,king 變成 queen, throne, prince, reigned, ruler;bank 變成 savings, bancorp, banking, lenders, jpmorgan——合理多了。

觀察 ②:反義詞很近

good 的鄰居有 bad,相似度 0.70。「這部電影很 ___」兩個字都能填,前後文一樣,詞向量分不出正反。

觀察 ③:一字多義被常見的意思蓋掉

這就是「一個字只有一組座標」的限制。老師投影片 W1 p60 正是用 bank 舉例;要解決要用上下文詞向量(BERT,W2 p39)。

觀察 ④:鄰居反映教材內容

cat 的鄰居 sourpuss 是什麼?筆記本回到教材搜尋,找到「toon characters including … gandy goose sourpuss dinky duck …」——是一隻卡通貓的名字。印證老師說的「貓的鄰居不一定是貓」。

考試可能問
「為什麼 good 跟 bad 會很像?」→ 前後文相似;詞向量學的是分布,不是意思。
「一個字兩種意思,詞向量怎麼處理?」→ 只有一組座標,兩種意思混在一起,常見的意思主導排名(但少見的意思還在,例如 bank–river 0.49)。
「鄰居名單出現怪字,可能的原因?」→ 冷門字只出現幾十次、上下文單一,座標被拉到特定字旁邊。