結論:資料越多,整體越好,但每多一倍只多約 1 分(46.12 → 47.15 → 48.39)。語法類的進步是真的(超過雜訊),語意類的進步太小、分不出是不是雜訊。
同樣的設定、只換亂數種子,訓練 4 次,結果不會一模一樣(第 12 節實驗 ①)。最高和最低差多少,就叫「雜訊範圍」。
規則:兩個結果的差距,要比雜訊範圍大,才能說「真的有差」。比雜訊小的,可能只是運氣。
| 5% | 10% | 20% | 5%→20% | 雜訊範圍 | 算數嗎? | |
|---|---|---|---|---|---|---|
| 教材字數 | 1.66 億 | 3.33 億 | 6.66 億 | |||
| 實際字典門檻 | 9 次 | 16 次 | 30 次 | |||
| 訓練時間 | 9.1 分 | 19.7 分 | 37.9 分 | |||
| 整體 | 46.12 | 47.15 | 48.39 | +2.27 | 1.05 | 算 |
| 語意 | 55.35 | 55.60 | 56.70 | +1.35 | 1.80 | 不算 |
| 語法 | 38.45 | 40.13 | 41.48 | +3.03 | 1.26 | 算 |
| 最高級 | 17.02 | 22.37 | 24.33 | +7.31 | 2.76 | 算 |
| 反義字首 | 11.82 | 14.29 | 16.01 | +4.19 | 2.22 | 算 |
| 家人 | 68.77 | 73.32 | 74.31 | +5.54 | 4.74 | 勉強 |
| 常見國家首都 | 81.82 | 76.48 | 77.87 | −3.95 | 2.77 | 勉強 |
| 查不到字的題目 | 107 | 0 | 0 |
| 觀察 | 原因 |
|---|---|
| 每多一倍資料,整體約多 1 分(+1.03、+1.24),訓練時間卻跟著加倍。 | (推論)常見的字在 5% 就出現很多次了,多出來的資料主要幫到少見的字。 |
| 語法類進步是真的:+3.03,比雜訊 1.26 大;最高級 +7.31、反義字首 +4.19 也都超過雜訊。 | (推論)biggest、worst、unaware 這些字形本來就少見,要多讀一點才學得穩。 |
| 語意類進步不能算:+1.35,比雜訊 1.80 還小。 | 語意類的五個小類都超過各自的雜訊,但方向不一:家人 +5.54、全世界首都 +2.98、貨幣 +2.66 上升,常見國家首都 −3.95、美國城市在哪州 −1.86 下降,加總後互相抵消。所以不是「語意類學夠了」,而是加總看不出明確方向。 |
| 5% 有 107 題查不到字,10% 以後沒有。 | 有些考題的字在 5% 裡出現不到 9 次(門檻),沒收進字典。 |
| 常見國家首都反而降了 3.95。 | 超過雜訊 2.77,但雜訊只用 4 個種子、在 5% 量過;所以只說「語意類沒有隨資料穩定上升」,不當成「資料多反而變差」的證據。 |
結論:「最像的字」常常不是人想的那樣。四個最重要的觀察:①冷門字會擠進鄰居名單(king 的第一名是只出現 34 次的泰國國王);②反義詞很近(good 的鄰居有 bad);③一字多義被常見意思蓋掉(apple 前 15 名全是科技);④鄰居反映教材內容(cat 的鄰居有只出現 64 次的 sourpuss)。
| 字 | 為什麼挑它 |
|---|---|
| king | 考卷裡的字,當基準 |
| cat | 老師上課說「貓的鄰居常常不是貓」,驗證看看 |
| apple、bank | 一字多義(水果/公司;銀行/河岸) |
| good | 看反義詞會不會跑進來 |
| taiwan | 專有名詞 |
| computer | 一般名詞,對照組 |
| 字 | GloVe(現成) | 自己的 Wiki 20% |
|---|---|---|
| king | prince, queen, son, brother, monarch | nangklao, chlothar, queen, suryavarman, bodawpaya |
| cat | dog, rabbit, cats, monkey, pet | rabbit, dog, sourpuss, mouse, pet |
| apple | microsoft, ibm, intel, software, dell | blackberry, iphone, goldieblox, tvos, raspberry |
| bank | banks, banking, credit, investment, financial | guaranty, savings, ameriprise, indymac, onewest |
| good | better, sure, really, kind, very | sure, decent, lovely, bad, thankful |
| taiwan | mainland, china, taiwanese, taipei, hong | taipei, china, guangdong, hainan, fujian |
| computer | computers, software, technology, pc, hardware | computing, computers, software, mainframe, hardware |
兩個模型的相似度分數尺度不同,只能比「各自的排名」,不能拿分數互相比大小。
筆記本印出了每個鄰居在 20% 維基裡出現幾次:
| 字 | 鄰居(出現次數) |
|---|---|
| king | nangklao(34,泰國國王)、chlothar(76)、queen(92,609)、suryavarman(53)、bodawpaya(77) |
| bank | guaranty(330)、savings(8,467)、ameriprise(49)、indymac(86)、onewest(38) |
這些字都只出現幾十次(34~86 次),在 30 萬字的字典裡屬於最冷門的一群(字典門檻是 30 次)。(推論)一個字只出現幾十次,而且幾乎每次都在國王或銀行的文章裡,它的座標就被拉到 king、bank 旁邊。
證據:只在「最常見的 5 萬個字」裡找鄰居,冷門字被排除,king 變成 queen, throne, prince, reigned, ruler;bank 變成 savings, bancorp, banking, lenders, jpmorgan——合理多了。
good 的鄰居有 bad,相似度 0.70。「這部電影很 ___」兩個字都能填,前後文相似,詞向量分不出正反。
這就是「一個字只有一組座標」的限制。老師投影片 W1 p60 正是用 bank 舉例;要解決要用上下文詞向量(BERT,W2 p39)。
cat 的鄰居 sourpuss 是什麼?筆記本回到教材搜尋,印出的前 5 處上下文裡,有 2 處是卡通角色名單(「toon characters including … gandy goose sourpuss dinky duck …」),其餘是字源說明、電視集名、樂團名。(Sourpuss 是老卡通 Terrytoons 裡的一隻貓——這點是外部知識,語料裡沒寫。)它只出現 64 次、而且(推論)5 處裡有 2 處和動物卡通角色並列,可能因此被拉到 cat 旁邊。
taiwan 在兩個模型的鄰居都是中國的地名與省份(taipei、china、guangdong、fujian),反映語料中的地理與歷史脈絡。computer 的鄰居兩邊都是同類詞(computers、software、hardware),是 7 個字裡最「乖」的一組——一般名詞、用法單一時,詞向量最符合直覺。