總結論:整份作業學到的 8 件事

結論:詞向量真的能抓到字的關係,但它是從「前後文相似」學來的,所以讀多少、讀什麼、怎麼整理、怎麼學都會改變它學到的東西;它也有一字一向量的根本限制。下面 8 件事,每一件都有筆記本的數字當證據。

#結論證據(繳交版筆記本的數字)對應投影片/上課
1字可以變成有意義的座標,關係大致可以用加減算出來GloVe 答對 63.11%;t-SNE 圖上男女配對貼在一起、按角色分群W2 p30(Washington − U.S. + U.K. = London);W3 00:28 老師:看的是「對比關係」
2座標是從「前後文相似」學來的,不是從「意思」good 的鄰居有 bad(0.70);論壇裡 salary 的鄰居是錯字 slary;cat 的鄰居是卡通貓 sourpussW1 p70、W2 p24(分布假說)
3資料越多越好,但幅度小,而且主要幫到少見的字形5%→10%→20%:46.12→47.15→48.39;語法類 +3.03(超過雜訊)、語意類 +1.35(沒超過雜訊)—
4資料種類決定學到哪些關係一樣大小下,論壇語意類 12.84 vs 維基 45.77,但最高級 40.55 vs 17.20;只算兩邊都查得到的題目,結果方向不變。cheapest 在論壇的頻率是維基的 28.64 倍,illinois 只有 0.01 倍W1 p93(It depends)
5前處理沒有絕對的好壞,要看任務刪停用詞:整體 −0.87(在雜訊內),但家人 −14.82、動詞第三人稱 −11.26(超過雜訊)W1 p47;W2 01:39:50(停用詞「現在不會去做」)
6在這份作業的設定下,模型設定的影響比資料量大300 維只用 5% 資料(57.44)就贏過 100 維的 20%(48.39);CBOW +6.46;window 10 −4.37。但每個只做一次W3 01:22:17(維度不是越大越好)、01:12:12(老師用 Skip-gram)
7評估方式本身也有限制前 3 名命中率比第 1 名高 13 分;45% 的錯題正確答案在前 10 名;有些「錯」只是拼法不同(argentinian/argentinean);同設定重跑,整體晃 1.05、小類晃到 4.74;3CosMul 反而較差W3 00:31 老師:queen「可能在前三名」
8一字一向量是根本限制apple 前 15 名全是科技;bank 前 5 名都是金融,但 bank–river 0.49 仍高於 bank–money 0.40,兩種意思混在同一個座標裡W1 p60(bank 一詞多義)、W2 p39(上下文詞向量)
考前背這一句
詞向量根據「分布假說」,從前後文學出每個字的座標,能用加減做類比;但它學的是前後文而不是意思,所以會受資料的量、種類、前處理與模型設定影響,分不出反義詞和一字多義,冷門字也會擠進鄰居——這就是後來需要 FastText(處理沒看過的字)和 BERT(看上下文)的原因。