[自然語言處理](https://app.notion.com/p/3e6fc631b03081b4a9e8f91f3411f61f) › [W4(10/1)](https://app.notion.com/p/3ecfc631b03081b8aa2cf4a97467ed41) › 02|影片 [0:14:58–0:30:19](https://www.youtube.com/watch?v=7kgOuhuIjvY&t=898s)|投影片 W2_Word p.20–28|上一章 [01 BM25 與 N-gram 模型(0:00–0:14)](https://app.notion.com/p/3ecfc631b030815a8015e146c3d4d717)|下一章 [03 稠密向量與 Word2Vec(0:30–0:49)](https://app.notion.com/p/3ecfc631b030819f9a0df026aac33ae7) 跳過提示:(0:24:41–0:26:14) 老師在把共現次數換成機率、手算 cherry 和 sugar 的 PPMI,聽不懂可以直接跳到 [0:26:27](https://www.youtube.com/watch?v=7kgOuhuIjvY&t=1587s),接著講「PPMI 向量和 TF-IDF、SVD 差在哪」。 跳過的這段在做什麼(白話):老師把 cherry 範例的次數表每一格除以總數變成比例,再代進 PMI 公式,算出 cherry 和 sugar 那一格是 3.3 分,意思是這兩個字一起出現的次數將近是偶然的 10 倍。看懂下面「cherry 範例」那段的白話就夠了。 ## 重點 - 稀疏向量(sparse vector)是「維度很高、幾乎都是 0」的向量。TF-IDF 和 PPMI 都屬於這一類。 - 稀疏向量的毛病是:字要一模一樣才對得上,意思相同的兩個字(enjoy、like)在向量裡卻完全不同。 - PPMI 用「兩個字一起出現的機率,比各自亂碰到的機率高多少」來打分數,負的改成 0。這樣一個字就能用幾個自己挑的情境(context)分數來表示,算起來比 SVD 簡單很多。 ## Exam-ready - **Sparse vector embeddings**: "Sparse vector embeddings represent words as high-dimensional vectors with mostly zero values."(W2_Word p.20) - 中文:稀疏向量把字表示成維度很高、而且大部分是 0 的向量。白話:一條很長的格子,只有少數幾格有數字。high-dimensional(高維度)、mostly zero values(大多是 0)。 - **Sparse vector dimension**: "Each dimension corresponds to a unique feature (word), measured by some well-designed methods."(W2_Word p.20) - 中文:每一個維度對應一個特徵(通常是一個字),值用設計好的方法算出來,例如 TF-IDF 或 PPMI。白話:一格代表一個字。corresponds to(對應到)、feature(特徵)。 - **TF (Term Frequency)**, TF_ij = n_ij / Σ_k n_kj: "Represents the "frequency" of a term appearing in a text."(W2_Word p.21) - 中文:TF 代表一個字在一篇文章裡出現得多頻繁。白話:這篇文章裡這個字出現幾次(換成比例)。term(詞)、frequency(頻率)。 - **IDF (Inverse Document Frequency)**, IDF_i = lg ( |D| / |{j : t_i ∈ d_j}| ): "Aims for terms to have higher specificity, meaning the fewer texts in the dataset contain the term, the better."(W2_Word p.21) - 中文:IDF 想讓字更有「代表性」:整個資料集裡越少文章出現這個字,它的分數越高。白話:人人都在用的字(的、是)不值錢,少見的字才有辨識度。specificity(專一性、代表性)、dataset(資料集)。 - **Stemming**: "By removing the suffixes from words (e.g."cats," "catlike," "catty" all have "cat" as their base), we can revert the words back to their root forms."(W2_Word p.23) - 中文:詞幹還原是把字尾去掉,讓字回到原本的字根,例如 cats、catlike、catty 都還原成 cat。白話:把同一家族的字合併成同一格。suffixes(字尾)、root forms(字根形式)。 - **Feature Selection**: "Filter and select which parts of speech to retain, such as verbs or nouns."(W2_Word p.23) - 中文:特徵選擇是篩選要保留哪些詞性,例如只留動詞或名詞。白話:先挑出有用的字,其他的丟掉。parts of speech(詞性)、retain(保留)。 - **Distributional Hypothesis**: "Words that occur in similar contexts tend to have similar meanings."(W2_Word p.24) - 中文:分布假說:出現在相似上下文的字,意思通常也相似。白話:看一個字常跟誰在一起,就知道它是什麼意思。occur(出現)、contexts(上下文)。 - **Mutual Information (MI)**, I(x,y) = log2 [ P(x,y) / ( P(x) P(y) ) ]: "It is a measure of how often two events x and y occur"(W2_Word p.25) - 中文:互資訊是衡量兩個事件 x、y 一起發生程度的指標:一起發生的機率除以各自機率相乘,再取 log。白話:看兩件事是不是「常常綁在一起出現」。measure(度量)、events(事件)。 - **PMI (Pointwise MI)**, PMI(w,c) = I(w,c): "The mutual information between a target word w and a context word c"(W2_Word p.25) - 中文:PMI 就是把互資訊用在「目標字 w」和「上下文字 c」之間。白話:這個字和旁邊那個字有多常一起出現。target word(目標字)、context word(上下文字)。 - **PPMI (Positive PMI)**, PPMI(w,c) = max(PMI(w,c), 0): "PPMI replaces all negative PMI values with zero"(W2_Word p.26) - 中文:PPMI 把所有負的 PMI 值都換成 0。白話:只留「比偶然更常一起出現」的分數。negative(負的)、replaces(取代)。 ## [0:14:58](https://www.youtube.com/watch?v=7kgOuhuIjvY&t=898s) 從 N-gram 到稀疏向量 上一章的 N-gram 是直接數字串出現幾次,學不到「意思」。老師想往更有語意(semantic)的表示走,所以先回頭整理稀疏向量,當作等一下稠密向量(dense vector)的對照組。 稀疏向量的「稀疏」是指:維度很高、大部分是 0。老師的例子:字典有三萬個字,一篇文章只有三百個字,那麼這篇文章的向量大約只有 1% 的格子有值。 要先懂的一個詞(我補充):向量(vector)就是「一排數字」,維度(dimension)就是這排有幾格。把字或文章變成一排數字,電腦才能拿來比較像不像、算距離。字典有三萬個字,文章向量就有三萬格。 下面這張圖是這一章在整條路線上的位置。 ```mermaid flowchart LR A["N-gram:直接數字串次數"] --> B["稀疏向量:TF-IDF、PPMI"] B --> C["稠密向量:word2vec 等"] B -.->|"缺點:同義字對不上"| C ``` 稀疏向量是中間那一站:比 N-gram 多了「打分數」,但還是一格一個字,所以下一章才需要稠密向量。
用生活例子講,什麼叫稀疏? 想像一張全校三萬人的點名表,一堂課只有三百人到。整張表幾乎都是空白,只有 1% 打勾。用這張表來描述「這堂課」就是稀疏向量:資訊都有,但大部分格子是浪費的。
## [0:16:27](https://www.youtube.com/watch?v=7kgOuhuIjvY&t=987s) TF-IDF 回顧與前處理 TF-IDF 把一篇文章變成一條向量:文章裡有出現的字,那一格就有分數;沒出現的字就是 0。投影片上把有值的格子排在一起,只是為了好看,實際的字順序不一定是這樣。 (第 2 週學過:TF-IDF 用「這個字在這篇出現多少次」乘上「這個字在所有文章裡有多少見」來打分數;把每篇文章變成一排分數的整套做法叫向量空間模型 vector space model。)特徵(feature)是描述一樣東西的其中一個面向,例如描述一個人可以看身高、體重;在 TF-IDF 裡,一個字就是一個特徵。 前處理(stemming 把 cats、catlike 還原成 cat;feature selection 只留某些詞性)其實就是以前講的「要不要斷詞、要不要取關鍵字」。為什麼稠密向量好像不用做這些?因為稠密向量是讓模型自己學該取哪些特徵,不用人工挑。 考試可能怎麼問:TF 和 IDF 各自在衡量什麼?為什麼兩個要相乘?
用生活例子講,TF 和 IDF 各管什麼? TF 像「這個人在這場會議裡發言幾次」,IDF 像「這個人是不是每場會議都在」。每場都在的人(像「的」「是」)存在感很低;只出現在這場、而且講很多的人,才最能代表這場會議在談什麼。TF 乘 IDF,就是兩個條件都要符合。
## [0:18:08](https://www.youtube.com/watch?v=7kgOuhuIjvY&t=1088s) 稀疏向量的限制 稀疏向量有兩個問題。第一,字要完全一樣才對得到:「enjoy」和「like」意思一樣,但它們是兩個不同的格子,向量看起來毫無關係。第二,概念在這麼大的空間裡分布很不均勻,有的地方擠成一團,有的地方空蕩蕩。 為什麼會這樣?因為每一格只代表「這個字本身」,向量裡完全沒有記錄「這個字常跟誰一起出現」。投影片 p.24 的分布假說(distributional hypothesis)正好補上這一點:enjoy 和 like 出現在一樣的句子位置(I ___ coding),所以意思相近。PPMI 就是照這個想法,改用「上下文」來描述一個字。 上下文(context)就是一個字前後的那幾個字。(第 3 週學過:分布假說,看一個字常跟誰在一起,就知道它的意思;第 3 週的 LSA 和 word2vec 也都是從這個想法出發。) 考試可能怎麼問:為什麼 TF-IDF 這類向量抓不到同義字?
老師原話是什麼? - 「它要完全一樣的東西才會能夠 hit 得到那個概念。」(0:18:15) - 「這兩個字其實是一樣的意思,但是以 vector 來表示的時候,它就是完全不同的。」(0:18:36)
## [0:18:42](https://www.youtube.com/watch?v=7kgOuhuIjvY&t=1122s) Mutual Information 與 PPMI 互資訊(mutual information,MI)是在問:兩件事「一起發生」的次數,比它們各自隨機碰在一起的次數多多少?分子放一起發生的機率,分母放各自機率相乘。如果兩件事完全無關,分子分母一樣大,比值是 1,取 log 後是 0。老師說互資訊在資料分析和機器學習裡很常用:拿到訓練資料時,用它檢查哪兩個特徵(feature)彼此相關,例如身高和體重常一起變大,互資訊就高。量相關性的指標還有很多(例如相關係數 correlation coefficient),互資訊只是其中一種。 要先懂的三個數學名詞(我補充):機率 P(x) 是「隨便抽一次,抽到 x 的比例」,P(x,y) 是「x 和 y 同時出現的比例」。獨立是指兩件事互不影響,這時 x 和 y 同時出現的比例,剛好等於兩個比例相乘。log2 是在問「2 要乘幾次才會變成這個數」:log2 8 = 3、log2 1 = 0,比 1 小的數取 log 會變成負的。所以 MI 只是把「實際比例 ÷ 偶然比例」換成一個以 0 為中線的分數。 把 x、y 換成「目標字」和「上下文字」,就是 PMI(pointwise mutual information):這個字出現在這裡,是獨立的,還是因為旁邊的字才出現?因為有取 log,比值小於 1 時 PMI 會是負的。老師說我們不希望有負值,所以把負值都改成 0,叫做 PPMI(positive PMI)。 為什麼負值要丟掉?負的意思是「兩個字比偶然還少一起出現」,這種「很少」的估計在語料不夠大時很不可靠,而且對描述一個字的意思幫助不大(我補充)。 考試可能怎麼問:PMI 等於 0 代表什麼?PPMI 為什麼要把負值設成 0? 下面「它到底怎麼運作?」摺疊放的是 MI、PMI、PPMI 三條公式。它們要解決的問題是:怎麼用一個數字說出「兩個字有多黏」。算出來大於 0 代表比偶然更常一起出現,等於 0 代表沒關係,小於 0 代表比偶然更少,PPMI 再把小於 0 的都當成 0。
用生活例子講,PMI 在量什麼? 想像你在夜市看到「珍奶」和「雞排」。如果大家點珍奶時剛好也點雞排的比例,跟「隨便抓兩樣東西」的比例一樣,那它們沒什麼關係(PMI 約 0)。如果點珍奶的人特別常加雞排,比偶然多很多,PMI 就是正的,代表它們是一對。如果點珍奶的人反而很少點熱湯,那就是負的,PPMI 直接把它當 0,不另外記「不搭」這件事。
它到底怎麼運作?(進階,可跳過) 公式(投影片 p.25、p.26): - MI:I(x,y) = log2 [ P(x,y) / ( P(x) P(y) ) ] - PMI:PMI(w,c) = I(w,c),w 是目標字,c 是上下文字 - PPMI:PPMI(w,c) = max( PMI(w,c), 0 ) 三種情況: - 一起出現比偶然多 → 比值大於 1 → log 大於 0 → 保留 - 剛好跟偶然一樣(獨立)→ 比值等於 1 → log 等於 0 - 一起出現比偶然少 → 比值小於 1 → log 小於 0 → PPMI 改成 0 下一段會用 cherry 的數字把三種情況都真的算一次。
## [0:21:51](https://www.youtube.com/watch?v=7kgOuhuIjvY&t=1311s) cherry 範例:共現表到 PPMI 老師用一個小資料集示範:4 個目標字(cherry、strawberry、digital、information),5 個自己選的情境(computer、data、result、pie、sugar)。步驟是:先數每個字在每個情境旁邊一起出現幾次,做成共現次數表;再除以總數換成機率;最後用 PMI 公式算分,負的改成 0。 共現(co-occurrence)就是兩個字在同一小段文字裡一起出現。這「一小段」通常是目標字前後幾個字的範圍,叫 context window(上下文視窗)。語料庫(corpus)則是拿來統計的一大堆文章。 結果 cherry 在 sugar 底下的 PPMI 約 3.30。整張 PPMI 表裡,cherry、strawberry 只在 pie、sugar 有分數,digital、information 只在 computer、data、result 有分數,食物和電腦自然分成兩群。 下面是投影片 p.27:上表是機率,下表是算好的 PPMI,紅箭頭標的是 cherry 和 sugar 那一格。 [[IMG: C:\D槽\TAICA課程\_work\notes-v2\nlp-w4\img\w2_word_embeddings_and_language_modeling_rnn_p027.png | 投影片 p.27:把共現次數換成機率(上),再算出 PPMI 矩陣(下),cherry=(0,0,0,4.38,3.30)]] 圖上重點: - Replacing the counts with joint probabilities(把次數換成聯合機率):上表每一格是「這個字和這個情境一起出現」的比例 P(w, context);最右欄 p(w) 是這個字自己出現的比例,最下列 p(context) 是情境字自己出現的比例。 - Compute the PPMI matrix(算出 PPMI 矩陣):下表每一格是 PPMI 分數。matrix(矩陣)就是一張排整齊的數字表。 - Sparse vectors are obtained(得到稀疏向量):cherry=(0,0,0,4.38,3.30),下表 cherry 那一列就是它的向量。 - 紅箭頭旁的 log2(0.0021/(0.0415*0.0052)):就是 cherry 在 sugar 那格 3.30 的算法。 這張圖在講:從「一起出現的比例」一路算到「每個字一排分數」,食物字和電腦字各自只在自己那一區有分數。 看下表就知道:PPMI 把「cherry 很常和 pie 一起出現」變成一個大數字,把跟它無關的 computer 壓成 0。 情境本身其實也是字(老師回答同學:沒錯),只是我們先把這五個字當成要描述的五個維度或特徵,再看每個目標字在這五個情境下的分數。這張共現表也很像以前講 SVD 時的「文件 × 字」次數表,都是在數一起出現的狀況。 情境要選哪些字?老師說可以依你的應用自己定,例如做情緒分類就挑跟情緒有關的字。情境越多,就像機器學習裡維度越高,也可以,只是這裡先用 5 個示範。另一種做法是把所有字都同時當目標字和情境,算法一樣。 考試可能怎麼問:用文字描述,怎麼從一份語料算出一個字的 PPMI 向量?(答:選情境 → 數共現次數 → 換成機率 → 算 PMI → 負的改 0。) 下面的進階摺疊用投影片上的真實次數,把 cherry 和 sugar 那一格從頭算一次,目的是看懂 3.30 怎麼來:cherry 和 sugar 一起出現的次數,將近是「兩者無關時應有次數」的 10 倍,所以分數是正的。另外也算了 cherry 和 computer,看負的分數怎麼被改成 0。
它到底怎麼運作?(進階,可跳過) 共現次數表(投影片 p.26)的總數是 11716。cherry 總共 486 次,sugar 那一欄總共 61 次,cherry 和 sugar 一起出現 25 次。 第 1 步,換成機率: - P(cherry, sugar) = 25 / 11716 ≈ 0.0021 - P(cherry) = 486 / 11716 ≈ 0.0415 - P(sugar) = 61 / 11716 ≈ 0.0052 第 2 步,算 PMI:log2 [ 0.0021 / (0.0415 × 0.0052) ] = log2 (0.0021 / 0.000216) ≈ log2 9.7 ≈ 3.3。比偶然多出現約 9.7 倍,所以是正的,保留。 第 3 步,換一格看負的情況(我補充):cherry 和 computer,P = 0.0002,P(computer) = 0.4265。log2 [ 0.0002 / (0.0415 × 0.4265) ] ≈ log2 0.011 ≈ -6.5(用原始次數 2/11716 算約 -6.7,一樣是負的)。比偶然少很多,PPMI 改成 0,這就是表上 cherry 在 computer 那格是 0 的原因。 同樣算法,cherry 和 pie 得到 4.38。所以 cherry = (0, 0, 0, 4.38, 3.30)。
## [0:26:27](https://www.youtube.com/watch?v=7kgOuhuIjvY&t=1587s) PPMI 向量和 TF-IDF、SVD 比較 算完之後,cherry 就可以用五個數字 (0, 0, 0, 4.38, 3.30) 表示。這跟 TF-IDF 很像,都是一格一個分數,但有兩點不同:維度不是整本字典,而是你自己定義的情境;格子裡的值不是詞頻,而是互資訊。 老師也提到,如果把每個字的 PPMI 向量再組合成整篇文章的表示,結果會跟 TF-IDF 很接近,因為兩者本質上都是在算「一起出現」的關係。 (第 3 週學過:SVD 是把一張很大的「文件 × 字」次數表拆開,只留最重要的幾個方向,LSA 就是用它把向量壓小;缺點是要拆整張表,計算很重。) 下面這張表整理三種做法的差別。 | 比較 | TF-IDF | PPMI | SVD | |---|---|---|---| | 每一維代表 | 字典裡的每個字 | 自己挑的情境字 | 拆解後的主要方向 | | 格子裡的值 | 詞頻 × 稀有度 | 互資訊(負的改 0) | 拆矩陣得到的數值 | | 計算量 | 小 | 小,只要統計再套公式 | 大,要拆解整個矩陣 | | 主要用途 | 描述文章 | 描述一個字 | 壓縮成較少維度 | 所以如果你的應用用這五個維度就能分出想要的結果,PPMI 是又省力又好懂的選擇,拿來算語意相近度或距離都行。 算兩排數字像不像,常用的是 cosine 相似度(第 2 週學過:看兩個向量指的方向是不是一致,越一致越接近 1)。 考試可能怎麼問:比較 PPMI 向量和 TF-IDF 向量的維度和數值意義;為什麼 PPMI 比 SVD 省計算?
老師原話是什麼? - 「我們的 dimension 就不是 vocabulary 的每一個字,而是我們定義的,我現在的情境是什麼。」(0:26:52) - 「這個會比之前我們在做 SVD 簡單許多。」(0:27:41)
## [0:28:48](https://www.youtube.com/watch?v=7kgOuhuIjvY&t=1728s) Concept space 與稠密向量預告 老師回頭提以前的情緒字例子:便宜、有名、讚、嫩、難吃、太貴、差、老,各用 8 個維度 d1–d8 來描述,這叫 concept space(概念空間)。這種壓縮後的少數維度,其實已經接近稠密向量了。 (第 2 週學過:word embedding 就是用少數幾個概念維度描述每個字、每一格都有值;這些數字是學出來的,不是數出來的。) 下面是投影片 p.28,左邊每一列是一個情緒字,右邊 8 欄是它在 8 個概念維度上的分數。 [[IMG: C:\D槽\TAICA課程\_work\notes-v2\nlp-w4\img\w2_word_embeddings_and_language_modeling_rnn_p028.png | 投影片 p.28:情緒字在 8 個概念維度上的分數(concept space)]] 圖上重點: - Word embedding(詞嵌入):這頁標題,意思是「把字變成一排數字」。 - Concept space(概念空間):上方大括號框住的 d1–d8,代表 8 個概念維度。 - Term vector(詞向量):左邊大括號框住的每一列,一個字(便宜、有名、讚⋯)就是一排 8 個數字。 - 格子裡有正有負也有 0,但不像稀疏向量那樣幾乎全是 0。 這張圖在講:用少數幾個概念維度描述每個字,就是稠密向量的雛形。 看完這張表,可以把它和 PPMI 對照:兩者都是「一個字配一排數字」,差別在維度從哪裡來。 PPMI 要先指定好每一維是哪個字;word2vec 的 300 維或 700 多維,不用告訴它第一維代表什麼,是訓練時讓模型逼近語料特性、自己學出來的。PPMI 的情境若取多一點,向量又大又稀疏,計算量高,也沒真正抓到語意相似度,所以接下來要講稠密向量。 (第 3 週學過:word2vec 是讓神經網路讀大量句子,練習「猜一個字旁邊會出現什麼字」,練完之後每個字就得到一排數字。下一章會再接著講。)訓練(training)的意思是讓模型反覆看資料、自己一點一點調整裡面的數字,直到表現變好。 考試可能怎麼問:PPMI 向量和 word2vec 向量,在「維度的意義從哪裡來」上有什麼不同?
用生活例子講,指定維度和學出來的維度差在哪? PPMI 像填一張你自己設計好的問卷:「甜不甜?是不是水果?跟電腦有關嗎?」每一題你都知道在問什麼。word2vec 像請一位很會觀察的人看完上萬筆資料,自己整理出 300 個評分角度,他不會告訴你每個角度叫什麼,但用這些角度比較兩個字,結果很準。
## Self-check
Q1. Why can't sparse vectors such as TF-IDF capture that "enjoy" and "like" have similar meanings?(中文:為什麼 TF-IDF 這類稀疏向量看不出 enjoy 和 like 意思相近?) **Answer**: In a sparse vector each dimension is one specific word, so only identical words match. "enjoy" and "like" occupy different dimensions and share no non-zero entries, so their vectors look unrelated. The vector records whether a word appears, not which contexts it appears in, although the distributional hypothesis says similar contexts imply similar meanings. 中文:稀疏向量的每一格就是一個特定的字,只有一模一樣的字才對得上。enjoy 和 like 在不同的格子,沒有共同的非零位置,所以向量看起來毫無關係。它只記錄「這個字有沒有出現」,沒有記錄「這個字常出現在什麼上下文」;但分布假說告訴我們,上下文相似的字意思就相似,所以這種向量抓不到同義關係。
Q2. Explain the idea of PMI. What does a PMI of zero mean, and why does PPMI replace negative values with zero?(中文:說明 PMI 的想法。PMI 等於 0 代表什麼?PPMI 為什麼把負值改成 0?) **Answer**: PMI compares how often a target word and a context word actually occur together, P(w,c), with how often they would co-occur by chance if independent, P(w)P(c), and takes the log of the ratio. PMI = 0 means the two are independent. A negative PMI means they co-occur less than chance; such estimates are unreliable with limited data and add little to a word's meaning, so PPMI keeps only positive associations by setting negatives to zero. 中文:PMI 比較「目標字和上下文字實際一起出現的機率」和「如果兩者無關、隨機碰在一起的機率」(各自機率相乘),把比值取 log。PMI 等於 0 代表兩者互相獨立、沒有關係。負的 PMI 代表它們比偶然還少一起出現;這種估計在資料不多時不可靠,對描述字義幫助也小,所以 PPMI 只保留正的關聯,把負值都設成 0。
Q3. Compare a PPMI word vector with a TF-IDF vector and with SVD.(中文:比較 PPMI 向量和 TF-IDF 向量、以及 SVD。) **Answer**: Both PPMI and TF-IDF are sparse vectors with one score per dimension. TF-IDF dimensions are every word in the vocabulary and its values are term frequency times inverse document frequency; PPMI dimensions are user-chosen context words and its values are positive mutual information. Compared with SVD, PPMI is much cheaper because it only needs co-occurrence counts and a formula, while SVD must decompose the whole matrix to find principal vectors. 中文:PPMI 和 TF-IDF 都是稀疏向量,每一維一個分數。TF-IDF 的維度是字典裡的每個字,值是詞頻乘上逆文件頻率;PPMI 的維度是自己挑的情境字,值是正的互資訊。和 SVD 比,PPMI 便宜很多,只要統計共同出現次數再套公式;SVD 則要拆解整個矩陣、找出主要向量。
Q4. How do the dimensions of a PPMI vector differ from those of a word2vec embedding?(中文:PPMI 向量和 word2vec 向量的維度有什麼不同?) **Answer**: In PPMI each dimension is a context word that we must specify in advance, so every dimension has a known meaning. In word2vec the 300 or so dimensions are not assigned any meaning; they are learned during training so the vectors fit the corpus, forming a compressed, dense concept space that captures semantic similarity better. 中文:PPMI 的每一維是我們事先指定好的情境字,所以每一維代表什麼都很清楚。word2vec 的 300 維左右不事先規定意義,是訓練時讓向量去貼近語料、自己學出來的,形成壓縮過的稠密概念空間,比較能抓到語意相似度。
讀完了嗎?下一章:[03 稠密向量與 Word2Vec(0:30–0:49)](https://app.notion.com/p/3ecfc631b030819f9a0df026aac33ae7)|回到週頁:[W4(10/1)](https://app.notion.com/p/3ecfc631b03081b8aa2cf4a97467ed41)