[自然語言處理](https://app.notion.com/p/3e6fc631b03081b4a9e8f91f3411f61f) › [W2(9/17)](https://app.notion.com/p/3e6fc631b03081a18b13fad72a8874fd) › 03|影片 [0:41:29–0:58:52](https://www.youtube.com/watch?v=MnA5KUETSg4&t=2489s)|投影片 W1_NLP_brief_v2 p.20–32|上一章 [02 語言的歧義與理解難題(0:21–0:41)](https://app.notion.com/p/3e6fc631b030815e805aead9c729a0d1)|下一章 [04 語法層次與深度學習時代(1:08–1:20)](https://app.notion.com/p/3e6fc631b03081768161d6716089043a)
## 重點
- LLM 出現以前,NLP 已經做出很多應用:聊天機器人(小冰)、情緒探勘、假新聞偵測、資訊擷取、Deep Web Mining。當時要把斷詞、詞性、NER 一步一步串起來,現在一個 LLM 就包辦。
- 社群上的文字可以預測真實世界:颱風路徑、民調、流感,甚至從臉書按讚猜出宗教和性別。這些應用都在處理「非結構化資料」:沒有欄位、不能直接用 SQL 查,所以要靠 NLP。
- NLP 分成幾個層次:構詞 → 語法 → 語意 → 語用。深度學習把每一層都用神經網路重做,例如 Luong(2013)把每個詞素變成向量再組合。很好用,但人說不出那些數字代表什麼。
## Exam-ready
- **NLP-based applications (before LLM)**: "Siri, 小冰 … Sentiment Mining: Depression detection… Deep Web Mining: Auto ticketing… Information Extraction: Price comparisons… Fake News Detection … UGC based predication e.g., stock, voting, …"(brief p.20)
- **Facebook PNAS paper**: "Private traits and attributes are predictable from digital records of human behavior"(brief p.24)
- **Medical text mining**: "Follow chains of causal implication to discover a relationship between migraines and biochemical levels." Data: "medical research papers, medical news (unstructured text information)"(brief p.25)
- **Swanson's chain**: "migraine patients have high platelet aggregability … magnesium can suppress platelet aggregability" (Swanson and Smalheiser, 1994)(brief p.26)
- **Unstructured Data Management**: "Natural language processing is a subset of Unstructured Data Management. … 80%-90% of Data is Unstructured"(brief p.27)
- **Data vs. document warehouse**: "Data warehouse: Who, what, when, where, how much … Internally focused … Rarely include external information. Document warehouse: Why … Often integrate external information"(brief p.28)
- **NLP Levels**: "Morphology: Prefix / Suffix, Lemmatization / Stemming, Spelling Checking. Syntax: Part-of-Speech Tagging, Syntax trees, Dependency Trees. Semantics: Named Entity Recognition / Normalization, Relation Extraction, Word Sense Disambiguation. Pragmatics: Co-reference resolution, Topic Segmentation, Summarization"(brief p.29)
- **Building blocks of language**: "Morphology: the study of the structure and form of words. Syntax: the study of how words and phrases form sentences. Semantics: relates to the meaning of words and statements. Phonology: the study of sounds in the language. Pragmatics: the study of idiomatic phrases that cannot be analyzed with strict semantic analysis"(brief p.30)
- **Morphology**: "Understanding words: Stems, Affixes (Prefix, Suffix), Inflectional elements"(brief p.31)
- **Morphology level representation**: "Traditional: Words are made of morphemes. "unfortunately" = un + fortunate + ly (prefix + stem + suffix). In DL (Luong, 2013): every morpheme is a vector; A neural network combines two vectors into one vector"(brief p.32)
## [0:41:29](https://www.youtube.com/watch?v=MnA5KUETSg4&t=2489s) Siri 與小冰:十年前的聊天機器人
Siri(Apple 的語音助理)和小冰(微軟的聊天機器人)是 LLM 之前最有名的對話系統。老師說小冰大約十年前很紅,晚上 10 點到半夜 2 點最多大學生找它聊天。它靠大量網路對話語料訓練;記者問它「這輩子最期待什麼」,它回答「活著」,比較可能的解釋是網路上本來就有這樣的一問一答。以前做到這樣很難,現在用 LLM 接一個 API(讓你的程式呼叫別人的模型)就做好了。
它到底怎麼運作?用檢索式聊天機器人手算一次
檢索式(retrieval-based)做法:先收集大量「問句 → 回答」配對,使用者一說話,就找最像的舊問句,直接回它的答案。
- 資料庫:Q1「你今天晚餐吃什麼」→「滷肉飯」;Q2「人這輩子最重要的是什麼」→「活著」;Q3「跟女朋友吵架怎麼辦」→「先道歉」
- 使用者問「你這輩子最期待的事是什麼」,斷詞成 8 個詞:你/這輩子/最/期待/的/事/是/什麼
- Jaccard 相似度=共同詞數 ÷ 合起來的不同詞數。Q1:2 ÷ 11 = 0.18;Q2:5 ÷ 10 = 0.50(這輩子、最、的、是、什麼);Q3:0
- 選最高的 Q2,回答「活著」
機器沒有在「想」,只是抄了最像的一句。所以對你的影響是:第 5–7 章的資訊檢索是同一個想法,只是把 Jaccard 換成 TF-IDF、BM25。
老師原話是什麼?
「晚上 10 點到半夜 2 點這之間使用率非常高」(0:42:13)
「期待的事情是什麼,然後小冰就回答,活著」(0:43:04)
「猜測都是說因為網路上有這樣的 Q 跟 A 的對應」(0:43:17)
## [0:43:51](https://www.youtube.com/watch?v=MnA5KUETSg4&t=2631s) LLM 之前的應用清單
p.20 把 LLM 之前的應用畫成一張地圖。老師點了幾個:假新聞偵測、情緒偵測、翻譯、醫療建議、股票、摘要、Deep Web Mining、資訊擷取(information extraction,從文字抽出公司名稱、數字這類欄位)。這些現在用 LLM 隨便就做得出來,因為不用再從斷詞、詞性、NER、NEN 一步一步做,整個模型一次做掉。
[[IMG: C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\nlp_w2_ch03_brief_p020.png | p.20:LLM 之前的 NLP 應用。縱軸是語意理解深度,橫軸是 Representation;老師沒解釋各點位置,不必背]]
Deep Web Mining 是什麼?跟暗網一樣嗎?
Deep web(深網)是搜尋引擎爬不到、要填表單查詢才看得到的網頁,例如訂票系統的班次。Deep Web Mining 就是寫程式自動送出大量查詢,把網站後面的資料庫撈出來;老師的例子是寫程式搶高鐵票(投影片寫 Auto ticketing)。它跟暗網(dark web,要特殊瀏覽器才進得去的匿名網站)不是同一件事。
以前為什麼要一步一步做?
以前是一條生產線(pipeline)。拿「台積電昨天宣布在高雄投資 100 億」跑一次:
1. 斷詞:台積電/昨天/宣布/在/高雄/投資/100/億
2. 詞性標註:台積電=名詞、宣布=動詞……
3. NER(找出人名、地名、公司名):台積電=公司、高雄=地點、100 億=金額
4. NEN(named entity normalization,把不同寫法對到同一個標準名稱):「台積電」「TSMC」是同一家公司
前一站錯,後面全錯:斷詞把「高雄投資」黏在一起,NER 就找不到「高雄」。LLM 直接吃整句、吐答案,中間站不見了。
老師原話是什麼?
「你可以自動下一堆查詢,然後去把整個資料庫撈出來」(0:44:29)
「因為我們不太需要像以前從斷字、詞性,然後做 NER、NEN 這個步驟做下來」(0:44:57)
## [0:45:10](https://www.youtube.com/watch?v=MnA5KUETSg4&t=2710s) Twitter 文字探勘:颱風、民調、心情、流感
Twitter(現在改名 X)的推文帶有時間和地點,很適合做 text mining(文字探勘,從大量文字挖出規律),拿來預測真實世界的事。台灣當年比較難做,因為範圍小、用 Twitter 的人少;現在可以改用 IG、Threads 等資料來源。
[[IMG: C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\nlp_w2_ch03_brief_p021.png | p.21:左上颱風路徑(紅色虛線是真實路徑),中上推文情緒對民調(r = 0.804),下方各時段、星期幾的心情曲線,右邊股票情緒]]
p.21、p.22 的例子分別在做什麼?
- 颱風:看誰推文說「外面風很大、雨開始下很大」,就知道暴風圈到哪了。綠線和藍色點線是兩種估計(粒子濾波 particle filter,用很多猜測點追蹤移動目標的機率方法;以及加權平均)。海上沒人發推文,只有陸地那段對得上。
- 民調:推文情緒和蓋洛普(Gallup)電話民調對得起來。老師提醒台灣可能不準,因為很多人「含淚投票」。
- 心情:一篇 Science 論文依星期幾、時段分析推文情緒,結論是星期一心情最差(Monday blue),不同人種、地區都一樣。
- 股票:推文情緒加財報,做股價分析與建議。
- 流感(p.22):日本的推文流感地圖。老師補充 Google 用搜尋紀錄偵測流感,比疾病管制單位公告還早。這服務叫 Google Flu Trends,後來在 2012–13 年流感季嚴重高估,2015 年停止公布:資料再大也會偏。
它到底怎麼運作?手算一次推文情緒和相關係數
1. 情緒字典:正面 good、great、happy、love;負面 bad、sad、hate、worst。
2. 一天的推文:"Great day, love this weather"(正)、"Worst traffic ever"(負)、"Economy looks good"(正)、"Sad news about jobs"(負)、"Happy weekend!"(正)。情緒比 = 正 3 ÷ 負 2 = 1.5。
3. 四天的情緒比 1.2、1.5、0.9、1.8;同四天民調 44、47、43、46(%)。
4. 相關係數 r(Pearson correlation,看兩條曲線是否一起漲跌,−1 到 1):
平均:情緒 1.35、民調 45。
離平均:情緒 −0.15、0.15、−0.45、0.45;民調 −1、2、−2、1。
相乘加總:0.15 + 0.30 + 0.90 + 0.45 = 1.80;平方和:情緒 0.45、民調 10。
r = 1.80 ÷ √(0.45 × 10) = 1.80 ÷ 2.121 ≈ 0.85。
p.21 圖上 r = 0.804 就是這個意思;window = 15 應該是先取 15 天移動平均讓曲線平滑(圖上沒寫單位,我依慣例判斷)。所以對你的影響是:相關不等於因果,發推文的人也不等於全體選民。
老師原話是什麼?
「誰在發布說現在目前外面風很大、雨開始下很大,就知道說颱風中心目前到他那邊了」(0:45:32)
「他們用 Twitter 的 sentiment 跟蓋洛普調查做個 align」(0:47:43)
「其實大家都知道結論,星期一大家心情都不太好,因為要上班這樣子」(0:48:28)
「這件事情的公告比真的這個疾病管制局公告的還要早」(0:50:14)
## [0:50:26](https://www.youtube.com/watch?v=MnA5KUETSg4&t=3026s) 美食評論與臉書按讚
p.23 是日本的 FOODMOOD:用推文分析大家對各種食物的情緒,咖哩、拉麵、壽司排在前面。p.24 是 2013 年刊在 PNAS(美國國家科學院院刊)的研究:只看一個人在臉書按了哪些讚,就能用監督式學習(supervised learning,拿有標準答案的資料訓練)預測宗教、政黨、性別、性傾向,很多項到八成以上。老師看完論文就去亂按讚,故意讓系統搞不懂他:走過必留下痕跡。
| AUC | p.24 圖上的特質 |
| 0.90 以上 | 種族 Caucasian vs. African American 0.95、性別 Gender 0.93 |
| 0.80–0.89 | 男同志 Gay 0.88、政黨 Democrat vs. Republican 0.85、宗教 Christianity vs. Islam 0.82 |
| 0.70–0.79 | 女同志 Lesbian 0.75、抽菸 0.73、喝酒 0.70 |
| 0.60–0.69 | 單身或交往中 0.67、用藥 0.65、21 歲時父母是否仍在一起 0.60 |
**注意:圖上的數字是 AUC,不是準確率。老師口頭說這研究「更久了,大概 14、15 年」,投影片上的論文網址是 2013 年 3 月,考試寫 2013。**
要先懂什麼?AUC 是什麼,怎麼算?
AUC(area under the ROC curve)=隨便抽一個「是」的人、一個「不是」的人,模型給「是」的人分數比較高的機率。0.5 等於亂猜,1 是完美。
- 模型替 6 個人打「是民主黨」的分數。真的是民主黨:0.9、0.7、0.4;真的是共和黨:0.6、0.3、0.2
- 配對共 3 × 3 = 9 組。0.9 贏 3 組、0.7 贏 3 組、0.4 贏 2 組(0.3、0.2),合計 8 組
- AUC = 8 ÷ 9 ≈ 0.89
為什麼不用準確率:95% 的人不抽菸時,全部猜「不抽」準確率就 95%,卻完全沒用;AUC 看排序排得對不對,不會被比例騙。Precision、Recall 老師說下次補充。
老師原話是什麼?
「在這種 Big Data 情況底下,這些東西其實可以做的蠻準,其實很多都到八成以上」(0:51:45)
「當年我看完這篇 paper 的時候,我就去網路上隨便按讚」(0:52:04)
## [0:52:24](https://www.youtube.com/watch?v=MnA5KUETSg4&t=3144s) 醫療文字探勘
醫療文字探勘可以輔助醫生判讀病歷、預測診斷、檢查醫生寫的內容有沒有錯。老師提到以前的比賽:給一位新病人的描述,要從舊病歷找出相關病患,等於病歷版的搜尋引擎。最難的是同一個症狀、醫學名詞有很多種寫法,要把它們對起來;現在 LLM 對醫學名詞已經懂得不少。
同一個症狀有很多寫法,要怎麼對起來?
heart attack、myocardial infarction、MI、心肌梗塞都是同一件事。把不同寫法對到同一個標準代碼叫 normalization(正規化),醫學界常用 UMLS 這類術語庫。反過來,MI 也可能是 mitral insufficiency(二尖瓣閉鎖不全),這是第 2 章的歧義,對應 p.29 的 Word Sense Disambiguation。
投影片 p.25–26 的偏頭痛與鎂在講什麼?(老師沒講)
Swanson 只讀文獻、不做實驗,就找到新假設。p.26 的句子兩兩一組,左邊來自偏頭痛論文,右邊來自鎂的論文:
- 壓力和偏頭痛有關;壓力會讓鎂流失
- 鈣離子通道阻斷劑能預防某些偏頭痛;鎂是天然的鈣離子通道阻斷劑
- 偏頭痛病人的血小板容易凝集;鎂能抑制血小板凝集
兩堆文獻很少互相引用,透過中間概念串起來,得到新假設:缺鎂可能跟偏頭痛有關。這叫 literature-based discovery(從文獻找新知識),常說成 ABC 模型:A 偏頭痛 — B 中間概念 — C 鎂。要先用 NER 抽出 symptoms、drugs、diseases、chemicals,才串得起鏈。
老師原話是什麼?
「最難的地方就是這些專有名詞、這些症狀、這些醫學上名詞,他其實有很多種寫法,然後你要怎麼對得起來這樣子」(0:53:09)
## [0:53:30](https://www.youtube.com/watch?v=MnA5KUETSg4&t=3210s) 非結構化資料
前面所有應用都在管理非結構化資料(unstructured data,沒有固定欄位的文字、圖片等)。結構化資料每個 column 意思清楚,可以直接下 SQL 查;非結構化資料沒有 metadata(描述資料的欄位資訊),同一句話還有「千奇百怪的解釋」,沒辦法直接查。要讓文字也能被查詢和統計,就要先做 NLP。投影片說 NLP 是 Unstructured Data Management 的一部分,而且 80%–90% 的資料是非結構化的。
| Data warehouse(資料倉儲) | Document warehouse(文件倉儲) |
| 回答什麼 | Who, what, when, where, how much | Why |
| 焦點 | Internally focused(公司內部) | May not be internally focused |
| 內容 | Operational information(營運數字) | May contain a range of information |
| 外部資訊 | Rarely include external information | Often integrate external information |
用生活例子講,結構化和非結構化差在哪?
班級名冊是結構化資料:姓名、縣市、年級各一欄。找住臺北市的人,一行 SQL:`SELECT 姓名 FROM 學生 WHERE 縣市 = '臺北市'`。
同樣資訊寫在週記裡:「我上個月從台中搬上來,現在住大安區。」沒有「縣市」欄位。電腦要先認出「大安區」是地名(NER),再知道它在臺北市(知識),還要懂「現在」才是最新住址(語意)。
所以對你的影響是:NLP 在做的,就是把週記變回名冊。
老師原話是什麼?
「並不是說他沒切好而已,是說他有千奇百怪的解釋」(0:53:53)
「你就可以用 SQL 的方式去查出這些東西」(0:54:41)
## [0:55:02](https://www.youtube.com/watch?v=MnA5KUETSg4&t=3302s) NLP 的分析層次
傳統 NLP 分析一層一層往上做:構詞(morphology,字怎麼由詞素組成)→ 語法(syntax,字怎麼組成句子)→ 語意(semantics,意思)→ 語用(pragmatics,情境裡真正的意思)。詞性標註(POS tagging)和剖析樹(parsing tree)屬於語法層。深度學習出來後還是這幾層,但每一步的方法都換了,NER、關係擷取、標註都重做一遍,後來發現 LLM 其實不太需要詞性標註。老師自己也在 ACL 2023 發表了用語言模型做中文斷詞的論文。
| 層次 | p.29 的任務 | 例句 "Apple's unhappy engineers moved to Taipei. They said it was just great." |
| Morphology 構詞 | Prefix / Suffix、Lemmatization / Stemming、Spelling Checking | unhappy = un + happy;engineers → engineer |
| Syntax 語法 | POS Tagging、Syntax trees、Dependency Trees | engineers=複數名詞、moved=過去式動詞;engineers 是主詞 |
| Semantics 語意 | NER / Normalization、Relation Extraction、Word Sense Disambiguation | Apple=公司不是水果(WSD);engineers 任職於 Apple |
| Pragmatics 語用 | Co-reference resolution、Topic Segmentation、Summarization | They 指 engineers(共指消解);"just great" 可能是反話 |
**注意:p.30 還多一層 Phonology(研究聲音),做語音辨識才用到。p.30 把 pragmatics 定義成「無法用嚴格語意分析處理的慣用語」,一般教科書說的是「語言在情境中的使用」,考試寫投影片的版本。**
老師的斷詞論文在做什麼?
中文沒有空格,要先斷詞。麻煩的是不同語料庫的斷詞標準不一樣(multi-criteria):同一句話,一套標準切成「用壞了」,另一套切成「用/壞/了」(p.29 右下的小圖)。他們的模型在輸入加一個提示(input hint)說明要照哪套標準切,再加上判斷標準(criterion classification)和去雜訊(denoising)的訓練目標,讓沒看過的新詞(OOV)更容易切對。
論文:[Advancing Multi-Criteria Chinese Word Segmentation Through Criterion Classification and Denoising(ACL 2023)](https://aclanthology.org/2023.acl-long.356/)
老師原話是什麼?
「甚至 tagging 也重做一遍,但是後來做的時候發現 LLM 其實不太需要 tagging」(0:55:49)
「在兩年前也有發表一個斷字的,用這種 LLM 的概念來做」(0:56:01)
## [0:56:08](https://www.youtube.com/watch?v=MnA5KUETSg4&t=3368s) 深度學習把每一層重做:以構詞為例
老師說,真正讓研究者覺得「差很大」的不是 LLM,而是深度學習:大家如獲至寶,把每個問題都用大型神經網路重做一遍。以構詞為例,傳統做法是建字首(prefix)、字尾(suffix)的統計表,例如看到 -able 多半是形容詞(p.31:in- + dispute + -able)。Luong(2013)改成把每個詞素(morpheme,最小有意義的單位)都變成向量,再用神經網路兩兩組合。學完之後,加上 un- 的向量字就帶有反向的意思,但沒人說得出那些數字為什麼做得到;這也是為什麼需要大量算力,NVIDIA 股價才這麼高。
[[IMG: C:\D槽\TAICA課程\_work\notes-v2\nlp-w2\img\nlp_w2_ch03_brief_p032.png | p.32:Luong 2013 的構詞遞迴網路。un 和 fortunate 先組成 unfortunate,再和 ly 組成 unfortunately,每次都用同一組 W_m、b_m]]
要先懂什麼?向量、串接、tanh
- 向量:一串數字,例如 (0.8, 0.6),可以想成空間裡的一個點。
- 串接(concatenate,寫成 [x; y]):把兩個向量頭尾接起來,(0.8, 0.6) 和 (1.0, 0.0) 接成 (0.8, 0.6, 1.0, 0.0)。
- 矩陣乘向量 W·x:W 的每一列跟 x 對應位置相乘再加總,得到新向量的一格。
- tanh:把任何數字壓到 −1 到 1 之間,tanh(0) = 0,tanh(−0.7) ≈ −0.60。
它到底怎麼運作?手算一次 unfortunately
Luong 論文的公式:p = f(W_m [x_stem; x_affix] + b_m),f 用 tanh;W_m 是 d × 2d 的矩陣,所有組合共用同一組 W_m、b_m。
我用 2 維向量,替兩維取名字:第 1 維=正面程度,第 2 維=形容詞(正)或副詞(負)。數字是我編的。
- x(fortunate) = (0.8, 0.6)、x(un) = (1.0, 0.0)、x(ly) = (0.0, −1.5);W_m 第一列 (1, 0, −1.5, 0)、第二列 (0, 1, 0, 1);b_m = (0, 0)
- unfortunate:[fortunate; un] = (0.8, 0.6, 1.0, 0.0)。第 1 格 0.8 − 1.5 = −0.7,第 2 格 0.6。tanh 後 ≈ (−0.60, 0.54):變負面,仍是形容詞
- unfortunately:[unfortunate; ly] = (−0.60, 0.54, 0.0, −1.5)。第 1 格 −0.60,第 2 格 0.54 − 1.5 = −0.96。tanh 後 ≈ (−0.54, −0.74):仍負面,變副詞
- 同一組 W_m 算 unhappy:x(happy) = (0.9, 0.7),得 ≈ (−0.54, 0.60),一樣被翻成負面
真正的模型裡,向量有幾十維、都是學出來的,每一維沒有名字。所以模型學會了「un- 會反轉意思」,我們卻指不出是哪個數字在做。好處是罕見字(例如 unaffordable)也能由詞素組出向量。
老師說的「這份投影片的第一頁那個例子」是 p.3(第 1 章以前 vs 現在做法的圖):越往後,模型越強,也越難解釋。
老師原話是什麼?
「大家就突然如獲至寶,就覺得這個工具非常厲害」(0:56:26)
「通常帶有所謂的負面或者是反向的意思的時候,那我就學會了這個 un 的表示應該是要怎麼做」(0:57:50)
「我們不知道說這些數字為什麼可以讓它變成一個反向的概念」(0:58:17)
## Self-check
Q1. List the four NLP levels on the slide and give two tasks for each. Which level does part-of-speech tagging belong to?
**Answer**: Morphology (prefix / suffix, lemmatization / stemming); Syntax (part-of-speech tagging, syntax trees, dependency trees); Semantics (named entity recognition / normalization, relation extraction, word sense disambiguation); Pragmatics (co-reference resolution, topic segmentation, summarization). POS tagging belongs to the syntax level.
中文重點:構詞、語法、語意、語用;詞性標註在語法層。
Q2. Why is NLP described as a subset of Unstructured Data Management? Contrast a data warehouse with a document warehouse.
**Answer**: 80%–90% of data is unstructured text without metadata, so it cannot be queried by fields; NLP turns it into structured information. A data warehouse answers who, what, when, where, how much and is internally focused; a document warehouse answers why and often integrates external information.
中文重點:文字沒有欄位,要靠 NLP 變成可查的資料;資料倉儲答「多少」,文件倉儲答「為什麼」。
Q3. How does Luong (2013) represent the word "unfortunately"? Write the composition function.
**Answer**: "unfortunately" = un + fortunate + ly (prefix + stem + suffix). Every morpheme is a vector, and a neural network combines two vectors into one: p = f(W_m [x_stem; x_affix] + b_m), f = tanh, with W_m, b_m shared. un + fortunate → "unfortunate", then + ly → "unfortunately". Rare words can be composed, but the dimensions are hard to interpret.
中文重點:每個詞素一個向量,同一組 W_m 兩兩組合,由下往上組出整個字。
Q4. A model predicts political party from Facebook Likes. Scores for three Democrats: 0.9, 0.7, 0.4; for three Republicans: 0.6, 0.3, 0.2. Compute the AUC.
**Answer**: Of the 3 × 3 = 9 Democrat–Republican pairs, the Democrat scores higher in 8 (0.9 and 0.7 beat all three; 0.4 beats 0.3 and 0.2), so AUC = 8/9 ≈ 0.89. AUC is the probability that a random positive is ranked above a random negative; 0.5 = random, 1.0 = perfect.
中文重點:AUC=隨機抽一正一負,正的分數比較高的機率。