# 05h 第三輪驗證:第二輪意見是否真的修好+修正後有沒有新的不一致 - 驗證日期:2026-10-05 - 驗證對象: - R=`示範實作\NLP_HW1_submission_draft.ipynb` 第 29 格(報告)。已確認與 `report_cell_v3.md` 逐字相同。 - G=`HW1\HW1_一條龍說明.html`(去標籤、去 base64 後逐段讀,890 行)。 - 對照的真實來源: - 筆記本輸出(`_extract2\outputs.txt`,並用 nbformat 重抓) - 兩張圖(`cell28_0.png`、`cell49_0.png`) - 投影片 W1 p64、p93、p94,W2 p31 - 作業 PDF p2 - 已知待辦(不計):檔名/學校/學號;Q6 的 `⟦WHAT_I_DID⟧`。 - 除了本檔,沒有修改任何檔案。 ## 一句話結論 > **報告(R)這一側,第二輪的意見幾乎全部修好。** 18 個 `In [n]` 引用都指到正確的格子。程式格只多了註解,輸出和執行序號完全沒動。 > **還要改的有兩類:** > 1. **R 有 3 處新的小問題。** > - 「是否超過雜訊」的邊界案例,三個地方判法不一。 > - 3.3 把「國籍形容詞」放進語意類。 > - 開頭說「所有數字都來自輸出」,但其實含外部數字。 > 2. **說明檔(G)還有 6 處沒跟上 R 的修正。** > - 506 題、211 萬則、Q10「打平」 > - sourpuss「是貓」卻「印證貓的鄰居不一定是貓」 > - bank 少見義「還在」沒有標推論 > - Q10「國籍字幾乎沒出現」 > > 全部只需要改文字,不用重跑。 --- ## 1. 程式格檢查(第三點) **結論:符合「只改文字和註解」。** 我用 nbformat 把 draft 和 `NLP_HW1_submission_executed_1005_backup.ipynb` 逐格比對了 55 格。 | 項目 | 結果 | |---|---| | 格數、格子類型 | 55=55,類型全部相同 | | 執行序號 | 43 個程式格全部相同(1–43 連號) | | 輸出 | 43 個程式格的 outputs JSON 全部相同 | | 筆記本與各格 metadata | 全部相同 | | 程式碼 | 只有第 2、18、19、20、21、22 格不同。差異**全部是新增的 `#` 註解**:`# Original template comment(s):`,加上模板原本的說明行。把註解行拿掉之後,程式碼逐行相同 | | markdown | 只有第 29 格(報告)不同。備份裡那一格是模板空白版,因為報告是執行完才填的 | 補回的註解,逐字對照模板 T[2]、T[18]–T[22],都一樣。 小瑕疵(不影響評分):第 18 格現在同時有兩行說明: - `# Each file contain 562365 lines (articles).`(剛補回的,出自 T[18]) - `# Each file contain 562365 lines (articles), except the last file.`(原本就在,出自 T[19]) 兩行意思重複。可以不管。 AI 標註:除了第 31 格,32 個程式格的 `# [Generative AI]` 都在第 1 行。第 31 格在第 2 行,因為第 1 行是模板的 `# Write your code here`。所以 Q6 寫「at the top」是成立的。 --- ## 2. `In [n]` 引用逐一核對(第二點) **結論:18 個引用全部指到對的格子;只有 Q2 表格少列兩個來源格。** | 報告位置 | 引用 | 實際格(0 起算) | 該格輸出有沒有被引用的內容 | 判定 | |---|---|---|---|---| | 開頭說明 | In [23](舉例) | 27 | TODO6 成績 | ✅ | | Q1 抽樣 | In [20] | 24 | 1,124,733 / 5,623,655(20.00%) | ✅ | | Q1 前處理 | In [21] | 25 | 0.72%、4,828,696 / 670,881,822 | ✅ | | Q1 停用詞 | In [35] | 44 | 206 題、family 86、currency 58 | ✅ | | Q1 門檻 | In [21], In [31] | 25、38 | effective min_count 30/9/16 | ✅ | | Q1 字數、時間、字典 | In [21] | 25 | 666,053,126、37.9 min、299,405 | ✅ | | Q2 表 | In [31] | 38 | 分數、10% 字數、9.1/19.7 min、OOV 107 | ⚠️ 見下方說明 | | Q2 註腳 | In [34] | 43 | 4 個種子的 max−min | ✅ | | Q3.1 | In [27], In [28] | 33、34 | 72,920,923/72,919,300;14 小類表;OOV | ✅ | | Q3.1 公平比較 | In [28] | 34 | 15,684 題與各數字 | ✅ | | Q3.2 | In [27] | 33 | 189,941 threads;2,118,254(輸出寫作 "posts") | ✅ | | Q3.2 字典大小 | In [28] | 34 | 100,310、224,050 | ✅ | | Q3.2 錯字鄰居 | In [29] | 35 | slary…;rp、viza、iqama | ✅ | | Q3.3 字頻表 | In [30] | 36 | 12 列全部相符 | ✅ | | Q4 | In [32], In [33] | 40、41 | 近鄰表、出現次數、restrict_vocab、相似度、5 處上下文 | ✅ | | Q5 (a)–(h) | In [34]–In [41] | 43–50 | 逐項相符 | ✅ | **Q2 表的說明:** - 「5% 處理後字數 166,194,401」只印在 **In [27]**(第 33 格 `5% wiki tokens`)。 - 「20% 字數 666,053,126、37.9 min」印在 **In [21]**。 - In [31] 只印了 10% 的字數。 說明檔 G 裡的兩個 `In [n]`,也都對得上: - 「6.93 GB(In [18])」→ 第 21 格。 - 「字頻表 In [30]」→ 第 36 格。 --- ## 3. 第二輪意見逐條驗證(第一點) ### 3-1 05e(規則合規)N1–N17 | 編號 | 問題 | 現況(證據) | 判定 | |---|---|---|---| | N1 | 〔cell N〕要改成 In [n] | 全部改了,開頭說明也改了。逐一核對見第 2 節 | ✅ 已修(Q2 表少列 In [21]、In [27],小事) | | N2 | CBOW「全面較好」 | R(c):「Overall、Semantic、Syntactic 都較好…14 個小類裡有 3 類較差,其中 nationality-adjective −1.81 超過雜訊」。和 In [36] 一致 | ✅ | | N3 | PCA「大致區分男女」 | R(g):「只有微弱的性別傾向…she、her、queen 也在上半,dad、grandpa、husband 在下半,分不乾淨」。我看過圖:he 1.58、his 1.46、king 1.45;she 0.93、her 0.46、queen 1.01;dad −0.67、grandpa −0.60、husband −0.40;mom −0.95、grandma −0.72、aunt −0.81。全部相符 | ✅ | | N4 | sourpuss「是卡通角色」 | R:「前 5 處上下文有 2 處是卡通角色名單…其餘是字源說明、電視集名、樂團名」,和 In [33] 一致 | ✅(呼應句仍有風險,見新問題 E) | | N5 | 「2,118,254 則貼文」 | R 3.2 改成「2,118,254 段文字」,並說明標題、內文、每則留言各算一段,少於 3 字刪掉。我核對了第 32 格 `thread_texts` 和第 33 格 `len(toks) >= 3`,相符 | ✅(R);❌ G 沒跟上(見 F2) | | N6 | present-participle 漏列 | R(a):「family、comparative、present-participle 最大,約 4.7」 | ✅ | | N7 | 「506 題」沒有出處 | R 改成「這一類題數較少」 | ✅(R);❌ G §9 還寫 506(見 F1) | | N8 | GloVe、Mikolov 要附連結 | R Q1 有 stanford 網址;R(c) 有 arXiv 1301.3781 | ✅ | | N9 | Q6 的 "starts with"、標題格、實驗設計 | 改成 "has … at the top";補了 "section headings below the report";新增一條 **Experiment design** | ✅ | | N10 | What I did | 已知待辦 | —(不計) | | N11 | taiwan、computer 沒有觀察 | R Q4 第 5 點補了,內容和 In [32] 一致 | ✅ | | N12 | 引用老師內容 | 沒有變動 | ✅ | | N13 | 執行後不能改程式 | 只加了註解,見第 1 節 | ✅ | | N14 | 個資 | 沒有變動 | ✅ | | N15 | requirements 補 ipykernel/jupyter(選做) | 沒補,還是 10 個套件 | ⚪ 選做,未做 | | N16 | 資料載入格補回模板說明註解(選做) | 已補,逐字相同 | ✅ | | N17 | 報告長度 | 不用改 | — | ### 3-2 05f(內容):第一輪部分修好的、缺的主題、N1–N22、M1–M10 **第一輪部分修好的那幾項:** | 項目 | 現況 | 判定 | |---|---|---| | #1、#24 邏輯框架「apple 混兩種、bank 只剩銀行」 | G 改成「apple 的鄰居只剩公司的意思、bank 的兩種意思可能混在同一組座標裡」 | ✅ | | #7「一起出現」 | G §10 考題改成「字典學的是每個字出現在什麼樣的前後文」。其他「一起出現」只用在 GloVe/LSA 的共現統計,是正確用法 | ✅ | | #10 ③ window 是上限 | G §6:「最多前後各 5 個字(每次實際在 1~5 之間隨機取…)」 | ✅ | | #25 PDF p2 筆誤 | G 觀念 3 加了註。我查了 PDF p2,原文是 `King + Queen - Man ≈ Woman`,確認是筆誤 | ✅ | | #26 PCA 線性 → 平行關係保得住 | G §12 ⑦「適合看:有沒有一條關係方向」;Q14 還是「PCA 保留整體方向但比較擠」,沒有點出「平行的差向量投影後仍平行」 | ⚠️ 部分(低) | **第一輪缺的三個主題:** | 主題 | 現況 | 判定 | |---|---|---| | #11 相似≠相關、領域外≠字典外 | G 課堂補充 11。我查了 W1 p94,兩句原文都在 | ✅ | | #12 詞義隨時間改變 | G 課堂補充 12。我查了 W2 p31:broadcast、network 1920s→2020s 的例子確實在(Telegraph/Wires → Social Media) | ✅(但最後一句有小問題,見 F8) | **05f 新發現 N1–N22:** | 編號 | 現況 | 判定 | |---|---|---| | N1 | 見上表 #1 | ✅ | | N2 課堂補充 7「最差兩類」 | 改成「表現最差的類別裡(最差的是貨幣),有兩類就是…」,並加「推論:本作業沒有實際跑 FastText」 | ✅ | | N3 Q12 覆蓋率 | 改成「(只在小語料時)…論壇 39%;GloVe 和 Wiki 20% 是 100%,所以它們錯在 ①②」,和 In [41] 一致 | ✅ | | N4 §9「常見字在 5% 就夠」 | R 刪掉了。G §9 第 1 列加了(推論);第 3 列補了全世界首都 +2.98、貨幣 +2.66;考題也改了 | ✅ | | N5 雜訊規則一致 | R 3.1 加了判斷規則,R 3.3 限制句也改了;G 3.1 表逐列標出「不判」或勝負,和雜訊一致 | ⚠️ 部分:G Q10 還是「語法類打平」(F3);G 3.3「家人」列寫「小類在這種大小的差距不下結論」,還是舊說法(F4);邊界案例的判法不一(新問題 A) | | N6 字頻挑證據 | R、G 都補了 biggest、best、brazilian,並寫「頻率不能解釋全部」 | ✅(G Q10 還有殘留,見 F6) | | N7 bank 河岸義 | R 加了(推論),並說明「money 是很泛用的字,只是旁證」;G §11 也一致 | ✅(G §11 考題那一句沒標推論,見 F5) | | N8 | 見上表 #7 | ✅ | | N9 實驗 ⑦、跑兩次 | G 改成「同樣設定跑 4 次…(第 12 節實驗 ①)」「換種子重跑 3 次(量雜訊)」 | ✅ | | N10 總結論第 3 列 | 改成「語法類的進步超過雜訊、語意類加總沒有(推論:…)」 | ✅ | | N11「前後文一樣」 | R、G 都改成「相似的前後文」 | ✅ | | N12 doah | 改成「doah(doha 的錯字)、qata、qatat、qutar(qatar 的錯字)」 | ✅ | | N13 課程地圖頁序 | 改成照 W1 頁序(TF-IDF → one-hot → WordNet → Bengio → 分布假說/LSA/PPMI → word2vec),並註明老師口頭回顧的順序;補了 WordNet、PPMI | ✅ | | N14 引用時間點 | 課堂補充 1 補了 W2 02:38:30–02:43:47;10 補了 W2 02:40:08;Global/Local 改成 W3 01:28:57 | ✅ | | N15 停用詞語境 | R Q1 和 G 四處都加了「老師是在講搜尋引擎建索引時說的」 | ✅ | | N16「卡在門檻」 | R、G 都改成「只出現幾十次(34~86 次)…最冷門的一群」 | ✅ | | N17 老師原話時間點 | 改成 W3 00:32:01 | ✅ | | N18 Q5 GloVe | 補了 Global/Local(01:28:57)、「一般會覺得 GloVe 比較好」(01:32:25)、看論文(01:29:33) | ✅ | | N19 sourpuss | G 改成「2 處是卡通角色名單…其餘是…」,並註明「Sourpuss 是 Terrytoons 的貓——外部知識」 | ⚠️ 加了外部知識之後,緊接的「印證貓的鄰居不一定是貓」變成自相矛盾(新問題 E) | | N20 window | 見上表 #10 | ✅ | | N21 | R、G 一致 | ✅ | | N22 PCA 例外 | R、G 一致 | ✅ | **05f 的數字問題 M1–M10:** | 編號 | 判定 | |---|---| | M1–M6、M8 | ✅ 已修 | | M7 | ❌ G §0 流程圖還寫「訓練 37 分鐘」,實際是 37.9(F7) | | M9 | ❌ G「我做了什麼」第 4 階段還寫「2 小時 38 分鐘」,繳交版沒有出處(F7) | | M10 | ❌ G §2 寫 RAM「15.7 GB」,R 和 G §13 寫「16 GB」,同一份文件寫法不一(F7) | ### 3-3 05g(評分助教)剩下的扣分與建議 | 項目 | 現況 | 判定 | |---|---|---| | TODO5 前處理只有一條規則(−1) | 要重跑才能補,沒做 | ⚪ 維持(是主理人的決定,不是文字問題) | | Q3.2 主題、結構沒有量化(−0.5) | 結構已量化:每篇約 592 字 vs 每段約 34 字,算式正確(666,053,126 / 1,124,733 = 592.2;72,919,300 / 2,118,254 = 34.4)。主題還是只有文字(要量化得加程式印 `RELQ_CATEGORY`) | ⚠️ 部分(可能補回 0.25) | | Q4 taiwan/computer、sourpuss、「接近門檻 30」(−0.5) | taiwan/computer 補了;「接近門檻」改了;sourpuss 改成 2/5。但助教建議刪掉的「呼應貓的鄰居不一定是貓」**還留著** | ⚠️ 部分(見 E) | | Q5(g) PCA 風險 | 已修 | ✅ | | Q5(c)「全面」 | 已修 | ✅ | | Q6 "All code added to the template"、"at the top" | 已修 | ✅ | | 縮短報告:刪 (h)、縮 (e)(f)、每題加一句粗體結論 | 都沒做 | ⚪ 選做,未做 | --- ## 4. 報告(R)與說明(G)互相矛盾的地方(第四點) | # | 同一件事 | R 寫 | G 寫 | 判定 | |---|---|---|---|---| | F1 | capital-common-countries 的題數 | 「這一類題數較少」 | §9 報告要點表第 5 列:「這類只有 506 題」 | ❌ G 還留著沒有出處的數字(05e N7 只修了 R) | | F2 | 論壇的段數 | 「2,118,254 段文字(標題、內文、留言各算一段;少於 3 字刪掉)」 | §10 來源句:「共 189,941 個討論串、211 萬則發問和留言」 | ❌ 和 R 不一致,也不精確(標題和內文分開算,短段落已刪) | | F3 | 3.1 語法類 | 「只略大於雜訊 1.26,視為差不多」 | 3.1 表寫「差不多(−1.34,只略大於雜訊 1.26)」,和 R 一致;但 §14 **Q10 寫「語法類打平」** | ⚠️ 考題答案的用詞比本文說得更滿 | | F4 | 家人 −2.97 的理由 | 「小於雜訊 4.74,不判勝負」 | 3.3 表「家人」列:「小類在這種大小的差距不下結論」 | ⚠️ 還是第二輪要拿掉的「個位數不下結論」舊說法 | | F5 | bank 的河岸義 | 「(推論)河岸義可能沒有消失…只是旁證」 | §11 觀察 ③ 也標了推論;但 §11 考題「一個字兩種意思」寫「但少見的意思還在,例如 bank–river 0.49」,沒有標推論 | ⚠️ 說法比 R 肯定 | | F6 | 論壇的國籍字 | R 3.3:「brazilian 在論壇也有維基的 0.79 倍」 | §14 Q10:「首都、州、**國籍字幾乎沒出現**」 | ❌ 和 In [30] 的 brazilian 0.79 倍矛盾,也和 G 自己的 3.3 表矛盾 | | E | sourpuss | 「它不是『貓』這個概念的近義詞…呼應老師說的『貓的鄰居不一定是貓』」 | §11 觀察 ④:「Sourpuss 是 Terrytoons 裡的一隻貓(外部知識)…**印證**老師說的『貓的鄰居不一定是貓』」 | ❌ G 自相矛盾:前一句說它是貓,後一句說它印證「鄰居不是貓」。R 沒寫它是貓,但懂卡通的助教會有同樣的疑問 | 其他數字我逐一對過,**R 和 G 一致**: - 總表 12 列 - §7 差值 17 列 - §9 表 - §10 的 3.1 表(14 列)、覆蓋率、15,684 題 - 字頻表 - §11 近鄰、次數、相似度 - §12 ①–⑦ - 總結論 8 列 - Q3、Q8、Q9、Q12、Q13、Q15 雜訊判斷也一致:G 3.1 表標「論壇/維基/不判」的每一列,都和 In [34] 各小類雜訊相符。 --- ## 5. R 的新問題(修正後才出現,或第二輪漏看) ### A. 「略超過雜訊」的邊界案例,判法不一(中低) 報告自己的規則:「差距的絕對值大於雜訊,才當作真的有差」(Q2 註腳)。但三個地方用起來不一樣: | 位置 | 差距/雜訊 | 倍數 | 報告的判法 | |---|---|---|---| | Q3.1 判斷規則 | Syntactic −1.34 / 1.26 | 1.06 倍 | 「視為差不多」 | | Q5(c) CBOW | nationality −1.81 / 1.69 | 1.07 倍 | 「超過雜訊」(算數) | | Q5(b) 停用詞 | Syntactic −1.65 / 1.26 | 1.31 倍 | 「是」(算數) | | Q2 | capital-common −3.95 / 2.77 | 1.43 倍 | 「只略大於雜訊…不當作證據」 | 倍數差不多(1.06 vs 1.07),卻判得相反;1.43 倍又叫「只略大於」。 另外,Q2 列語意類「有升有降」時,只列了 capital-world +2.98、currency +2.66、capital-common −3.95。漏了兩個也超過雜訊的小類(In [31] 對 In [34]): - family +5.54(雜訊 4.74) - city-in-state −1.86(雜訊 1.66) **這樣會有挑資料的觀感。** ### B. Q3.3 把「國籍形容詞」放進「語意類大幅落後」(低中) `gram6-nationality-adjective` 在考卷裡屬於 **Syntactic**(R 3.1 表、In [28] 都把它列在 gram 類)。 R 3.3 第一點的標題是「語意類大幅落後」,內文卻寫「論壇很少談世界首都、美國州名、國籍形容詞」。 這句在 v2 就有,第二輪三位審查員都沒抓到。助教對照 3.1 表就會看出分類錯了。 ### C. 「所有數字都來自輸出」說得太滿(低中) R 開頭寫「以下所有數字都來自本筆記本的執行輸出」,Q6 寫 "All numbers and figures in this report come from the outputs of this notebook"。但報告裡有幾類數字不是這樣來的: - **外部數字**(有附連結):GloVe「約 60 億字、40 萬字」、Mikolov 2013、Levy & Goldberg 2014。 - **環境規格**:RAM 16 GB(輸出沒印)。 - **自己相除算出來的**:592、34、+1.03 等差值。 自己算的那類可以接受。外部數字和「所有」直接衝突。 ### D. Q2 表的來源格少列兩個(低) 見第 2 節:「〔In [31]〕」應該補上 In [21] 和 In [27]。 ### E. sourpuss 的呼應句(低中,R 和 G 都有) 見第 4 節 E。R 那句「少量、特定的上下文把它拉到 cat 旁邊」是因果推論,但沒有標(推論)。 ### F7. G 的舊數字(低) - 「訓練 37 分鐘」 - 「2 小時 38 分鐘」 - RAM 15.7 GB vs 16 GB ### F8. G 課堂補充 12 最後一句(低) 原文:「GloVe 是 2014 年的資料…作業裡 apple 的鄰居是 blackberry、iphone、tvos,就反映了訓練資料所在的年代。」 問題有兩個: - blackberry、iphone、tvos 是 **Wiki 20%** 的鄰居,不是 GloVe 的(GloVe 的是 microsoft、ibm、intel)。這句讀起來像在講同一個模型。 - 「反映年代」是推論,沒有標。 ### F9. G TODO7 表「皇室…在最下面」(低) 我看了 `cell28_0.png`:皇室(king −3.7、queen −3.9)在右下,但代名詞 his(−5.5)、he(−4.9)、her(−4.8)比皇室更低。 ### 其他沒有問題的(我特別查過) - PCA/t-SNE 的描述和兩張圖一致。 - 3.1「依序切出同字數對照組」和第 33 格程式一致。 - Q5(e) 錯題例子 12 個都在 In [38]。 - Q5(f)「14 個小類全部下降」,In [39] 確認。 - Mikolov 論文「Skip-gram 語意類較好」符合原論文。 - 課堂補充 11、12 的投影片原文都查到。 --- ## 6. 還要改的清單(照優先順序;全部只改文字,不用重跑) | 優先 | 位置 | 現在的文字 | 建議改成 | |---|---|---|---| | 1 | R 3.3 第一點(第 29 格「語意類大幅落後」那一點) | 「論壇很少談世界首都、美國州名、國籍形容詞(capital 只有維基的 0.27 倍、illinois 0.01 倍)」 | 「論壇很少談世界首都、美國州名(capital 只有維基的 0.27 倍、illinois 0.01 倍)」。國籍放在第二點已經有的 brazilian 那句,不要放在語意類底下 | | 2 | R 3.1 判斷規則 | 「Syntactic −1.34 只略大於雜訊 1.26,視為差不多」 | 「Syntactic −1.34 剛好超過雜訊 1.26:論壇略低,但差距很小」(和 Q5(c) nationality −1.81/1.69 的判法一致) | | 3 | R Q2 觀察第 2、4 點 | 「capital-world +2.98…currency +2.66 超過雜訊,capital-common-countries 卻 −3.95,互相抵消」;「capital-common-countries 下降 3.95,只略大於雜訊 2.77,而且這一類題數較少,不當作…證據」 | 第 2 點改成「語意類五個小類都超過雜訊,但方向不一:family +5.54、capital-world +2.98、currency +2.66 上升,capital-common-countries −3.95、city-in-state −1.86 下降,加總後互相抵消」。第 4 點改成「capital-common-countries(−3.95)、city-in-state(−1.86)的下降超過雜訊,但雜訊只用 4 個種子、在 5% 量的,所以只說『語意類沒有隨資料穩定上升』,不推論成『資料多反而變差』」 | | 4 | R 開頭說明 + Q6 Execution | 「以下所有數字都來自本筆記本的執行輸出」;"All numbers and figures in this report come from the outputs of this notebook." | 「除了附出處連結的外部資料(GloVe 規模、論文)與執行環境,以下數字都來自本筆記本的執行輸出;差值與平均字數(592、34)由輸出數字相減或相除」;Q6 改成 "All experimental numbers and figures in this report come from the outputs of this notebook." | | 5 | R Q4 觀察 4 | 「…而是少量、特定的上下文把它拉到 cat 旁邊,呼應老師說的『貓的鄰居不一定是貓』。」 | 「(推論)它只出現 64 次,向量容易被少數特定上下文(例如動物卡通角色名單)決定,因此靠近 cat。」刪掉呼應句。想保留呼應,改舉 In [33] 只在常見 5 萬字裡找時 cat 的第 5 名 **mug**,並寫「原因未查」 | | 6 | G §11 觀察 ④ | 「…所以被拉到 cat 旁邊。印證老師說的『貓的鄰居不一定是貓』。」 | 刪掉「印證…」那句。「常跟動物角色並列,所以被拉到」改成「(推論)5 處裡有 2 處和動物卡通角色並列,可能因此被拉到 cat 旁邊」 | | 7 | G §14 Q10 | 「論壇語意類大輸(首都、州、國籍字幾乎沒出現),語法類打平」 | 「論壇語意類大輸(capital 只有維基的 0.27 倍、illinois 0.01 倍),國籍類也大輸(但 brazilian 有 0.79 倍,不只是頻率問題);語法類略低 1.34,只比雜訊大一點」 | | 8 | G §9「報告要點」表第 5 列 | 「只比雜訊 2.77 大一點,而且這類只有 506 題」 | 和 R 同步:「超過雜訊 2.77,但雜訊只在 5% 量過;這一類題數較少,不當成『資料多反而變差』的證據」(如果採用第 3 項,就照第 3 項同步,city-in-state 一起寫) | | 9 | G §10 來源句 | 「共 189,941 個討論串、211 萬則發問和留言。」 | 「共 189,941 個討論串;標題、內文、每則留言各算一段,刪掉少於 3 個字的段落後留下 2,118,254 段(筆記本輸出寫作 posts)。」 | | 10 | G §10 3.3 表「家人」列 | 「差 2.97,小類在這種大小的差距不下結論」 | 「差 2.97,小於家人類的雜訊 4.74,不下結論」 | | 11 | G §11「考試可能問」一字兩義 | 「(但少見的意思還在,例如 bank–river 0.49)」 | 「(推論:少見的意思可能還在,例如 bank–river 0.49 高於 bank–money 0.40)」 | | 12 | R Q2 表上方 | 〔In [31]〕 | 〔In [21], In [27], In [31]〕 | | 13 | G 小地方 | ①§0「訓練 37 分鐘」;②「2 小時 38 分鐘」;③§2「15.7 GB」;④課堂補充 12 的 apple 那句;⑤TODO7 表「皇室…在最下面」 | ①「約 38 分鐘」;②刪掉,或註明「第一版筆記本,繳交版無此數字」;③統一寫「16 GB(系統顯示 15.7 GB)」;④改成「(推論)我們自己訓練的 Wiki 20% 裡,apple 的鄰居有 iphone、tvos,反映這份維基資料的年代」;⑤「皇室在右下自成一群」 | | 選做 | G §14 Q14 | 「PCA 保留整體方向但比較擠」 | 補半句:「PCA 是線性投影,原本平行的差向量(man→woman、king→queen)投影後仍然平行」 | | 選做 | R 整體 | — | 照 05g 建議:刪 (h)、每題第一行加粗體結論(可讀性;不影響正確性) | **不要動的:** 所有程式碼與輸出、執行序號。第 18 格那兩行重複的註解不用處理。 --- 本驗證的每一項判斷都來自實際查證: - 用 nbformat 逐格比對 draft、執行備份與模板(程式、輸出、執行序號、metadata)。 - 把 18 個 `In [n]` 逐一對到輸出。 - 看了 `cell28_0.png`、`cell49_0.png`。 - 用 pymupdf 讀 W1 p64、p93、p94,W2 p31,作業 PDF p2。 - 把說明檔去標籤後逐段讀,和報告逐項比對。 以下是外部常識,不是課程或筆記本能驗證的: - 「Sourpuss 是 Terrytoons 的貓」。 - 「goldieblox 是玩具公司」(本檔沒有拿它當修改依據)。