# 章節包:人工智慧導論(AI)W4(10/1)第 02 章「用聯合分布推論與獨立性」 Ch12 Part 2(2021 錄影)影片 0:15:54–0:41:38,YouTube ID iuAeHIfOscA,逐字稿 C:\D槽\TAICA課程\人工智慧導論\第四周1151001\W4_人工智慧導論_Ch12_Part2.逐字稿.txt。Notion 章節頁 https://app.notion.com/p/3ecfc631b03081bdb8b1e658c224b992(頁 ID 3ecfc631b03081bdb8b1e658c224b992),頁面標題「02 用聯合分布推論與獨立性(0:15–0:41)」。 ## 1. 第一行(直接照抄,不要改) [人工智慧導論](https://app.notion.com/p/3e6fc631b0308131b213f0a3d93fe91d) › [W4(10/1)](https://app.notion.com/p/3ecfc631b03081e895d2c5f3aec0353e) › 02|Ch12 Part 2(2021 錄影)影片 [0:15:54–0:41:38](https://www.youtube.com/watch?v=iuAeHIfOscA&t=954s)|投影片 Ch12 p.27–39|上一章 [01 機率的表示法與基本公理(0:00–0:15)](https://app.notion.com/p/3ecfc631b030815aa226c2d0b9d9456b)|下一章 [03 貝氏定理與腦膜炎例子(0:00–0:18)](https://app.notion.com/p/3ecfc631b0308195b80eee3967f27362) ## 1b. 最後一行(直接照抄,放在 Self-check 後面,當全頁最後一行) 讀完了嗎?下一章:[03 貝氏定理與腦膜炎例子(0:00–0:18)](https://app.notion.com/p/3ecfc631b0308195b80eee3967f27362)|回到週頁:[W4(10/1)](https://app.notion.com/p/3ecfc631b03081e895d2c5f3aec0353e) ## 2. 各段標題(照順序;每段一個 ## 標題,直接照抄連結) - `## [0:15:54](https://www.youtube.com/watch?v=iuAeHIfOscA&t=954s) 機率推論與完整聯合分布` 老師講什麼:從這裡開始跟 AI 有關:probabilistic inference 是根據觀察到的 evidence 算 query 的 posterior probability(事後機率),用 full joint distribution 當知識庫。例子是 Toothache、Cavity、Catch(牙醫探針有沒有卡住)三個 Boolean 變數,共 8 格、總和為 1。 - `## [0:18:51](https://www.youtube.com/watch?v=iuAeHIfOscA&t=1131s) 查表加總:P(cavity ∨ toothache)` 老師講什麼:要算某個命題的機率,就找出命題成立的所有 possible world 把機率加起來;有蛀牙或有牙痛的格子加總得 0.28。 - `## [0:20:08](https://www.youtube.com/watch?v=iuAeHIfOscA&t=1208s) Marginalization 與 conditioning` 老師講什麼:只要某個變數的分布時,把其他變數所有值的機率加起來,叫 marginalization(summing out),例如 P(cavity)=0.108+0.012+0.072+0.008=0.2,老師說這件事很常做。一般式 P(Y)=Σz P(Y,z);搭配 product rule 改寫成 Σz P(Y|z)P(z) 就叫 conditioning。 - `## [0:24:05](https://www.youtube.com/watch?v=iuAeHIfOscA&t=1445s) 從表算條件機率` 老師講什麼:實務上最關心的是條件機率,例如病人說牙痛時有蛀牙的機率:P(cavity|toothache)=P(cavity∧toothache)/P(toothache)=0.12/0.2=0.6,沒蛀牙則是 0.4。 - `## [0:25:56](https://www.youtube.com/watch?v=iuAeHIfOscA&t=1556s) Normalization constant α` 老師講什麼:0.6 和 0.4 加起來必須是 1,而且分母都是 P(toothache),所以把 1/P(toothache) 當成正規化常數 α,寫成 P(Cavity|toothache)=α P(Cavity, toothache)=α[<0.108,0.016>+<0.012,0.064>]=α<0.12,0.08>=<0.6,0.4>。 - `## [0:30:24](https://www.youtube.com/watch?v=iuAeHIfOscA&t=1824s) 不用知道 P(toothache) 也能算` 老師講什麼:老師反問「這是在玩數學嗎」:重點是整個過程沒用到 P(toothache),只要把分子向量自己正規化就好。實際問題常拿不到某些機率,這個捷徑讓計算更簡單,也讓缺資料時還能算。一般式寫成 P(X|e)=α Σy P(X,e,y)(X 是 query、e 是 evidence、y 是其他未觀察變數)。 - `## [0:35:50](https://www.youtube.com/watch?v=iuAeHIfOscA&t=2150s) 加入 Weather:獨立讓表變小` 老師講什麼:多加一個 Weather,聯合分布變成 2×2×2×4=32 格。照 product rule 拆開後,因為天氣跟牙齒狀況無關,P(cloudy|toothache,catch,cavity)=P(cloudy),整張表可寫成 P(Weather) 乘上原本三變數的聯合分布。 - `## [0:39:14](https://www.youtube.com/watch?v=iuAeHIfOscA&t=2354s) Independence 的定義與銅板例子` 老師講什麼:a、b 獨立時 P(a|b)=P(a)、P(b|a)=P(b)、P(a∧b)=P(a)P(b);變數是否獨立通常靠 domain knowledge 判斷。N 個獨立銅板有 2^N 種結果,聯合分布很難算,但可以各算各的再相乘,大幅減少需要的資訊。 ## 3. 老師強調/會考/不考的地方(原句已驗證;寫進筆記時 ASR 錯字要改正) - (0:33:08) [強調] 「這個巧妙的點在這裡」 → Normalization 技巧的重點:算 P(Cavity|toothache) 完全不需要知道 P(toothache),把分子自己正規化就好。 - (0:39:16) [強調] 「大家不要小看」 → Independence 是機率推論上很重要的特性(0:39:20「很重要的一個特性」),能大幅簡化聯合分布的計算。 ## 3b. 數學段候選(程式抓的,只是提示;寫「跳過提示」行用) 0:24:30–0:26:30 (120s, score 26) 機率 等於 分母 加起來 分之 總和 想說在講這個幹嘛事實上都是為了我們要來算這個機率好那這個conditional probability根據剛剛我們說的告訴你給定有牙痛我有注牙的機率就等於誰呢就等於是我有牙痛的機率分之我有牙痛而且有注牙的機率嘛對不對那我有牙痛的機率是多少呢根據這個表 1 段候選(門檻 6.3 字/30 秒) ## 4. 這章摘要與重要度 (Ch12 Part 2 影片,時間是那支影片的時間)以牙痛/蛀牙/探針卡住的 8 格聯合分布表示範機率推論:查表加總、邊緣化、算條件機率、用 α 正規化而不需要 P(toothache),最後講獨立性如何化簡聯合分布。(核心) ## 5. 整堂課的提醒(ASR 錯字、老師口誤、投影片缺公式等;只用跟這章有關的) - 這週老師採非同步上課,給三支 2021 年錄的舊影片。各章的影片時間是那一支影片自己的時間,章節第一行寫了是哪一支。 - [Ch12 Part 2] 這支是 2021 年錄的舊影片(10/1 非同步上課三支之一),內容只有上課,沒有提到作業、日期或考試安排。 - [Ch12 Part 2] 影片最後在 0:41:36「講到這邊我們想先」句子講到一半就斷了,接續內容應在 Ch12 Part 3。 - [Ch12 Part 2] 老師引用的是課本舊版編號(equation 13.1、13.2;3rd edition 的機率章是 Ch13),今年課本第 4 版是 Ch12,公式編號可能不同。 - [Ch12 Part 2] Ch12 投影片本機沒有,章節的 Exam-ready 英文要用老師唸出的投影片英文句或自己的話(標 my wording),不要憑記憶背課本原文。 - [Ch12 Part 3] 這是 2021 年的錄影。片尾 0:31:05 老師說「下一次上課」會講 Bayesian network,這是 2021 年的課程安排,不代表今年的進度。今年接下來是 Ch13 Part 1 影片,內容剛好接得上。 - [Ch12 Part 3] Ch12 投影片本機沒有,slides 欄寫「Ch12(投影片待補)」。老師在 0:21:29 說「回去翻一下之前那幾頁」、0:27:48 說「最後兩頁」,都要等拿到投影片才能對頁碼。 - [Ch12 Part 3] 逐字稿 0:01:45–0:02:20 有語音辨識重複句和亂碼(日文、土耳其文碎字),內容只有「推廣到隨機變數、可以加入其他證據」一句,寫的時候不要照抄。 - [Ch12 Part 3] 語音辨識常見錯字:Base rule/Best Rule=Bayes' rule、腦模擬=腦膜炎、cursal=causal、cost=cause、to sac=toothache、探身=探針(probe)、basion network=Bayesian network、頭影片=投影片。 - [Ch12 Part 3] 預期中的 wumpus world 例子這支片沒有講;絕對獨立(天氣)只在 0:24:48 順口帶過一句,可能 Part 2 已經講過。 - [Ch13 Part 1] 這支是 2021 年錄的舊影片(10/1 非同步上課的三支之一)。影片裡沒有提到作業、日期或考試安排,所以沒有需要標成「2021 年說法」的行政資訊。 - [Ch13 Part 1] Ch13 投影片本機沒有,slides 欄一律寫「Ch13(投影片待補)」。老師口頭引用的是課本第 3 版的圖號(Figure 14.3),第 4 版對應的是 Ch13,拿到投影片後要再核頁碼。 - [Ch13 Part 1] 逐字稿把「貝氏網路」辨識成「被視網路/備試網路/被子網路/貝斯網路」,把 Earthquake 辨識成「R-squared/EarthCraft」,把 axioms 辨識成「axing」,把 It contains 辨識成「Lay contains」,寫筆記時要改回正確寫法。 - [Ch13 Part 1] 影片停在「怎麼建構貝氏網路」(0:48:13 老師說「稍微告一個段落」),本章第二大問題「怎麼用貝氏網路做推論」留到之後的影片。 - [Ch12 Part 2] Ch12 投影片本機沒有,無法對照頁碼;老師在 0:31:13 說「回到45頁」,指的是算 P(cavity|toothache)=0.6 那一頁(2021 版投影片 p.45),拿到投影片後可用來對齊頁碼。 - [Ch12 Part 2] 老師引用 equation 13.1、13.2(課本第 3 版編號),今年第 4 版是 Ch12,編號可能是 12.1、12.2,不確定。 - [Ch12 Part 2] 0:03:06 逐字稿寫 Weather 的機率「0.6、0.1、0.29、0.11」,0:03:3x 又說「0.6、0.1、0.29、0.01」;課本例子應是 0.01(加總才等於 1),以 0.01 為準。 - [Ch12 Part 2] 0:29:55 附近逐字稿把 0.008 有時寫成 0.08(例如 0:31:5x「0.12 除上 0.12 加 0.08」);正確是 <0.12, 0.08>,正規化後 0.6/0.4(0.12/0.2=0.6),寫筆記時要統一成 0.08。 - [Ch12 Part 2] ASR 錯字很多:to sec/to snack/tootsack=toothache、注牙=蛀牙、join=joint、the basic action Asian=the basic axioms、正宗5=正中午、random robot=random variable、出題字的e=粗體字的 e。0:02:02–0:02:34 有 Whisper 重複段落與亂碼("propablythe patient...tis act"),內容是 P(cavity|¬toothache, teen)=0.1 的例子。 - [Ch12 Part 2] 影片開頭直接從隨機變數講起,沒有重講 W3 的條件機率與 product rule,只在 0:02:04 用「給定沒牙痛的青少年蛀牙機率 0.1」一句回顧,已併在第 1 章第 1 段。 - [Ch12 Part 2] 第 2 章約 25.7 分鐘,略超過 25 分鐘;獨立性(0:35:50 起約 6 分鐘)太短不足以單獨成章,所以併入第 2 章。 - [Ch12 Part 3] 只切成 2 章:第 1 章約 18.8 分鐘、第 2 章約 12.9 分鐘。第 2 章比 15 分鐘短一點,但它是一個完整主題(多證據、條件獨立、naive Bayes),又是片尾,切不出第 3 章,併進第 1 章會超過 30 分鐘,所以維持 2 章。 - [Ch12 Part 3] 沒有投影片,所以每段對應哪一頁沒辦法確認。老師的數字(0.7、1/50000、0.01、0.108、0.016、0.871/0.129)看起來跟 AIMA 課本一致,但沒有拿投影片核對過。 - [Ch12 Part 3] 老師在 0:20:28 一度把 0.016 唸成「0.01 呃 0.016」,應以 0.016 為準。 - [Ch12 Part 3] 0:13:47 老師說的「五千分之一」是假設中有經驗醫生的診斷數字,跟算出來的 0.0014(約 1/714)不一樣;寫筆記時要說清楚兩者是不同來源,不要混在一起。 - [Ch12 Part 3] 片尾 0:30:54 老師說「今天我們主要講的就是整個機遇的介紹」,聽起來 Part 3 是 2021 年某一堂課的結尾,Part 2 與 Part 3 可能是同一堂課的前後段,主 session 合併時可以留意章節之間是否有重疊。 - [Ch13 Part 1] 沒有投影片可對照,章節只能照逐字稿切,頁碼範圍全部待補。拿到 Ch13 投影片後要補每章的頁碼,並核對 Exam-ready 英文句。 - [Ch13 Part 1] 老師引用「figure 14.3」是課本第 3 版的編號(第 3 版貝氏網路在 Ch14,第 4 版在 Ch13),筆記引用圖號時要註明版本。 - [Ch13 Part 1] 0:23:21 逐字稿說聯合機率算出來是「0.00628」,課本的值是 0.000628(0.90×0.70×0.001×0.999×0.998);同一段 John 打電話的機率被辨識成「0.98」,前面 0:13:31 說的是 0.9。不確定是老師口誤還是辨識錯,寫筆記時照課本數字寫,並加一句「注意」。 - [Ch13 Part 1] 逐字稿有大量貝氏網路的錯字(被視網路、備試網路、被子網路、貝斯網路)和英文辨識錯誤(R-squared=Earthquake、Lay contains=It contains、axing=axioms),寫筆記與 Exam-ready 時要改正。 - [Ch13 Part 1] 全片沒有老師明說「會考/不考」的地方;emphasis 只列了帶強調語氣的句子(特別要注意、這是要注意的、ordering 很重要、不要忘了同一個分布)。 - [投影片 2026-10-01 補到] 這章草稿是在沒有投影片時寫的。審稿時必做:(1) 第一行換成章節包第 1 節那行(投影片頁碼已更新);(2) Exam-ready 每一行標「(自擬,投影片待補)」或 (my wording) 的英文,全部換成章節包第 6 節的投影片原句並標頁碼(例 Ch12 p.31),中文解釋跟著改;投影片有、筆記沒有的重要句子補進去;(3) 正文和概念檔裡的 (my wording) 定義改成投影片原句;(4) 投影片的數字、符號、例子跟草稿不同時,以投影片為準。 ## 6. 投影片文字(這章範圍) **這幾頁的公式或內容只在圖裡(文字檔抓不到),寫 Exam-ready 與公式前先用 Read 看這幾張圖:** - Ch12 p.27 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p027.png - Ch12 p.28 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p028.png - Ch12 p.29 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p029.png - Ch12 p.31 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p031.png - Ch12 p.32 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p032.png - Ch12 p.34 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p034.png - Ch12 p.35 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p035.png - Ch12 p.36 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p036.png - Ch12 p.37 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p037.png - Ch12 p.38 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p038.png - Ch12 p.39 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p039.png --- Ch12 p.27 --- • We describe a simple method for probabilistic inference—that is, the computation of posterior probabilities for query propositions given observed evidence. • We begin with a simple example: a domain consisting of just the three Boolean variables Toothache, Cavity, and Catch. The full joint distribution is a 2 × 2 × 2 table as shown in Figure 13.3. Inference Using Full Joint Distributions 38 --- Ch12 p.28 --- • Notice that the probabilities in the joint distribution sum to 1, as required by the axioms of probability. Equation (13.2) gives us a direct way to calculate the probability: simply identify those possible worlds in which the proposition is true and add up their probabilities. For example, there are six possible worlds in which cavity ∨toothache holds: Inference Using Full Joint Distributions 39 --- Ch12 p.29 --- • One particularly common task is to extract the distribution over some subset of variables or a single variable. For example, adding the entries in the first row gives the unconditional or marginal probability of cavity: • This process is called marginalization, or summing out—because we sum up the probabilities for each possible value of the other variables, thereby taking them out of the equation. Inference Using Full Joint Distributions 40 --- Ch12 p.30 --- Inference Using Full Joint Distributions 41 --- Ch12 p.31 --- • In most cases, we are interested in computing conditional probabilities of some variables, given evidence about others. For example, we can compute the probability of a cavity, given evidence of a toothache, as follows: Inference Using Full Joint Distributions 42 --- Ch12 p.32 --- • The two values sum to 1.0, as they should. Notice that in these two calculations the term 1/P(toothache) remains constant, no matter which value of Cavity we calculate. It can be viewed as a normalization constant for the distribution P(Cavity | toothache), ensuring that it adds up to 1. Throughout the chapters dealing with probability, we use α to denote such constants. With this notation, we can write the two preceding equations in one: Inference Using Full Joint Distributions 43 --- Ch12 p.33 --- • In other words, we can calculate P(Cavity | toothache) even if we don’t know the value of P(toothache)! • We temporarily forget about the factor 1/P(toothache) and add up the values for cavity and ¬cavity, getting 0.12 and 0.08. Those are the correct relative proportions, but they don’t sum to 1, so we normalize them by dividing each one by 0.12 + 0.08, getting the true probabilities of 0.6 and 0.4. • Normalization turns out to be a useful shortcut in many probability calculations, both to make the computation easier and to allow us to proceed when some probability assessment (such as P(toothache)) is not available. Inference Using Full Joint Distributions 44 --- Ch12 p.34 --- • If the query involves a single variable, X (Cavity in the example). Let E be the list of evidence variables (just Toothache in the example), let e be the list of observed values for them, and let Y be the remaining unobserved variables (just Catch in the example). The query is P(X | e) and can be evaluated as where the summation is over all possible y’s (i.e., all possible combinations of values of the unobserved variables Y). Notice that together the variables X, E, and Y constitute the complete set of variables for the domain, so P(X, e, y) is simply a subset of probabilities from the full joint distribution. Inference Using Full Joint Distributions 45 --- Ch12 p.35 --- • Let us expand the full joint distribution in Figure 13.3 by adding a fourth variable, Weather. The full joint distribution then becomes P(Toothache, Catch, Cavity, Weather), which has 2 × 2 × 2 × 4 = 32 entries. It contains four “editions” of the table shown in Figure 13.3, one for each kind of weather. • How are P(toothache, catch, cavity, cloudy) and P(toothache, catch, cavity) related? We can use the product rule: Independence 46 --- Ch12 p.36 --- Independence 47 [IMAGE-ONLY] --- Ch12 p.37 --- • The property we used in Equation (13.10) is called independence (also marginal independence and absolute independence). In particular, the weather is independent of one’s dental problems. Independence between propositions a and b can be written as • All these forms are equivalent. Independence between variables X and Y can be written as follows: Independence 48 (13.11) --- Ch12 p.38 --- • Independence assertions are usually based on knowledge of the domain. As the toothache– weather example illustrates, they can dramatically reduce the amount of information necessary to specify the full joint distribution. If the complete set of variables can be divided into independent subsets, then the full joint distribution can be factored into separate joint distributions on those subsets. • For example, the full joint distribution on the outcome of n independent coin flips, P(C1, . . . , Cn), has 2n entries, but it can be represented as the product of n single-variable distributions P(Ci). Independence 49 --- Ch12 p.39 --- Independence 50 [IMAGE-ONLY] ## 7. 逐字稿(0:15:54 前後各多 1 分鐘,原始行) [00:14:56] 好 [00:14:57] 那另外一個 [00:14:59] 叫做inclusion exclusion principle [00:15:03] 好 [00:15:05] probability [00:15:06] 我們剛剛曾經看過probability a and b [00:15:09] 那我們也可以來看 [00:15:11] probability a or b [00:15:13] 就等於誰呢 [00:15:15] probability a加上probability b [00:15:17] 減掉probability a and b嘛 [00:15:19] OK [00:15:20] 這個你可以畫一個Venn diagram [00:15:22] 有沒有 [00:15:23] 左邊這個圓圈圈代表是a出現的 [00:15:26] 範圍 [00:15:27] 右邊這個圓圈圈 [00:15:28] 出現的是b這個範圍 [00:15:29] 那中間交集的部分就是a and b嘛 [00:15:32] 那你要求的是probability a or b [00:15:35] 就是這兩個圓圈圈的 [00:15:37] 連集的範圍 [00:15:38] 我想這個大家應該都知道了 [00:15:42] 好 [00:15:45] 那 [00:15:48] OK所以以上所講的這些呢 [00:15:50] 真的就都是 [00:15:52] 機率的複習而已 [00:15:54] 那慢慢的 [00:15:55] 從這一頁開始我們要進入到 [00:15:57] 那有了這些機率的基本條件之後 [00:16:00] 我們要來進行推算了 [00:16:03] 所以開始真的比較跟AI有關係的 [00:16:09] 跟AI有關係 [00:16:11] 那首先我們先從一個simple method開始 [00:16:14] 我們來做probability inference [00:16:17] That is the computation of posterior probability for query proposition [00:16:23] given observed evidence [00:16:26] 就是我給定我已經觀察到的一些資訊 [00:16:30] 那我想要去問某一個資訊出現的機率 [00:16:35] 這個機率叫做posterior probability [00:16:38] 事後機率啊 [00:16:39] 也就是說我根據一些現有觀察到的事實去推論 [00:16:45] 某一件事情會出現的機率 [00:16:47] We use the full joint distribution as the knowledge base [00:16:52] from which answers to all questions may be derived [00:16:57] 那我們現在呢還是從這個 [00:16:59] 牙醫的這個例子 [00:17:01] 來開始 [00:17:03] 那現在呢假設我有三個random variable [00:17:06] 就是牙痛 [00:17:08] 蛀牙 [00:17:10] 跟這個catch [00:17:11] 這個catch呢 [00:17:13] 你如果去查一下 [00:17:14] 這裡意思是說 [00:17:16] 醫生他的這個牙醫啊 [00:17:19] 牙醫他的這個探針 [00:17:21] 有沒有被卡住 [00:17:23] 有沒有被卡住 [00:17:25] 所以其實啊 [00:17:26] 這裡每一個 [00:17:28] variable的數值都是 [00:17:30] 都是true or false [00:17:32] 都是boolean variable [00:17:34] 有牙痛沒牙痛 [00:17:35] 有蛀牙沒蛀牙 [00:17:37] 然後醫生在看診的時候呢 [00:17:39] 他的這個探針有沒有被你的牙齒卡住 [00:17:41] 有卡住還是沒卡住 [00:17:43] 那通常有卡住可能就代表說那裡有一個洞啊 [00:17:46] 或者是有蛀牙嘛 [00:17:49] 這樣子 [00:17:50] 所以totally呢 [00:17:52] 這個probability distribution [00:17:55] 會有二乘二乘二 [00:17:56] 總共八個 [00:17:58] 數值 [00:18:00] 總共八個數值 [00:18:02] 假設這八個數值是這樣 [00:18:05] 我們姑且不論這裡面這個數字 [00:18:07] 這機率怎麼來的 [00:18:08] 假設是這樣 [00:18:09] 這怎麼看呢 [00:18:10] 就是說 [00:18:11] 在有蛀牙的 [00:18:13] 有牙痛的情況底下 [00:18:15] 探針會卡住 [00:18:17] 而且你有這個蛀牙的機率呢 [00:18:20] 0.108 [00:18:23] 有蛀牙痛 [00:18:25] 然後呢 [00:18:26] 沒有卡住 [00:18:28] 然後呢 [00:18:30] 有蛀牙的機率呢 [00:18:31] 0.012 [00:18:32] 依次類推 [00:18:33] 這樣子 [00:18:37] 好 [00:18:38] 那記得啊 [00:18:39] 這些這總共total有八個機率 [00:18:44] 這八個機率加起來呢 [00:18:45] 會是等於一 [00:18:47] 這個是機率的基本定理 [00:18:51] 那equation13.2 [00:18:52] give us a direct way to calculate the probability [00:18:54] simply identify those possible worlds in which [00:18:57] the proposition is true [00:18:59] and add up their probability [00:19:01] 好 [00:19:02] 什麼意思呢 [00:19:03] 假設我們今天是要來算 [00:19:06] 有蛀牙或牙痛的機率 [00:19:10] 那這個機率怎麼算呢 [00:19:12] 其實只要查表 [00:19:14] 你把有蛀牙的狀況 [00:19:16] 或者是 [00:19:19] 有牙痛的狀況 [00:19:20] 全部把它加起來嘛 [00:19:22] 所以有蛀牙的狀況其實就是這一列 [00:19:25] 0.108 0.012 0.072 0.008 [00:19:29] 你把這四個加在一起嘛 [00:19:32] 所以這個就是 [00:19:35] 前面這四個數字 [00:19:38] 然後再來是有牙痛 [00:19:40] 有牙痛的其實就是 [00:19:42] 0.108 0.012 0.016 0.064嘛 [00:19:47] 但因為上面這兩個剛剛已經加過了 [00:19:49] 所以現在再把這兩個加起來就好了 [00:19:51] 所以呢 [00:19:53] 就是有蛀牙 [00:19:55] 然後呢 [00:19:56] 或者有牙痛的機率呢是 [00:19:58] 0.28 [00:20:00] OK 是這樣子 [00:20:02] 好 [00:20:06] 那 [00:20:08] 在我們在進行機率的這些運算的時候呢 [00:20:12] 我們 [00:20:14] One particular common task [00:20:16] is to extract the distribution [00:20:18] over some subset of variable [00:20:20] or a single variable [00:20:22] 有的時候我們更常做的是說 [00:20:24] 我只要算 [00:20:26] 有蛀牙的機率 [00:20:28] 我現在三個random variable嘛 [00:20:29] 我現在 [00:20:30] 想要去算出說 [00:20:32] 某一個random variable的 [00:20:34] 其中一個數值的機率 [00:20:35] 比如說有蛀牙的機率 [00:20:37] 那其實就是把剛剛的 [00:20:39] 那一列的數值加起來 [00:20:40] 0.108 0.012 0.072 0.008 [00:20:43] 把它加起來嘛 [00:20:45] 這一件這個動作 [00:20:47] 叫做marginalization [00:20:51] marginalization [00:20:53] 邊緣化 [00:20:55] 或者叫summing out [00:20:57] 那它的意義其實就是說 [00:21:00] 有蛀牙 [00:21:03] 有蛀牙的情況底下 [00:21:05] 我把 [00:21:07] 同時有牙痛沒牙痛的狀況 [00:21:09] 全部都加起來 [00:21:11] 然後探針有卡住跟沒卡住的狀況 [00:21:14] 都加起來 [00:21:16] 我等於說我去sum over [00:21:20] summing over [00:21:22] the subset of variable [00:21:24] 我把有牙痛沒牙痛 [00:21:27] 有探針有卡住沒卡住的狀況 [00:21:29] 的機率全部加起來 [00:21:31] 那就得到了 [00:21:32] 我有蛀牙的狀況的機率 [00:21:36] 這件事情是很常做的 [00:21:39] 我們稱呼這個叫做marginal probability of cavity [00:21:43] 那這個動作就叫做marginalization [00:21:46] 或者是summing out [00:21:49] 那因為呢我們sum up [00:21:52] the probability for each possible value [00:21:55] of the other variables [00:21:57] 所以說呢 [00:21:58] taking them out of the equation [00:22:02] 我們你看在這個equation裡面 [00:22:04] 沒有看到什麼牙痛 [00:22:06] 跟探針卡住的variable在裡面 [00:22:09] 的數值在裡面 [00:22:10] 因為它已經被我 [00:22:12] 全部都含瓜住了 [00:22:14] 我不用特別指定說什麼 [00:22:16] 有蛀牙沒蛀牙 [00:22:17] 因為我care的是 [00:22:19] 不是 [00:22:20] 我沒有去care它是不是有牙痛沒牙痛 [00:22:23] 因為我care的是有蛀牙這件事 [00:22:26] 而有蛀牙有可能沒牙痛啊 [00:22:28] 有蛀牙有可能有牙痛啊 [00:22:30] 這樣子 [00:22:32] 好那這更formally來寫的話 [00:22:35] marginalization這件事情 [00:22:37] 可以寫成這樣 [00:22:39] 你看這裡的寫法已經是 [00:22:41] probability density function了嘛 [00:22:43] probability y [00:22:44] 就等於是summation z [00:22:47] 屬於大Z probability y [00:22:50] 也就是說這裡其實是把y的狀況 [00:22:54] 它對應到各式各樣不同的z的狀況的機率 [00:22:57] 你全部的加起來 [00:22:59] 就得到probability y [00:23:01] 這個就是marginalization [00:23:04] 那同樣的這個cavity的狀況也是啊 [00:23:07] 我去算這個probability density function of cavity [00:23:13] 那它就相當於是 [00:23:15] 我把所有可能的z [00:23:17] 全部的狀況的機率全部加起來 [00:23:19] 那這個這時候的z呢 [00:23:20] 就包含的是探針有沒有卡住 [00:23:22] 有沒有牙痛的狀況全部加起來了 [00:23:25] 那conditional probability的部分 [00:23:27] 也是一樣 [00:23:29] 你可以這樣子寫 [00:23:31] 這叫conditioning [00:23:33] 你也一樣就是把所有的z狀況全部都把它加起來 [00:23:37] 就是說你可以把這上面的這個 [00:23:39] 應該這樣講 [00:23:40] 這個probability y到點z [00:23:44] 可以寫成是probability z [00:23:47] 再乘上probability y given z [00:23:50] 這個就是join probability的拆解嘛 [00:23:53] 有沒有你可以把這個 [00:23:55] 拆解成這個樣子嘛 [00:23:57] 好這個在我們剛剛 [00:24:00] 在講到join probability的時候 [00:24:02] 應該也講過這件事 [00:24:05] 好在大部分的情況底下呢 [00:24:07] 我們對於conditional probability [00:24:10] 某一些variable的conditional probability [00:24:13] 是很有興趣的 [00:24:15] 比如說在給定 [00:24:18] 這個病人來了 [00:24:19] 他說我有牙痛 [00:24:21] 好那麼你有注牙的機率是多少 [00:24:26] 所以我們常常對這樣的機率有興趣 [00:24:29] 好那剛剛前面講了一頭拉鼓 [00:24:32] 想說在講這個幹嘛 [00:24:33] 事實上都是為了我們要來算這個機率 [00:24:37] 好那這個conditional probability [00:24:39] 根據剛剛我們說的 [00:24:42] 告訴你給定有牙痛 [00:24:46] 我有注牙的機率就等於誰呢 [00:24:49] 就等於是我有牙痛的機率 [00:24:52] 分之我有牙痛而且有注牙的機率嘛 [00:24:56] 對不對 [00:24:57] 那我有牙痛的機率是多少呢 [00:24:59] 根據這個表 [00:25:00] 我們就可以把這幾個數字加起來 [00:25:03] 好那有牙痛又有注牙的機率呢 [00:25:07] 就是0.108加上0.012嘛 [00:25:09] 所以加起來一除上這個就等於0.6嘛 [00:25:14] 對不對 [00:25:15] 好那反之告訴你有牙痛 [00:25:20] 你沒有注牙的機率 [00:25:22] 那一樣它有同樣的事實嘛 [00:25:24] 那分母一樣照樣選 [00:25:26] 就是牙痛的機率總和 [00:25:28] 分之有牙痛沒有注牙 [00:25:33] 那就是0.016加上0.064 [00:25:36] 加起來呢就等於0.4嘛 [00:25:41] 對不對 [00:25:42] 好所以呢 [00:25:43] 我們常常在實際的應用當中 [00:25:46] 我們care的是這個conditional probability [00:25:51] conditional probability [00:25:52] 而我們可以這樣子下去進行計算 [00:25:55] 好 [00:25:56] 那特別注意一點是說 [00:25:58] 這兩個數值0.6跟0.4加起來等於1耶 [00:26:02] 它們事實上也必須等於1 [00:26:05] 為什麼呢 [00:26:06] 因為是我在給定牙痛的情況底下 [00:26:09] 它有注牙的機率跟沒注牙的機率 [00:26:12] 那加起來當然應該等於1呀 [00:26:14] 好 [00:26:16] 那再來另外一個要注意一點就是說 [00:26:19] 它們都同處同一個分母 [00:26:23] 這個分母是固定的 [00:26:26] 對不對 [00:26:27] 你看它們的分母都長一樣 [00:26:29] 這分母是一個固定的值 [00:26:31] 好那既然分母是一個固定的值 [00:26:33] 我們就可以把 [00:26:35] probability cavity given to sec [00:26:39] 這個事情啊 [00:26:41] 視為是一個 [00:26:43] 我們好像用同樣的一個數字 [00:26:45] 這個來進行正規化 [00:26:49] 它是一個normalization constant [00:26:51] 的意思 [00:26:53] 這個normalization constant確保了 [00:26:56] 我有注牙跟沒注牙的機率 [00:27:00] 在給定這個條件的情況底下 [00:27:02] 有注牙沒注牙的機率加起來會等於1呀 [00:27:05] OK [00:27:07] 那在底下的探討裡面呢 [00:27:09] 我們會故意用一個α這個值 [00:27:12] 來代表這個normalization constant [00:27:15] 有了這樣的一個說明之後 [00:27:20] 我們就可以把 [00:27:21] 本來應該是probability cavity given to sec [00:27:24] 我們可以把它寫成是 [00:27:27] αprobability cavity given to sec [00:27:32] 好這是什麼呢 [00:27:34] 這個就相當於 [00:27:36] 你這個probability cavity given to sec [00:27:39] 相當於上面的這個分子 [00:27:42] 跟這個分子 [00:27:44] 這兩個分子 [00:27:46] 好那那個α是誰 [00:27:48] α就是probability to sec分之一 [00:27:53] 這個α其實就是probability to sec分之一 [00:27:56] 這樣子 [00:27:57] 這樣瞭解嗎 [00:28:01] 因為他們都處於同一個分母嘛 [00:28:03] 我把這個分母 [00:28:05] 把它提出來變成是這樣子吧 [00:28:09] 分母分子 [00:28:10] 這個probability to sec分之一 [00:28:12] 就是我的α [00:28:13] 然後呢在乘上 [00:28:14] 我現在 [00:28:15] 我這裡其實是兩個分子的意思嘛 [00:28:18] 好 [00:28:20] 那這個分子呢 [00:28:23] 我又可以寫的 [00:28:24] 再更general一點 [00:28:27] 這個分子的意義就是說 [00:28:30] 呃 [00:28:31] 有牙痛 [00:28:33] 以及 [00:28:35] 有蛀牙 [00:28:36] 跟沒蛀牙的兩種狀況 [00:28:38] 好 [00:28:39] 有牙痛 [00:28:40] 有然後呢 [00:28:41] 蛀牙不蛀牙 [00:28:43] 我後面還有另外一個 [00:28:45] 我探針有有卡住沒卡住啊 [00:28:47] 所以我又可以把它 [00:28:48] 另外一個具體化就是說 [00:28:50] 有卡住 [00:28:51] 沒卡住 [00:28:52] 這樣子 [00:28:53] 好 [00:28:54] 那我們來看一下 [00:28:55] 好 [00:28:56] 這個是什麼勒 [00:28:57] 這個機率就是說 [00:28:59] 有蛀 [00:29:00] 有牙痛 [00:29:01] 有卡住 [00:29:02] 然後呢 [00:29:03] 有蛀牙的機率跟沒蛀牙的機率 [00:29:05] 這個probability distribution [00:29:07] 就等於是 [00:29:09] 看一下 [00:29:10] 呃 [00:29:11] 牙痛蛀牙 [00:29:12] 牙痛卡住 [00:29:13] 牙痛卡住 [00:29:14] 有蛀牙沒蛀牙 [00:29:15] 所以是0.108跟0.016 [00:29:17] 在這裡 [00:29:19] 在這裡 [00:29:20] 好 [00:29:21] 那右邊這個呢 [00:29:22] 有牙痛 [00:29:23] 沒卡住 [00:29:25] 有蛀牙沒蛀牙 [00:29:27] 好 [00:29:28] 有牙痛 [00:29:29] 沒卡住 [00:29:31] 有蛀牙 [00:29:32] 沒蛀牙 [00:29:33] 0.012跟0.064 [00:29:35] 是這個 [00:29:36] 好 [00:29:37] 所以這個是 [00:29:38] 這一個符號 [00:29:39] 這代表兩個機率嘛 [00:29:41] 這個符號也代表兩個機率嘛 [00:29:42] 然後前面呈上一個α [00:29:44] OK [00:29:45] 好 [00:29:46] 那 [00:29:47] 你把這兩個機率這樣加起來 [00:29:50] 好 [00:29:51] 為什麼這可以加起來 [00:29:52] 因為就是有蛀牙沒蛀牙的兩種狀況 [00:29:54] 加起來 [00:29:55] 就變成α0.12 [00:29:57] 0.008 [00:30:00] 0.12跟0.008 [00:30:02] 那經過你這個normalize之後呢 [00:30:04] 其實就等於0.6 [00:30:05] 0.4 [00:30:06] 那的確 [00:30:07] 如果我們所預期兩個加起來 [00:30:09] 應該要等於 [00:30:10] 以經過這個normalize的vector之後 [00:30:13] 它加起來應該要等於1 [00:30:15] 好 [00:30:16] 那以後呢 [00:30:17] 這樣子的表達形式 [00:30:19] 還會繼續的出現 [00:30:21] 好 [00:30:23] 那 [00:30:24] 但是這個是在玩數學嗎 [00:30:26] 這樣是在玩數學嗎 [00:30:28] 事實上不是 [00:30:29] 你仔細看 [00:30:31] in other words [00:30:32] we can calculate [00:30:33] probability cavity given to snack [00:30:38] even if we don't know the value [00:30:41] of probability to snack [00:30:43] 什麼意思呢 [00:30:50] 就是說 [00:30:54] 在整個運算的過程當中 [00:30:58] 我們其實並不知道 [00:31:01] 會發生 [00:31:04] 應該怎麼講 [00:31:05] 在這整個運算當中 [00:31:06] 我們其實並沒有應用到 [00:31:10] 牙痛出現的機率 [00:31:12] 就是說你看啊 [00:31:13] 回到45頁這一頁的影片 [00:31:16] 當我們要來計算這個機率的時候 [00:31:19] 我們是不是要分母要放 [00:31:21] 牙痛的機率 [00:31:22] 然後呢 [00:31:23] 分支牙痛而且蛀牙 [00:31:26] 的機率對不對 [00:31:27] 這個計算也是 [00:31:28] 我們要知道牙痛的機率分支牙痛 [00:31:31] 而且沒有蛀牙的機率 [00:31:34] 可是呢 [00:31:35] 到了這邊的這個推導 [00:31:37] 我們其實這最後 [00:31:39] 我們一樣是算出0.6 0.4 [00:31:41] 而我們怎麼算出來的呢 [00:31:43] 我們是根據 [00:31:45] 這個機率 [00:31:47] 這個distribution [00:31:49] 跟這個distribution [00:31:51] 這加總 [00:31:52] 然後我們再做一個normalize [00:31:54] 這個normalize [00:31:55] 其實0.12 0.008 [00:31:57] 我不知道α [00:31:58] 我也可以normalize [00:31:59] 0.12跟0.008 [00:32:02] 為什麼 [00:32:03] 因為我們只要把它 [00:32:04] 這個normalize是一個 [00:32:06] 是一個什麼簡單的運算嘛 [00:32:09] 你只要把0.12除上 [00:32:11] 0.12加0.08 [00:32:13] 其實就等於0.6啊 [00:32:15] 你把0.08除上 [00:32:17] 0.12加上0.08 [00:32:19] 也是等於0.4啊 [00:32:21] 也就是說 [00:32:22] 我根本不必利用到這個α [00:32:24] 大家還記得 [00:32:25] 我剛剛講這個α是誰 [00:32:27] 這個α就是 [00:32:28] 牙痛的機率分之一嘛 [00:32:31] 可是呢 [00:32:32] 其實你在這裡你可以完 [00:32:33] 你只是把這個α當成是一個 [00:32:36] 我告訴你喔 [00:32:37] 你這邊你要normalize [00:32:39] 而你這個你normalize [00:32:41] 要不要仰賴 [00:32:43] 牙痛的機率 [00:32:44] 其實不用 [00:32:45] 你這兩個數字 [00:32:46] 你自己就可以normalize [00:32:47] 乘0.6 0.4的 [00:32:49] 好所以下面這一頁的重點 [00:32:50] 再來講說 [00:32:52] 我啊 [00:32:53] 其實根本就不需要 [00:32:54] 用到牙痛的機率 [00:32:56] 我就可以去算出 [00:32:58] 告訴你牙痛 [00:33:00] 你 [00:33:01] 是 [00:33:02] 蛀牙或非蛀牙的機率 [00:33:04] 這樣瞭解嗎 [00:33:08] 這個巧妙的點在這裡 [00:33:10] 好 [00:33:11] 那代表說呢 [00:33:12] 我們是暫時性的 [00:33:14] 忽略或忘記了 [00:33:16] 牙痛的機率分之一 [00:33:18] 這件事情 [00:33:19] 我們剛剛的整個運算 [00:33:20] 就是算出0.12 0.008 [00:33:22] 那0.12 0.08 [00:33:24] 我們自己normalize [00:33:25] 就變成0.6 0.4了 [00:33:27] 我根本也不用看這個 [00:33:29] 好所以normalization [00:33:31] turns out to be a useful shortcut [00:33:33] in many probability calculations [00:33:35] both to make the computation easier [00:33:38] and allow us to perceive [00:33:40] when some probability assessment [00:33:42] is not available [00:33:44] 好就是說這樣子的一個技巧 [00:33:47] 讓我們 [00:33:48] 有的時候我們可能根本 [00:33:50] 在實際問題上 [00:33:52] 我們根本無法取得所謂的 [00:33:55] 牙痛的機率 [00:33:57] 那你說有啊有啊這裡有啊 [00:33:58] 這個表不就是了嗎 [00:34:00] 那這只是一個舉例吧 [00:34:03] 我們不是永遠都可以 [00:34:05] 找出這個表格裡面的 [00:34:08] 每一個數字 [00:34:10] 這實際的問題上不見得如此 [00:34:14] 那也就是這樣的一個技巧 [00:34:17] 讓我們能夠 [00:34:19] 有機會的算出各種 [00:34:21] 更多的不同的機率 [00:34:28] 好那如果我的query [00:34:30] 只牽涉到一個variable [00:34:32] 比如說cavity [00:34:34] 出題字的e呢 [00:34:35] 代表是我的evidence [00:34:37] 比如說就是這個 [00:34:39] to sec [00:34:41] 所以說我們剛剛 [00:34:42] 前面那兩頁在講的事情 [00:34:44] 寫的更一般話來講就是 [00:34:46] probability x given e [00:34:49] 給定evidence [00:34:51] 然後呢我要去算 [00:34:52] x出現的機率 [00:34:54] 那根據剛剛前面的邏輯 [00:34:55] 我可以把這一個寫成是 [00:34:58] probability x到點e的 [00:35:01] normalization的版本 [00:35:03] 正規化的版本 [00:35:05] 好 [00:35:06] 那這個再往下延伸 [00:35:08] 我們就可以寫成是 [00:35:10] 我把所有 [00:35:11] 因為這個機率 [00:35:12] 我可能還是不會算 [00:35:14] 但是我有可能是 [00:35:15] 我知道說 [00:35:16] x跟e以及 [00:35:19] 各種可能的y的所有的狀況 [00:35:22] 的機率 [00:35:23] 我可能有 [00:35:24] 那我把這些都sum起來 [00:35:26] 加起來 [00:35:27] 我就得到了 [00:35:28] 這個機率 [00:35:29] 這個distribution [00:35:30] 那我有了這個distribution [00:35:32] 我自己就可以去做normalization [00:35:34] 那我就可以算出這個了 [00:35:36] 我根本也不要你這個alpha [00:35:38] 所以整個的概念就是這樣子 [00:35:43] 好 [00:35:44] 那所以這個部分呢 [00:35:46] 算是蠻有趣的一個技巧 [00:35:50] 那接下來下一個主題 [00:35:53] 下一個主題 [00:35:58] 我們現在把這個 [00:36:00] 剛剛這個表呢 [00:36:01] 在expand [00:36:02] 多一個variable [00:36:04] random variable [00:36:06] 比如說weather [00:36:07] 好了 [00:36:08] 好 [00:36:09] 所以剛剛本來已經有三個variable [00:36:10] 就是有沒有牙套 [00:36:12] 有沒有蛀牙 [00:36:14] 探針有沒有卡住 [00:36:16] 現在再多一個 [00:36:17] 就是說今天的天氣是怎麼樣 [00:36:20] 那這樣子的話呢 [00:36:22] 我們的probability distribution function [00:36:25] 就變成是probability to set [00:36:27] catch cavity跟weather [00:36:30] 你這個排列組合就會有 [00:36:31] 二乘二乘二乘四 [00:36:33] 總共32個entry [00:36:35] 所以其實啊 [00:36:36] 這個table呢 [00:36:39] 這個table本來就已經是 [00:36:43] 三個variable [00:36:44] 我好不容易弄出一個 [00:36:47] 有八個entry的table [00:36:50] 那現在呢 [00:36:51] 我可能晴天我就有一個這樣的table [00:36:53] 雨天就有一個這樣的table [00:36:55] 陰天跟下雪都個別有一個這樣的table [00:36:58] 這樣 [00:36:59] 好 [00:37:02] 那 [00:37:04] 我們現在想要探討的是說 [00:37:06] 那麼 [00:37:08] 今天probability to set [00:37:11] catch cavity cloudy [00:37:14] 這個join probability [00:37:16] 跟probability to set [00:37:19] catch cavity [00:37:21] 它們的關係是怎麼樣 [00:37:23] 好 [00:37:24] 那根據我們之前講的product rule [00:37:26] 這個join probability呢 [00:37:28] 其實可以寫成是 [00:37:30] 這三個的join probability [00:37:32] 的機率在乘上 [00:37:34] 給定這三個 [00:37:36] 陰天出現的機率 [00:37:38] 就形成了這四個的 [00:37:40] join probability [00:37:42] 對不對 [00:37:43] 就是product rule [00:37:45] 其實可以再繼續往下細分 [00:37:47] 這個大家以前學機率應該學過 [00:37:49] 就是chain rule [00:37:51] 好 [00:37:53] 那但是呢 [00:37:55] 這裡故意舉一個這麼奇怪的例子 [00:37:57] 是因為 [00:37:58] 但是其實就正常的人 [00:38:00] 就應該知道 [00:38:02] 就是說你牙不牙痛 [00:38:04] 探針有沒有卡住 [00:38:05] 有沒有蛀牙 [00:38:06] 跟天氣有沒有關係 [00:38:08] 一點關係都沒有啊 [00:38:09] 所以我給定 [00:38:11] 你這個什麼牙痛的狀況 [00:38:13] 探針卡住的狀況 [00:38:15] 跟這個 [00:38:16] 呃 [00:38:17] 這個蛀牙的狀況 [00:38:18] 會不會影響到天氣 [00:38:20] 不會影響 [00:38:21] 所以 [00:38:22] whether [00:38:23] 這個random variable [00:38:24] 跟其他random variable [00:38:25] 是怎麼樣 [00:38:26] 獨立的 [00:38:27] 其實這個機率呢 [00:38:29] 可以直接寫成是 [00:38:31] 陰天的機率 [00:38:34] 因為它跟 [00:38:36] 這三個random variable是independent [00:38:38] 是獨立的嘛 [00:38:39] 那也就是因為這樣 [00:38:41] 所以我們可以把剛剛的product rule [00:38:43] 簡寫成這樣 [00:38:45] probability cloudy [00:38:47] 乘上probability [00:38:48] 這三個的join probability就好了 [00:38:50] 好 [00:38:51] 那原因是因為 [00:38:52] 我把這個部分簡化了嘛 [00:38:54] 因為它是獨立的 [00:38:55] 所以我們可以簡化 [00:38:57] 那寫成這個random variable的形式 [00:39:00] 我們就可以把 [00:39:01] 這四個random variable的join probability distribution [00:39:04] 寫成是 [00:39:05] whether的probability distribution [00:39:07] 乘上這三個的join probability distribution [00:39:11] 我們可以進行簡化 [00:39:13] 好 [00:39:14] 那independence這件事情 [00:39:16] 大家不要小看 [00:39:17] 它其實是 [00:39:18] 很在我們這個機率的推論上 [00:39:20] 很重要的一個特性 [00:39:22] 好 [00:39:23] 我們特別喜歡independent的狀況 [00:39:26] 因為這樣可以讓我們的運算 [00:39:29] 簡化很多 [00:39:31] 所以今天如果說 [00:39:32] A跟B這兩個proposition [00:39:34] 是independent [00:39:36] 是獨立的話 [00:39:37] 那麼probability A given B [00:39:39] 就可以寫成是probability A [00:39:41] probability B given A呢 [00:39:43] 就可以寫成probability B [00:39:45] probability A and B呢 [00:39:46] 就可以寫成probability A [00:39:48] 乘上probability B [00:39:50] 好 [00:39:51] 那這是proposition [00:39:53] 那如果說寫成是random variable的形式 [00:39:56] 就是底下這個樣子 [00:39:58] 好 [00:40:00] 好 [00:40:01] 那independence呢 [00:40:02] usually based on knowledge of domain [00:40:04] 那我怎麼知道 [00:40:05] 哪個random variable [00:40:06] 跟哪個random variable [00:40:07] 是不是independence [00:40:09] 那可能就會有一些domain knowledge [00:40:11] 好 [00:40:12] 那 [00:40:13] 它呢 [00:40:14] 可以急劇的減少 [00:40:16] 我們所需要的資訊量 [00:40:18] 來 [00:40:19] 當我們要計算這個 [00:40:21] full or joint distribution的時候 [00:40:23] 可以大量的簡化我們的運算 [00:40:25] 好 [00:40:26] 那所以比如說啦 [00:40:28] 假設今天我丟N個獨立的銅板 [00:40:33] 好 [00:40:34] 那我們想要去算說 [00:40:35] 這銅板呢 [00:40:36] 這N個獨立的銅板 [00:40:38] 它的正反正反的狀況 [00:40:41] 其實有幾種變化 [00:40:42] 有2的N次方種 [00:40:44] 這麼多種變化 [00:40:45] 好 [00:40:46] 那所以我們要算的是probability [00:40:48] 第一個銅板是正面反面的機率 [00:40:51] and第二個銅板正面反面的機率 [00:40:53] 一直到第N個銅板正面反面的機率 [00:40:55] 那這個其實這個join probability [00:40:57] 是不好算的 [00:40:59] 是很難算的 [00:41:00] 好 [00:41:01] 那但是呢 [00:41:02] 我們就可以利用independent的形式 [00:41:04] 我們可以各算各的 [00:41:06] 第一個銅板正面的機率 [00:41:08] 跟反面的機率 [00:41:10] 乘上第二個銅板 [00:41:11] 我各算各的 [00:41:12] 所以我只要把它乘起來 [00:41:13] 就好了嘛 [00:41:14] 好 [00:41:15] 那底下這是一個示意圖啊 [00:41:17] 就是說 [00:41:18] 如果原本是這四個random robot [00:41:21] 我其實根本就可以把它細分 [00:41:24] 拆解成這樣 [00:41:25] 很簡單的拆解成這樣 [00:41:27] 那如果是independent的coin的話 [00:41:29] 也可以拆解 [00:41:31] OK [00:41:33] 好 [00:41:34] 講到這邊 [00:41:36] 我們想先 ## 8. 寫作規則 (這是 `_筆記SOP.md` 第 3.1、4、5、6 節的濃縮版。兩者衝突時以 SOP 為準。) 讀者:碩士生,兩門課期末是英文考試。要只看筆記就能學會,講得比老師好懂。畫面要簡潔。 **概念優先(2026-09-26 主理人)**:主理人只想懂概念,不想補數學、不想看程式碼和座標圖。兩門課的考試也都是問答題、不考算式(AI W1 1:16:52;NLP W3 1:47:41、2:48:36)。所以: - 每段預設看得到的只有:白話摘要(2–4 句)+**一句生活比喻**(例:模擬退火像投資理財,年輕時敢冒險、越老越保守)+「考試可能怎麼問」一句。 - 數學推導、公式、手算、程式碼、座標圖,全部收進標題寫「(進階,可跳過)」的摺疊,例如「它到底怎麼運作?(進階,可跳過)」。每段最多一個進階摺疊,不要寫長篇計算。 - 演算法要能「用文字說出步驟」(考試可能要你描述),這一點放在預設看得到的地方,不用數字。 - **重心比例**:白話理論與概念模式(它在解決什麼問題、核心想法、跟別的方法差在哪、優缺點、生活比喻)占主要篇幅;數學與程式細節只用一兩句帶過,細節收進進階摺疊。 **圖文並茂(2026-09-26 主理人:不要只有文字)**: - 每章至少 2–3 個圖,放在**預設看得到**的地方,每個圖前後各用一兩句白話說明「這張圖在看什麼」。 - 流程、步驟、因果、比較 → 用 mermaid 流程圖(```mermaid,flowchart LR 或 TD;節點文字用中文、加雙引號;一張圖不超過 10 個節點)。 - 投影片上的示意圖、架構圖 → 用 [[IMG: …]] 放投影片圖。 - 仍守「每個 ## 段落最多一種視覺元素」。 ### 輸出兩個檔 1. `chNN.md`(Notion 寫法,不含頁面標題),結構固定: - 第一行:章節包第 1 節那行,原樣照抄。 - 第二行起(有數學段才寫):**跳過提示**,每段一行,讓主理人看影片時知道從哪跳到哪。用章節包第 3b 節的候選當提示,對照第 7 節逐字稿確認(只標老師連續講公式、推導、矩陣、微積分、機率計算、程式細節超過約 1 分鐘的段落;概念講解和比喻不算): `跳過提示:(1:31:02–1:35:40) 老師在推導梯度公式,聽不懂可以直接跳到 [1:35:40](YouTube 連結),接著講「步長 α 怎麼選」。` - `## 重點`:三點中文,每點一到兩句。 - `## Exam-ready`:3–10 行英文,**從章節包的投影片文字逐字抄**,每行 `- **Term**: "原句"(Ch3 p.14)`。老師有明確證據才在行尾加 `【老師強調】(h:mm:ss)`。 **每一行下面一定要有一行縮排的中文解釋**(主理人英文不好,看不懂的英文等於沒用): ``` - **Hill climbing**: "It keeps track of one current state and on each iteration moves to the neighboring state with highest value."(Ch4 p.5) - 中文:爬山法只記住「現在這一個狀態」,每一輪都移到分數最高的鄰居。白話:一直往比較高的地方走一步。 ``` 中文要先把句子意思講清楚,再補一句白話;最後用「英文(中文)」列出這句裡 1–3 個難字,例:sparse(稀疏)、distinct terms(不重複的字)。 **一行只放一句投影片原句**。同一頁有多句要考就拆成多行,每行各接一行中文;不要用分號串三句以上,不要把計算量 O(...) 塞進去。 - 章節包第 2 節的每一段:`## [h:mm:ss](連結) 標題`(照抄),下面 2–4 句白話摘要,其餘全部收進摺疊: ```
問句(例:用生活例子講,BFS 在做什麼?) 內容
``` 摺疊種類(需要才放):用生活例子講?/它到底怎麼運作?/要先懂什麼?(老師假設你會的數學或概念,短版教學)/老師原話是什麼?(「原話」(h:mm:ss),只放重要的,最多 5 句)。 - 「它到底怎麼運作?」要用一組小數字把這段的演算法**真的跑 1–3 步**(例:算出梯度、更新一次、比較兩個 α),不是只示範定義的加減乘除。全章盡量沿用同一組數字,讓前一段的答案能在下一段被驗證。 - 每段正文要回答讀者最可能卡住的一個「為什麼」。投影片公式方向跟題目相反、或投影片說「解不出來」時,用一兩句講出原因,自己補的標(我補充)。 - 投影片句子停在公式前(公式在圖裡)時:Exam-ready 在粗體詞條上補公式、引號內保持原句;正文寫出同一條式子。公式圖看章節包第 6 節列出的 PNG。 - `## Self-check`:2–4 題英文考題,答案收摺疊。**至少一題考老師強調的內容**;只出 explain/why/compare 這類問答題,**不出要代數字計算的題目**(考試不考算式);不出「老師和投影片哪裡不同」這類不會考的題目。每題格式: ```
Q1. English question?(中文:中文題目) **Answer**: English answer. 中文:把答案完整講一遍(不是只翻一句),讓看不懂英文的人也知道要怎麼答。
``` - **最後一行**:章節包第 1b 節那行(下一章連結),原樣照抄。讓讀完的人直接點下一章。 - 不要把章節包或這份規則裡的指示句寫進筆記(例如「寫筆記時照投影片寫」「已改正 ASR 錯字」)。 - 長度:全文不超過 16,000 字元(跟 check_note.py 同一個數字)。**不要為了壓字數反覆刪改**(實測一章最多花 12 輪在刪字);超過時只刪進階摺疊裡的第二組算例,比喻、比較表、圖說、「老師說不用背」的提醒都不刪。 - 預設看得到的正文不放計算量 O(...)、代號對照(例如 SMART 字母)、課本出處考據,一律移進進階摺疊。 2. `chNN.concepts.json`:JSON 陣列,4–12 個考試可能問的術語,每個物件: `name`(英文)、`zh`、`type`(概念/演算法/公式/人物事件/前置知識/行政)、`signal`("老師說會考"/"老師強調"/"核心(我判斷)"/"")、`evidence`(有 signal 前兩種時必填:原句+時間)、`definition_en`(投影片原句;沒有就註明 (textbook)/(lecture)/(my wording))、`plain`(一句中文)、`a4`(≤150 字元英文,可夾極短中文;期末拼貼用的小方塊)、`time`、`slides`、`prereq`(英文名陣列)。 ### 風格鐵律 - 不用 emoji 或裝飾符號(✓✗★⚠ 都不要;→ 可以)。不用 callout。不用 `$`。時間不要用 code 樣式。 - 每個 `##` 段落最多一種視覺元素:一張圖、或一個表格、或一個 mermaid。 - 摺疊標題是問句,前面不加符號。 - 圖片最多 3 張,只放文字取代不了的圖。放法:單獨一行 `[[IMG: | 中文圖說]]`,PNG 用 `slides_to_png.py <圖片資料夾> <頁> --dpi=110` 產生。 - 考試訊號只在老師明確說時標。老師只說「不用背」「不講」就寫「注意:……」。 - 老師口誤或跟投影片不同:照投影片寫,加「注意:老師口頭說的是……」。 - 引用老師的話時,ASR 錯字改成正確的字。 ### 沒有投影片時 不要憑記憶逐字重現課本段落或數值表。英文定義用自己的話寫、句尾標 (my wording);Exam-ready 每行標「(自擬,投影片待補)」。例子只用老師講的。 ### 寫完之後(只做一次) 跑檢查: `C:\Users\user\.cache\meeting-record\venv\Scripts\python.exe C:\Users\user\.claude\scripts\check_note.py --transcript <逐字稿> --slides <投影片 txt …> --start <起> --end <訖> --vid <影片 ID>` - STYLE/VISUAL/TIME/FORMAT:全部改掉。 - QUOTE:確認是不是你改正了 ASR 錯字(是就保留),不是就改成原文或拿掉引號。 - ENGLISH:確認是不是投影片斷行造成的(是就保留),不是就改成投影片原句。 **省額度守則**:章節包裡已經有你需要的全部資料。不要再去讀整份逐字稿、整份投影片、segments.json 或手冊。一次寫好整個檔(Write 一次),檢查後集中修改。