# W4_人工智慧導論_Ch12_Part3.m4a|長度 00:31:39|model large-v3 on cuda [00:00:01] Base rule是在做機率推論裡面最重要的一項原則跟工具。 [00:00:13] 首先我們來看,我們之前講過這個Product rule, [00:00:16] Probability A and B就等於是Probability B乘上Probability A given B。 [00:00:22] 也可以是寫成這樣,是一樣的意思。 [00:00:26] 那你如果把等號左右兩邊,equate the two right hand side and divide it by probability A, [00:00:36] 就是說,因為等號左邊都一樣嘛,所以等號右邊,第一個式子的等號右邊跟第二個式子的等號右邊也一樣。 [00:00:45] 然後呢,大家同儲Probability A,那你就可以得到這個式子。 [00:00:51] 好,那這是什麼呢? [00:00:53] 那Probability B given A等於是Probability A分之Probability B乘上Probability A given B。 [00:01:00] 那這個Equation呢,稱為是Base rule,或者是Base law,或者是Base theory。 [00:01:12] 那這個式子大家不要小看它,它可以說是讓現代的AI系統,讓它有機率推論的最重要的一個式子。 [00:01:24] 就是我們要算, [00:01:25] 給定A的情況底下B出現的機率。 [00:01:28] 這機率怎麼算呢? [00:01:30] 就等於是A出現的機率分之B出現的機率在乘上B出現的情況底下A出現的機率。 [00:01:38] 好,那等一下我們會看到一些例子說明為什麼這個那麼重要。 [00:01:45] 好,那一樣的,我們可以把它推展到Random Variable的形式。 [00:01:50] 所以Probability Y given X就等於是Probability X分之Probability Y乘上Probability X given X。 [00:01:54] 好,那一樣的,我們可以把它推展到Random Variable的形式。 [00:01:55] 所以Probability Y given X就等於是Probability X分之Probability Y乘上Probability X given X。 [00:01:56] 好,那一樣的,我們可以把它推展到Random Variable的形式。 [00:01:57] 好,那一樣的,我們可以把它推展到Random Variable的形式。 [00:01:59] 甚至我如果有考慮其它的Evidence的話 [00:02:00] 甚至我如果有考慮其它的Evidence的話 [00:02:03] 也可以一起把它加進來。 [00:02:05] 也可以一起把它加進來。 [00:02:07] 好,那表面上這個Baselaw好像沒什麼用嘛。 [00:02:10] 好,那表面上這個Baselaw好像沒什麼用嘛。 [00:02:12] これは是讓我們從... [00:02:14] 我們要去算Probability B givenA。 [00:02:16] 我們只是把這個的計算寫成是Probability B跟Probability A。 [00:02:18] 我們只是把這個的計算寫成是Probability A跟Probability B跟Probability A givenB的一些値 cloth göster出來。 [00:02:20] 這個的計算呢 寫成是 [00:02:23] probability A, probability B 跟 [00:02:26] probability A given B 的一些相乘相除的結果 [00:02:29] 表面上好像沒什麼用 [00:02:32] 只是這樣子換來換去 [00:02:35] 但實際上 base rule is useful in practice [00:02:38] because there are many cases [00:02:41] where we do have good probability estimate [00:02:44] for these three numbers and the need to compute the force [00:02:47] 在很多實際的問題上 [00:02:50] 我們沒有辦法 [00:02:53] 直接去估算 [00:02:56] probability B given A [00:02:59] 但是實際上我們有辦法算出 [00:03:02] 這三個數字 [00:03:05] 相對來講比較容易算出probability A [00:03:08] given B 但是我們算不出probability B [00:03:11] given A 就資料的蒐集或者是 [00:03:14] 統計的時候有可能 [00:03:17] 常常會出現這樣的一個情況 [00:03:20] 比如說舉例來講我們常常是 [00:03:23] 看到了某一個 [00:03:26] 某一個結果 [00:03:29] 我們要去推估它的原因 [00:03:32] 所以我們常常想要做這個級率的運算 [00:03:35] 就是probability cost given effect [00:03:38] 就是說我們觀察到一件事情的 [00:03:41] 結果我們要去推 [00:03:44] 告訴你這個結果是長這樣 [00:03:47] 它的原因 [00:03:48] 它原因可能有原因一 [00:03:50] 原因二 [00:03:51] 原因三 [00:03:52] 那它個別這些原因的機率是多少 [00:03:56] 那這件事情是就有點類似說 [00:03:59] 我們在做醫療的診斷 [00:04:01] 我們看到的結果是你牙痛 [00:04:04] 那可能造成牙痛 [00:04:06] 可能有第一個原因第二個原因第三個原因 [00:04:09] 我們想要去推算這個原因 [00:04:11] 但這個機率很難算 [00:04:14] 那根據Best Rule [00:04:16] 我們可以把這個機率改寫成 [00:04:19] probability effect [00:04:21] 分支probability cost [00:04:23] 乘上probability effect given cost [00:04:26] 反而右邊雖然牽涉到三個機率 [00:04:29] 但這三個機率可能是好算的 [00:04:32] 可能是比較好取得的 [00:04:35] 好 [00:04:37] 那所以說呢probability cost [00:04:40] given cost [00:04:41] 我要去算effect [00:04:43] 這個呢是一個cursal direction [00:04:46] 就是這是一個因果關係 [00:04:48] 我告訴你原因 [00:04:50] 我告訴你一個原因 [00:04:51] 它會產生出哪些結果的機率是這個 [00:04:56] 我們可以利用這個機率來去推算 [00:04:59] 我告訴你結果 [00:05:01] 那它是某種原因造成這個結果的機率 [00:05:04] 所以這個是在做診斷 [00:05:07] 上面這個是在因果關係 [00:05:11] In a task [00:05:12] 比如說今天在一個醫療診斷的這個問題裡 [00:05:16] 某一個疾病導致於有某些症狀 [00:05:21] 這個叫做因果關係 [00:05:23] 給定這個疾病 [00:05:24] 那它產生出這種症狀 [00:05:27] 那這個是經過大量的研究之後 [00:05:31] 比如說統計之後 [00:05:33] 我們知道說它有這個疾病 [00:05:35] 那它會有哪些症狀 [00:05:37] 這是因果關係 [00:05:39] 那在一開始一個未知的 [00:05:41] 一個新的病人進來的時候 [00:05:43] 他只知道症狀 [00:05:45] 好 [00:05:46] 給定症狀 [00:05:48] 那它是什麼疾病造成這樣的症狀 [00:05:51] 這個就是在做診斷的 [00:05:53] 所以現在來舉個例子 [00:05:55] 一個醫生知道 [00:05:57] 這個腦膜炎 [00:05:59] 會造成 [00:06:01] 這個頸椎僵硬 [00:06:04] 腦膜炎 [00:06:06] 如果一個人患有腦膜炎 [00:06:08] 有百分之 [00:06:09] 是這樣的嗎 [00:06:15] 對 [00:06:16] 有百分之七十的機率 [00:06:19] 患有腦膜炎的人會頸椎僵硬 [00:06:23] OK [00:06:24] 那此外呢 [00:06:26] 這個醫生又知道一些unconditional的事實 [00:06:32] 比如說某一個地區 [00:06:34] 患有腦膜炎的機率是五萬分之一 [00:06:37] 那這個是可以藉由 [00:06:39] 普遍的統計而得的 [00:06:42] 比如說我們在某個地區 [00:06:45] 這個患有腦膜炎的機率是這樣 [00:06:47] 五萬分之一 [00:06:48] 那某個地區 [00:06:50] 頸椎僵硬的會是1% [00:06:54] 好 [00:06:55] 那假設令S代表的是頸椎僵硬 [00:07:00] M代表的是有腦膜炎 [00:07:02] 那把剛剛上面那些描述呢 [00:07:04] 寫成機率形式就是說 [00:07:06] 患有腦膜炎會造成頸椎 [00:07:09] 告訴你有腦膜炎 [00:07:10] 那他會有頸椎僵硬的機率是0.7 [00:07:13] 腦膜炎的機率呢五萬分之一 [00:07:16] 頸椎僵硬的機率呢 [00:07:18] 0.01 [00:07:19] 好 [00:07:20] 那麼現在有一個人進來了 [00:07:22] 有一個病人進來了 [00:07:23] 未知的情況 [00:07:25] 他說呢他頸椎僵硬 [00:07:27] 那麼他患有腦膜炎的機率是多少呢 [00:07:30] 那我們就可以利用Best Rule [00:07:32] 就寫成是 [00:07:33] Probability S分之Probability M [00:07:36] 乘上Probability S given M [00:07:39] 那把剛剛上面這些數字帶進去 [00:07:41] 0.01分之0.7乘上五萬分之一 [00:07:44] 就等於0.0014 [00:07:46] 所以一個人進來 [00:07:47] 他說他有頸椎僵硬 [00:07:49] 他患有腦膜炎的機率是 [00:07:52] 0.0014 [00:07:55] OK [00:07:56] 好 [00:07:57] 那這個機率呢 [00:07:59] 也許有點出乎你的意料之外 [00:08:02] 因為當你 [00:08:05] 當你在看到這個敘述的時候 [00:08:08] 就是說 [00:08:09] 有腦膜炎 [00:08:11] 的時候 [00:08:13] 會造成頸椎僵硬的機率 [00:08:15] 高達70% [00:08:18] 可是今天如果有一個病人進來 [00:08:21] 他說他頸椎僵硬 [00:08:24] 這個地區的病人進來了 [00:08:27] 他說他頸椎僵硬 [00:08:29] 他實際上患有腦膜炎的機率 [00:08:32] 只有0.0014 [00:08:34] 好像有一點超出 [00:08:37] 我們的直覺的預期對不對 [00:08:41] 好 [00:08:42] 那 [00:08:43] 呃 [00:08:44] 事實上呢 [00:08:45] the probability of 腦膜炎 [00:08:47] in the patient remains small [00:08:50] 事實上是很小的 [00:08:52] 那為什麼那麼小呢 [00:08:54] 其實是因為 [00:08:55] the prior probability of stiff necks [00:08:59] is much higher than that of [00:09:02] 腦膜炎 [00:09:04] 主要是因為這個分子分母的 [00:09:06] 彼此對應的關係 [00:09:08] 因為 [00:09:09] 他說 [00:09:11] 患有頸椎僵硬的機率其實遠高於 [00:09:13] 患有腦膜炎的機率 [00:09:16] 在這個地區 [00:09:18] 患有頸椎僵硬的機率 [00:09:21] 遠高於患有腦膜炎的機率 [00:09:24] 因此 [00:09:25] 雖然說 [00:09:27] 患有腦膜炎 [00:09:29] 會頸椎僵硬的機率是0.7這麼高 [00:09:32] 但是你看他的分子 [00:09:34] 他乘上一個 [00:09:36] 腦膜炎的事前機率是一個很小的值 [00:09:40] 一乘之後這個分子變很小 [00:09:42] 你除上這個相對大的分母 [00:09:45] 所以呢 [00:09:46] 你這整個預估出來的機率 [00:09:48] 就是這麼的低 [00:09:50] 就這麼的低 [00:09:52] 所以有的時候我們在 [00:09:54] 看到這些事實的陳述 [00:09:56] 好像 [00:09:58] 我們會推算出 [00:10:00] 某一件事情好像機率很高 [00:10:02] 但其實你真的下去算一下 [00:10:04] 他跟你的直覺不太一樣 [00:10:06] 好 [00:10:08] 那 [00:10:10] OK [00:10:13] 那 [00:10:16] 他說呢 [00:10:17] 其實 [00:10:18] One can avoid assessing the probability of the evidence [00:10:22] 就是說其實啊 [00:10:24] 這裡要應用到一個 [00:10:25] 我們剛剛曾經用過的一個招式 [00:10:27] 就是說 [00:10:29] 這裡啊這個分母 [00:10:31] 就是頸椎僵硬的機率 [00:10:35] 事實上他告訴我們說 [00:10:36] 其實啊 [00:10:37] 我們可以不用真的去evaluate這個 [00:10:40] 頸椎僵硬的機率 [00:10:41] 我其實也可以推算出 [00:10:43] 類似這樣的結果 [00:10:45] 那比如說就是這個probability [00:10:48] M given S [00:10:50] 這裡的大M就是有腦膜炎跟沒腦膜炎 [00:10:53] 還記得嗎 [00:10:54] 這個conditional probability可以寫成是 [00:10:57] 這個版本的 [00:11:00] 正規化的版本 [00:11:02] 它可以正規化 [00:11:04] 就是我只保留分子的部分 [00:11:06] 我分子的部分這裡是腦膜炎嘛 [00:11:08] 我可以分成有腦膜炎跟沒腦膜炎 [00:11:10] 的兩個狀況 [00:11:12] 就寫成這樣 [00:11:14] 那所以我可以完全不靠probability S [00:11:18] 我就把這兩個機率去算出來 [00:11:21] 撐開來 [00:11:22] 然後呢我再做一個正規化 [00:11:23] 其實可以得到一樣的一個結果 [00:11:27] To use this approach [00:11:29] We need to estimate [00:11:31] 但是呢就是說 [00:11:32] 當然了你如果要用這種方式的話 [00:11:35] 你得要去預估出 [00:11:36] 沒有腦膜炎的情況底下 [00:11:39] 頸椎僵硬的機率 [00:11:42] 你不算probability S [00:11:44] 那你但是要多一個這個東西 [00:11:46] 你要去進行預估 [00:11:48] There is no free lunch [00:11:49] Sometimes this is easier [00:11:51] Sometimes it is harder [00:11:53] 那這個機率到底好不好算呢 [00:11:55] 就看狀況而定 [00:11:57] 有的時候說不定是probability S比較好算 [00:12:01] 有的時候是這個比較好算 [00:12:03] 或者說也不講算啦 [00:12:05] 比較好取得啊 [00:12:07] 當你在做一些臨床的 [00:12:09] 一些統計的時候 [00:12:11] 也許有的時候是右邊這個比較好取得 [00:12:13] 也許有時候是左邊這個比較好取得 [00:12:15] 那就看狀況而定 [00:12:18] 所以這裡只是再次的 [00:12:20] 再提一次 [00:12:21] 你其實可以不用 [00:12:23] 那個分母的那個機率 [00:12:25] 你也可以去預估出 [00:12:26] 這個機率的值 [00:12:30] 好 [00:12:31] 那當在用這個base rule的時候 [00:12:34] 一個明顯的一個question就是說 [00:12:37] Why one might have available [00:12:40] the conditional probability [00:12:42] in one direction [00:12:43] but not the other [00:12:45] 你說 [00:12:46] 我們剛剛的動作是在算 [00:12:49] probability M given S嗎 [00:12:52] 那在計算這個機率的時候 [00:12:54] 我們得要用到probability S given M [00:12:57] 那你可能會覺得說 [00:13:00] 可是 [00:13:02] 我要計算這個M given S的時候 [00:13:04] 我要用到S given M [00:13:06] 那憑什麼 [00:13:08] 你如果可以得到S given M [00:13:10] 你幹嘛不能得到M given S呢 [00:13:13] 我這邊幹嘛要用一個倍式定義 [00:13:17] 你在那邊算來算去 [00:13:19] 我能不能直接根據統計 [00:13:21] 我就得到這個probability M given S呢 [00:13:24] 你可能會有一個這樣的一個疑問 [00:13:27] 那感覺不就是前後的一個對調而已嗎 [00:13:30] 順序對調而已嗎 [00:13:32] 事實上在這個腦模擬的這個domain [00:13:35] 醫生也許醫生知道說 [00:13:40] 這個頸椎僵硬呢 [00:13:45] 代表的這個 [00:13:47] 代表會有腦模擬的機率是五千分之一 [00:13:51] 也許他知道 [00:13:53] That is the doctor has quantitative information [00:13:56] in the diagnosis direction [00:13:58] from symptoms to cause [00:14:00] 就是說不定啦 [00:14:02] 有一個醫生非常有經驗 [00:14:04] 他常常看頸椎僵硬的病人 [00:14:08] 那他後來呢 [00:14:09] 也進行診斷 [00:14:10] 那真的確實有去知道說 [00:14:13] 這個病人是有腦模擬或沒有腦模擬的 [00:14:16] 他說不定他真的根據他過去 [00:14:18] 看了大量的病人之後 [00:14:20] 他的經驗統計起來 [00:14:23] 他的確也許他可以整理出 [00:14:26] 五千個頸椎僵硬的裡面 [00:14:28] 真的有一個是腦模擬 [00:14:30] 如果是這樣子 [00:14:31] 其實這個超級有經驗的醫生 [00:14:35] 當有一個新的病人進來 [00:14:38] 他說他頸椎僵硬的時候 [00:14:40] 他其實他心裡面已經有一個答案了 [00:14:42] 他知道說 [00:14:43] 這個頸椎僵硬的病人 [00:14:45] 他有腦模擬的機率是五千分之一 [00:14:48] 好 [00:14:50] 那你就不用這樣子算了 [00:14:52] 你就是根據你的經驗是 [00:14:54] 是這樣就可以了 [00:14:56] 有沒有可能呢 [00:14:57] 有可能 [00:14:58] 有可能 [00:14:59] 好 [00:15:00] 那你說這樣子那base rule就沒有用啦 [00:15:03] 好 [00:15:04] 如果在這樣的情況底下 [00:15:06] 這個醫生的確不需要用base rule [00:15:08] 好 [00:15:09] 但是很不幸的事情是說呢 [00:15:11] 這個診斷的知識是有一點脆弱的 [00:15:16] 他比這樣子的 [00:15:18] 他比較像是依賴他的個人的經驗 [00:15:23] 而不是根據一個更具有公信力 [00:15:27] 或者是累積更多的因果關係的事實而來的 [00:15:34] 比如說突然在某個情況底下 [00:15:37] 發生腦膜炎大流行 [00:15:40] 好 [00:15:41] 那如果在 [00:15:43] 因為某種原因 [00:15:45] 比如新的病毒 [00:15:46] 或者什麼病媒紋的傳播或怎麼樣 [00:15:49] 突然某個地區腦膜炎大流行 [00:15:52] 那這個時候unconditional probability [00:15:55] probability M就會升高 [00:15:57] 這個地區比如說 [00:15:58] 之前臺南不是有登革熱嗎 [00:16:00] 好 [00:16:01] 突然在某一個期間 [00:16:03] 腦膜炎大流行 [00:16:05] 那這個時候probability M [00:16:07] 就會增加 [00:16:09] 好 [00:16:10] 你probability M如果增加 [00:16:11] 如果在這個階段大流行階段 [00:16:14] 有一個頸椎僵硬的病人進來 [00:16:17] 這個時候 [00:16:18] 這個相當有經驗的醫生 [00:16:21] 還能夠說 [00:16:23] 他真正患有腦膜炎的機率只有五千分之一嗎 [00:16:27] 這個時候 [00:16:28] 他的經驗就不夠reliable [00:16:32] 就不靠譜了 [00:16:33] 為什麼 [00:16:34] 因為今天你probability M變了 [00:16:37] 相反的如果他用的是被試定理 [00:16:40] 在這裡的話 [00:16:42] 他有辦法納入新的probability M [00:16:47] 來估算出更為準確的probability M given S [00:16:54] 這樣大家懂我意思嗎 [00:16:56] 也就是說今天如果是腦膜炎大流行的期間 [00:16:59] 等於是我擁有了一些 [00:17:02] 我update了我的資訊 [00:17:04] 我擁有一些新的資訊 [00:17:06] 我根據新的狀況去update我的背景知識 [00:17:11] 那我有機會去update更準確的probability M given S [00:17:17] OK [00:17:19] 所以我要講的點就這個 [00:17:21] 就是說的確 [00:17:22] 雖然有可能一個超有經驗的醫生 [00:17:25] 根據他過去看診的經驗 [00:17:27] 我可以直接在心中預估出一個這個機率 [00:17:31] 可是這個機率 [00:17:32] 當情況變的時候 [00:17:35] 事實上是會變的 [00:17:37] 那你如果只是純粹都靠經驗 [00:17:40] 你沒有跟上新的時代 [00:17:42] 那麼你這個預估出來的機率 [00:17:44] 可能就是不準的 [00:17:46] 這個跟我們很多在科學上 [00:17:51] 政治上 [00:17:52] 社會上 [00:17:53] 人生 [00:17:54] 你說老腮乎 [00:17:57] 過去我做一個事情 [00:17:59] 我可能都常常怎麼做 [00:18:01] 那他就用他幾十年來累積的經驗 [00:18:03] 一直這樣子做 [00:18:04] 可是時代在改變嘛 [00:18:06] 說不定有新的工具 [00:18:07] 或新的什麼什麼資訊進來 [00:18:09] 或者因為全球暖化的關係 [00:18:11] 你就應該要怎麼樣會怎麼做比較好 [00:18:14] 你如果沒有跟著去update的話 [00:18:16] 那麼你做出來的結果可能就不好 [00:18:19] 其實就是這個意思 [00:18:22] 好 [00:18:23] 那所以這裡就講說 [00:18:24] 如果這個醫生還是堅持 [00:18:26] 根據他過去的經驗 [00:18:27] 去預估這個probability M given S的話 [00:18:30] 那他其實就have no idea [00:18:33] how to update the value [00:18:35] 但是如果這個醫生是根據base rule [00:18:38] 根據新的知識 [00:18:40] 來去預估這個probability M given S [00:18:43] 那他就可以做出更有效的判斷 [00:18:47] 好 [00:18:49] 那所以說呢 [00:18:50] 在這邊介紹了base rule的重要的內容 [00:18:55] 還有另外一個重要的意義 [00:19:01] 當我們有更多的資訊的時候 [00:19:05] 其實base rule呢 [00:19:07] 會讓我們有更彈性的這個能力 [00:19:11] 來combine更多的evidence [00:19:14] 好 [00:19:15] 所以what happens [00:19:16] when we have two or more pieces of evidence [00:19:19] 假設我們有更多的資訊 [00:19:21] 那怎麼整合呢 [00:19:23] 比如說 [00:19:25] a dentist conclude [00:19:27] if her nasty steel prop catch in the [00:19:31] 這個 [00:19:32] 哎 [00:19:33] 喇滴賽啊 [00:19:34] 就是說如果他的探身 [00:19:35] 他故意這個是書上這樣子寫了 [00:19:37] 如果他探身真的卡住了 [00:19:39] 好 [00:19:40] 那 [00:19:43] 本來呢 [00:19:44] 我們預估的是probability cavity given to sac [00:19:48] 如果今天他真的下去看診了 [00:19:50] 那麼 [00:19:51] 你在探身進去看診之前 [00:19:55] 你可能是有某一個預估的機率 [00:19:58] 你現在呢 [00:19:59] 探身下去探測了 [00:20:02] 然後呢有卡住或沒卡住了 [00:20:04] 這個時候醫生根據他有沒有卡住 [00:20:07] 他就得要去update [00:20:09] 他的那個 [00:20:10] background knowledge [00:20:12] 然後呢就要去update他預估 [00:20:14] 他有沒有 [00:20:16] 蛀牙的機率 [00:20:17] ok [00:20:18] 好那在之前我們有說過 [00:20:20] probability cavity given to sac and the catch [00:20:26] 這個機率就是有牙痛 [00:20:29] 呃 [00:20:30] 探針有卡住 [00:20:31] 好 [00:20:32] 那他cavity的狀況就是 [00:20:34] 0.108跟0.01 [00:20:36] 呃0.016吧 [00:20:38] 好 [00:20:39] 那你知道是有卡住的 [00:20:41] 有牙痛的 [00:20:42] 然後又有卡住的 [00:20:43] 那這個呢 [00:20:44] 你經過normalize之後呢 [00:20:46] 0.871 [00:20:47] 是有蛀牙的 [00:20:49] 0.129是沒蛀牙的 [00:20:51] 好 [00:20:52] 這個就跟 [00:20:53] 你探針還沒下去 [00:20:55] 你只是單純知道說牙痛 [00:20:58] 的時候 [00:20:59] 那所預估出來的機率就不一樣了 [00:21:01] 好 [00:21:05] 那但是我們知道說呢 [00:21:07] 欸 [00:21:08] 要是你今天的這個 [00:21:10] 呃 [00:21:11] variable的數量變得更多了 [00:21:14] 那他其實是不容易scale up [00:21:17] 好如果說你的這個 [00:21:19] variable很多的話 [00:21:20] 那你要去算這個什麼join probability [00:21:23] 其實是很複雜的 [00:21:24] 好 [00:21:25] 所以這時候呢我們可以使用base rule [00:21:27] 來重新reformulate一下這個問題 [00:21:29] 好 [00:21:30] 就是說這個機率 [00:21:32] 可以描寫成 [00:21:34] 呃 [00:21:35] 可以倒過來有沒有 [00:21:37] probability cavity given這個東西 [00:21:40] 可以寫成是 [00:21:42] probability這個東西分支 [00:21:44] probability cavity在乘上 [00:21:46] probability cavity [00:21:48] 欸 [00:21:49] toothache and catch given cavity [00:21:52] 知道我在講什麼嗎 [00:21:54] 你去回去翻一下之前那幾頁頭影片 [00:21:57] 就是base rule了 [00:21:58] 然後呢 [00:21:59] 我把分母省略用一個α來寫 [00:22:02] 所以這個部分就是分子啊 [00:22:04] 你把它倒過來寫本來是 [00:22:06] cavity given [00:22:08] 這個事情 [00:22:09] 現在變成什麼 [00:22:10] probability cavity乘上 [00:22:13] probability [00:22:14] 這件事情given cavity [00:22:16] 就倒過來寫 [00:22:18] 這個就是base rule嘛 [00:22:20] 對不對 [00:22:21] 好 [00:22:22] 那你要遇過這個機率 [00:22:23] 我可以把它倒過來寫變成這個啦 [00:22:26] 好 [00:22:27] 那 [00:22:28] 這個的話呢我們就得要知道說 [00:22:30] 呃 [00:22:31] 蛀牙的機率 [00:22:32] 他的視線機率在乘上 [00:22:34] 呃 [00:22:35] 如果有蛀牙的話 [00:22:36] 那麼會牙痛 [00:22:37] 而且探針會卡住的機率 [00:22:39] 我們就要去預估 [00:22:40] 這個conditional probability [00:22:42] 好 [00:22:43] ok [00:22:44] 那也許 [00:22:45] 呃 [00:22:46] 我們 [00:22:47] 就 [00:22:48] 比較容易取得這樣子的機率 [00:22:51] 而不容易算得這個機率 [00:22:53] 因為如果是 [00:22:54] 上面這個機率 [00:22:55] 我們 [00:22:56] 那是因為之前有這個table嘛 [00:22:58] 我們去查表 [00:22:59] 所以我們算得出這個機率啊 [00:23:01] 但是也許在一些實際的用途上 [00:23:04] 這個table裡面有些數值我們可能很難取得 [00:23:07] 所以 [00:23:08] 我們就得要去仰賴 [00:23:10] 這個東西嘛 [00:23:12] 好 [00:23:13] 那這只是一個簡單的例子喔 [00:23:15] 呃 [00:23:16] 如果今天有N個possible的evidence variable [00:23:20] 比如說你可以照X光啦 [00:23:22] 醫生問你的飲食狀況啦 [00:23:24] 然後你的牙齒的清潔狀況啊什麼等等等等的 [00:23:28] 那這個時候就 [00:23:30] 你 [00:23:31] 如果還是依照這種 [00:23:33] table [00:23:34] 見table [00:23:35] 查table的形式 [00:23:36] 哇 [00:23:37] 那就不得了 [00:23:38] 你這個table就很大很大 [00:23:39] 好 [00:23:40] 你各個機率 [00:23:41] 每一格的機率 [00:23:42] 都要預估的出來 [00:23:43] 那這個就難了 [00:23:44] 對不對 [00:23:45] 好 [00:23:46] 那所以說呢 [00:23:47] 你如果有2的N次方這麼多種 [00:23:49] 啊 [00:23:50] possible的combination [00:23:51] 那你這個table就很長很長 [00:23:54] 好 [00:23:55] 那這時候base rule呢 [00:23:56] 可以幫助我們來 [00:23:57] 有效率的來完成這件事 [00:24:00] 好 [00:24:01] we need to find some additional assertion [00:24:04] about the domain [00:24:05] that will enable us to simplify [00:24:07] 好 [00:24:08] 那不只如此啊 [00:24:09] 不僅是我們可以做這樣的一個 [00:24:11] 呃 [00:24:12] 反轉 [00:24:13] 我們有時候呢 [00:24:14] 還可以考慮到independence的狀況 [00:24:17] 好 [00:24:18] 所以比如說 [00:24:19] 說不定啊 [00:24:20] 啊 [00:24:21] 如果說 [00:24:22] 呃 [00:24:23] 這個呃 [00:24:24] 有沒有牙痛 [00:24:25] 跟探針會不會卡住 [00:24:27] 如果這兩件事情是獨立的話 [00:24:29] 我們還可以把 [00:24:30] 這個再進一步的拆開簡化 [00:24:33] 好 [00:24:34] 拆開簡化 [00:24:35] 好 [00:24:37] 那但是我們當然知道了 [00:24:39] 這個有沒有牙痛跟探針有沒有卡住 [00:24:41] 可能是 [00:24:42] 可能不是獨立的啦 [00:24:43] 好 [00:24:44] 那 [00:24:47] 當然瞭如果是 [00:24:48] 比如說再加上一個天氣 [00:24:50] 天氣跟這些都是獨立的 [00:24:52] 那就可以特別的拆開這樣 [00:24:54] 好 [00:24:56] each is directly caused by the cavity [00:24:59] the cavity [00:25:00] but neither [00:25:01] ok [00:25:02] 好那這裡是講說呢 [00:25:03] 有的時候他們也許啊 [00:25:06] 牙痛跟探針有沒有 [00:25:08] 他們不是獨立的 [00:25:10] 啊 [00:25:11] 他們不是獨立的 [00:25:12] 但是呢 [00:25:13] 如果給定 [00:25:14] 他是有蛀牙或沒蛀牙的基礎之上 [00:25:18] 他就有可能是獨立的囉 [00:25:20] 啊 [00:25:21] 這個叫做conditional independence [00:25:22] 這個也是 [00:25:23] 過去我們在學機率的時候 [00:25:25] 因為 [00:25:27] 蛀牙造成了 [00:25:29] 有可能會造成牙痛 [00:25:31] 也有可能造成 [00:25:32] 你探針會卡住 [00:25:34] 所以在給定你有蛀牙或沒蛀牙的情況底下 [00:25:37] 其實牙不牙痛 [00:25:39] 有牙痛 [00:25:40] 跟探針會被卡住 [00:25:42] 其實是 [00:25:43] 可能可以是獨立的 [00:25:45] 他們就是符合conditional independence [00:25:48] 好 [00:25:49] 那如果符合conditional independence [00:25:51] 那麼 [00:25:52] 我們就可以把 [00:25:54] 這個剛剛在寫在這裡的 [00:25:57] 這個 [00:25:58] 是conditional on cavity嘛 [00:26:00] 如果是 [00:26:01] 如果他們是conditional independence [00:26:03] 我就可以把 [00:26:04] 左邊的這一項呢 [00:26:05] 又再拆分成 [00:26:07] 兩項相乘 [00:26:09] 就變成是底下這一個 [00:26:12] 就變成底下這一個 [00:26:13] 我們可以再 [00:26:14] 更進一步的 [00:26:15] 來 [00:26:16] 簡化 [00:26:17] 這樣子一個計算 [00:26:20] 那當然了 [00:26:21] 到底他們是不是conditional independence [00:26:24] 以前我們學機率 [00:26:26] 其實從數學的觀點上 [00:26:27] 我們常常要去證明他 [00:26:29] 是或不是conditional independence [00:26:32] 好 [00:26:33] 那在實際的問題上 [00:26:34] 我們可能得要經過 [00:26:36] 大量的這個資料的統計 [00:26:38] 那我們才能夠 [00:26:39] 去釐清說他是不是 [00:26:41] 或者是幾乎是不是 [00:26:43] conditional independence [00:26:46] 好 [00:26:47] 那如果寫成這個 [00:26:49] random variable的形式 [00:26:50] 就是長這樣嘛 [00:26:52] 那所以這裡又again [00:26:54] 這個又再重述一次 [00:26:55] 其實就是一樣的意思 [00:26:57] 好 [00:26:59] 那所以說呢 [00:27:00] 如果一切都很完美 [00:27:03] 這個join的 [00:27:05] probability density function [00:27:07] 可以拆解成 [00:27:09] probability cavity [00:27:10] 乘上probability [00:27:12] 這兩件事情 [00:27:13] given cavity [00:27:15] 那如果cavity [00:27:16] 這兩個 [00:27:17] 牙痛跟探針有沒有卡住 [00:27:20] 是conditional independent的話 [00:27:22] 又可以進一步的拆解 [00:27:24] 變成這樣 [00:27:26] 那如果你可以這樣子拆的話 [00:27:28] 就會變成說 [00:27:29] 你要處理的這個 [00:27:31] 機率的這個形式啊 [00:27:32] 如果你有and個variable的話呢 [00:27:34] 你可以拆解成這個 [00:27:36] 它是linear的grow [00:27:38] 而不是exponential grow [00:27:43] OK [00:27:44] 好 [00:27:46] 那好像講完了耶 [00:27:48] 最後最後最後兩頁頭影片 [00:27:50] 好 [00:27:52] 那 [00:27:54] 剛剛的這個這個 [00:27:56] 牙醫的這個例子 [00:27:58] 有點不太順 [00:28:02] 是怎麼樣 [00:28:03] 好 [00:28:06] 牙醫的這個例子呢 [00:28:10] 如果今天我們觀察到 [00:28:13] 它有好多的這個 [00:28:16] effect [00:28:17] 就是說 [00:28:18] 我現在看到好幾個症狀 [00:28:20] 我今天呢 [00:28:21] 我常常是要估計的是一個 [00:28:22] full的join distribution [00:28:24] 就是說 [00:28:26] 我有A症狀B症狀C症狀 [00:28:28] 然後呢 [00:28:29] 我的原因是什麼什麼的原因 [00:28:32] 我今天是因為什麼原因 [00:28:35] 造成什麼什麼什麼什麼症狀 [00:28:37] 這幾個共同發生在同一個病人身上嘛 [00:28:39] 好 [00:28:40] 那這個機率要怎麼求呢 [00:28:42] 那就是說天生 [00:28:44] 會有這個在這個地區有這個 [00:28:46] 有這個病的機率在乘上 [00:28:49] 我有這個病 [00:28:50] 產生出症狀一的機率在乘上 [00:28:52] 我有這個病 [00:28:53] 我會產生出症狀二的機率整個乘起來 [00:28:56] 所以這整個乘起來的結果 [00:28:58] 就是 [00:28:59] 就是這個join probability [00:29:01] 好 [00:29:02] 那為什麼這個 [00:29:03] 這幾個不同的症狀可以這樣子 [00:29:05] 拆分開來乘呢 [00:29:07] 其實都是因為剛剛前面所說的 [00:29:10] conditional independence [00:29:13] 好 [00:29:14] 如果這幾個症狀 [00:29:15] 你只要given [00:29:17] 給定這個原因 [00:29:19] 他們是conditional independence的話 [00:29:21] 那他們就可以這樣子拆開來乘 [00:29:24] 那這件事情 [00:29:26] 如果說我們經過這樣子的一個推算 [00:29:29] 機率可以這樣子推算的話 [00:29:31] 這個就成為是一個naive的base model [00:29:34] 這樣子的probability distribution [00:29:37] 叫做naive base model [00:29:39] naive這個字為什麼叫它呢 [00:29:41] 因為 [00:29:42] it's often used in cases [00:29:44] where the effect variable are not strictly independent [00:29:48] given the cause variable [00:29:50] 就是說理論上它其實不是完全的 [00:29:53] conditional independent [00:29:55] 但是我們假裝它是 [00:29:57] 那這種naive base的model呢 [00:30:00] 有時候又成為是base classifier [00:30:03] 好 [00:30:04] 那 [00:30:05] 雖然它不是完美的 [00:30:07] 非常嚴格的conditional independent [00:30:10] 但是我們 [00:30:12] 因為你數學上如果把它 [00:30:14] 假設成是conditional independent [00:30:17] 那麼 [00:30:18] 我們這數學的這個計算就會容易很多 [00:30:20] 所以常常是數學上我們都假設它是 [00:30:23] 而實際我們應用的結果呢 [00:30:25] 發現這個naive base的system呢 [00:30:28] 其實通常也 [00:30:29] 運作的蠻不錯的 [00:30:31] 運作的蠻不錯的 [00:30:33] 雖然即使這個conditional independent assumption [00:30:36] is not strictly true [00:30:39] 它其實運作的也還蠻不錯的 [00:30:41] 在各個不同的領域 [00:30:43] 都運作的蠻不錯的 [00:30:45] 那這個呢就成為是naive base的model [00:30:50] 那這個應該算是今天的最後一頁頭影片 [00:30:54] 那今天我們主要講的就是 [00:30:57] 整個機遇的介紹 [00:30:59] 然後呢最後的慢慢導出 [00:31:02] 機率推論這件事 [00:31:03] 這是最簡單的一個機率推論 [00:31:05] 那下一次上課我們就會進一步的 [00:31:09] 提到 [00:31:10] basion network [00:31:12] 利用basion [00:31:14] 的這個base rule [00:31:15] 利用conditional independence [00:31:17] 的這些內容 [00:31:18] 來進行一些事件機率的推導 [00:31:21] 那這一塊這個整個的領域 [00:31:24] 可以說是大概在 [00:31:26] 1980年代到2010年 [00:31:29] 的這二三十年間 [00:31:31] 最主要的一個主流 [00:31:33] 最主要的一個主流之一 [00:31:36] 好