# W4_人工智慧導論_Ch12_Part2.m4a|長度 00:41:38|model large-v3 on cuda [00:00:01] 好,那接下來呢,我們持續的來講這個機率,當我們在進行這個機率的這個描述的時候,通常呢,在機率裡面呢,我們所使用的這個variable呢,都是所謂的random variable,那習慣上,至少在我們這本書裡面呢,random variable都是會用大寫字母開頭,大寫字母開頭,比如說,兩個骰子的點數,總點數就是total, [00:00:31] 好,那第一顆骰子的點數就是die1,這樣子,那它們都是random variable,因為這個variable呢,它們的數值呢,是根據一個,某一個狀態所決定的,它是一個會變的,它的數值可能是123456,這樣子,好,那這些數值所形成的範圍,這個集合,就是稱為這個random variable的domain,OK,所以說呢,total, [00:01:01] 那total的這個總數的數值可以從2一直到12嘛,234567一直到12,好,那第一個骰子的數值可以是1,2,3,4,5,6的其中一個,所以這個就稱呼它,稱呼為這兩個random variable的domain, [00:01:17] 那有些random variable呢,它的domain只有true或false,就是對或錯,成立或不成立,好,所以比如說,要判別,這個它是不是一個, [00:01:31] 呃,雙雙對對的情況,那就是,要嘛不是,這樣子,好,那在習慣上呢,呃,某一個random variable等於true,也有可能直接寫成一個小a,好,那它如果等於false,也有可能寫成這樣,not a,這樣,好,那, [00:01:54] 誒,跳到哪裡去了,喔,好,來,那variable呢,呃,它可以有,它的domain可以是無限大的,喔,呃,而且不管, [00:02:02] 呃,它的domain可以是無限大的,喔,呃,而且不管, [00:02:02] 呃,它的domain可以是無限大的,喔,呃,而且不管, [00:02:04] 呃,它的domain可以是無限大的,喔,呃,而且不管, [00:02:04] 你是discrete的random variable,還是continuous,都有可能是無限大,好,那另外一個就是說呢,我們可以把這樣子的一個表達形式,表達在機率上面,好,所以比如說,其實這個例子,我們剛剛也看過類似的,就是說,給定沒有牙痛,好,然後呢,呃,而且又是十幾歲的親,的這個,呃,青少年,那麼它是蛀牙的機率,是等於0.1,好,類似像這樣,好,然後呢,呃,而且又是十幾歲的親,的這個,呃,青少年,那麼它是蛀牙的機率,是等於0.1,好,類似像這樣,好,然後呢,呃,而且又是十幾歲的親,的這個,呃,青少年,那麼它是蛀牙的機率, [00:02:34] 長沒了,那propablythe patient, has a cavity,giventhat she is a teenager, with no",,tis",act",is 10%,你可以這麼,把這樣子的一個描述方式,整合到機率的表達裡面,好,那有的時候呢,我們會可能會想要列出,一個random variable的所有可能的狀況,它以及它對應的機率,喔,比如說,我可能有一個random variable是天氣, [00:03:04] 陰天跟下雪 [00:03:06] 那個別的機率就是0.6、0.1、0.29、0.11等等的 [00:03:11] 那我們也可以把它一起寫起來 [00:03:14] 變成是粗體字的p [00:03:17] 然後呢括號weather [00:03:18] 就是說weather這個random variable [00:03:21] 它的所有可能的各種不同的sample [00:03:25] 它的機率的分佈 [00:03:28] 就是0.6、0.1、0.29、0.01 [00:03:31] 那大家知道在數學課本 [00:03:34] 或者是說像這種比較formal [00:03:37] 比較正式的書籍裡面 [00:03:40] 你有沒有斜體跟有沒有粗體 [00:03:43] 其實都有嚴格的意義 [00:03:46] 所以通常像我們以前 [00:03:49] 線性代數也是一樣 [00:03:51] 你如果有一個字母是粗體的字母 [00:03:53] 代表它是一個向量 [00:03:55] 細體字代表它是一個scatter [00:03:58] 那這邊也是一樣 [00:03:59] 今天這個粗體字的 [00:04:01] p粗體跟細體是有差別的 [00:04:05] 粗體字的p代表的是 [00:04:07] 好幾個數字所形成的一個向量 [00:04:11] 所以in this case [00:04:13] 這個p呢代表是一個probability distribution [00:04:16] for the random variable weather [00:04:19] ok [00:04:20] 那這個粗體字的p這個notation呢 [00:04:23] 也可以用在conditional distribution上面 [00:04:26] 比如說像這個p of x given y [00:04:30] 就是給定y這個random variable的狀況 [00:04:34] 那麼我x這個random variable的probability distribution是怎麼樣 [00:04:40] 所以這裡等於是說 [00:04:42] 我y呢大y可以是等於y1y2y3y4 [00:04:48] 那大寫的x呢也可能等於x1x2x3x4 [00:04:52] 就是所有ij的這些配對的所有可能的機率 [00:04:57] 我把它簡寫成一個粗體字的p [00:05:00] 所以這個就形成一個 [00:05:02] 所以其實這個不是一個機率喔 [00:05:04] 這個是好多個機率所形成的一個distribution [00:05:08] 那在continuous case呢 [00:05:12] 事實上我們就不可能寫出整個distribution [00:05:16] 整個向量因為它是continuous [00:05:19] 它的數它的random variable的變動是continuous [00:05:23] 所以無限多種變化 [00:05:25] 我們不可能寫下無限多個值 [00:05:27] 那這個時候呢我們習慣上 [00:05:30] 就會寫成是一個範圍 [00:05:33] 比如說這個的意義就是說 [00:05:35] 正宗5的氣溫等於x的機率 [00:05:40] 那它的分佈呢是一個uniform distribution [00:05:45] 介於18度C到26度C之間 [00:05:49] 所以它代表的是distributed uniformly [00:05:52] between 18 and 26 degrees celsius [00:05:57] 那我們稱呼這種continuous的variable [00:06:00] 這個continuous的機率呢 [00:06:02] 是probability density function [00:06:06] 所以之前大家就學過這個什麼pdf [00:06:10] 這個也是probability distribution [00:06:13] 跟probability density function [00:06:16] 那它簡稱pdf [00:06:19] 那probability density function呢 [00:06:22] differ in meaning from discrete distribution [00:06:25] 這是連續的 [00:06:27] 那跟離散的不一樣喔 [00:06:30] 主要的差別在於說 [00:06:31] probability density is uniform [00:06:33] from 18度C到26度C [00:06:35] 那代表的是說呢 [00:06:37] 在這個範圍 [00:06:38] 我正宗5的溫度 [00:06:40] 是在這個範圍之內的機率是100% [00:06:45] 那這整個是一個8度C的範圍 [00:06:48] 那我如果說呢 [00:06:51] 今天我正宗5的溫度是落在 [00:06:54] 剛剛是18到26度嘛 [00:06:56] 你的溫度是落在18度到22度 [00:06:59] 這中間的範圍的機率呢 [00:07:02] 就會是剩下50% [00:07:04] 剩下50% [00:07:06] 那之所以要這樣子來描述 [00:07:08] 其實大家以前應該也學過 [00:07:11] 機率的時候應該也學過這個 [00:07:13] 那微積分的時候也學過 [00:07:15] 就是說 [00:07:17] 在一個continuous random variable X [00:07:20] 我們說它的 [00:07:23] 這個random variable X的數值 [00:07:25] 等於小X的機率 [00:07:27] 會是多少呢? [00:07:28] 其實是沒辦法算的 [00:07:32] 應該說它等於0 [00:07:34] 你在這個continuous的空間當中 [00:07:37] 它剛好等於某一個 [00:07:39] exactly [00:07:40] 剛好等於某一個數值的機率 [00:07:43] 幾乎等於0 [00:07:46] 幾乎就等於0 [00:07:48] 所以其實啊 [00:07:49] 當我們在看一個continuous function的時候 [00:07:51] 它在某一個點的機率 [00:07:53] 其實是這個意義 [00:07:54] 就是limit X [00:07:56] 在X到X加上 [00:07:58] delta X之間 [00:08:00] 這個很小的範圍之內 [00:08:02] 而這個delta X呢 [00:08:03] 趨近於0 [00:08:04] 大家這個回顧一下 [00:08:06] 這個就是極限 [00:08:08] 極限的定義 [00:08:09] 所以說在continuous function裡面 [00:08:12] probability X等於小X的機率 [00:08:15] 其實是我們去算 [00:08:17] 這個大X這個random variable [00:08:20] 這一個很接近X的一個區域範圍內 [00:08:25] 的這個所佔的這個機率 [00:08:28] 這個機率是多少 [00:08:30] 在數學上的定義是如此 [00:08:32] 那所以說呢 [00:08:35] 當你的這個X呢 [00:08:37] 是在18度C到26度C之間呢 [00:08:39] 你這個機率等於是 [00:08:41] 8度C分之1 [00:08:42] 就是八分之一 [00:08:44] 你這個範圍內 [00:08:46] 你這個範圍內的話 [00:08:48] 那就看說你是要 [00:08:50] 在哪裡 [00:08:52] 比如說 [00:08:54] 20.18 [00:08:58] 20.18度C [00:09:01] 的機率等於8C分之一 [00:09:03] 8C分之一 [00:09:04] 它不是一個機率 [00:09:06] 它是一個probability density [00:09:09] 所以說呢 [00:09:10] 正中午的機率 [00:09:11] 剛好等於20.18度C的機率 [00:09:14] 事實上是等於0 [00:09:16] 因為你如果是剛好在這個點上 [00:09:18] 它對應的這個區域的寬度是等於0 [00:09:23] 那所以大家切記 [00:09:25] 就是說雖然我們 [00:09:27] 習慣上是講 [00:09:29] 是寫成這樣 [00:09:30] 但它的意義其實是 [00:09:31] 一個很小很小的區間之內 [00:09:33] 它佔整體的比例是多少 [00:09:36] 好 [00:09:38] 那以上呢 [00:09:40] 這是針對單一的一個variable來看 [00:09:43] 那其實我們也可以同時 [00:09:45] 同時考慮多個variable啊 [00:09:47] 比如說天氣的變化 [00:09:50] 跟有沒有蛀牙 [00:09:52] 這兩個join probability [00:09:55] the probability distribution [00:09:57] OK [00:09:58] 那比如說天氣如果有四種變化 [00:10:00] 那蛀牙有兩種變化 [00:10:02] 就是蛀牙跟非蛀牙 [00:10:04] 所以其實呢 [00:10:05] 我們如果列出所有的排列組合 [00:10:07] 其實總共有八種可能性 [00:10:10] 就是晴天有蛀牙 [00:10:13] 陰天有蛀牙 [00:10:15] 下雨有蛀牙 [00:10:16] 下雪有蛀牙 [00:10:18] 晴天沒蛀牙 [00:10:20] 陰天沒蛀牙 [00:10:21] 下雨沒蛀牙 [00:10:22] 跟下雪有蛀牙 [00:10:23] 總共八種狀況 [00:10:25] 那它整體而言呢 [00:10:26] 寫成這個樣子 [00:10:28] 它就是一個join的 [00:10:29] probability distribution [00:10:31] 好 [00:10:32] OK [00:10:33] 那在表達上呢 [00:10:35] 我們也可以把 [00:10:36] 比如說某一個variable [00:10:38] 它實際的只代入進來 [00:10:40] 比如說寫成這樣 [00:10:41] probability sunny [00:10:43] 痘點cavity [00:10:45] 那這個其實代表的是幾個機率 [00:10:48] 它代表的是兩個機率喔 [00:10:50] 就是晴天有蛀牙 [00:10:52] 跟晴天沒蛀牙 [00:10:54] 所以大家 [00:10:56] 要注意一下大小寫 [00:10:58] 粗體字有差喔 [00:11:00] 這裡寫sunny都寫小寫 [00:11:02] 這代表的是 [00:11:03] whether這個random variable [00:11:05] 它的一個instance [00:11:08] 它的一個狀況這樣子 [00:11:10] 好 [00:11:12] 好 [00:11:13] 那你也可以寫下之後 [00:11:15] 你也可以做某種運算 [00:11:17] 比如說whether跟cavity的join probability [00:11:21] distribution [00:11:23] 可以寫成是 [00:11:24] cavity出現的機率 [00:11:26] 在乘上給定cavity [00:11:28] weather的機率 [00:11:30] 總共八種變化 [00:11:32] 好 [00:11:33] 那所以說底下這個就是把 [00:11:35] 這八個情況都把它寫下來嘛 [00:11:38] 就是說呢 [00:11:39] 這個有蛀牙又晴天 [00:11:42] 那就等於是蛀牙出現的機率 [00:11:44] 在乘上給定蛀牙的機率 [00:11:46] 出現晴天的機率 [00:11:48] 依此類推 [00:11:49] 總共八種狀況 [00:11:52] 好 [00:11:53] 那你也可以說 [00:11:55] 你也可以寫成這樣啊 [00:11:57] 就是說 [00:11:58] 晴天的機率跟有蛀牙的 [00:12:01] 你看這裡的c現在是小寫 [00:12:03] 就是有蛀牙的機率跟晴天的join probability [00:12:08] 好 [00:12:09] 那其實如果是寫成這樣子的話 [00:12:11] 其實這是幾個機率 [00:12:14] 這是一個機率喔 [00:12:16] 就是說晴天這件事情 [00:12:18] 跟有蛀牙這個共同發生的機率 [00:12:21] 所以其實寫成這個呢 [00:12:23] 它其實可以reduce成這樣 [00:12:26] 你可以寫成細體字的p斜體 [00:12:29] 這個代表的是一個機率 [00:12:31] 或者是說sunny and cavity [00:12:35] 這是一個機率 [00:12:36] 好所以大家 [00:12:37] 我們打這個投影片來打蠻辛苦的 [00:12:41] 這個粗體字細體字 [00:12:43] 這個都有講究的 [00:12:44] 大小寫這個都有講究的 [00:12:46] 好 [00:12:48] 那我們可以再讓這個整個描述變得更為複雜 [00:12:58] a possible world is defined to be an assignment of values [00:13:03] to all the random variables under consideration [00:13:06] 你如果考慮更多的random variables [00:13:08] 比如說cavity [00:13:09] tootsack [00:13:10] 跟weather [00:13:11] 好 [00:13:12] 那有蛀牙沒蛀牙兩種狀況 [00:13:14] 有牙痛沒牙痛兩種狀況 [00:13:16] 四種天氣變化 [00:13:17] 那總共就會有16種這個組合 [00:13:20] 好 [00:13:21] 那當然我們也可以寫下它的probability density function [00:13:25] 是長這樣 [00:13:26] 它這個時候呢 [00:13:27] 這樣的一個描述就包含了16個 [00:13:32] 包含了16個機率 [00:13:34] 好 [00:13:37] 那以上呢 [00:13:38] 是一些表達的形式 [00:13:41] 那再來呢 [00:13:42] 是一些基本的定理 [00:13:45] the basic action [00:13:46] Asian of probability [00:13:49] 那首先一個就是說 [00:13:51] probability not a [00:13:53] 其實就等於1減掉probability a [00:13:56] 這個其實我們 [00:13:57] 之前就知道了 [00:13:59] 那這裡只是在推演一下 [00:14:00] 就是說probability not a [00:14:02] 就是把我所有的sample [00:14:04] 屬於not a的 [00:14:05] 機率全部都加起來 [00:14:07] 好 [00:14:08] 那這裡呢可以故意的 [00:14:10] 加上 [00:14:11] 屬於a的 [00:14:13] 再減掉屬於a的 [00:14:15] 然後把前面這兩個加起來 [00:14:17] 那它機率就等於1嘛 [00:14:18] 1減掉probability a [00:14:20] 所以說這裡只是在講說我們 [00:14:22] 有了之前的equation [00:14:25] 13.1跟13.2 [00:14:27] 我們其實可以推出 [00:14:29] 所有其他的這個機率的定理 [00:14:33] 13.1 13.2是什麼 [00:14:35] 就是所有mutually exclusive的 [00:14:39] 這一些set [00:14:42] 它的機率加起來要等於1嘛 [00:14:45] 好 [00:14:46] 然後再來就是說 [00:14:47] 他們每一個人的數值 [00:14:48] 都在0到1之間嘛 [00:14:50] 就是那個 [00:14:51] 利用那個呢 [00:14:52] 我們可以推出很多其他的這個定理 [00:14:56] 好 [00:14:57] 那另外一個 [00:14:59] 叫做inclusion exclusion principle [00:15:03] 好 [00:15:05] probability [00:15:06] 我們剛剛曾經看過probability a and b [00:15:09] 那我們也可以來看 [00:15:11] probability a or b [00:15:13] 就等於誰呢 [00:15:15] probability a加上probability b [00:15:17] 減掉probability a and b嘛 [00:15:19] OK [00:15:20] 這個你可以畫一個Venn diagram [00:15:22] 有沒有 [00:15:23] 左邊這個圓圈圈代表是a出現的 [00:15:26] 範圍 [00:15:27] 右邊這個圓圈圈 [00:15:28] 出現的是b這個範圍 [00:15:29] 那中間交集的部分就是a and b嘛 [00:15:32] 那你要求的是probability a or b [00:15:35] 就是這兩個圓圈圈的 [00:15:37] 連集的範圍 [00:15:38] 我想這個大家應該都知道了 [00:15:42] 好 [00:15:45] 那 [00:15:48] OK所以以上所講的這些呢 [00:15:50] 真的就都是 [00:15:52] 機率的複習而已 [00:15:54] 那慢慢的 [00:15:55] 從這一頁開始我們要進入到 [00:15:57] 那有了這些機率的基本條件之後 [00:16:00] 我們要來進行推算了 [00:16:03] 所以開始真的比較跟AI有關係的 [00:16:09] 跟AI有關係 [00:16:11] 那首先我們先從一個simple method開始 [00:16:14] 我們來做probability inference [00:16:17] That is the computation of posterior probability for query proposition [00:16:23] given observed evidence [00:16:26] 就是我給定我已經觀察到的一些資訊 [00:16:30] 那我想要去問某一個資訊出現的機率 [00:16:35] 這個機率叫做posterior probability [00:16:38] 事後機率啊 [00:16:39] 也就是說我根據一些現有觀察到的事實去推論 [00:16:45] 某一件事情會出現的機率 [00:16:47] We use the full joint distribution as the knowledge base [00:16:52] from which answers to all questions may be derived [00:16:57] 那我們現在呢還是從這個 [00:16:59] 牙醫的這個例子 [00:17:01] 來開始 [00:17:03] 那現在呢假設我有三個random variable [00:17:06] 就是牙痛 [00:17:08] 蛀牙 [00:17:10] 跟這個catch [00:17:11] 這個catch呢 [00:17:13] 你如果去查一下 [00:17:14] 這裡意思是說 [00:17:16] 醫生他的這個牙醫啊 [00:17:19] 牙醫他的這個探針 [00:17:21] 有沒有被卡住 [00:17:23] 有沒有被卡住 [00:17:25] 所以其實啊 [00:17:26] 這裡每一個 [00:17:28] variable的數值都是 [00:17:30] 都是true or false [00:17:32] 都是boolean variable [00:17:34] 有牙痛沒牙痛 [00:17:35] 有蛀牙沒蛀牙 [00:17:37] 然後醫生在看診的時候呢 [00:17:39] 他的這個探針有沒有被你的牙齒卡住 [00:17:41] 有卡住還是沒卡住 [00:17:43] 那通常有卡住可能就代表說那裡有一個洞啊 [00:17:46] 或者是有蛀牙嘛 [00:17:49] 這樣子 [00:17:50] 所以totally呢 [00:17:52] 這個probability distribution [00:17:55] 會有二乘二乘二 [00:17:56] 總共八個 [00:17:58] 數值 [00:18:00] 總共八個數值 [00:18:02] 假設這八個數值是這樣 [00:18:05] 我們姑且不論這裡面這個數字 [00:18:07] 這機率怎麼來的 [00:18:08] 假設是這樣 [00:18:09] 這怎麼看呢 [00:18:10] 就是說 [00:18:11] 在有蛀牙的 [00:18:13] 有牙痛的情況底下 [00:18:15] 探針會卡住 [00:18:17] 而且你有這個蛀牙的機率呢 [00:18:20] 0.108 [00:18:23] 有蛀牙痛 [00:18:25] 然後呢 [00:18:26] 沒有卡住 [00:18:28] 然後呢 [00:18:30] 有蛀牙的機率呢 [00:18:31] 0.012 [00:18:32] 依次類推 [00:18:33] 這樣子 [00:18:37] 好 [00:18:38] 那記得啊 [00:18:39] 這些這總共total有八個機率 [00:18:44] 這八個機率加起來呢 [00:18:45] 會是等於一 [00:18:47] 這個是機率的基本定理 [00:18:51] 那equation13.2 [00:18:52] give us a direct way to calculate the probability [00:18:54] simply identify those possible worlds in which [00:18:57] the proposition is true [00:18:59] and add up their probability [00:19:01] 好 [00:19:02] 什麼意思呢 [00:19:03] 假設我們今天是要來算 [00:19:06] 有蛀牙或牙痛的機率 [00:19:10] 那這個機率怎麼算呢 [00:19:12] 其實只要查表 [00:19:14] 你把有蛀牙的狀況 [00:19:16] 或者是 [00:19:19] 有牙痛的狀況 [00:19:20] 全部把它加起來嘛 [00:19:22] 所以有蛀牙的狀況其實就是這一列 [00:19:25] 0.108 0.012 0.072 0.008 [00:19:29] 你把這四個加在一起嘛 [00:19:32] 所以這個就是 [00:19:35] 前面這四個數字 [00:19:38] 然後再來是有牙痛 [00:19:40] 有牙痛的其實就是 [00:19:42] 0.108 0.012 0.016 0.064嘛 [00:19:47] 但因為上面這兩個剛剛已經加過了 [00:19:49] 所以現在再把這兩個加起來就好了 [00:19:51] 所以呢 [00:19:53] 就是有蛀牙 [00:19:55] 然後呢 [00:19:56] 或者有牙痛的機率呢是 [00:19:58] 0.28 [00:20:00] OK 是這樣子 [00:20:02] 好 [00:20:06] 那 [00:20:08] 在我們在進行機率的這些運算的時候呢 [00:20:12] 我們 [00:20:14] One particular common task [00:20:16] is to extract the distribution [00:20:18] over some subset of variable [00:20:20] or a single variable [00:20:22] 有的時候我們更常做的是說 [00:20:24] 我只要算 [00:20:26] 有蛀牙的機率 [00:20:28] 我現在三個random variable嘛 [00:20:29] 我現在 [00:20:30] 想要去算出說 [00:20:32] 某一個random variable的 [00:20:34] 其中一個數值的機率 [00:20:35] 比如說有蛀牙的機率 [00:20:37] 那其實就是把剛剛的 [00:20:39] 那一列的數值加起來 [00:20:40] 0.108 0.012 0.072 0.008 [00:20:43] 把它加起來嘛 [00:20:45] 這一件這個動作 [00:20:47] 叫做marginalization [00:20:51] marginalization [00:20:53] 邊緣化 [00:20:55] 或者叫summing out [00:20:57] 那它的意義其實就是說 [00:21:00] 有蛀牙 [00:21:03] 有蛀牙的情況底下 [00:21:05] 我把 [00:21:07] 同時有牙痛沒牙痛的狀況 [00:21:09] 全部都加起來 [00:21:11] 然後探針有卡住跟沒卡住的狀況 [00:21:14] 都加起來 [00:21:16] 我等於說我去sum over [00:21:20] summing over [00:21:22] the subset of variable [00:21:24] 我把有牙痛沒牙痛 [00:21:27] 有探針有卡住沒卡住的狀況 [00:21:29] 的機率全部加起來 [00:21:31] 那就得到了 [00:21:32] 我有蛀牙的狀況的機率 [00:21:36] 這件事情是很常做的 [00:21:39] 我們稱呼這個叫做marginal probability of cavity [00:21:43] 那這個動作就叫做marginalization [00:21:46] 或者是summing out [00:21:49] 那因為呢我們sum up [00:21:52] the probability for each possible value [00:21:55] of the other variables [00:21:57] 所以說呢 [00:21:58] taking them out of the equation [00:22:02] 我們你看在這個equation裡面 [00:22:04] 沒有看到什麼牙痛 [00:22:06] 跟探針卡住的variable在裡面 [00:22:09] 的數值在裡面 [00:22:10] 因為它已經被我 [00:22:12] 全部都含瓜住了 [00:22:14] 我不用特別指定說什麼 [00:22:16] 有蛀牙沒蛀牙 [00:22:17] 因為我care的是 [00:22:19] 不是 [00:22:20] 我沒有去care它是不是有牙痛沒牙痛 [00:22:23] 因為我care的是有蛀牙這件事 [00:22:26] 而有蛀牙有可能沒牙痛啊 [00:22:28] 有蛀牙有可能有牙痛啊 [00:22:30] 這樣子 [00:22:32] 好那這更formally來寫的話 [00:22:35] marginalization這件事情 [00:22:37] 可以寫成這樣 [00:22:39] 你看這裡的寫法已經是 [00:22:41] probability density function了嘛 [00:22:43] probability y [00:22:44] 就等於是summation z [00:22:47] 屬於大Z probability y [00:22:50] 也就是說這裡其實是把y的狀況 [00:22:54] 它對應到各式各樣不同的z的狀況的機率 [00:22:57] 你全部的加起來 [00:22:59] 就得到probability y [00:23:01] 這個就是marginalization [00:23:04] 那同樣的這個cavity的狀況也是啊 [00:23:07] 我去算這個probability density function of cavity [00:23:13] 那它就相當於是 [00:23:15] 我把所有可能的z [00:23:17] 全部的狀況的機率全部加起來 [00:23:19] 那這個這時候的z呢 [00:23:20] 就包含的是探針有沒有卡住 [00:23:22] 有沒有牙痛的狀況全部加起來了 [00:23:25] 那conditional probability的部分 [00:23:27] 也是一樣 [00:23:29] 你可以這樣子寫 [00:23:31] 這叫conditioning [00:23:33] 你也一樣就是把所有的z狀況全部都把它加起來 [00:23:37] 就是說你可以把這上面的這個 [00:23:39] 應該這樣講 [00:23:40] 這個probability y到點z [00:23:44] 可以寫成是probability z [00:23:47] 再乘上probability y given z [00:23:50] 這個就是join probability的拆解嘛 [00:23:53] 有沒有你可以把這個 [00:23:55] 拆解成這個樣子嘛 [00:23:57] 好這個在我們剛剛 [00:24:00] 在講到join probability的時候 [00:24:02] 應該也講過這件事 [00:24:05] 好在大部分的情況底下呢 [00:24:07] 我們對於conditional probability [00:24:10] 某一些variable的conditional probability [00:24:13] 是很有興趣的 [00:24:15] 比如說在給定 [00:24:18] 這個病人來了 [00:24:19] 他說我有牙痛 [00:24:21] 好那麼你有注牙的機率是多少 [00:24:26] 所以我們常常對這樣的機率有興趣 [00:24:29] 好那剛剛前面講了一頭拉鼓 [00:24:32] 想說在講這個幹嘛 [00:24:33] 事實上都是為了我們要來算這個機率 [00:24:37] 好那這個conditional probability [00:24:39] 根據剛剛我們說的 [00:24:42] 告訴你給定有牙痛 [00:24:46] 我有注牙的機率就等於誰呢 [00:24:49] 就等於是我有牙痛的機率 [00:24:52] 分之我有牙痛而且有注牙的機率嘛 [00:24:56] 對不對 [00:24:57] 那我有牙痛的機率是多少呢 [00:24:59] 根據這個表 [00:25:00] 我們就可以把這幾個數字加起來 [00:25:03] 好那有牙痛又有注牙的機率呢 [00:25:07] 就是0.108加上0.012嘛 [00:25:09] 所以加起來一除上這個就等於0.6嘛 [00:25:14] 對不對 [00:25:15] 好那反之告訴你有牙痛 [00:25:20] 你沒有注牙的機率 [00:25:22] 那一樣它有同樣的事實嘛 [00:25:24] 那分母一樣照樣選 [00:25:26] 就是牙痛的機率總和 [00:25:28] 分之有牙痛沒有注牙 [00:25:33] 那就是0.016加上0.064 [00:25:36] 加起來呢就等於0.4嘛 [00:25:41] 對不對 [00:25:42] 好所以呢 [00:25:43] 我們常常在實際的應用當中 [00:25:46] 我們care的是這個conditional probability [00:25:51] conditional probability [00:25:52] 而我們可以這樣子下去進行計算 [00:25:55] 好 [00:25:56] 那特別注意一點是說 [00:25:58] 這兩個數值0.6跟0.4加起來等於1耶 [00:26:02] 它們事實上也必須等於1 [00:26:05] 為什麼呢 [00:26:06] 因為是我在給定牙痛的情況底下 [00:26:09] 它有注牙的機率跟沒注牙的機率 [00:26:12] 那加起來當然應該等於1呀 [00:26:14] 好 [00:26:16] 那再來另外一個要注意一點就是說 [00:26:19] 它們都同處同一個分母 [00:26:23] 這個分母是固定的 [00:26:26] 對不對 [00:26:27] 你看它們的分母都長一樣 [00:26:29] 這分母是一個固定的值 [00:26:31] 好那既然分母是一個固定的值 [00:26:33] 我們就可以把 [00:26:35] probability cavity given to sec [00:26:39] 這個事情啊 [00:26:41] 視為是一個 [00:26:43] 我們好像用同樣的一個數字 [00:26:45] 這個來進行正規化 [00:26:49] 它是一個normalization constant [00:26:51] 的意思 [00:26:53] 這個normalization constant確保了 [00:26:56] 我有注牙跟沒注牙的機率 [00:27:00] 在給定這個條件的情況底下 [00:27:02] 有注牙沒注牙的機率加起來會等於1呀 [00:27:05] OK [00:27:07] 那在底下的探討裡面呢 [00:27:09] 我們會故意用一個α這個值 [00:27:12] 來代表這個normalization constant [00:27:15] 有了這樣的一個說明之後 [00:27:20] 我們就可以把 [00:27:21] 本來應該是probability cavity given to sec [00:27:24] 我們可以把它寫成是 [00:27:27] αprobability cavity given to sec [00:27:32] 好這是什麼呢 [00:27:34] 這個就相當於 [00:27:36] 你這個probability cavity given to sec [00:27:39] 相當於上面的這個分子 [00:27:42] 跟這個分子 [00:27:44] 這兩個分子 [00:27:46] 好那那個α是誰 [00:27:48] α就是probability to sec分之一 [00:27:53] 這個α其實就是probability to sec分之一 [00:27:56] 這樣子 [00:27:57] 這樣瞭解嗎 [00:28:01] 因為他們都處於同一個分母嘛 [00:28:03] 我把這個分母 [00:28:05] 把它提出來變成是這樣子吧 [00:28:09] 分母分子 [00:28:10] 這個probability to sec分之一 [00:28:12] 就是我的α [00:28:13] 然後呢在乘上 [00:28:14] 我現在 [00:28:15] 我這裡其實是兩個分子的意思嘛 [00:28:18] 好 [00:28:20] 那這個分子呢 [00:28:23] 我又可以寫的 [00:28:24] 再更general一點 [00:28:27] 這個分子的意義就是說 [00:28:30] 呃 [00:28:31] 有牙痛 [00:28:33] 以及 [00:28:35] 有蛀牙 [00:28:36] 跟沒蛀牙的兩種狀況 [00:28:38] 好 [00:28:39] 有牙痛 [00:28:40] 有然後呢 [00:28:41] 蛀牙不蛀牙 [00:28:43] 我後面還有另外一個 [00:28:45] 我探針有有卡住沒卡住啊 [00:28:47] 所以我又可以把它 [00:28:48] 另外一個具體化就是說 [00:28:50] 有卡住 [00:28:51] 沒卡住 [00:28:52] 這樣子 [00:28:53] 好 [00:28:54] 那我們來看一下 [00:28:55] 好 [00:28:56] 這個是什麼勒 [00:28:57] 這個機率就是說 [00:28:59] 有蛀 [00:29:00] 有牙痛 [00:29:01] 有卡住 [00:29:02] 然後呢 [00:29:03] 有蛀牙的機率跟沒蛀牙的機率 [00:29:05] 這個probability distribution [00:29:07] 就等於是 [00:29:09] 看一下 [00:29:10] 呃 [00:29:11] 牙痛蛀牙 [00:29:12] 牙痛卡住 [00:29:13] 牙痛卡住 [00:29:14] 有蛀牙沒蛀牙 [00:29:15] 所以是0.108跟0.016 [00:29:17] 在這裡 [00:29:19] 在這裡 [00:29:20] 好 [00:29:21] 那右邊這個呢 [00:29:22] 有牙痛 [00:29:23] 沒卡住 [00:29:25] 有蛀牙沒蛀牙 [00:29:27] 好 [00:29:28] 有牙痛 [00:29:29] 沒卡住 [00:29:31] 有蛀牙 [00:29:32] 沒蛀牙 [00:29:33] 0.012跟0.064 [00:29:35] 是這個 [00:29:36] 好 [00:29:37] 所以這個是 [00:29:38] 這一個符號 [00:29:39] 這代表兩個機率嘛 [00:29:41] 這個符號也代表兩個機率嘛 [00:29:42] 然後前面呈上一個α [00:29:44] OK [00:29:45] 好 [00:29:46] 那 [00:29:47] 你把這兩個機率這樣加起來 [00:29:50] 好 [00:29:51] 為什麼這可以加起來 [00:29:52] 因為就是有蛀牙沒蛀牙的兩種狀況 [00:29:54] 加起來 [00:29:55] 就變成α0.12 [00:29:57] 0.008 [00:30:00] 0.12跟0.008 [00:30:02] 那經過你這個normalize之後呢 [00:30:04] 其實就等於0.6 [00:30:05] 0.4 [00:30:06] 那的確 [00:30:07] 如果我們所預期兩個加起來 [00:30:09] 應該要等於 [00:30:10] 以經過這個normalize的vector之後 [00:30:13] 它加起來應該要等於1 [00:30:15] 好 [00:30:16] 那以後呢 [00:30:17] 這樣子的表達形式 [00:30:19] 還會繼續的出現 [00:30:21] 好 [00:30:23] 那 [00:30:24] 但是這個是在玩數學嗎 [00:30:26] 這樣是在玩數學嗎 [00:30:28] 事實上不是 [00:30:29] 你仔細看 [00:30:31] in other words [00:30:32] we can calculate [00:30:33] probability cavity given to snack [00:30:38] even if we don't know the value [00:30:41] of probability to snack [00:30:43] 什麼意思呢 [00:30:50] 就是說 [00:30:54] 在整個運算的過程當中 [00:30:58] 我們其實並不知道 [00:31:01] 會發生 [00:31:04] 應該怎麼講 [00:31:05] 在這整個運算當中 [00:31:06] 我們其實並沒有應用到 [00:31:10] 牙痛出現的機率 [00:31:12] 就是說你看啊 [00:31:13] 回到45頁這一頁的影片 [00:31:16] 當我們要來計算這個機率的時候 [00:31:19] 我們是不是要分母要放 [00:31:21] 牙痛的機率 [00:31:22] 然後呢 [00:31:23] 分支牙痛而且蛀牙 [00:31:26] 的機率對不對 [00:31:27] 這個計算也是 [00:31:28] 我們要知道牙痛的機率分支牙痛 [00:31:31] 而且沒有蛀牙的機率 [00:31:34] 可是呢 [00:31:35] 到了這邊的這個推導 [00:31:37] 我們其實這最後 [00:31:39] 我們一樣是算出0.6 0.4 [00:31:41] 而我們怎麼算出來的呢 [00:31:43] 我們是根據 [00:31:45] 這個機率 [00:31:47] 這個distribution [00:31:49] 跟這個distribution [00:31:51] 這加總 [00:31:52] 然後我們再做一個normalize [00:31:54] 這個normalize [00:31:55] 其實0.12 0.008 [00:31:57] 我不知道α [00:31:58] 我也可以normalize [00:31:59] 0.12跟0.008 [00:32:02] 為什麼 [00:32:03] 因為我們只要把它 [00:32:04] 這個normalize是一個 [00:32:06] 是一個什麼簡單的運算嘛 [00:32:09] 你只要把0.12除上 [00:32:11] 0.12加0.08 [00:32:13] 其實就等於0.6啊 [00:32:15] 你把0.08除上 [00:32:17] 0.12加上0.08 [00:32:19] 也是等於0.4啊 [00:32:21] 也就是說 [00:32:22] 我根本不必利用到這個α [00:32:24] 大家還記得 [00:32:25] 我剛剛講這個α是誰 [00:32:27] 這個α就是 [00:32:28] 牙痛的機率分之一嘛 [00:32:31] 可是呢 [00:32:32] 其實你在這裡你可以完 [00:32:33] 你只是把這個α當成是一個 [00:32:36] 我告訴你喔 [00:32:37] 你這邊你要normalize [00:32:39] 而你這個你normalize [00:32:41] 要不要仰賴 [00:32:43] 牙痛的機率 [00:32:44] 其實不用 [00:32:45] 你這兩個數字 [00:32:46] 你自己就可以normalize [00:32:47] 乘0.6 0.4的 [00:32:49] 好所以下面這一頁的重點 [00:32:50] 再來講說 [00:32:52] 我啊 [00:32:53] 其實根本就不需要 [00:32:54] 用到牙痛的機率 [00:32:56] 我就可以去算出 [00:32:58] 告訴你牙痛 [00:33:00] 你 [00:33:01] 是 [00:33:02] 蛀牙或非蛀牙的機率 [00:33:04] 這樣瞭解嗎 [00:33:08] 這個巧妙的點在這裡 [00:33:10] 好 [00:33:11] 那代表說呢 [00:33:12] 我們是暫時性的 [00:33:14] 忽略或忘記了 [00:33:16] 牙痛的機率分之一 [00:33:18] 這件事情 [00:33:19] 我們剛剛的整個運算 [00:33:20] 就是算出0.12 0.008 [00:33:22] 那0.12 0.08 [00:33:24] 我們自己normalize [00:33:25] 就變成0.6 0.4了 [00:33:27] 我根本也不用看這個 [00:33:29] 好所以normalization [00:33:31] turns out to be a useful shortcut [00:33:33] in many probability calculations [00:33:35] both to make the computation easier [00:33:38] and allow us to perceive [00:33:40] when some probability assessment [00:33:42] is not available [00:33:44] 好就是說這樣子的一個技巧 [00:33:47] 讓我們 [00:33:48] 有的時候我們可能根本 [00:33:50] 在實際問題上 [00:33:52] 我們根本無法取得所謂的 [00:33:55] 牙痛的機率 [00:33:57] 那你說有啊有啊這裡有啊 [00:33:58] 這個表不就是了嗎 [00:34:00] 那這只是一個舉例吧 [00:34:03] 我們不是永遠都可以 [00:34:05] 找出這個表格裡面的 [00:34:08] 每一個數字 [00:34:10] 這實際的問題上不見得如此 [00:34:14] 那也就是這樣的一個技巧 [00:34:17] 讓我們能夠 [00:34:19] 有機會的算出各種 [00:34:21] 更多的不同的機率 [00:34:28] 好那如果我的query [00:34:30] 只牽涉到一個variable [00:34:32] 比如說cavity [00:34:34] 出題字的e呢 [00:34:35] 代表是我的evidence [00:34:37] 比如說就是這個 [00:34:39] to sec [00:34:41] 所以說我們剛剛 [00:34:42] 前面那兩頁在講的事情 [00:34:44] 寫的更一般話來講就是 [00:34:46] probability x given e [00:34:49] 給定evidence [00:34:51] 然後呢我要去算 [00:34:52] x出現的機率 [00:34:54] 那根據剛剛前面的邏輯 [00:34:55] 我可以把這一個寫成是 [00:34:58] probability x到點e的 [00:35:01] normalization的版本 [00:35:03] 正規化的版本 [00:35:05] 好 [00:35:06] 那這個再往下延伸 [00:35:08] 我們就可以寫成是 [00:35:10] 我把所有 [00:35:11] 因為這個機率 [00:35:12] 我可能還是不會算 [00:35:14] 但是我有可能是 [00:35:15] 我知道說 [00:35:16] x跟e以及 [00:35:19] 各種可能的y的所有的狀況 [00:35:22] 的機率 [00:35:23] 我可能有 [00:35:24] 那我把這些都sum起來 [00:35:26] 加起來 [00:35:27] 我就得到了 [00:35:28] 這個機率 [00:35:29] 這個distribution [00:35:30] 那我有了這個distribution [00:35:32] 我自己就可以去做normalization [00:35:34] 那我就可以算出這個了 [00:35:36] 我根本也不要你這個alpha [00:35:38] 所以整個的概念就是這樣子 [00:35:43] 好 [00:35:44] 那所以這個部分呢 [00:35:46] 算是蠻有趣的一個技巧 [00:35:50] 那接下來下一個主題 [00:35:53] 下一個主題 [00:35:58] 我們現在把這個 [00:36:00] 剛剛這個表呢 [00:36:01] 在expand [00:36:02] 多一個variable [00:36:04] random variable [00:36:06] 比如說weather [00:36:07] 好了 [00:36:08] 好 [00:36:09] 所以剛剛本來已經有三個variable [00:36:10] 就是有沒有牙套 [00:36:12] 有沒有蛀牙 [00:36:14] 探針有沒有卡住 [00:36:16] 現在再多一個 [00:36:17] 就是說今天的天氣是怎麼樣 [00:36:20] 那這樣子的話呢 [00:36:22] 我們的probability distribution function [00:36:25] 就變成是probability to set [00:36:27] catch cavity跟weather [00:36:30] 你這個排列組合就會有 [00:36:31] 二乘二乘二乘四 [00:36:33] 總共32個entry [00:36:35] 所以其實啊 [00:36:36] 這個table呢 [00:36:39] 這個table本來就已經是 [00:36:43] 三個variable [00:36:44] 我好不容易弄出一個 [00:36:47] 有八個entry的table [00:36:50] 那現在呢 [00:36:51] 我可能晴天我就有一個這樣的table [00:36:53] 雨天就有一個這樣的table [00:36:55] 陰天跟下雪都個別有一個這樣的table [00:36:58] 這樣 [00:36:59] 好 [00:37:02] 那 [00:37:04] 我們現在想要探討的是說 [00:37:06] 那麼 [00:37:08] 今天probability to set [00:37:11] catch cavity cloudy [00:37:14] 這個join probability [00:37:16] 跟probability to set [00:37:19] catch cavity [00:37:21] 它們的關係是怎麼樣 [00:37:23] 好 [00:37:24] 那根據我們之前講的product rule [00:37:26] 這個join probability呢 [00:37:28] 其實可以寫成是 [00:37:30] 這三個的join probability [00:37:32] 的機率在乘上 [00:37:34] 給定這三個 [00:37:36] 陰天出現的機率 [00:37:38] 就形成了這四個的 [00:37:40] join probability [00:37:42] 對不對 [00:37:43] 就是product rule [00:37:45] 其實可以再繼續往下細分 [00:37:47] 這個大家以前學機率應該學過 [00:37:49] 就是chain rule [00:37:51] 好 [00:37:53] 那但是呢 [00:37:55] 這裡故意舉一個這麼奇怪的例子 [00:37:57] 是因為 [00:37:58] 但是其實就正常的人 [00:38:00] 就應該知道 [00:38:02] 就是說你牙不牙痛 [00:38:04] 探針有沒有卡住 [00:38:05] 有沒有蛀牙 [00:38:06] 跟天氣有沒有關係 [00:38:08] 一點關係都沒有啊 [00:38:09] 所以我給定 [00:38:11] 你這個什麼牙痛的狀況 [00:38:13] 探針卡住的狀況 [00:38:15] 跟這個 [00:38:16] 呃 [00:38:17] 這個蛀牙的狀況 [00:38:18] 會不會影響到天氣 [00:38:20] 不會影響 [00:38:21] 所以 [00:38:22] whether [00:38:23] 這個random variable [00:38:24] 跟其他random variable [00:38:25] 是怎麼樣 [00:38:26] 獨立的 [00:38:27] 其實這個機率呢 [00:38:29] 可以直接寫成是 [00:38:31] 陰天的機率 [00:38:34] 因為它跟 [00:38:36] 這三個random variable是independent [00:38:38] 是獨立的嘛 [00:38:39] 那也就是因為這樣 [00:38:41] 所以我們可以把剛剛的product rule [00:38:43] 簡寫成這樣 [00:38:45] probability cloudy [00:38:47] 乘上probability [00:38:48] 這三個的join probability就好了 [00:38:50] 好 [00:38:51] 那原因是因為 [00:38:52] 我把這個部分簡化了嘛 [00:38:54] 因為它是獨立的 [00:38:55] 所以我們可以簡化 [00:38:57] 那寫成這個random variable的形式 [00:39:00] 我們就可以把 [00:39:01] 這四個random variable的join probability distribution [00:39:04] 寫成是 [00:39:05] whether的probability distribution [00:39:07] 乘上這三個的join probability distribution [00:39:11] 我們可以進行簡化 [00:39:13] 好 [00:39:14] 那independence這件事情 [00:39:16] 大家不要小看 [00:39:17] 它其實是 [00:39:18] 很在我們這個機率的推論上 [00:39:20] 很重要的一個特性 [00:39:22] 好 [00:39:23] 我們特別喜歡independent的狀況 [00:39:26] 因為這樣可以讓我們的運算 [00:39:29] 簡化很多 [00:39:31] 所以今天如果說 [00:39:32] A跟B這兩個proposition [00:39:34] 是independent [00:39:36] 是獨立的話 [00:39:37] 那麼probability A given B [00:39:39] 就可以寫成是probability A [00:39:41] probability B given A呢 [00:39:43] 就可以寫成probability B [00:39:45] probability A and B呢 [00:39:46] 就可以寫成probability A [00:39:48] 乘上probability B [00:39:50] 好 [00:39:51] 那這是proposition [00:39:53] 那如果說寫成是random variable的形式 [00:39:56] 就是底下這個樣子 [00:39:58] 好 [00:40:00] 好 [00:40:01] 那independence呢 [00:40:02] usually based on knowledge of domain [00:40:04] 那我怎麼知道 [00:40:05] 哪個random variable [00:40:06] 跟哪個random variable [00:40:07] 是不是independence [00:40:09] 那可能就會有一些domain knowledge [00:40:11] 好 [00:40:12] 那 [00:40:13] 它呢 [00:40:14] 可以急劇的減少 [00:40:16] 我們所需要的資訊量 [00:40:18] 來 [00:40:19] 當我們要計算這個 [00:40:21] full or joint distribution的時候 [00:40:23] 可以大量的簡化我們的運算 [00:40:25] 好 [00:40:26] 那所以比如說啦 [00:40:28] 假設今天我丟N個獨立的銅板 [00:40:33] 好 [00:40:34] 那我們想要去算說 [00:40:35] 這銅板呢 [00:40:36] 這N個獨立的銅板 [00:40:38] 它的正反正反的狀況 [00:40:41] 其實有幾種變化 [00:40:42] 有2的N次方種 [00:40:44] 這麼多種變化 [00:40:45] 好 [00:40:46] 那所以我們要算的是probability [00:40:48] 第一個銅板是正面反面的機率 [00:40:51] and第二個銅板正面反面的機率 [00:40:53] 一直到第N個銅板正面反面的機率 [00:40:55] 那這個其實這個join probability [00:40:57] 是不好算的 [00:40:59] 是很難算的 [00:41:00] 好 [00:41:01] 那但是呢 [00:41:02] 我們就可以利用independent的形式 [00:41:04] 我們可以各算各的 [00:41:06] 第一個銅板正面的機率 [00:41:08] 跟反面的機率 [00:41:10] 乘上第二個銅板 [00:41:11] 我各算各的 [00:41:12] 所以我只要把它乘起來 [00:41:13] 就好了嘛 [00:41:14] 好 [00:41:15] 那底下這是一個示意圖啊 [00:41:17] 就是說 [00:41:18] 如果原本是這四個random robot [00:41:21] 我其實根本就可以把它細分 [00:41:24] 拆解成這樣 [00:41:25] 很簡單的拆解成這樣 [00:41:27] 那如果是independent的coin的話 [00:41:29] 也可以拆解 [00:41:31] OK [00:41:33] 好 [00:41:34] 講到這邊 [00:41:36] 我們想先