# 章節包:人工智慧導論(AI)W4(10/1)第 01 章「機率的表示法與基本公理」 Ch12 Part 2(2021 錄影)影片 0:00:01–0:15:54,YouTube ID iuAeHIfOscA,逐字稿 C:\D槽\TAICA課程\人工智慧導論\第四周1151001\W4_人工智慧導論_Ch12_Part2.逐字稿.txt。Notion 章節頁 https://app.notion.com/p/3ecfc631b030815aa226c2d0b9d9456b(頁 ID 3ecfc631b030815aa226c2d0b9d9456b),頁面標題「01 機率的表示法與基本公理(0:00–0:15)」。 ## 1. 第一行(直接照抄,不要改) [人工智慧導論](https://app.notion.com/p/3e6fc631b0308131b213f0a3d93fe91d) › [W4(10/1)](https://app.notion.com/p/3ecfc631b03081e895d2c5f3aec0353e) › 01|Ch12 Part 2(2021 錄影)影片 [0:00:01–0:15:54](https://www.youtube.com/watch?v=iuAeHIfOscA&t=1s)|投影片 Ch12 p.11、p.18–26|上一章 無|下一章 [02 用聯合分布推論與獨立性(0:15–0:41)](https://app.notion.com/p/3ecfc631b03081bdb8b1e658c224b992) ## 1b. 最後一行(直接照抄,放在 Self-check 後面,當全頁最後一行) 讀完了嗎?下一章:[02 用聯合分布推論與獨立性(0:15–0:41)](https://app.notion.com/p/3ecfc631b03081bdb8b1e658c224b992)|回到週頁:[W4(10/1)](https://app.notion.com/p/3ecfc631b03081e895d2c5f3aec0353e) ## 2. 各段標題(照順序;每段一個 ## 標題,直接照抄連結) - `## [0:00:01](https://www.youtube.com/watch?v=iuAeHIfOscA&t=1s) 隨機變數與 domain` 老師講什麼:隨機變數用大寫開頭(例 Total、Die1),它所有可能值的集合叫 domain;Boolean 變數的 domain 只有 true/false,true 可簡寫成小寫 a、false 寫 ¬a。domain 可以是無限的,離散或連續都可能。 - `## [0:02:34](https://www.youtube.com/watch?v=iuAeHIfOscA&t=154s) 機率分布:粗體 P 是一整個向量` 老師講什麼:列出 Weather 每個值的機率(0.6、0.1、0.29、0.01),合寫成粗體 P(Weather);粗體代表好幾個數字組成的向量(probability distribution),細體才是單一機率。P(X|Y) 則是所有 xi、yj 配對的條件分布。 - `## [0:05:08](https://www.youtube.com/watch?v=iuAeHIfOscA&t=308s) 連續變數與機率密度函數` 老師講什麼:連續變數無法列出所有值,改用函數描述,例如正中午氣溫在 18–26°C 均勻分布,叫 probability density function(pdf)。P(X=20.18) 寫出來是 1/8,但那是密度不是機率,剛好等於某一點的機率其實是 0,意義是極小區間佔整體的比例。 - `## [0:09:38](https://www.youtube.com/watch?v=iuAeHIfOscA&t=578s) 聯合機率分布與符號細節` 老師講什麼:同時考慮 Weather(4 種)和 Cavity(2 種)得到 8 格的 joint distribution P(Weather, Cavity);P(sunny, Cavity) 是 2 個機率,P(sunny, cavity) 只是 1 個機率。也可用 product rule 寫成 P(Weather|Cavity)P(Cavity)。 - `## [0:12:58](https://www.youtube.com/watch?v=iuAeHIfOscA&t=778s) Possible world` 老師講什麼:possible world 是把所有考慮中的隨機變數都指定一個值;Cavity、Toothache、Weather 三個變數共有 2×2×4=16 種組合,聯合分布就包含 16 個機率。 - `## [0:13:41](https://www.youtube.com/watch?v=iuAeHIfOscA&t=821s) 從公理推出基本定理` 老師講什麼:利用「互斥事件機率總和為 1、每個機率介於 0 到 1」兩條公理,推出 P(¬a)=1−P(a);再用文氏圖說明 inclusion–exclusion principle:P(a∨b)=P(a)+P(b)−P(a∧b)。老師說到這裡都是機率複習。 ## 3. 老師強調/會考/不考的地方(原句已驗證;寫進筆記時 ASR 錯字要改正) - (0:09:23) [強調] 「那所以大家切記」 → 連續變數寫成 P(X=x) 的值是機率密度,不是機率;剛好落在某一點的機率是 0,意義是極小區間內佔整體的比例。 - (0:10:58) [強調] 「粗體字有差喔」 → 大小寫與粗細體有不同意義:P(sunny, Cavity) 代表兩個機率,小寫 sunny 是 Weather 的一個值;0:12:44 又說「大小寫這個都有講究的」。 ## 3b. 數學段候選(程式抓的,只是提示;寫「跳過提示」行用) 0 段候選(門檻 6.7 字/30 秒) ## 4. 這章摘要與重要度 (Ch12 Part 2 影片,時間是那支影片的時間)介紹隨機變數與 domain、機率分布與粗體 P 的意義、連續變數的機率密度、聯合分布與 possible world,最後從公理推出 P(¬a) 與排容原理。(核心) ## 5. 整堂課的提醒(ASR 錯字、老師口誤、投影片缺公式等;只用跟這章有關的) - 這週老師採非同步上課,給三支 2021 年錄的舊影片。各章的影片時間是那一支影片自己的時間,章節第一行寫了是哪一支。 - [Ch12 Part 2] 這支是 2021 年錄的舊影片(10/1 非同步上課三支之一),內容只有上課,沒有提到作業、日期或考試安排。 - [Ch12 Part 2] 影片最後在 0:41:36「講到這邊我們想先」句子講到一半就斷了,接續內容應在 Ch12 Part 3。 - [Ch12 Part 2] 老師引用的是課本舊版編號(equation 13.1、13.2;3rd edition 的機率章是 Ch13),今年課本第 4 版是 Ch12,公式編號可能不同。 - [Ch12 Part 2] Ch12 投影片本機沒有,章節的 Exam-ready 英文要用老師唸出的投影片英文句或自己的話(標 my wording),不要憑記憶背課本原文。 - [Ch12 Part 3] 這是 2021 年的錄影。片尾 0:31:05 老師說「下一次上課」會講 Bayesian network,這是 2021 年的課程安排,不代表今年的進度。今年接下來是 Ch13 Part 1 影片,內容剛好接得上。 - [Ch12 Part 3] Ch12 投影片本機沒有,slides 欄寫「Ch12(投影片待補)」。老師在 0:21:29 說「回去翻一下之前那幾頁」、0:27:48 說「最後兩頁」,都要等拿到投影片才能對頁碼。 - [Ch12 Part 3] 逐字稿 0:01:45–0:02:20 有語音辨識重複句和亂碼(日文、土耳其文碎字),內容只有「推廣到隨機變數、可以加入其他證據」一句,寫的時候不要照抄。 - [Ch12 Part 3] 語音辨識常見錯字:Base rule/Best Rule=Bayes' rule、腦模擬=腦膜炎、cursal=causal、cost=cause、to sac=toothache、探身=探針(probe)、basion network=Bayesian network、頭影片=投影片。 - [Ch12 Part 3] 預期中的 wumpus world 例子這支片沒有講;絕對獨立(天氣)只在 0:24:48 順口帶過一句,可能 Part 2 已經講過。 - [Ch13 Part 1] 這支是 2021 年錄的舊影片(10/1 非同步上課的三支之一)。影片裡沒有提到作業、日期或考試安排,所以沒有需要標成「2021 年說法」的行政資訊。 - [Ch13 Part 1] Ch13 投影片本機沒有,slides 欄一律寫「Ch13(投影片待補)」。老師口頭引用的是課本第 3 版的圖號(Figure 14.3),第 4 版對應的是 Ch13,拿到投影片後要再核頁碼。 - [Ch13 Part 1] 逐字稿把「貝氏網路」辨識成「被視網路/備試網路/被子網路/貝斯網路」,把 Earthquake 辨識成「R-squared/EarthCraft」,把 axioms 辨識成「axing」,把 It contains 辨識成「Lay contains」,寫筆記時要改回正確寫法。 - [Ch13 Part 1] 影片停在「怎麼建構貝氏網路」(0:48:13 老師說「稍微告一個段落」),本章第二大問題「怎麼用貝氏網路做推論」留到之後的影片。 - [Ch12 Part 2] Ch12 投影片本機沒有,無法對照頁碼;老師在 0:31:13 說「回到45頁」,指的是算 P(cavity|toothache)=0.6 那一頁(2021 版投影片 p.45),拿到投影片後可用來對齊頁碼。 - [Ch12 Part 2] 老師引用 equation 13.1、13.2(課本第 3 版編號),今年第 4 版是 Ch12,編號可能是 12.1、12.2,不確定。 - [Ch12 Part 2] 0:03:06 逐字稿寫 Weather 的機率「0.6、0.1、0.29、0.11」,0:03:3x 又說「0.6、0.1、0.29、0.01」;課本例子應是 0.01(加總才等於 1),以 0.01 為準。 - [Ch12 Part 2] 0:29:55 附近逐字稿把 0.008 有時寫成 0.08(例如 0:31:5x「0.12 除上 0.12 加 0.08」);正確是 <0.12, 0.08>,正規化後 0.6/0.4(0.12/0.2=0.6),寫筆記時要統一成 0.08。 - [Ch12 Part 2] ASR 錯字很多:to sec/to snack/tootsack=toothache、注牙=蛀牙、join=joint、the basic action Asian=the basic axioms、正宗5=正中午、random robot=random variable、出題字的e=粗體字的 e。0:02:02–0:02:34 有 Whisper 重複段落與亂碼("propablythe patient...tis act"),內容是 P(cavity|¬toothache, teen)=0.1 的例子。 - [Ch12 Part 2] 影片開頭直接從隨機變數講起,沒有重講 W3 的條件機率與 product rule,只在 0:02:04 用「給定沒牙痛的青少年蛀牙機率 0.1」一句回顧,已併在第 1 章第 1 段。 - [Ch12 Part 2] 第 2 章約 25.7 分鐘,略超過 25 分鐘;獨立性(0:35:50 起約 6 分鐘)太短不足以單獨成章,所以併入第 2 章。 - [Ch12 Part 3] 只切成 2 章:第 1 章約 18.8 分鐘、第 2 章約 12.9 分鐘。第 2 章比 15 分鐘短一點,但它是一個完整主題(多證據、條件獨立、naive Bayes),又是片尾,切不出第 3 章,併進第 1 章會超過 30 分鐘,所以維持 2 章。 - [Ch12 Part 3] 沒有投影片,所以每段對應哪一頁沒辦法確認。老師的數字(0.7、1/50000、0.01、0.108、0.016、0.871/0.129)看起來跟 AIMA 課本一致,但沒有拿投影片核對過。 - [Ch12 Part 3] 老師在 0:20:28 一度把 0.016 唸成「0.01 呃 0.016」,應以 0.016 為準。 - [Ch12 Part 3] 0:13:47 老師說的「五千分之一」是假設中有經驗醫生的診斷數字,跟算出來的 0.0014(約 1/714)不一樣;寫筆記時要說清楚兩者是不同來源,不要混在一起。 - [Ch12 Part 3] 片尾 0:30:54 老師說「今天我們主要講的就是整個機遇的介紹」,聽起來 Part 3 是 2021 年某一堂課的結尾,Part 2 與 Part 3 可能是同一堂課的前後段,主 session 合併時可以留意章節之間是否有重疊。 - [Ch13 Part 1] 沒有投影片可對照,章節只能照逐字稿切,頁碼範圍全部待補。拿到 Ch13 投影片後要補每章的頁碼,並核對 Exam-ready 英文句。 - [Ch13 Part 1] 老師引用「figure 14.3」是課本第 3 版的編號(第 3 版貝氏網路在 Ch14,第 4 版在 Ch13),筆記引用圖號時要註明版本。 - [Ch13 Part 1] 0:23:21 逐字稿說聯合機率算出來是「0.00628」,課本的值是 0.000628(0.90×0.70×0.001×0.999×0.998);同一段 John 打電話的機率被辨識成「0.98」,前面 0:13:31 說的是 0.9。不確定是老師口誤還是辨識錯,寫筆記時照課本數字寫,並加一句「注意」。 - [Ch13 Part 1] 逐字稿有大量貝氏網路的錯字(被視網路、備試網路、被子網路、貝斯網路)和英文辨識錯誤(R-squared=Earthquake、Lay contains=It contains、axing=axioms),寫筆記與 Exam-ready 時要改正。 - [Ch13 Part 1] 全片沒有老師明說「會考/不考」的地方;emphasis 只列了帶強調語氣的句子(特別要注意、這是要注意的、ordering 很重要、不要忘了同一個分布)。 - [投影片 2026-10-01 補到] 這章草稿是在沒有投影片時寫的。審稿時必做:(1) 第一行換成章節包第 1 節那行(投影片頁碼已更新);(2) Exam-ready 每一行標「(自擬,投影片待補)」或 (my wording) 的英文,全部換成章節包第 6 節的投影片原句並標頁碼(例 Ch12 p.31),中文解釋跟著改;投影片有、筆記沒有的重要句子補進去;(3) 正文和概念檔裡的 (my wording) 定義改成投影片原句;(4) 投影片的數字、符號、例子跟草稿不同時,以投影片為準。 ## 6. 投影片文字(這章範圍) **這幾頁的公式或內容只在圖裡(文字檔抓不到),寫 Exam-ready 與公式前先用 Read 看這幾張圖:** - Ch12 p.11 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p011.png - Ch12 p.18 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p018.png - Ch12 p.19 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p019.png - Ch12 p.22 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p022.png - Ch12 p.23 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p023.png - Ch12 p.24 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p024.png - Ch12 p.26 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch12_p026.png --- Ch12 p.11 --- • A fully specified probability model associates a numerical probability P(ω) with each possible world. The basic axioms of probability theory: • For example, if we assume that each die is fair and the rolls don’t interfere with each other, then each of the possible worlds (1,1), (1,2), ..., (6,6) has probability 1/36. What probabilities are about 11 --- Ch12 p.18 --- • Variables in probability theory are called random variables and their names begin with an uppercase letter. In the dice example, Total and Die1 are random variables. Every random variable has a domain—the set of possible values it can take on. The domain of Total for two dice is the set {2,...,12} and the domain of Die1 is {1,...,6}. • A Boolean random variable has the domain {true, false}. For example, the proposition that doubles are rolled can be written as Doubles = true. By convention, propositions of the form A=true are abbreviated simply as a, while A=false is abbreviated as ¬a. Lang. of propositions in prob. assertions 19 --- Ch12 p.19 --- • Variables can have infinite domains—either discrete (like the integers) or continuous (like the reals). • Finally, we can combine these sorts of elementary propositions by using the connectives of propositional logic. For example, we can express “The probability that the patient has a cavity, given that she is a teenager with no toothache, is 0.1” as follows: Lang. of propositions in prob. assertions 20 --- Ch12 p.20 --- • where the bold P indicates that the result is a vector of numbers. We say that the P statement defines a probability distribution for the random variable Weather. The P notation is also used for conditional distributions: P(X | Y) gives the values of P(X = xi | Y = yj) for each possible i, j pair. Lang. of propositions in prob. assertions 21 --- Ch12 p.21 --- • For continuous variables, it is not possible to write out the entire distribution as a vector, because there are infinitely many values. Instead, we can define the probability that a random variable takes on some value x as a parameterized function of x. For example, the sentence expresses the belief that the temperature at noon is distributed uniformly between 18 and 26 degrees Celsius. We call this a probability density function. Lang. of propositions in prob. assertions 22 --- Ch12 p.22 --- • Probability density functions (sometimes called pdfs) differ in meaning from discrete distributions. Saying that the probability density is uniform from 18C to 26C means that there is a 100% chance that the temperature will fall somewhere in that 8C-wide region and a 50% chance that it will fall in any 4C-wide region, and so on. • We write the probability density for a continuous random variable X at value x as P(X = x) or just P(x); the intuitive definition of P(x) is the probability that X falls within an arbitrarily small region beginning at x, divided by the width of the region: Lang. of propositions in prob. assertions 23 --- Ch12 p.23 --- • In addition to distributions on single variables, we need notation for distributions on multiple variables. Commas are used for this. For example, P(Weather, Cavity) denotes the probabilities of all combinations of the values of Weather and Cavity. This is a 4×2 table of probabilities called the joint probability distribution of Weather and Cavity. • We can also mix variables with and without values; P(sunny, Cavity) would be a two-element vector giving the probabilities of a sunny day with a cavity and a sunny day with no cavity. Lang. of propositions in prob. assertions 25 --- Ch12 p.24 --- • The product rules for all possible values of Weather and Cavity can be written as a single equation: instead of as these 4 × 2 = 8 equations (using abbreviations W and C ): Lang. of propositions in prob. assertions 26 --- Ch12 p.25 --- • As a degenerate case, P(sunny, cavity) has no variables and thus is a one- element vector that is the probability of a sunny day with a cavity, which could also be written as P(sunny, cavity) or P(sunny ∧cavity). Lang. of propositions in prob. assertions 27 --- Ch12 p.26 --- • A possible world is defined to be an assignment of values to all of the random variables under consideration. For example, if the random variables are Cavity, Toothache, and Weather, then there are 2 × 2 × 4 = 16 possible worlds. • A probability model is completely determined by the joint distribution for all of the random variables. For example, if the variables are Cavity, Toothache, and Weather, then the full joint distribution is given by P(Cavity, Toothache, Weather). This joint distribution can be represented as a 2 × 2 × 4 table with 16 entries. Lang. of propositions in prob. assertions 28 ## 7. 逐字稿(0:00:01 前後各多 1 分鐘,原始行) [00:00:01] 好,那接下來呢,我們持續的來講這個機率,當我們在進行這個機率的這個描述的時候,通常呢,在機率裡面呢,我們所使用的這個variable呢,都是所謂的random variable,那習慣上,至少在我們這本書裡面呢,random variable都是會用大寫字母開頭,大寫字母開頭,比如說,兩個骰子的點數,總點數就是total, [00:00:31] 好,那第一顆骰子的點數就是die1,這樣子,那它們都是random variable,因為這個variable呢,它們的數值呢,是根據一個,某一個狀態所決定的,它是一個會變的,它的數值可能是123456,這樣子,好,那這些數值所形成的範圍,這個集合,就是稱為這個random variable的domain,OK,所以說呢,total, [00:01:01] 那total的這個總數的數值可以從2一直到12嘛,234567一直到12,好,那第一個骰子的數值可以是1,2,3,4,5,6的其中一個,所以這個就稱呼它,稱呼為這兩個random variable的domain, [00:01:17] 那有些random variable呢,它的domain只有true或false,就是對或錯,成立或不成立,好,所以比如說,要判別,這個它是不是一個, [00:01:31] 呃,雙雙對對的情況,那就是,要嘛不是,這樣子,好,那在習慣上呢,呃,某一個random variable等於true,也有可能直接寫成一個小a,好,那它如果等於false,也有可能寫成這樣,not a,這樣,好,那, [00:01:54] 誒,跳到哪裡去了,喔,好,來,那variable呢,呃,它可以有,它的domain可以是無限大的,喔,呃,而且不管, [00:02:02] 呃,它的domain可以是無限大的,喔,呃,而且不管, [00:02:02] 呃,它的domain可以是無限大的,喔,呃,而且不管, [00:02:04] 呃,它的domain可以是無限大的,喔,呃,而且不管, [00:02:04] 你是discrete的random variable,還是continuous,都有可能是無限大,好,那另外一個就是說呢,我們可以把這樣子的一個表達形式,表達在機率上面,好,所以比如說,其實這個例子,我們剛剛也看過類似的,就是說,給定沒有牙痛,好,然後呢,呃,而且又是十幾歲的親,的這個,呃,青少年,那麼它是蛀牙的機率,是等於0.1,好,類似像這樣,好,然後呢,呃,而且又是十幾歲的親,的這個,呃,青少年,那麼它是蛀牙的機率,是等於0.1,好,類似像這樣,好,然後呢,呃,而且又是十幾歲的親,的這個,呃,青少年,那麼它是蛀牙的機率, [00:02:34] 長沒了,那propablythe patient, has a cavity,giventhat she is a teenager, with no",,tis",act",is 10%,你可以這麼,把這樣子的一個描述方式,整合到機率的表達裡面,好,那有的時候呢,我們會可能會想要列出,一個random variable的所有可能的狀況,它以及它對應的機率,喔,比如說,我可能有一個random variable是天氣, [00:03:04] 陰天跟下雪 [00:03:06] 那個別的機率就是0.6、0.1、0.29、0.11等等的 [00:03:11] 那我們也可以把它一起寫起來 [00:03:14] 變成是粗體字的p [00:03:17] 然後呢括號weather [00:03:18] 就是說weather這個random variable [00:03:21] 它的所有可能的各種不同的sample [00:03:25] 它的機率的分佈 [00:03:28] 就是0.6、0.1、0.29、0.01 [00:03:31] 那大家知道在數學課本 [00:03:34] 或者是說像這種比較formal [00:03:37] 比較正式的書籍裡面 [00:03:40] 你有沒有斜體跟有沒有粗體 [00:03:43] 其實都有嚴格的意義 [00:03:46] 所以通常像我們以前 [00:03:49] 線性代數也是一樣 [00:03:51] 你如果有一個字母是粗體的字母 [00:03:53] 代表它是一個向量 [00:03:55] 細體字代表它是一個scatter [00:03:58] 那這邊也是一樣 [00:03:59] 今天這個粗體字的 [00:04:01] p粗體跟細體是有差別的 [00:04:05] 粗體字的p代表的是 [00:04:07] 好幾個數字所形成的一個向量 [00:04:11] 所以in this case [00:04:13] 這個p呢代表是一個probability distribution [00:04:16] for the random variable weather [00:04:19] ok [00:04:20] 那這個粗體字的p這個notation呢 [00:04:23] 也可以用在conditional distribution上面 [00:04:26] 比如說像這個p of x given y [00:04:30] 就是給定y這個random variable的狀況 [00:04:34] 那麼我x這個random variable的probability distribution是怎麼樣 [00:04:40] 所以這裡等於是說 [00:04:42] 我y呢大y可以是等於y1y2y3y4 [00:04:48] 那大寫的x呢也可能等於x1x2x3x4 [00:04:52] 就是所有ij的這些配對的所有可能的機率 [00:04:57] 我把它簡寫成一個粗體字的p [00:05:00] 所以這個就形成一個 [00:05:02] 所以其實這個不是一個機率喔 [00:05:04] 這個是好多個機率所形成的一個distribution [00:05:08] 那在continuous case呢 [00:05:12] 事實上我們就不可能寫出整個distribution [00:05:16] 整個向量因為它是continuous [00:05:19] 它的數它的random variable的變動是continuous [00:05:23] 所以無限多種變化 [00:05:25] 我們不可能寫下無限多個值 [00:05:27] 那這個時候呢我們習慣上 [00:05:30] 就會寫成是一個範圍 [00:05:33] 比如說這個的意義就是說 [00:05:35] 正宗5的氣溫等於x的機率 [00:05:40] 那它的分佈呢是一個uniform distribution [00:05:45] 介於18度C到26度C之間 [00:05:49] 所以它代表的是distributed uniformly [00:05:52] between 18 and 26 degrees celsius [00:05:57] 那我們稱呼這種continuous的variable [00:06:00] 這個continuous的機率呢 [00:06:02] 是probability density function [00:06:06] 所以之前大家就學過這個什麼pdf [00:06:10] 這個也是probability distribution [00:06:13] 跟probability density function [00:06:16] 那它簡稱pdf [00:06:19] 那probability density function呢 [00:06:22] differ in meaning from discrete distribution [00:06:25] 這是連續的 [00:06:27] 那跟離散的不一樣喔 [00:06:30] 主要的差別在於說 [00:06:31] probability density is uniform [00:06:33] from 18度C到26度C [00:06:35] 那代表的是說呢 [00:06:37] 在這個範圍 [00:06:38] 我正宗5的溫度 [00:06:40] 是在這個範圍之內的機率是100% [00:06:45] 那這整個是一個8度C的範圍 [00:06:48] 那我如果說呢 [00:06:51] 今天我正宗5的溫度是落在 [00:06:54] 剛剛是18到26度嘛 [00:06:56] 你的溫度是落在18度到22度 [00:06:59] 這中間的範圍的機率呢 [00:07:02] 就會是剩下50% [00:07:04] 剩下50% [00:07:06] 那之所以要這樣子來描述 [00:07:08] 其實大家以前應該也學過 [00:07:11] 機率的時候應該也學過這個 [00:07:13] 那微積分的時候也學過 [00:07:15] 就是說 [00:07:17] 在一個continuous random variable X [00:07:20] 我們說它的 [00:07:23] 這個random variable X的數值 [00:07:25] 等於小X的機率 [00:07:27] 會是多少呢? [00:07:28] 其實是沒辦法算的 [00:07:32] 應該說它等於0 [00:07:34] 你在這個continuous的空間當中 [00:07:37] 它剛好等於某一個 [00:07:39] exactly [00:07:40] 剛好等於某一個數值的機率 [00:07:43] 幾乎等於0 [00:07:46] 幾乎就等於0 [00:07:48] 所以其實啊 [00:07:49] 當我們在看一個continuous function的時候 [00:07:51] 它在某一個點的機率 [00:07:53] 其實是這個意義 [00:07:54] 就是limit X [00:07:56] 在X到X加上 [00:07:58] delta X之間 [00:08:00] 這個很小的範圍之內 [00:08:02] 而這個delta X呢 [00:08:03] 趨近於0 [00:08:04] 大家這個回顧一下 [00:08:06] 這個就是極限 [00:08:08] 極限的定義 [00:08:09] 所以說在continuous function裡面 [00:08:12] probability X等於小X的機率 [00:08:15] 其實是我們去算 [00:08:17] 這個大X這個random variable [00:08:20] 這一個很接近X的一個區域範圍內 [00:08:25] 的這個所佔的這個機率 [00:08:28] 這個機率是多少 [00:08:30] 在數學上的定義是如此 [00:08:32] 那所以說呢 [00:08:35] 當你的這個X呢 [00:08:37] 是在18度C到26度C之間呢 [00:08:39] 你這個機率等於是 [00:08:41] 8度C分之1 [00:08:42] 就是八分之一 [00:08:44] 你這個範圍內 [00:08:46] 你這個範圍內的話 [00:08:48] 那就看說你是要 [00:08:50] 在哪裡 [00:08:52] 比如說 [00:08:54] 20.18 [00:08:58] 20.18度C [00:09:01] 的機率等於8C分之一 [00:09:03] 8C分之一 [00:09:04] 它不是一個機率 [00:09:06] 它是一個probability density [00:09:09] 所以說呢 [00:09:10] 正中午的機率 [00:09:11] 剛好等於20.18度C的機率 [00:09:14] 事實上是等於0 [00:09:16] 因為你如果是剛好在這個點上 [00:09:18] 它對應的這個區域的寬度是等於0 [00:09:23] 那所以大家切記 [00:09:25] 就是說雖然我們 [00:09:27] 習慣上是講 [00:09:29] 是寫成這樣 [00:09:30] 但它的意義其實是 [00:09:31] 一個很小很小的區間之內 [00:09:33] 它佔整體的比例是多少 [00:09:36] 好 [00:09:38] 那以上呢 [00:09:40] 這是針對單一的一個variable來看 [00:09:43] 那其實我們也可以同時 [00:09:45] 同時考慮多個variable啊 [00:09:47] 比如說天氣的變化 [00:09:50] 跟有沒有蛀牙 [00:09:52] 這兩個join probability [00:09:55] the probability distribution [00:09:57] OK [00:09:58] 那比如說天氣如果有四種變化 [00:10:00] 那蛀牙有兩種變化 [00:10:02] 就是蛀牙跟非蛀牙 [00:10:04] 所以其實呢 [00:10:05] 我們如果列出所有的排列組合 [00:10:07] 其實總共有八種可能性 [00:10:10] 就是晴天有蛀牙 [00:10:13] 陰天有蛀牙 [00:10:15] 下雨有蛀牙 [00:10:16] 下雪有蛀牙 [00:10:18] 晴天沒蛀牙 [00:10:20] 陰天沒蛀牙 [00:10:21] 下雨沒蛀牙 [00:10:22] 跟下雪有蛀牙 [00:10:23] 總共八種狀況 [00:10:25] 那它整體而言呢 [00:10:26] 寫成這個樣子 [00:10:28] 它就是一個join的 [00:10:29] probability distribution [00:10:31] 好 [00:10:32] OK [00:10:33] 那在表達上呢 [00:10:35] 我們也可以把 [00:10:36] 比如說某一個variable [00:10:38] 它實際的只代入進來 [00:10:40] 比如說寫成這樣 [00:10:41] probability sunny [00:10:43] 痘點cavity [00:10:45] 那這個其實代表的是幾個機率 [00:10:48] 它代表的是兩個機率喔 [00:10:50] 就是晴天有蛀牙 [00:10:52] 跟晴天沒蛀牙 [00:10:54] 所以大家 [00:10:56] 要注意一下大小寫 [00:10:58] 粗體字有差喔 [00:11:00] 這裡寫sunny都寫小寫 [00:11:02] 這代表的是 [00:11:03] whether這個random variable [00:11:05] 它的一個instance [00:11:08] 它的一個狀況這樣子 [00:11:10] 好 [00:11:12] 好 [00:11:13] 那你也可以寫下之後 [00:11:15] 你也可以做某種運算 [00:11:17] 比如說whether跟cavity的join probability [00:11:21] distribution [00:11:23] 可以寫成是 [00:11:24] cavity出現的機率 [00:11:26] 在乘上給定cavity [00:11:28] weather的機率 [00:11:30] 總共八種變化 [00:11:32] 好 [00:11:33] 那所以說底下這個就是把 [00:11:35] 這八個情況都把它寫下來嘛 [00:11:38] 就是說呢 [00:11:39] 這個有蛀牙又晴天 [00:11:42] 那就等於是蛀牙出現的機率 [00:11:44] 在乘上給定蛀牙的機率 [00:11:46] 出現晴天的機率 [00:11:48] 依此類推 [00:11:49] 總共八種狀況 [00:11:52] 好 [00:11:53] 那你也可以說 [00:11:55] 你也可以寫成這樣啊 [00:11:57] 就是說 [00:11:58] 晴天的機率跟有蛀牙的 [00:12:01] 你看這裡的c現在是小寫 [00:12:03] 就是有蛀牙的機率跟晴天的join probability [00:12:08] 好 [00:12:09] 那其實如果是寫成這樣子的話 [00:12:11] 其實這是幾個機率 [00:12:14] 這是一個機率喔 [00:12:16] 就是說晴天這件事情 [00:12:18] 跟有蛀牙這個共同發生的機率 [00:12:21] 所以其實寫成這個呢 [00:12:23] 它其實可以reduce成這樣 [00:12:26] 你可以寫成細體字的p斜體 [00:12:29] 這個代表的是一個機率 [00:12:31] 或者是說sunny and cavity [00:12:35] 這是一個機率 [00:12:36] 好所以大家 [00:12:37] 我們打這個投影片來打蠻辛苦的 [00:12:41] 這個粗體字細體字 [00:12:43] 這個都有講究的 [00:12:44] 大小寫這個都有講究的 [00:12:46] 好 [00:12:48] 那我們可以再讓這個整個描述變得更為複雜 [00:12:58] a possible world is defined to be an assignment of values [00:13:03] to all the random variables under consideration [00:13:06] 你如果考慮更多的random variables [00:13:08] 比如說cavity [00:13:09] tootsack [00:13:10] 跟weather [00:13:11] 好 [00:13:12] 那有蛀牙沒蛀牙兩種狀況 [00:13:14] 有牙痛沒牙痛兩種狀況 [00:13:16] 四種天氣變化 [00:13:17] 那總共就會有16種這個組合 [00:13:20] 好 [00:13:21] 那當然我們也可以寫下它的probability density function [00:13:25] 是長這樣 [00:13:26] 它這個時候呢 [00:13:27] 這樣的一個描述就包含了16個 [00:13:32] 包含了16個機率 [00:13:34] 好 [00:13:37] 那以上呢 [00:13:38] 是一些表達的形式 [00:13:41] 那再來呢 [00:13:42] 是一些基本的定理 [00:13:45] the basic action [00:13:46] Asian of probability [00:13:49] 那首先一個就是說 [00:13:51] probability not a [00:13:53] 其實就等於1減掉probability a [00:13:56] 這個其實我們 [00:13:57] 之前就知道了 [00:13:59] 那這裡只是在推演一下 [00:14:00] 就是說probability not a [00:14:02] 就是把我所有的sample [00:14:04] 屬於not a的 [00:14:05] 機率全部都加起來 [00:14:07] 好 [00:14:08] 那這裡呢可以故意的 [00:14:10] 加上 [00:14:11] 屬於a的 [00:14:13] 再減掉屬於a的 [00:14:15] 然後把前面這兩個加起來 [00:14:17] 那它機率就等於1嘛 [00:14:18] 1減掉probability a [00:14:20] 所以說這裡只是在講說我們 [00:14:22] 有了之前的equation [00:14:25] 13.1跟13.2 [00:14:27] 我們其實可以推出 [00:14:29] 所有其他的這個機率的定理 [00:14:33] 13.1 13.2是什麼 [00:14:35] 就是所有mutually exclusive的 [00:14:39] 這一些set [00:14:42] 它的機率加起來要等於1嘛 [00:14:45] 好 [00:14:46] 然後再來就是說 [00:14:47] 他們每一個人的數值 [00:14:48] 都在0到1之間嘛 [00:14:50] 就是那個 [00:14:51] 利用那個呢 [00:14:52] 我們可以推出很多其他的這個定理 [00:14:56] 好 [00:14:57] 那另外一個 [00:14:59] 叫做inclusion exclusion principle [00:15:03] 好 [00:15:05] probability [00:15:06] 我們剛剛曾經看過probability a and b [00:15:09] 那我們也可以來看 [00:15:11] probability a or b [00:15:13] 就等於誰呢 [00:15:15] probability a加上probability b [00:15:17] 減掉probability a and b嘛 [00:15:19] OK [00:15:20] 這個你可以畫一個Venn diagram [00:15:22] 有沒有 [00:15:23] 左邊這個圓圈圈代表是a出現的 [00:15:26] 範圍 [00:15:27] 右邊這個圓圈圈 [00:15:28] 出現的是b這個範圍 [00:15:29] 那中間交集的部分就是a and b嘛 [00:15:32] 那你要求的是probability a or b [00:15:35] 就是這兩個圓圈圈的 [00:15:37] 連集的範圍 [00:15:38] 我想這個大家應該都知道了 [00:15:42] 好 [00:15:45] 那 [00:15:48] OK所以以上所講的這些呢 [00:15:50] 真的就都是 [00:15:52] 機率的複習而已 [00:15:54] 那慢慢的 [00:15:55] 從這一頁開始我們要進入到 [00:15:57] 那有了這些機率的基本條件之後 [00:16:00] 我們要來進行推算了 [00:16:03] 所以開始真的比較跟AI有關係的 [00:16:09] 跟AI有關係 [00:16:11] 那首先我們先從一個simple method開始 [00:16:14] 我們來做probability inference [00:16:17] That is the computation of posterior probability for query proposition [00:16:23] given observed evidence [00:16:26] 就是我給定我已經觀察到的一些資訊 [00:16:30] 那我想要去問某一個資訊出現的機率 [00:16:35] 這個機率叫做posterior probability [00:16:38] 事後機率啊 [00:16:39] 也就是說我根據一些現有觀察到的事實去推論 [00:16:45] 某一件事情會出現的機率 [00:16:47] We use the full joint distribution as the knowledge base [00:16:52] from which answers to all questions may be derived ## 8. 寫作規則 (這是 `_筆記SOP.md` 第 3.1、4、5、6 節的濃縮版。兩者衝突時以 SOP 為準。) 讀者:碩士生,兩門課期末是英文考試。要只看筆記就能學會,講得比老師好懂。畫面要簡潔。 **概念優先(2026-09-26 主理人)**:主理人只想懂概念,不想補數學、不想看程式碼和座標圖。兩門課的考試也都是問答題、不考算式(AI W1 1:16:52;NLP W3 1:47:41、2:48:36)。所以: - 每段預設看得到的只有:白話摘要(2–4 句)+**一句生活比喻**(例:模擬退火像投資理財,年輕時敢冒險、越老越保守)+「考試可能怎麼問」一句。 - 數學推導、公式、手算、程式碼、座標圖,全部收進標題寫「(進階,可跳過)」的摺疊,例如「它到底怎麼運作?(進階,可跳過)」。每段最多一個進階摺疊,不要寫長篇計算。 - 演算法要能「用文字說出步驟」(考試可能要你描述),這一點放在預設看得到的地方,不用數字。 - **重心比例**:白話理論與概念模式(它在解決什麼問題、核心想法、跟別的方法差在哪、優缺點、生活比喻)占主要篇幅;數學與程式細節只用一兩句帶過,細節收進進階摺疊。 **圖文並茂(2026-09-26 主理人:不要只有文字)**: - 每章至少 2–3 個圖,放在**預設看得到**的地方,每個圖前後各用一兩句白話說明「這張圖在看什麼」。 - 流程、步驟、因果、比較 → 用 mermaid 流程圖(```mermaid,flowchart LR 或 TD;節點文字用中文、加雙引號;一張圖不超過 10 個節點)。 - 投影片上的示意圖、架構圖 → 用 [[IMG: …]] 放投影片圖。 - 仍守「每個 ## 段落最多一種視覺元素」。 ### 輸出兩個檔 1. `chNN.md`(Notion 寫法,不含頁面標題),結構固定: - 第一行:章節包第 1 節那行,原樣照抄。 - 第二行起(有數學段才寫):**跳過提示**,每段一行,讓主理人看影片時知道從哪跳到哪。用章節包第 3b 節的候選當提示,對照第 7 節逐字稿確認(只標老師連續講公式、推導、矩陣、微積分、機率計算、程式細節超過約 1 分鐘的段落;概念講解和比喻不算): `跳過提示:(1:31:02–1:35:40) 老師在推導梯度公式,聽不懂可以直接跳到 [1:35:40](YouTube 連結),接著講「步長 α 怎麼選」。` - `## 重點`:三點中文,每點一到兩句。 - `## Exam-ready`:3–10 行英文,**從章節包的投影片文字逐字抄**,每行 `- **Term**: "原句"(Ch3 p.14)`。老師有明確證據才在行尾加 `【老師強調】(h:mm:ss)`。 **每一行下面一定要有一行縮排的中文解釋**(主理人英文不好,看不懂的英文等於沒用): ``` - **Hill climbing**: "It keeps track of one current state and on each iteration moves to the neighboring state with highest value."(Ch4 p.5) - 中文:爬山法只記住「現在這一個狀態」,每一輪都移到分數最高的鄰居。白話:一直往比較高的地方走一步。 ``` 中文要先把句子意思講清楚,再補一句白話;最後用「英文(中文)」列出這句裡 1–3 個難字,例:sparse(稀疏)、distinct terms(不重複的字)。 **一行只放一句投影片原句**。同一頁有多句要考就拆成多行,每行各接一行中文;不要用分號串三句以上,不要把計算量 O(...) 塞進去。 - 章節包第 2 節的每一段:`## [h:mm:ss](連結) 標題`(照抄),下面 2–4 句白話摘要,其餘全部收進摺疊: ```
問句(例:用生活例子講,BFS 在做什麼?) 內容
``` 摺疊種類(需要才放):用生活例子講?/它到底怎麼運作?/要先懂什麼?(老師假設你會的數學或概念,短版教學)/老師原話是什麼?(「原話」(h:mm:ss),只放重要的,最多 5 句)。 - 「它到底怎麼運作?」要用一組小數字把這段的演算法**真的跑 1–3 步**(例:算出梯度、更新一次、比較兩個 α),不是只示範定義的加減乘除。全章盡量沿用同一組數字,讓前一段的答案能在下一段被驗證。 - 每段正文要回答讀者最可能卡住的一個「為什麼」。投影片公式方向跟題目相反、或投影片說「解不出來」時,用一兩句講出原因,自己補的標(我補充)。 - 投影片句子停在公式前(公式在圖裡)時:Exam-ready 在粗體詞條上補公式、引號內保持原句;正文寫出同一條式子。公式圖看章節包第 6 節列出的 PNG。 - `## Self-check`:2–4 題英文考題,答案收摺疊。**至少一題考老師強調的內容**;只出 explain/why/compare 這類問答題,**不出要代數字計算的題目**(考試不考算式);不出「老師和投影片哪裡不同」這類不會考的題目。每題格式: ```
Q1. English question?(中文:中文題目) **Answer**: English answer. 中文:把答案完整講一遍(不是只翻一句),讓看不懂英文的人也知道要怎麼答。
``` - **最後一行**:章節包第 1b 節那行(下一章連結),原樣照抄。讓讀完的人直接點下一章。 - 不要把章節包或這份規則裡的指示句寫進筆記(例如「寫筆記時照投影片寫」「已改正 ASR 錯字」)。 - 長度:全文不超過 16,000 字元(跟 check_note.py 同一個數字)。**不要為了壓字數反覆刪改**(實測一章最多花 12 輪在刪字);超過時只刪進階摺疊裡的第二組算例,比喻、比較表、圖說、「老師說不用背」的提醒都不刪。 - 預設看得到的正文不放計算量 O(...)、代號對照(例如 SMART 字母)、課本出處考據,一律移進進階摺疊。 2. `chNN.concepts.json`:JSON 陣列,4–12 個考試可能問的術語,每個物件: `name`(英文)、`zh`、`type`(概念/演算法/公式/人物事件/前置知識/行政)、`signal`("老師說會考"/"老師強調"/"核心(我判斷)"/"")、`evidence`(有 signal 前兩種時必填:原句+時間)、`definition_en`(投影片原句;沒有就註明 (textbook)/(lecture)/(my wording))、`plain`(一句中文)、`a4`(≤150 字元英文,可夾極短中文;期末拼貼用的小方塊)、`time`、`slides`、`prereq`(英文名陣列)。 ### 風格鐵律 - 不用 emoji 或裝飾符號(✓✗★⚠ 都不要;→ 可以)。不用 callout。不用 `$`。時間不要用 code 樣式。 - 每個 `##` 段落最多一種視覺元素:一張圖、或一個表格、或一個 mermaid。 - 摺疊標題是問句,前面不加符號。 - 圖片最多 3 張,只放文字取代不了的圖。放法:單獨一行 `[[IMG: | 中文圖說]]`,PNG 用 `slides_to_png.py <圖片資料夾> <頁> --dpi=110` 產生。 - 考試訊號只在老師明確說時標。老師只說「不用背」「不講」就寫「注意:……」。 - 老師口誤或跟投影片不同:照投影片寫,加「注意:老師口頭說的是……」。 - 引用老師的話時,ASR 錯字改成正確的字。 ### 沒有投影片時 不要憑記憶逐字重現課本段落或數值表。英文定義用自己的話寫、句尾標 (my wording);Exam-ready 每行標「(自擬,投影片待補)」。例子只用老師講的。 ### 寫完之後(只做一次) 跑檢查: `C:\Users\user\.cache\meeting-record\venv\Scripts\python.exe C:\Users\user\.claude\scripts\check_note.py --transcript <逐字稿> --slides <投影片 txt …> --start <起> --end <訖> --vid <影片 ID>` - STYLE/VISUAL/TIME/FORMAT:全部改掉。 - QUOTE:確認是不是你改正了 ASR 錯字(是就保留),不是就改成原文或拿掉引號。 - ENGLISH:確認是不是投影片斷行造成的(是就保留),不是就改成投影片原句。 **省額度守則**:章節包裡已經有你需要的全部資料。不要再去讀整份逐字稿、整份投影片、segments.json 或手冊。一次寫好整個檔(Write 一次),檢查後集中修改。