# 章節包:人工智慧導論(AI)W4(10/1)第 07 章「網路的精簡性與節點順序」
Ch13 Part 1(2021 錄影)影片 0:33:53–0:48:19,YouTube ID MxNi_mjW4qs,逐字稿 C:\D槽\TAICA課程\人工智慧導論\第四周1151001\W4_人工智慧導論_Ch13_Part1.逐字稿.txt。Notion 章節頁 https://app.notion.com/p/3ecfc631b03081a4b341d85d2cb7f773(頁 ID 3ecfc631b03081a4b341d85d2cb7f773),頁面標題「07 網路的精簡性與節點順序(0:33–0:48)」。
## 1. 第一行(直接照抄,不要改)
[人工智慧導論](https://app.notion.com/p/3e6fc631b0308131b213f0a3d93fe91d) › [W4(10/1)](https://app.notion.com/p/3ecfc631b03081e895d2c5f3aec0353e) › 07|Ch13 Part 1(2021 錄影)影片 [0:33:53–0:48:19](https://www.youtube.com/watch?v=MxNi_mjW4qs&t=2033s)|投影片 Ch13 p.11–17|上一章 [06 語意與建構網路的步驟(0:19–0:33)](https://app.notion.com/p/3ecfc631b03081f19fe0d87a2b1bbab2)|下一章 無
## 1b. 最後一行(直接照抄,放在 Self-check 後面,當全頁最後一行)
這週讀完了。回到週頁:[W4(10/1)](https://app.notion.com/p/3ecfc631b03081e895d2c5f3aec0353e)
## 2. 各段標題(照順序;每段一個 ## 標題,直接照抄連結)
- `## [0:33:55](https://www.youtube.com/watch?v=MxNi_mjW4qs&t=2035s) 精簡來自局部結構` 老師講什麼:貝氏網路通常比完整聯合分布精簡得多,因為現實問題多半是局部結構(locally structured):每個變數只跟少數幾個變數有關,例如今天天氣只跟前一兩天有關、台南氣溫只跟嘉義高雄有關。
- `## [0:36:36](https://www.youtube.com/watch?v=MxNi_mjW4qs&t=2196s) 全連接網路與名詞提醒` 老師講什麼:如果每個變數都跟其他所有變數有關,就是全連接網路,機率表會非常大;老師順帶提醒這裡的 network 跟深度學習的類神經網路、電腦通訊網路都無關。
- `## [0:37:36](https://www.youtube.com/watch?v=MxNi_mjW4qs&t=2256s) 微弱關聯可以忽略` 老師講什麼:像蝴蝶效應那種極小的影響,實務上直接假設沒有關係;要不要多拉一條地震到鄰居的箭頭沒有標準答案,多一個 parent 就要多估一張 CPT,看你對問題和計算量的取捨。
- `## [0:39:44](https://www.youtube.com/watch?v=MxNi_mjW4qs&t=2384s) 順序選得好才精簡` 老師講什麼:就算領域是局部結構,也只有節點順序選得好才會得到精簡網路;老師舉反例順序 MaryCalls、JohnCalls、Alarm、Burglary、Earthquake,說明 JohnCalls 為什麼被迫要有 MaryCalls 當 parent。
- `## [0:44:12](https://www.youtube.com/watch?v=MxNi_mjW4qs&t=2652s) 多出的連線與難估的機率` 老師講什麼:反例網路比原本多兩條連線,更糟的是有些機率很難估,例如給定竊賊與警報時地震的機率;網路要連 CPT 都填得出來才算建好。
- `## [0:45:32](https://www.youtube.com/watch?v=MxNi_mjW4qs&t=2732s) 診斷方向與因果方向` 老師講什麼:從症狀往原因建(diagnostic)因果是反的,要另外指定原本獨立的原因之間的依賴;照因果方向建(causal)只需要較少、較好估的機率,所以順序很重要。
- `## [0:46:47](https://www.youtube.com/watch?v=MxNi_mjW4qs&t=2807s) 最爛的順序與同一個分布` 老師講什麼:順序 MaryCalls、JohnCalls、Earthquake、Burglary、Alarm 建出更亂的網路,Alarm 有四個 parent;但三個網路都代表同一個聯合分布,差在後兩個沒有善用條件獨立。
## 3. 老師強調/會考/不考的地方(原句已驗證;寫進筆記時 ASR 錯字要改正)
- (0:46:45) [強調] 「所以這個ordering是很重要的」 → 照因果方向排節點順序,網路才精簡、CPT 才好估
- (0:47:47) [強調] 「他們其實都代表同樣的join distribution」 → 三種順序建出的網路代表同一個聯合分布,只是後兩個沒善用條件獨立(老師前一句說「但不要忘了」)
## 3b. 數學段候選(程式抓的,只是提示;寫「跳過提示」行用)
0:34:30–0:35:30 (60s, score 8) 變數
那為什麼會可以那麼簡約呢因為基本上被子網路有所謂的區域的結構性locally structured或者是所謂的稀疏的特性也就是說即使我整個系統裡面整個問題裡面我有好多個變數比如說10個變數好了10個隨機變數你這10個隨機變數你任何一個隨機變數不會都跟
1 段候選(門檻 3.0 字/30 秒)
## 4. 這章摘要與重要度
(Ch13 Part 1 影片,時間是那支影片的時間)說明貝氏網路為什麼能很精簡(局部結構),以及節點順序選錯會讓網路變複雜、機率變難估,結論是照因果方向建。(核心)
## 5. 整堂課的提醒(ASR 錯字、老師口誤、投影片缺公式等;只用跟這章有關的)
- 這週老師採非同步上課,給三支 2021 年錄的舊影片。各章的影片時間是那一支影片自己的時間,章節第一行寫了是哪一支。
- [Ch12 Part 2] 這支是 2021 年錄的舊影片(10/1 非同步上課三支之一),內容只有上課,沒有提到作業、日期或考試安排。
- [Ch12 Part 2] 影片最後在 0:41:36「講到這邊我們想先」句子講到一半就斷了,接續內容應在 Ch12 Part 3。
- [Ch12 Part 2] 老師引用的是課本舊版編號(equation 13.1、13.2;3rd edition 的機率章是 Ch13),今年課本第 4 版是 Ch12,公式編號可能不同。
- [Ch12 Part 2] Ch12 投影片本機沒有,章節的 Exam-ready 英文要用老師唸出的投影片英文句或自己的話(標 my wording),不要憑記憶背課本原文。
- [Ch12 Part 3] 這是 2021 年的錄影。片尾 0:31:05 老師說「下一次上課」會講 Bayesian network,這是 2021 年的課程安排,不代表今年的進度。今年接下來是 Ch13 Part 1 影片,內容剛好接得上。
- [Ch12 Part 3] Ch12 投影片本機沒有,slides 欄寫「Ch12(投影片待補)」。老師在 0:21:29 說「回去翻一下之前那幾頁」、0:27:48 說「最後兩頁」,都要等拿到投影片才能對頁碼。
- [Ch12 Part 3] 逐字稿 0:01:45–0:02:20 有語音辨識重複句和亂碼(日文、土耳其文碎字),內容只有「推廣到隨機變數、可以加入其他證據」一句,寫的時候不要照抄。
- [Ch12 Part 3] 語音辨識常見錯字:Base rule/Best Rule=Bayes' rule、腦模擬=腦膜炎、cursal=causal、cost=cause、to sac=toothache、探身=探針(probe)、basion network=Bayesian network、頭影片=投影片。
- [Ch12 Part 3] 預期中的 wumpus world 例子這支片沒有講;絕對獨立(天氣)只在 0:24:48 順口帶過一句,可能 Part 2 已經講過。
- [Ch13 Part 1] 這支是 2021 年錄的舊影片(10/1 非同步上課的三支之一)。影片裡沒有提到作業、日期或考試安排,所以沒有需要標成「2021 年說法」的行政資訊。
- [Ch13 Part 1] Ch13 投影片本機沒有,slides 欄一律寫「Ch13(投影片待補)」。老師口頭引用的是課本第 3 版的圖號(Figure 14.3),第 4 版對應的是 Ch13,拿到投影片後要再核頁碼。
- [Ch13 Part 1] 逐字稿把「貝氏網路」辨識成「被視網路/備試網路/被子網路/貝斯網路」,把 Earthquake 辨識成「R-squared/EarthCraft」,把 axioms 辨識成「axing」,把 It contains 辨識成「Lay contains」,寫筆記時要改回正確寫法。
- [Ch13 Part 1] 影片停在「怎麼建構貝氏網路」(0:48:13 老師說「稍微告一個段落」),本章第二大問題「怎麼用貝氏網路做推論」留到之後的影片。
- [Ch12 Part 2] Ch12 投影片本機沒有,無法對照頁碼;老師在 0:31:13 說「回到45頁」,指的是算 P(cavity|toothache)=0.6 那一頁(2021 版投影片 p.45),拿到投影片後可用來對齊頁碼。
- [Ch12 Part 2] 老師引用 equation 13.1、13.2(課本第 3 版編號),今年第 4 版是 Ch12,編號可能是 12.1、12.2,不確定。
- [Ch12 Part 2] 0:03:06 逐字稿寫 Weather 的機率「0.6、0.1、0.29、0.11」,0:03:3x 又說「0.6、0.1、0.29、0.01」;課本例子應是 0.01(加總才等於 1),以 0.01 為準。
- [Ch12 Part 2] 0:29:55 附近逐字稿把 0.008 有時寫成 0.08(例如 0:31:5x「0.12 除上 0.12 加 0.08」);正確是 <0.12, 0.08>,正規化後 0.6/0.4(0.12/0.2=0.6),寫筆記時要統一成 0.08。
- [Ch12 Part 2] ASR 錯字很多:to sec/to snack/tootsack=toothache、注牙=蛀牙、join=joint、the basic action Asian=the basic axioms、正宗5=正中午、random robot=random variable、出題字的e=粗體字的 e。0:02:02–0:02:34 有 Whisper 重複段落與亂碼("propablythe patient...tis act"),內容是 P(cavity|¬toothache, teen)=0.1 的例子。
- [Ch12 Part 2] 影片開頭直接從隨機變數講起,沒有重講 W3 的條件機率與 product rule,只在 0:02:04 用「給定沒牙痛的青少年蛀牙機率 0.1」一句回顧,已併在第 1 章第 1 段。
- [Ch12 Part 2] 第 2 章約 25.7 分鐘,略超過 25 分鐘;獨立性(0:35:50 起約 6 分鐘)太短不足以單獨成章,所以併入第 2 章。
- [Ch12 Part 3] 只切成 2 章:第 1 章約 18.8 分鐘、第 2 章約 12.9 分鐘。第 2 章比 15 分鐘短一點,但它是一個完整主題(多證據、條件獨立、naive Bayes),又是片尾,切不出第 3 章,併進第 1 章會超過 30 分鐘,所以維持 2 章。
- [Ch12 Part 3] 沒有投影片,所以每段對應哪一頁沒辦法確認。老師的數字(0.7、1/50000、0.01、0.108、0.016、0.871/0.129)看起來跟 AIMA 課本一致,但沒有拿投影片核對過。
- [Ch12 Part 3] 老師在 0:20:28 一度把 0.016 唸成「0.01 呃 0.016」,應以 0.016 為準。
- [Ch12 Part 3] 0:13:47 老師說的「五千分之一」是假設中有經驗醫生的診斷數字,跟算出來的 0.0014(約 1/714)不一樣;寫筆記時要說清楚兩者是不同來源,不要混在一起。
- [Ch12 Part 3] 片尾 0:30:54 老師說「今天我們主要講的就是整個機遇的介紹」,聽起來 Part 3 是 2021 年某一堂課的結尾,Part 2 與 Part 3 可能是同一堂課的前後段,主 session 合併時可以留意章節之間是否有重疊。
- [Ch13 Part 1] 沒有投影片可對照,章節只能照逐字稿切,頁碼範圍全部待補。拿到 Ch13 投影片後要補每章的頁碼,並核對 Exam-ready 英文句。
- [Ch13 Part 1] 老師引用「figure 14.3」是課本第 3 版的編號(第 3 版貝氏網路在 Ch14,第 4 版在 Ch13),筆記引用圖號時要註明版本。
- [Ch13 Part 1] 0:23:21 逐字稿說聯合機率算出來是「0.00628」,課本的值是 0.000628(0.90×0.70×0.001×0.999×0.998);同一段 John 打電話的機率被辨識成「0.98」,前面 0:13:31 說的是 0.9。不確定是老師口誤還是辨識錯,寫筆記時照課本數字寫,並加一句「注意」。
- [Ch13 Part 1] 逐字稿有大量貝氏網路的錯字(被視網路、備試網路、被子網路、貝斯網路)和英文辨識錯誤(R-squared=Earthquake、Lay contains=It contains、axing=axioms),寫筆記與 Exam-ready 時要改正。
- [Ch13 Part 1] 全片沒有老師明說「會考/不考」的地方;emphasis 只列了帶強調語氣的句子(特別要注意、這是要注意的、ordering 很重要、不要忘了同一個分布)。
- [投影片 2026-10-01 補到] 這章草稿是在沒有投影片時寫的。審稿時必做:(1) 第一行換成章節包第 1 節那行(投影片頁碼已更新);(2) Exam-ready 每一行標「(自擬,投影片待補)」或 (my wording) 的英文,全部換成章節包第 6 節的投影片原句並標頁碼(例 Ch12 p.31),中文解釋跟著改;投影片有、筆記沒有的重要句子補進去;(3) 正文和概念檔裡的 (my wording) 定義改成投影片原句;(4) 投影片的數字、符號、例子跟草稿不同時,以投影片為準。
## 6. 投影片文字(這章範圍)
**這幾頁的公式或內容只在圖裡(文字檔抓不到),寫 Exam-ready 與公式前先用 Read 看這幾張圖:**
- Ch13 p.11 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch13_p011.png
- Ch13 p.12 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch13_p012.png
- Ch13 p.14 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch13_p014.png
- Ch13 p.15 → C:\D槽\TAICA課程\_work\notes-v2\ai-w4\img\brief_Ch13_p015.png
--- Ch13 p.11 ---
• Compactness and node ordering
• One might object to our burglary network on the grounds that if there is an
earthquake, then John and Mary would not call even if they heard the alarm,
because they assume that the earthquake is the cause.
• Whether to add the link from Earthquake to JohnCalls and MaryCalls (and
thus enlarge the tables) depends on comparing the importance of getting more
accurate probabilities with the cost of specifying the extra information.
Representing the full joint distribution
11
--- Ch13 p.12 ---
• Even in a locally structured domain, we will get a compact
Bayesian network only if we choose the node ordering well.
What happens if we happen to choose the wrong order?
• Suppose we decide to add the nodes in the order MaryCalls,
JohnCalls, Alarm, Burglary, Earthquake. We then get the
somewhat more complicated network shown in Figure 14.3(a).
Representing the full joint distribution
12
--- Ch13 p.13 ---
Representing the full joint distribution
13
--- Ch13 p.14 ---
• The process goes as follows:
Representing the full joint distribution
14
--- Ch13 p.15 ---
• The resulting network has two more links than the original network in Figure
14.2 and requires three more probabilities to be specified. What’s worse, some
of the links represent tenuous (稀薄的) relationships that require difficult and
unnatural probability judgments, such as assessing the probability of
Earthquake, given Burglary and Alarm.
Representing the full joint distribution
15
--- Ch13 p.16 ---
• The topological semantics specifies that each variable is conditionally
independent of its non-descendants, given its parents (Figure 14.4(a)).
• A node is conditionally independent of all other nodes in the network, given its
parents, children, and children’s parents—that is, given its Markov blanket.
Conditional independence relations in
Bayesian networks
16
--- Ch13 p.17 ---
Conditional independence relations in
Bayesian networks
17
## 7. 逐字稿(0:33:53 前後各多 1 分鐘,原始行)
[00:32:53] 所以這是要注意的
[00:32:55] 那另外一個被子網路的
[00:32:57] 重要的特性是說
[00:32:59] Lay contains no redundant
[00:33:01] Probability value
[00:33:03] If there is no redundancy
[00:33:05] and there is no chance for inconsistency
[00:33:07] 也就是說呢
[00:33:09] It's impossible for the knowledge
[00:33:11] in engineering or domain experts
[00:33:13] to create a basic network
[00:33:15] that violates the axing of probability
[00:33:17] 就是說這個被子網路
[00:33:19] 你到時候你去估算出來的
[00:33:21] 這些機率完全都會符合
[00:33:23] 機率的這些基本的定理
[00:33:25] 比如說
[00:33:27] 這個機率都在0到1之間
[00:33:29] 所有的機率加起來要等於1
[00:33:31] 完全都會符合
[00:33:33] 它不會有
[00:33:35] 什麼redundancy
[00:33:37] 比如說你走這個路徑
[00:33:39] 不要講熱路徑
[00:33:41] 你某一個這個
[00:33:43] conditional probability
[00:33:45] 跟另外一個conditional probability
[00:33:47] 整個加起來超過1不會有這種事情
[00:33:53] 好
[00:33:55] 那所以接下來我們就要來看說
[00:33:57] 我們在建這個網路的時候
[00:33:59] 我們Node的順序是怎麼樣
[00:34:01] 好
[00:34:03] 那一個被子網路呢
[00:34:05] Can often be far more compact
[00:34:07] in distribution
[00:34:09] 你如果妥善的利用它的因果關係
[00:34:11] 跟conditional independent的話
[00:34:13] 它畫出來的結果
[00:34:15] 這個網路可以非常的
[00:34:17] 簡約
[00:34:19] 比起我們的機率
[00:34:21] 寫成這樣子簡約很多
[00:34:23] 好
[00:34:25] OK
[00:34:27] 那好
[00:34:31] 那為什麼會可以
[00:34:35] 那麼簡約呢
[00:34:37] 因為基本上被子網路有所謂的
[00:34:39] 區域的結構性
[00:34:41] locally structured
[00:34:43] 或者是所謂的
[00:34:45] 稀疏的特性
[00:34:47] 也就是說
[00:34:49] 即使我整個系統裡面
[00:34:51] 整個問題裡面我有好多個變數
[00:34:53] 比如說10個變數好了
[00:34:55] 10個隨機變數
[00:34:57] 你這10個隨機變數
[00:34:59] 你任何一個隨機變數不會都跟
[00:35:01] 其他的9個變數會有關係
[00:35:03] 這是現實世界當中
[00:35:05] 常常
[00:35:07] 常常有這種現象
[00:35:09] 常常可以合理的假設
[00:35:11] 是這個樣子
[00:35:13] 我們可以假設說
[00:35:15] 我這個隨機變數大概只跟兩三個
[00:35:17] 另外的隨機變數有關
[00:35:19] 這有點類似說
[00:35:21] 你今天
[00:35:23] 今天天氣怎麼樣
[00:35:25] 今天天氣怎麼樣
[00:35:27] 可能跟昨天的天氣會有一點關係
[00:35:29] 跟前天的勉強
[00:35:31] 可能也有點關係
[00:35:33] 但是你說跟10天以前的
[00:35:35] 很有關係
[00:35:37] 那我覺得就扯遠了
[00:35:39] 對不對
[00:35:41] 或者說臺南
[00:35:43] 臺南現在的溫度的狀況怎麼樣
[00:35:45] 可能跟
[00:35:47] 往北一點是嘉義
[00:35:49] 往南一點是高雄
[00:35:51] 可能跟隔壁的都市
[00:35:53] 有一點關係
[00:35:55] 可是呢跟基隆的關係就不大了
[00:35:57] 所以很多
[00:35:59] 實際的問題都有這所謂的
[00:36:01] 區域的結構性
[00:36:03] 區域的關聯性
[00:36:05] 那也就是
[00:36:07] 因為這樣子
[00:36:09] 我們可以
[00:36:11] 所以他這裡就講嘛
[00:36:13] Each sub-component interacts directly
[00:36:15] with only a bounded number of other components
[00:36:17] 它只會
[00:36:19] 跟一部分有關係
[00:36:21] 所以我們就可以大幅的去簡化
[00:36:23] 這個網路
[00:36:26] 那當然也是有一些
[00:36:28] 複雜的問題
[00:36:30] 牽一髮動全身的每一個
[00:36:32] 變數都跟所有其他變數有關
[00:36:34] 那這樣子的
[00:36:36] Network就是
[00:36:38] Fully Connected Network
[00:36:40] 我附帶一提
[00:36:42] 大家現在不要看到Network
[00:36:44] 就興奮起來好像都跟這個
[00:36:46] 什麼深度學習的那個Network有關
[00:36:48] 沒有
[00:36:50] 跟深度學習那個類先進網路無關
[00:36:52] 然後呢
[00:36:54] 也跟
[00:36:56] 我們的通訊網路無關
[00:36:58] 所以
[00:37:00] 可能有些人是學網路的
[00:37:02] 電腦網路
[00:37:04] 跟那個也無關
[00:37:06] 但是我們只是都用同樣
[00:37:08] Network這個字而已
[00:37:10] 就是Fuse的
[00:37:12] 那
[00:37:14] 如果你這個Base網路是Fully Connected
[00:37:16] 哇那不得了啦
[00:37:18] 你要Specify的這個Join Distribution
[00:37:20] 你這個Probability Table
[00:37:22] 就很大很大
[00:37:24] 但其實大部分的
[00:37:26] 領域裡面
[00:37:28] 大部分的問題裡面呢
[00:37:30] 其實
[00:37:32] 每一個Random Variable
[00:37:34] 只跟少部分的有關係
[00:37:36] 那即使
[00:37:38] 你這個Random Variable
[00:37:40] 我跟比較遠的
[00:37:42] 比如說臺南的目前的氣溫
[00:37:44] 你也許你可以說
[00:37:46] 勉強我跟宜蘭的氣溫
[00:37:48] 也有一點點關係嘛
[00:37:50] 你說蝴蝶效應對不對
[00:37:52] 什麼宜蘭的一隻蝴蝶在那邊拍翅膀
[00:37:54] 後來導致臺南這邊
[00:37:56] 什麼有颱風來
[00:37:58] 有沒有可能說不定有可能吧
[00:38:00] 但是這個關係
[00:38:02] 實在是太小了
[00:38:04] 所以我們在處理實際的
[00:38:06] 問題上的時候
[00:38:08] 我們其實
[00:38:10] 可以假設他們之間沒關係
[00:38:12] 因為這個影響微乎其微
[00:38:14] OK
[00:38:16] 好
[00:38:18] 那所以說呢
[00:38:20] 這裡可能就講到說
[00:38:34] 就是說你可以提出
[00:38:36] 我們剛剛那個
[00:38:38] Burglary那個Network其實是
[00:38:40] 相當簡易的
[00:38:42] 那你也許你可以提出一些不同的
[00:38:44] 意見
[00:38:46] 你說你怎麼沒有把什麼地震的考慮進來啊
[00:38:48] 因為說不定John跟Mary
[00:38:50] 他會感覺到地震
[00:38:52] 他就知道說啊
[00:38:54] 你現在這個氣靈在想是因為地震的關係
[00:38:56] 那你到底要不要
[00:38:58] 你要不要弄到那麼細吧
[00:39:00] 你如果要弄那麼細
[00:39:02] 那你要把地震這個Random Variable
[00:39:04] 你拉一條線
[00:39:06] 拉一條這個箭頭
[00:39:08] 到John Coates跟Mary Coates
[00:39:10] 這樣做的話
[00:39:12] 那
[00:39:14] 但是有地震沒地震
[00:39:16] 如何去影響
[00:39:18] John跟Mary要不要打電話
[00:39:20] 這個機率你就要去預估出來
[00:39:22] 對不對
[00:39:24] 因為你拉多拉一個Parent
[00:39:26] 那你就要想辦法去把那個CPT
[00:39:28] 去估計出來
[00:39:30] 那你說這個有標準答案一定要這樣做
[00:39:32] 一定不能這樣做嗎
[00:39:34] 也沒有標準答案
[00:39:36] 那就看說你對於這個
[00:39:38] 整個問題的掌握
[00:39:40] 這個整個計算的複雜度是怎麼樣
[00:39:42] 好啦
[00:39:44] 那即使是Locally Structured Domain
[00:39:48] We will
[00:39:50] We will get a compact baseline
[00:39:52] Only if we choose the
[00:39:54] No ordering well
[00:39:56] 那你說好啦我們去除掉這些
[00:39:58] 這些比較鑽牛角尖的
[00:40:00] 我們都假設他沒有關係
[00:40:02] 那
[00:40:04] 我們這樣下去建出來的
[00:40:06] 貝斯網路就一定很簡潔嗎
[00:40:08] 那根據你的這個
[00:40:10] Node的Odering而定
[00:40:12] 你的這個順序你建的順序怎麼樣
[00:40:14] 那現在假設
[00:40:16] 我們舉一個反例
[00:40:18] 如果我們今天建這個Node的順序是
[00:40:20] Mary Cole
[00:40:22] John Cole
[00:40:24] Alam
[00:40:26] Burglary跟EarthCraft
[00:40:28] 如果你的順序是這樣
[00:40:30] 你不是先從Burglary EarthCraft去建
[00:40:32] 你是反過來這樣建
[00:40:34] 那會發生什麼事呢
[00:40:36] We may
[00:40:38] We may get somewhat more complicated network
[00:40:40] Shown in figure 14.3
[00:40:42] 那你建出來
[00:40:44] 可能就會長這樣
[00:40:46] 根據你對於這個世界的整個
[00:40:48] 定義而定
[00:40:50] 比如說
[00:40:52] 你Mary有沒有打電話
[00:40:54] 影響到John有沒有打電話
[00:40:56] 影響到John有沒有打電話
[00:40:58] 或者是說這個Alarm的關係
[00:41:00] 或者是說這個Alarm的關係
[00:41:02] 那有沒有Alarm
[00:41:04] 又跟John跟Mary有沒有打電話有關係
[00:41:06] 有沒有Alarm又跟這個Burglary
[00:41:08] 跟EarthCraft有關係
[00:41:10] 當然這整個這樣子建起來
[00:41:12] 感覺邏輯很怪
[00:41:14] 有沒有
[00:41:16] 這個整個邏輯很怪
[00:41:22] 好
[00:41:29] 所以說這整個
[00:41:31] 怎麼個建法呢
[00:41:33] 第一個Random Variable是Mary Cole
[00:41:35] 第二個John Cole
[00:41:37] 我們怎麼會加進來呢
[00:41:39] 如果Mary打電話的話
[00:41:41] 那代表說
[00:41:43] 可能這個警報器響了
[00:41:45] 那如果Mary打電話
[00:41:47] 可能代表警報器響
[00:41:49] 那也許Mary打電話這件事情
[00:41:51] 那也許Mary打電話這件事情
[00:41:53] 已經隱含了一個意義就是說
[00:41:55] 她可能也會有比較高的機率
[00:41:57] John也會打電話
[00:41:59] 因此John呢
[00:42:01] John Cole這個Random Variable
[00:42:03] 就需要Mary打電話這個來當她的Parent
[00:42:05] 就需要Mary打電話這個來當她的Parent
[00:42:09] 因為如果你今天要求說
[00:42:11] 因為如果你今天要求說
[00:42:13] 我加到這個貝斯網路的
[00:42:15] 這個Random Variable的
[00:42:17] 這個順序一定要Mary Cole
[00:42:19] 接下來John Cole
[00:42:21] 如果你要求這個順序
[00:42:23] 一定是要這樣子的話
[00:42:25] 那麼我真的只好把Mary Cole
[00:42:27] 拉一條箭頭到John Cole
[00:42:29] 拉一條箭頭到John Cole
[00:42:31] 而為什麼Mary Cole
[00:42:33] 會影響到John Cole呢
[00:42:35] 事實上是因為一些
[00:42:37] 比較間接的原因
[00:42:39] 是因為Mary如果打電話
[00:42:41] 是因為Mary如果打電話
[00:42:43] 隱含的意義是
[00:42:45] 有比較高的機率
[00:42:47] 警報器是響的
[00:42:49] 而警報器
[00:42:51] 有比較高的機率警報器響
[00:42:53] 那麼John會打電話的機率會比較高
[00:42:55] 所以這中間的所謂的
[00:42:57] 這個箭頭代表的
[00:42:59] 其實隱含的就是
[00:43:01] 這個意義
[00:43:03] 好要依此類推啦
[00:43:05] 你要把Jing Lin的這個
[00:43:07] 加進來
[00:43:09] 如果說John跟Mary都打電話
[00:43:11] 如果說John跟Mary都打電話
[00:43:13] 那有比較高的機率
[00:43:15] 代表Jing Lin是響的
[00:43:17] 所以說呢Mary Cole跟John Cole
[00:43:19] 都要當成是他的Parent
[00:43:21] 那接下來
[00:43:23] 切到
[00:43:25] 如果我們知道
[00:43:27] 這個警報器的狀況
[00:43:29] 然後
[00:43:31] 然後呢John跟Mary
[00:43:34] 都有打電話
[00:43:36] 那他可能都會影響到
[00:43:38] 我的這個
[00:43:40] 這個切到的這個機率
[00:43:42] 但其實
[00:43:44] 打電話Mary打電話跟Alarm呢
[00:43:46] 基本上
[00:43:48] 直接影響到這個切到的
[00:43:50] 可能只有Alarm
[00:43:52] 所以只有Alarm是他的Parent
[00:43:54] 好那依此類推Earthquake
[00:43:56] 也是
[00:43:58] Earthquake的狀況也是
[00:44:00] 那你最後建出來的網路
[00:44:02] 可能就會長這個樣子
[00:44:04] 好
[00:44:06] 那相對應於我們剛剛前面
[00:44:08] 建出來這個比較簡潔的網路
[00:44:10] 比起來的話呢
[00:44:12] 這個Figure 14.3 AR
[00:44:14] 他就硬是多了
[00:44:16] 兩個link
[00:44:18] 硬是多了兩個link
[00:44:20] 所以也就代表說呢你有更多的機率
[00:44:22] 要去specify
[00:44:24] 那更糟的事情是
[00:44:26] 為什麼他會亂跳
[00:44:28] 更糟的事情是說呢
[00:44:30] Some of the links represent
[00:44:32] tenuous relation that require
[00:44:34] difficult and unnatural probability
[00:44:36] judgment such as
[00:44:38] accessing the probability of Earthquake
[00:44:40] given burglary and alarm
[00:44:42] 更糟的是
[00:44:44] 如果在剛剛的這個network裡面
[00:44:46] 有些機率是很難預估的
[00:44:48] 比如說
[00:44:50] 當有竊盜案
[00:44:52] 跟警鈴響或不響的情況底下
[00:44:54] 地震發生的機率
[00:44:56] 那這機率怎麼預估啊
[00:44:58] 誰知道啊
[00:45:00] 對不對
[00:45:02] 所以的確你可以建構出一個
[00:45:04] 這樣的被視網路
[00:45:06] 但是建不
[00:45:08] 可能很難建得成功
[00:45:10] 因為除了把這個Topology畫出來之外
[00:45:12] 你的CPT都能夠
[00:45:14] 預估出來才完成了
[00:45:16] 整個被視網路的建造
[00:45:18] 那所以其實
[00:45:20] 這整個建構起來不只是
[00:45:22] 結構變得更複雜
[00:45:24] 它裡面的機率你還寫不出來
[00:45:26] 好
[00:45:30] If we try to build a
[00:45:32] diagnostic model with things
[00:45:34] from symptom to cause
[00:45:36] we end up
[00:45:39] having to specify additional
[00:45:41] dependency between other
[00:45:43] otherwise independent cause
[00:45:45] 今天如果是從
[00:45:47] 症狀
[00:45:49] 要去
[00:45:51] 我建構的這個順序
[00:45:53] 是從症狀
[00:45:55] 開始建構
[00:45:57] 再建到原因的話
[00:45:59] 就像剛剛這個
[00:46:01] 症狀其實就是Mary打電話來
[00:46:03] 然後呢
[00:46:05] 她去建構到這個什麼
[00:46:07] 警報跡象
[00:46:09] 然後警報跡象又去建構到
[00:46:11] 有沒有竊案
[00:46:13] 所以呢它整個因果就我們人的理解來講
[00:46:15] 它是因果關係是反的
[00:46:17] 如果你硬要這樣子建的話呢
[00:46:19] 你的網路變得比較複雜
[00:46:21] 那你就要寫
[00:46:23] 你就要去specify更多其他的dependency
[00:46:25] 才能夠把這個
[00:46:27] 建起來
[00:46:29] 那如果說我們是
[00:46:31] 鎖定在因果關係的model
[00:46:33] 基本上我們可以用比較少數量
[00:46:35] 然後呢
[00:46:37] 比較容易去
[00:46:39] 評估出來的機率
[00:46:41] CPT
[00:46:43] 能夠去把整件事情描述出來
[00:46:45] 所以這個ordering是很重要的
[00:46:47] 那另外
[00:46:49] 還有另外一個例子就是說
[00:46:51] 故意舉一個很
[00:46:53] 很爛的一個例子
[00:46:55] 如果今天我建構的順序是
[00:46:57] Mary code, John code,
[00:46:59] R-squared, burglary跟alarm
[00:47:01] 那你建構出來的
[00:47:03] 這個network呢就會長
[00:47:05] 這個樣子
[00:47:07] 看起來就又更複雜了
[00:47:09] 看起來就更複雜
[00:47:11] 拉來拉去光這個alarm
[00:47:13] 就會有四個parent
[00:47:15] 然後這個burglary
[00:47:17] 就有三個parent
[00:47:21] 就一大堆亂七八糟的
[00:47:23] 所以說呢
[00:47:25] 我們知道說any of these three
[00:47:27] the three network
[00:47:29] can represent exactly the same
[00:47:31] 但是呢
[00:47:33] 我們可以看到說
[00:47:35] 我們從簡潔到複雜的
[00:47:37] 這個被視網路
[00:47:39] 複雜那個看起來
[00:47:41] 當然很礙眼吧
[00:47:43] 但不要忘了
[00:47:45] 這個被視網路
[00:47:47] 他們其實都代表同樣的join distribution
[00:47:49] join distribution
[00:47:51] 只是說我們後來才講的
[00:47:53] 這兩個版本呢
[00:47:55] 是沒有妥善的應用到
[00:47:57] conditional independence
[00:47:59] 的關係
[00:48:01] 所以說我就
[00:48:03] 要去預估一些可能不必要
[00:48:05] 或者是說很難預估的
[00:48:07] 這個機率在裡面
[00:48:09] 好
[00:48:11] 那講到這邊呢
[00:48:13] 稍微告一個段落
## 8. 寫作規則
(這是 `_筆記SOP.md` 第 3.1、4、5、6 節的濃縮版。兩者衝突時以 SOP 為準。)
讀者:碩士生,兩門課期末是英文考試。要只看筆記就能學會,講得比老師好懂。畫面要簡潔。
**概念優先(2026-09-26 主理人)**:主理人只想懂概念,不想補數學、不想看程式碼和座標圖。兩門課的考試也都是問答題、不考算式(AI W1 1:16:52;NLP W3 1:47:41、2:48:36)。所以:
- 每段預設看得到的只有:白話摘要(2–4 句)+**一句生活比喻**(例:模擬退火像投資理財,年輕時敢冒險、越老越保守)+「考試可能怎麼問」一句。
- 數學推導、公式、手算、程式碼、座標圖,全部收進標題寫「(進階,可跳過)」的摺疊,例如「它到底怎麼運作?(進階,可跳過)」。每段最多一個進階摺疊,不要寫長篇計算。
- 演算法要能「用文字說出步驟」(考試可能要你描述),這一點放在預設看得到的地方,不用數字。
- **重心比例**:白話理論與概念模式(它在解決什麼問題、核心想法、跟別的方法差在哪、優缺點、生活比喻)占主要篇幅;數學與程式細節只用一兩句帶過,細節收進進階摺疊。
**圖文並茂(2026-09-26 主理人:不要只有文字)**:
- 每章至少 2–3 個圖,放在**預設看得到**的地方,每個圖前後各用一兩句白話說明「這張圖在看什麼」。
- 流程、步驟、因果、比較 → 用 mermaid 流程圖(```mermaid,flowchart LR 或 TD;節點文字用中文、加雙引號;一張圖不超過 10 個節點)。
- 投影片上的示意圖、架構圖 → 用 [[IMG: …]] 放投影片圖。
- 仍守「每個 ## 段落最多一種視覺元素」。
### 輸出兩個檔
1. `chNN.md`(Notion 寫法,不含頁面標題),結構固定:
- 第一行:章節包第 1 節那行,原樣照抄。
- 第二行起(有數學段才寫):**跳過提示**,每段一行,讓主理人看影片時知道從哪跳到哪。用章節包第 3b 節的候選當提示,對照第 7 節逐字稿確認(只標老師連續講公式、推導、矩陣、微積分、機率計算、程式細節超過約 1 分鐘的段落;概念講解和比喻不算):
`跳過提示:(1:31:02–1:35:40) 老師在推導梯度公式,聽不懂可以直接跳到 [1:35:40](YouTube 連結),接著講「步長 α 怎麼選」。`
- `## 重點`:三點中文,每點一到兩句。
- `## Exam-ready`:3–10 行英文,**從章節包的投影片文字逐字抄**,每行 `- **Term**: "原句"(Ch3 p.14)`。老師有明確證據才在行尾加 `【老師強調】(h:mm:ss)`。
**每一行下面一定要有一行縮排的中文解釋**(主理人英文不好,看不懂的英文等於沒用):
```
- **Hill climbing**: "It keeps track of one current state and on each iteration moves to the neighboring state with highest value."(Ch4 p.5)
- 中文:爬山法只記住「現在這一個狀態」,每一輪都移到分數最高的鄰居。白話:一直往比較高的地方走一步。
```
中文要先把句子意思講清楚,再補一句白話;最後用「英文(中文)」列出這句裡 1–3 個難字,例:sparse(稀疏)、distinct terms(不重複的字)。
**一行只放一句投影片原句**。同一頁有多句要考就拆成多行,每行各接一行中文;不要用分號串三句以上,不要把計算量 O(...) 塞進去。
- 章節包第 2 節的每一段:`## [h:mm:ss](連結) 標題`(照抄),下面 2–4 句白話摘要,其餘全部收進摺疊:
```
問句(例:用生活例子講,BFS 在做什麼?)
內容
```
摺疊種類(需要才放):用生活例子講?/它到底怎麼運作?/要先懂什麼?(老師假設你會的數學或概念,短版教學)/老師原話是什麼?(「原話」(h:mm:ss),只放重要的,最多 5 句)。
- 「它到底怎麼運作?」要用一組小數字把這段的演算法**真的跑 1–3 步**(例:算出梯度、更新一次、比較兩個 α),不是只示範定義的加減乘除。全章盡量沿用同一組數字,讓前一段的答案能在下一段被驗證。
- 每段正文要回答讀者最可能卡住的一個「為什麼」。投影片公式方向跟題目相反、或投影片說「解不出來」時,用一兩句講出原因,自己補的標(我補充)。
- 投影片句子停在公式前(公式在圖裡)時:Exam-ready 在粗體詞條上補公式、引號內保持原句;正文寫出同一條式子。公式圖看章節包第 6 節列出的 PNG。
- `## Self-check`:2–4 題英文考題,答案收摺疊。**至少一題考老師強調的內容**;只出 explain/why/compare 這類問答題,**不出要代數字計算的題目**(考試不考算式);不出「老師和投影片哪裡不同」這類不會考的題目。每題格式:
```
Q1. English question?(中文:中文題目)
**Answer**: English answer.
中文:把答案完整講一遍(不是只翻一句),讓看不懂英文的人也知道要怎麼答。
```
- **最後一行**:章節包第 1b 節那行(下一章連結),原樣照抄。讓讀完的人直接點下一章。
- 不要把章節包或這份規則裡的指示句寫進筆記(例如「寫筆記時照投影片寫」「已改正 ASR 錯字」)。
- 長度:全文不超過 16,000 字元(跟 check_note.py 同一個數字)。**不要為了壓字數反覆刪改**(實測一章最多花 12 輪在刪字);超過時只刪進階摺疊裡的第二組算例,比喻、比較表、圖說、「老師說不用背」的提醒都不刪。
- 預設看得到的正文不放計算量 O(...)、代號對照(例如 SMART 字母)、課本出處考據,一律移進進階摺疊。
2. `chNN.concepts.json`:JSON 陣列,4–12 個考試可能問的術語,每個物件:
`name`(英文)、`zh`、`type`(概念/演算法/公式/人物事件/前置知識/行政)、`signal`("老師說會考"/"老師強調"/"核心(我判斷)"/"")、`evidence`(有 signal 前兩種時必填:原句+時間)、`definition_en`(投影片原句;沒有就註明 (textbook)/(lecture)/(my wording))、`plain`(一句中文)、`a4`(≤150 字元英文,可夾極短中文;期末拼貼用的小方塊)、`time`、`slides`、`prereq`(英文名陣列)。
### 風格鐵律
- 不用 emoji 或裝飾符號(✓✗★⚠ 都不要;→ 可以)。不用 callout。不用 `$`。時間不要用 code 樣式。
- 每個 `##` 段落最多一種視覺元素:一張圖、或一個表格、或一個 mermaid。
- 摺疊標題是問句,前面不加符號。
- 圖片最多 3 張,只放文字取代不了的圖。放法:單獨一行 `[[IMG: | 中文圖說]]`,PNG 用 `slides_to_png.py <圖片資料夾> <頁> --dpi=110` 產生。
- 考試訊號只在老師明確說時標。老師只說「不用背」「不講」就寫「注意:……」。
- 老師口誤或跟投影片不同:照投影片寫,加「注意:老師口頭說的是……」。
- 引用老師的話時,ASR 錯字改成正確的字。
### 沒有投影片時
不要憑記憶逐字重現課本段落或數值表。英文定義用自己的話寫、句尾標 (my wording);Exam-ready 每行標「(自擬,投影片待補)」。例子只用老師講的。
### 寫完之後(只做一次)
跑檢查:
`C:\Users\user\.cache\meeting-record\venv\Scripts\python.exe C:\Users\user\.claude\scripts\check_note.py --transcript <逐字稿> --slides <投影片 txt …> --start <起> --end <訖> --vid <影片 ID>`
- STYLE/VISUAL/TIME/FORMAT:全部改掉。
- QUOTE:確認是不是你改正了 ASR 錯字(是就保留),不是就改成原文或拿掉引號。
- ENGLISH:確認是不是投影片斷行造成的(是就保留),不是就改成投影片原句。
**省額度守則**:章節包裡已經有你需要的全部資料。不要再去讀整份逐字稿、整份投影片、segments.json 或手冊。一次寫好整個檔(Write 一次),檢查後集中修改。