# 章節包:人工智慧導論(AI)W1(9/10)第 05 章「Agent、理性與任務環境」 影片 2:42:08–2:59:48,YouTube ID KWGgi100YLY。Notion 章節頁 https://app.notion.com/p/3e7fc631b0308166ab40e7f402602f69(頁 ID 3e7fc631-b030-8166-ab40-e7f402602f69),頁面標題「05 Agent、理性與任務環境(2:42–2:59)」。 ## 1. 第一行(直接照抄,不要改) [人工智慧導論](https://app.notion.com/p/3e6fc631b0308131b213f0a3d93fe91d) › [W1(9/10)](https://app.notion.com/p/3e7fc631b03081309a2adad7f8ae1e27) › 05|影片 [2:42:08–2:59:48](https://www.youtube.com/watch?v=KWGgi100YLY&t=9728s)|投影片 Ch2 p.2–12|上一章 [04 深度學習崛起與 AI 風險(2:07–2:31)](https://app.notion.com/p/3e7fc631b030813ba471f1cdc276f72c)|下一章 無 ## 1b. 最後一行(直接照抄,放在 Self-check 後面,當全頁最後一行) 這週讀完了。下一週第一章:[01 HW1 提案寫法與分組(0:01–0:13)](https://app.notion.com/p/3e6fc631b030816cb5e8d1b405b4349e)|回到週頁:[W1(9/10)](https://app.notion.com/p/3e7fc631b03081309a2adad7f8ae1e27) ## 2. 各段標題(照順序;每段一個 ## 標題,直接照抄連結) - `## [2:42:08](https://www.youtube.com/watch?v=KWGgi100YLY&t=9728s) Agent 不是新名詞` 老師講什麼:老師說 Ch2 也偏聊天;agent 這個概念在 AI 領域已經存在幾十年,不是 LLM 時代才出現的。 - `## [2:44:02](https://www.youtube.com/watch?v=KWGgi100YLY&t=9842s) Agent 的定義` 老師講什麼:透過 sensors 感知環境、透過 actuators 對環境採取行動的任何東西都是 agent,可以是系統、機器、一段程式甚至一個函式。sensor 不限溫度或濕度感測器,動作也可以只是回傳一串資料。 - `## [2:45:16](https://www.youtube.com/watch?v=KWGgi100YLY&t=9916s) Percept 與 agent function` 老師講什麼:agent 感知到的輸入叫 percept;agent function 就是把感知到的東西(percept sequence)對應到要做的動作。 - `## [2:46:28](https://www.youtube.com/watch?v=KWGgi100YLY&t=9988s) 吸塵器世界與查表的問題` 老師講什麼:世界只有 A、B 兩塊地磚,吸塵器可以左移、右移、吸塵或不動;最簡單的規則是「髒就吸,不然換到另一格」。如果加上時間維度,把所有情況列成表格會長到寫不完,所以用查表寫 agent 不是好辦法。 - `## [2:50:03](https://www.youtube.com/watch?v=KWGgi100YLY&t=10203s) 理性要看效能怎麼定義` 老師講什麼:rational agent 就是「把事情做對」:在已知資訊下讓效能最大。效能要依你想要的環境結果來定義,而不是規定 agent 該怎麼動;同一台吸塵器理不理性要「看情況」:目標是吸最多灰塵、維持地板乾淨,還是省電,答案都不同。 - `## [2:53:14](https://www.youtube.com/watch?v=KWGgi100YLY&t=10394s) 全知、學習與自主` 老師講什麼:老師口頭用 omniscient 描述「環境裡所有資訊都知道」,舉 NVIDIA 的 Omniverse 為例;課本的意思是理性不要求全知。理性 agent 還要能從經驗學習、自主補足不完整或錯誤的先驗知識。 - `## [2:55:04](https://www.youtube.com/watch?v=KWGgi100YLY&t=10504s) PEAS:計程車司機` 老師講什麼:描述任務環境要列出 Performance、Environment、Actuators、Sensors。計程車例子:環境是路況、紅綠燈、行人;動作是方向盤、油門、煞車;感測器是攝影機、GPS、速度計等;效能可以是最快、最順或最省錢。 - `## [2:57:15](https://www.youtube.com/watch?v=KWGgi100YLY&t=10635s) 環境屬性:前三組` 老師講什麼:fully vs partially observable(圍棋盤面全看得到,開車看不到全部)、single vs multi-agent(下棋有兩個 agent 互動)、deterministic vs stochastic(落子結果確定,開車轉向有不確定性)。其餘屬性下週再講。 ## 3. 老師強調/會考/不考的地方(原句已驗證;寫進筆記時 ASR 錯字要改正) - (2:50:21) [強調] 「最能夠落地應用的是所謂的rational agent的這一個派別」 → 再次提到 rational agent 是最能落地的一派(和 1:44:52 重複) ## 3b. 數學段候選(程式抓的,只是提示;寫「跳過提示」行用) 0 段候選(門檻 3.0 字/30 秒) ## 4. 這章摘要與重要度 定義 agent、percept 與 agent function,用吸塵器世界說明理性要看效能怎麼定義,再介紹全知與學習、PEAS 與前三組環境屬性。(核心) ## 5. 整堂課的提醒(ASR 錯字、老師口誤、投影片缺公式等;只用跟這章有關的) - 影片 0:00:00–0:08:21 是在設定直播,沒有上課內容,直接從 0:08:21 開始看。 - 01 章(0:08–1:20)是行政:考試日期、作業時程、評分比例已經整理在課程頁,這章只補課程頁沒有的(衛星課程、選題建議、這門課教什麼不教什麼、Slido 問答精選)。 - 朝陽科大是衛星學校:作業和學期分數由朝陽的協同教師陳榮靜老師負責(逐字稿 ASR 寫成「長陽科大的陳榮進老師」,0:14:32)。 - 老師說 Ch1、Ch2 都偏「聊聊天」,真正核心從 Ch3 開始(2:59:31)。這週 Ch2 只講到 p.12,p.13 起在 W2 接著講。 - 本機的 Lecture 0 投影片 PDF 是去年版(p.2 寫 114 學年、p.19 寫 12/11 考試與 12/18 報告);今年老師口頭說的是 12/10 考試、12/24 報告,以老師口頭與 NTU COOL 為準。 - ASR 人名校名:「長陽科大的陳榮進」=朝陽科大陳榮靜(0:14:32);「鎮丘科大的施松春」=正修科大施松村;「高雄科大的蕭宏傑」投影片(去年版)寫戴鴻傑,今年是否換人不確定。 - ASR 術語:混程式授權=混成式授權;系統老師=協同教師;頭影片=投影片;TICA/拍卡=TAICA;期末卡=期末考;志工系館=資訊系館;AIDAIGOCAGO=Aidea、Aigo、Kaggle;Engineering AI/EngineeringAgent=Agentic AI;ntu庫/ntu酷/MTU COOL=NTU COOL;ChainGPT=ChatGPT;Olama=Ollama。 - ASR 歷史人名:McClouch/Macroch=McCulloch;Dim Edelman=Dean Edmonds;Marvin Vinsky=Minsky;Claudius Shannon=Claude Shannon;Harper Simon=Herbert Simon;Prowe=Judea Pearl;Yashua Bejo=Yoshua Bengio;Bartol=Barto;Rison and Hall=Bryson and Ho;Dendro=DENDRAL;MindC=MYCIN;Base Network=Bayesian network;被propagation=back-propagation;Geometric Theory Prover=Geometry Theorem Prover;ImgNet/Ingenet=ImageNet;Lewis/New Year's=NeurIPS;Hawking Face=Hugging Face。 - ASR Ch2:a curator/Equator=actuator;「回答他們提出一個系統叫Onimus/Oniverse」應是「輝達(NVIDIA)提出的 Omniverse」(2:53:52,推測);CyberCat=Tesla Cybercab;Athropic Cloud=Anthropic Claude。 - 老師口誤:2:06:22 說「billions of dollars in 1980年」,投影片 p.21 是 1988;0:47:36 說 ChatGPT「大概在 2020 年左右」出來,實際是 2022 年 11 月;2:15:14 附近說訓練出「語音辨識」模型,前後文是 ImageNet 影像辨識。 - Samuel 的程式投影片 p.15 寫 checkers(西洋棋),但 checkers 其實是西洋跳棋,老師口頭也說西洋棋;考試寫 checkers。 - Omniscience:老師口頭(2:53:45)講的 omniscient 比較像 fully observable(環境資訊全都知道);課本 p.7 的意思是「知道行動的真實結果」,並說理性不要求全知(rationality maximizes expected performance, while perfection maximizes actual performance)。考試寫課本版。 - 老師提到的 2026 年新聞(GPT-6 Astra、OpenAI 模型逃出沙盒侵入 Hugging Face、Meta 記錄員工滑鼠軌跡訓練模型)無法查證,筆記只當老師舉的例子轉述,不當事實寫。 - 本機 Lecture 0 PDF 是去年版:p.3 衛星學校列了 5 所(含南臺科大),今年老師口頭說只有 4 所(臺中科大、高雄科大、朝陽科大、正修科大);p.19 日期 12/11、12/18 也是去年的,今年是 12/10 考試、12/24 報告。 - Lecture 0 p.17 的圖(AI ⊃ ML ⊃ DL ⊃ GenAI)在本機是去年版;老師說今年的投影片在 GenAI 裡多畫了 Agentic AI(0:47:59)。 ## 6. 投影片文字(這章範圍) **這幾頁的公式或內容只在圖裡(文字檔抓不到),寫 Exam-ready 與公式前先用 Read 看這幾張圖:** - Ch2 p.4 → C:\D槽\TAICA課程\_work\notes-v2\ai-w1\img\brief_Ch2_p004.png - Ch2 p.6 → C:\D槽\TAICA課程\_work\notes-v2\ai-w1\img\brief_Ch2_p006.png - Ch2 p.7 → C:\D槽\TAICA課程\_work\notes-v2\ai-w1\img\brief_Ch2_p007.png - Ch2 p.8 → C:\D槽\TAICA課程\_work\notes-v2\ai-w1\img\brief_Ch2_p008.png - Ch2 p.9 → C:\D槽\TAICA課程\_work\notes-v2\ai-w1\img\brief_Ch2_p009.png - Ch2 p.10 → C:\D槽\TAICA課程\_work\notes-v2\ai-w1\img\brief_Ch2_p010.png - Ch2 p.11 → C:\D槽\TAICA課程\_work\notes-v2\ai-w1\img\brief_Ch2_p011.png - Ch2 p.12 → C:\D槽\TAICA課程\_work\notes-v2\ai-w1\img\brief_Ch2_p012.png --- Ch2 p.2 --- • An agent is anything that can be viewed as perceiving its environment through sensors and acting upon that environment through actuators (促動 器). Agents and Environments 2 --- Ch2 p.3 --- • The term percept refers to the agent’s perceptual inputs at any given instant. • An agent’s behavior is described by the agent function that maps any given percept sequence to an action. • A very simple example—the vacuum-cleaner world Agents and Environments 3 --- Ch2 p.4 --- • It can choose to move left, move right, suck up the dirt, or do nothing. One very simple agent function: if the current square is dirty, then suck; otherwise, move to the other square. • What is the right way to fill out the table? What makes an agent good or bad, intelligent or stupid? Agents and Environments 4 --- Ch2 p.5 --- • A rational agent is one that does the right thing. • Right thing: The agent’s actions causes the environment to go through a sequence of states. If the sequence is desirable, then the agent has performed well. This notion of desirability is captured by a performance measure that evaluates any given sequence of environment states. • It is better to design performance measures according to what one actually wants in the environment, rather than according to how one thinks the agent should behave. The Concept of Rationality 5 --- Ch2 p.6 --- • Definition of a rational agent • For each possible percept sequence, a rational agent should select an action that is expected to maximize its performance measure, given the evidence provided by the percept sequence and whatever built-in knowledge the agent has. • Consider the simple vacuum-cleaner agent. Is this a rational agent? That depends! • Performance measure: the amount of dirt being cleaned up • Performance measure: a clean floor Rationality 6 --- Ch2 p.7 --- • Rationality maximizes expected performance, while perfection maximizes actual performance. • Our definition of rationality does not require omniscience (全知), because the rational choice depends only on the percept sequence to date. • Our definition requires a rational agent not only to gather information but also to learn as much as possible from what it perceives. Omniscience, Learning, and Autonomy 7 --- Ch2 p.8 --- • A rational agent should be autonomous—it should learn what it can to compensate for partial or incorrect prior knowledge. • A vacuum-cleaning agent that learns to foresee where and when additional dirt will appear will do better than one that does not. • The incorporation of learning allows one to design a single rational agent that will succeed in a vast variety of environments. Omniscience, Learning, and Autonomy 8 --- Ch2 p.9 --- • Task environment: we have to specify the performance measure, the environment, and the agent’s actuators and sensors. • PEAS (Performance, Environment, Actuators, Sensors) Task Environments 9 --- Ch2 p.10 --- Task Environments 10 [IMAGE-ONLY] --- Ch2 p.11 --- • Fully observable vs. partially observable • Fully observable: if the sensors detect all aspects that are relevant to the choice of action • Single agent vs. multiagent • The key distinction is whether B’s behavior is best described as maximizing a performance measure whose value depends on agent A’s behavior. • Chess is a competitive multiagent environment Properties of Task Environments 11 --- Ch2 p.12 --- • Deterministic vs. stochastic • If the next state of the environment is completely determined by the current state and the action executed by the agent, then we say the environment is deterministic; otherwise, it is stochastic. • Taxi driving is clearly stochastic • “Stochastic” generally implies that uncertainty about outcomes is quantified in terms of probabilities Properties of Task Environments 12 ## 7. 逐字稿(2:42:08 前後各多 1 分鐘,原始行) [02:42:08] 十幾分鐘時間 [02:42:10] 稍微講一下第二章 [02:42:12] 第二章呢 [02:42:18] 基本上也是在聊聊天的啦 [02:42:20] 好第二章 [02:42:22] 不見了 [02:42:57] OK好來 [02:42:59] 那我們第二章呢 [02:43:00] 要講的是Intelligent Agents [02:43:03] 你看到這個 [02:43:05] 這個Chapter的Title [02:43:07] 老師你不是說 [02:43:08] 不教一些最新的東西嗎 [02:43:10] 不是說不教Agent嗎 [02:43:12] 怎麼第二章就開始Intelligent Agents [02:43:15] 事實上自己就 [02:43:16] 跟大家證明說 [02:43:18] 跟大家說明說 [02:43:19] 事實上代理人 [02:43:21] 或者是所謂的Agent這個觀念 [02:43:24] 是一個 [02:43:26] AI這個研究領域裡面 [02:43:29] 一直以來維持的一個概念 [02:43:31] 本來就已經有一個概念 [02:43:33] 那只是說在最近幾年 [02:43:36] 在這個世界 [02:43:39] 大家是要Large Language Model [02:43:42] 來去實現出 [02:43:45] 你覺得所謂的Agent [02:43:47] 就一定是現在GPT [02:43:49] 所做的這些 [02:43:51] 或者是Cloud [02:43:52] Athropic Cloud [02:43:53] 他們在做的這些事情 [02:43:55] 但其實Agent這個概念 [02:43:58] 老早在幾十年來 [02:44:00] 就一直都有 [02:44:02] 好來 [02:44:03] 那我們來講一下 [02:44:04] 一個Agent [02:44:06] Agent可以是任何的東西 [02:44:08] Anything [02:44:09] Agent is anything [02:44:10] that can be viewed as [02:44:11] perceiving its environment [02:44:13] through sensors [02:44:16] and acting upon that environment [02:44:19] through a curator [02:44:21] Agent呢 [02:44:22] 就是在一個環境裡面 [02:44:25] 可以透過感測器 [02:44:28] 來感知到一些訊息 [02:44:31] 然後依照這些訊息 [02:44:33] 做一些動作的東西 [02:44:36] 都叫做Agent [02:44:38] OK [02:44:39] 聽起來非常的廣泛吧 [02:44:40] 好 [02:44:41] 那一般來講 [02:44:42] 你就把它想像成 [02:44:43] 它就是一個系統 [02:44:46] 或者是一個機器設備 [02:44:48] 或者說根本就只是一段程式 [02:44:51] 或者說根本就是 [02:44:52] 你所撰寫的某一個Function [02:44:55] 某一個含釋 [02:44:56] 這些都可以是Agent [02:44:59] 那這個Sensor [02:45:00] 這個感測器 [02:45:01] 大家也不要覺得說 [02:45:02] 講的就是溫度感測器 [02:45:04] 濕度感測器喔 [02:45:05] 不是 [02:45:06] 你只要能夠感受到 [02:45:08] 某一個定義的範圍內的資訊 [02:45:13] 都是叫感測器 [02:45:15] OK [02:45:16] 所以如果說 [02:45:21] 如果說畫一個示意圖的話 [02:45:24] 就像底下的這一個 [02:45:26] 一個Agent就是在一個環境裡面 [02:45:28] 那我們可以感測到一些資訊 [02:45:31] 然後呢感測到資訊之後呢 [02:45:33] 透過一個 [02:45:35] 某一種Function [02:45:37] 或某一種邏輯 [02:45:38] 或某一個模型 [02:45:40] 來推動我的Equator [02:45:43] Equator可能是在做一個動作 [02:45:46] 那這個動作也不見得一定是什麼 [02:45:47] 機器手臂怎麼移動喔 [02:45:49] 可能我只是在回傳一串資料 [02:45:51] 也是一個動作 [02:45:54] 這樣懂我意思嗎 [02:45:55] 所以它非常非常廣泛 [02:45:58] 那感受Perceive這個詞呢 [02:46:02] 它可以是很廣泛的 [02:46:05] 你任何的Input的形式都可以 [02:46:08] 那你感受到這個環境的資訊之後 [02:46:11] 你就透過一個Agent Function [02:46:14] 你輸入這個感測的結果 [02:46:16] 你就會輸出你要做的動作 [02:46:19] Again這個動作不見得一定是移動 [02:46:23] 不見得一定是什麼 [02:46:25] 可能只是傳一個資料都是 [02:46:28] 好那為了讓大家知道一個 [02:46:31] 這是舉一個例子啦 [02:46:33] 這個例子呢 [02:46:34] 在本課本裡面 [02:46:35] 在未來會出現好幾次 [02:46:37] 就是一個非常簡單的吸塵器的例子 [02:46:40] 假設呢這個世界裡面呢 [02:46:42] 只有兩塊地磚A跟B [02:46:45] 這兩塊地磚呢 [02:46:46] 地上都有可能有髒東西有灰塵 [02:46:50] 那這個吸塵器它可以做的事情就是 [02:46:53] 它可以吸塵 [02:46:55] 它也可以往右走 [02:46:57] 也可以往左走 [02:46:58] 這個就是它會做的事情 [02:47:00] 所以你看喔在這個來 [02:47:01] 以這個角度來講 [02:47:03] 這個環境就是兩塊地磚 [02:47:06] 這個世界就是兩塊地磚 [02:47:08] 這個Agent呢 [02:47:10] 其實就是運作在這個吸塵器上面 [02:47:15] 那這個吸塵器可能 [02:47:17] 根據你吸塵器的功能啊 [02:47:19] 你吸塵器可能可以感測的到 [02:47:23] 我現在所在地有沒有灰塵 [02:47:27] 那它可以移動它可以吸塵 [02:47:30] 它也可以左右移動這樣 [02:47:32] 那所以這裡就講說它可以往左移 [02:47:34] 往右移可以吸塵 [02:47:35] 或者說它根本什麼事都不做 [02:47:37] 這個就是一個Agent [02:47:40] 那一個很簡單的一個Agent function [02:47:43] 我們剛剛講Agent function是什麼 [02:47:45] Agent function就是說 [02:47:46] 當你感知到一些資訊之後 [02:47:48] 你要做什麼動作 [02:47:49] 你這中間的mapping [02:47:51] 你從感知的資訊到做出什麼動作 [02:47:53] 這中間的mapping就叫做Agent function [02:47:57] 一個非常簡單的Agent function就是說 [02:47:59] 我如果感知到我目前所在的 [02:48:02] 地磚是髒的 [02:48:04] 那我就吸塵 [02:48:05] 不然呢 [02:48:06] 我就移到另外一塊地磚 [02:48:08] 這是廢話嗎 [02:48:09] 這就是一個最最簡單的一個Agent function [02:48:13] 好那可是實際上 [02:48:18] 這個是一個空間裡面 [02:48:22] 某一個瞬間 [02:48:24] 有兩塊地磚 [02:48:25] 那有可能有髒的有不髒的 [02:48:27] 那如果我們再多一個維度 [02:48:29] 是時間的話呢 [02:48:30] 比如說 [02:48:32] 經過五秒後 [02:48:34] 本來A地磚被你吸乾淨了 [02:48:36] 搞不好 [02:48:37] 我就 [02:48:38] 我吸乾淨了 [02:48:39] 我就跑到B地磚去嘛 [02:48:41] 搞不好五秒之後呢 [02:48:42] 天上又掉下來一些灰塵 [02:48:44] 又落在A地磚上面 [02:48:45] 所以A地磚可能又髒啊 [02:48:47] 所以說你再多一個維度 [02:48:48] 如果考慮到時間的話 [02:48:50] 你要在所有的時間 [02:48:52] 都要把 [02:48:54] 這個地都吸乾淨的話 [02:48:56] 那你可能 [02:48:57] 你如果用一個最笨的一個方法 [02:48:59] 你可能就要列出一個表格 [02:49:01] 是一個包含所有時間的一個表格 [02:49:06] 比如說 [02:49:07] 我在某一個瞬間 [02:49:08] 我可能是 [02:49:09] 我感測到我在A地磚 [02:49:11] 那它是乾淨的 [02:49:12] 那我就往右移 [02:49:13] 我可能在A地磚它是髒的 [02:49:15] 那我就吸塵 [02:49:16] 我在B地磚乾淨的 [02:49:18] 我就往左移 [02:49:19] 我是B地磚髒的 [02:49:21] 我就往右移 [02:49:22] 我如果在第一個時間 [02:49:24] 這時候多了一個時間的維度 [02:49:25] 第一個時間A地磚是乾淨的 [02:49:28] 然後呢 [02:49:30] 我可能 [02:49:32] 不動 [02:49:33] 或者怎麼樣 [02:49:34] 或者說我在第二個時間 [02:49:36] 它也是乾淨的 [02:49:38] 那我才往右移 [02:49:40] 依此類推 [02:49:41] 你可以把這個 [02:49:42] table寫得非常的長 [02:49:44] 來cover所有可能 [02:49:46] 在任何時間點 [02:49:47] 它可能連續時間 [02:49:49] 它可能出現了一個情況 [02:49:51] 那這個表格就寫得太長了 [02:49:54] 所以很顯然的 [02:49:55] 寫一個規則 [02:49:57] 來處理一個 [02:49:59] agent system [02:50:00] 可能不是一個很好的一個選擇 [02:50:03] 好 [02:50:04] 那這時候我們就要代入到 [02:50:05] 剛剛我們前面介紹過 [02:50:07] agent呢 [02:50:10] 當我們在定義AI的時候 [02:50:12] 我們可以從怎麼進行思考 [02:50:14] 以及怎麼樣進行行為 [02:50:17] 這兩個不同的角度 [02:50:18] 其中我們 [02:50:19] 剛剛講的就是說 [02:50:21] 最能夠落地應用的 [02:50:24] 是所謂的rational agent的 [02:50:27] 這一個派別 [02:50:28] 它的意思就是說 [02:50:30] 它只要做出來的行為 [02:50:33] 是理性的 [02:50:35] 這樣子的話 [02:50:37] 我們就稱呼它是一個 [02:50:38] 可用的一個AI系統 [02:50:40] 那什麼叫做理性的agent呢 [02:50:44] 那就是它會把事情做對 [02:50:47] 怎麼樣叫做做對呢 [02:50:49] 那就是在你有限 [02:50:50] 你所取得的資訊的情況之下 [02:50:52] 它能夠盡可能的 [02:50:54] 讓它的效能最大化 [02:50:57] 那我們就說 [02:50:59] 這樣子的agent [02:51:00] 是一個理性的agent [02:51:02] 好 [02:51:03] 那接下來問題連環問 [02:51:05] 那什麼叫做效能最大化呢 [02:51:08] 那就看你怎麼去定義效能這件事情 [02:51:11] 定義效能這件事情 [02:51:13] 所以 [02:51:15] 所以呢 [02:51:16] 我們最好是定義出一個 [02:51:18] 效能的評判方式 [02:51:19] 而不是去定義 [02:51:21] 你這個agent [02:51:22] 應該要怎麼去移動 [02:51:24] 怎麼去進行行為 [02:51:26] 講到這邊 [02:51:27] 大家有沒有覺得 [02:51:28] 我好像都是在講一些非常虛無縹緲的東西 [02:51:32] 到底在講什麼 [02:51:34] 但是我們這本書 [02:51:36] 因為畢竟是聖經本嘛 [02:51:37] 所以它前面都是屬於 [02:51:39] 很多這樣的一個描述 [02:51:41] 所以一個理性的agent [02:51:43] 就是要去最大化它的效能 [02:51:46] 比如說 [02:51:49] 比如說一個 [02:51:50] 在剛剛的這個吸塵器的例子裡面 [02:51:54] 到底這個吸塵器 [02:51:56] 這個 [02:51:57] 如果 [02:51:58] 我現在的地磚是髒的 [02:52:00] 我就吸 [02:52:01] 不然呢 [02:52:02] 我就移到另外一塊地磚 [02:52:03] 請問 [02:52:04] 這樣子的吸塵器 [02:52:05] 是不是一個理性的吸塵器 [02:52:07] 是不是呢 [02:52:09] 答案是 [02:52:11] Depends [02:52:13] 不一定 [02:52:14] 為什麼 [02:52:15] 因為根據你怎麼去定義你的效能 [02:52:17] 我們才能夠說它是不是夠理性 [02:52:20] 比如說 [02:52:21] 你的效能可能是 [02:52:22] 你能夠吸到的灰塵的最大的 [02:52:25] 你最多能夠吸多少灰塵的 [02:52:26] 我希望你能夠吸最多的灰塵 [02:52:31] 那就應該是怎麼樣 [02:52:32] 就是說 [02:52:33] 我應該一直不斷的左右移左右移 [02:52:36] 無時無刻一直在移 [02:52:37] 然後一直吸一直吸 [02:52:39] 這可能才會最大化你的效能 [02:52:42] 那也有可能是 [02:52:44] 我的目標是 [02:52:45] 我只要有一個 [02:52:47] 在某一個瞬間 [02:52:48] 有一個乾淨的地板 [02:52:49] 這樣就好啦 [02:52:50] 所以你能夠維持 [02:52:52] 越多時間是有乾淨地板的 [02:52:55] 那這可能也是一種效能模式 [02:52:57] 那或者是說呢 [02:52:58] 它現在已經快沒電了 [02:53:00] 你要進入省電模式 [02:53:02] 你要盡可能的少移動 [02:53:04] 這可能也是一種效能的一個最大化 [02:53:07] 所以說 [02:53:08] Rational Agents [02:53:09] 到底一個Agent是不是Rational [02:53:11] 其實是要根據你的效能怎麼定義而定 [02:53:14] 好 [02:53:15] 那當我們在考慮 [02:53:17] 這個所謂的效能的時候呢 [02:53:19] 我們有時候還要參考到 [02:53:23] 這整個環境 [02:53:25] 是不是 [02:53:27] 我們一直在講說 [02:53:29] 我們能夠感知到的資訊嗎 [02:53:31] 你感知到的資訊有分成 [02:53:34] 你到底是全部都感知到的 [02:53:36] 還是說你只能夠感知到部分的資訊 [02:53:39] 所以 [02:53:41] 有一些情境之下 [02:53:43] 它是所謂的 [02:53:45] Omniscient [02:53:46] 全知全能的 [02:53:48] 意思是說 [02:53:49] 這個環境底下 [02:53:50] 我所有的資訊我都知道 [02:53:52] 大家是不是知道這個 [02:53:55] 回答他們提出一個系統 [02:53:57] 叫Onimus [02:53:58] Oniverse [02:53:59] Oniverse就是說一個虛擬的空間當中 [02:54:01] 事實上裡面的物件 [02:54:03] 都是模擬出來的 [02:54:04] 所有的參數全部都知道 [02:54:06] 所以他取這個名字 [02:54:07] Oniverse [02:54:08] 那這Omniscient只是指說 [02:54:10] 我在這個某一個環境之下 [02:54:12] 他所有該得到的資訊都知道 [02:54:15] 這是一種狀況 [02:54:16] 也有可能是 [02:54:17] 我只知道部分資訊 [02:54:20] 那我們當然是希望說一個 [02:54:23] 更有更為有用的Rational Agents [02:54:25] 他不只是會收集資訊 [02:54:27] 他還能夠根據 [02:54:29] 收集資訊做出理性的判斷 [02:54:31] 而且呢 [02:54:32] 他最好是能夠根據 [02:54:34] 過去的歷史 [02:54:36] 來學會 [02:54:37] 我剛剛以為 [02:54:39] 這樣子是一個最理性的判斷 [02:54:40] 其實到後來 [02:54:41] 我收集到更多資訊 [02:54:43] 看了更多的時間之後 [02:54:44] 我能夠做出來的判斷 [02:54:46] 所以說呢 [02:54:48] 我們也會希望 [02:54:50] 我們的Rational Agent [02:54:51] 是有自動化的 [02:54:53] 他能夠 [02:54:54] Learn what he can do [02:54:56] to compensate for partial [02:54:58] or incorrect prior knowledge [02:55:01] 那他需要具備有一些 [02:55:03] 學習的一個能力 [02:55:04] 好來這裡舉個例子 [02:55:07] 到底Agent可以有哪些情況呢 [02:55:10] 基本上我們在描述一個Agent的時候 [02:55:13] 我們可能會同時考慮的 [02:55:15] 的東西是PEAS [02:55:18] Performance Environment Actuator & Sensor [02:55:22] 比如說計程車司機 [02:55:25] 其實就是一種Agent [02:55:27] 他的Environment是什麼 [02:55:30] 當然就是路上 [02:55:31] 他的這個道路的情況 [02:55:34] 路面的情況啦 [02:55:36] 紅綠燈啦 [02:55:38] 有沒有行人啊 [02:55:40] 旁邊有沒有其他人在騎腳踏車 [02:55:42] 這個就是他所面臨的環境 [02:55:45] 然後他的Actuator [02:55:46] 他可以做什麼 [02:55:48] 他可以做的就是 [02:55:49] 轉動方向盤 [02:55:50] 加速跟煞車 [02:55:52] 對不對 [02:55:54] 然後他的Sensor是什麼 [02:55:56] 你要做一個系統 [02:56:00] 能夠像一個計程車司機 [02:56:02] 你的Sensor [02:56:03] 如果一般的真人的計程車司機 [02:56:05] 他大概就是他的Sensor就是 [02:56:07] 他看得到聽得到 [02:56:09] 聞得到頂多 [02:56:11] 好那如果是像現在CyberCat [02:56:13] 有沒有Tesla的CyberCat出來了 [02:56:16] 他就像一個計程車司機 [02:56:18] 他的Sensor可能就會有攝影機 [02:56:20] 有聲浪 [02:56:22] 有速度儀 [02:56:23] 有GPS [02:56:24] 有加速器 [02:56:25] 等等等等等等的 [02:56:27] 當然CyberCat是目前 [02:56:29] 可能很多東西這裡沒有啦 [02:56:31] 好那他的Performance是什麼呢 [02:56:33] 評判一個計程車司機的效能 [02:56:37] 你可以有很多不同的評判方法 [02:56:39] 比如說我現在要去桃園機場 [02:56:41] 你用最快的方式給我過去 [02:56:43] 所以可能是抵達的時間 [02:56:45] 要越短越好 [02:56:47] 那有可能是 [02:56:49] 我走的路要能夠越通順越好 [02:56:53] 也有可能是 [02:56:55] 我花的錢越少越好 [02:57:00] 這可能都是他的Performance [02:57:02] 所以這是計程車司機的這個例子 [02:57:05] 那還有很多其他的 [02:57:06] 你可以自己去Check一下 [02:57:08] 這些全部都是所謂的 [02:57:11] Agent可能的一個形式 [02:57:13] 好那所以在一個Task Environment裡面 [02:57:17] 他可能有一些屬性 [02:57:18] 你可以把你的問題 [02:57:20] 你可以明確定義出 [02:57:22] 他是Fully Observable [02:57:24] 還是Partially Observable [02:57:25] 你的資訊是全部可被觀察的 [02:57:27] 還是隻有一部分 [02:57:29] 比如說 [02:57:33] 比如說你要開發一個下圍棋的程式 [02:57:38] 下圍棋的時候 [02:57:39] 盤面一定是Fully Observable的嘛 [02:57:41] 對不對 [02:57:42] 你不可以跟人家下棋的時候 [02:57:43] 你故意把你的什麼地方蓋起來 [02:57:45] 不行嘛 [02:57:46] 他一定是Fully Observable [02:57:48] 那有一些情況就不是 [02:57:51] 比如說你開車在路上 [02:57:54] 你很難說你坐在車裡面 [02:57:57] 你360度前後左右上下 [02:57:59] 你全部都看得到 [02:58:00] 所以開車是一個Partially Observable的一個環境 [02:58:05] 然後呢 [02:58:06] 你這個整個運作是Single Agent [02:58:09] 還是Multi Agent [02:58:10] 你是隻有 [02:58:11] 只要處理一個 [02:58:12] 你這個環境裡面只有一個Agent在做事嗎 [02:58:15] 還是有Multi Agent [02:58:16] 比如說下棋對打 [02:58:19] 就是有AB兩個Agent [02:58:22] 在互相 [02:58:24] 運作 [02:58:25] 互相互動 [02:58:27] 那所以這個環境不一樣 [02:58:31] Deterministic或者是Stochastic [02:58:33] 那就是說呢 [02:58:34] 你下完一個動作之後 [02:58:37] 你下一個狀態是一定可被預期的 [02:58:41] 還是它有一些不確定性 [02:58:45] 比如說Taxi Driver其實是Stochastic [02:58:49] Stochastic的意思就是說 [02:58:51] 有不確定性 [02:58:52] 有隨機性 [02:58:54] 你叫它往右轉 [02:58:56] 這個所謂的往右轉 [02:58:58] 是轉一點點呢 [02:59:01] 還是一下子轉很多呢 [02:59:03] 轉得快還是轉得慢呢 [02:59:05] 是不一定的 [02:59:06] 是Stochastic [02:59:08] 那Deterministic是什麼 [02:59:09] 比如說下棋 [02:59:10] 我要在某一個位置下一個黑子 [02:59:13] 它下下去之後 [02:59:15] 它就一定就是黑子會在那個地方 [02:59:17] 它不會有別的情況 [02:59:19] 所以這個都有一些關係 [02:59:22] 我們時間差不多到了啦 [02:59:24] 那所以說呢 [02:59:25] 也許接下來其他的部分呢 [02:59:28] 我們下次再補 [02:59:31] 那第一章跟第二章都是這種聊聊天的 [02:59:34] 真正會比較進入到核心的那種 [02:59:37] 會從第三章開始 [02:59:40] OK [02:59:41] 好 [02:59:42] 一樣最後有沒有什麼問題 [02:59:44] 有一些我都已經回覆很多了 [02:59:47] 那沒有問題的話 [02:59:48] 我們就下禮拜再見 ## 8. 寫作規則 (這是 `_筆記SOP.md` 第 3.1、4、5、6 節的濃縮版。兩者衝突時以 SOP 為準。) 讀者:碩士生,兩門課期末是英文考試。要只看筆記就能學會,講得比老師好懂。畫面要簡潔。 **概念優先(2026-09-26 主理人)**:主理人只想懂概念,不想補數學、不想看程式碼和座標圖。兩門課的考試也都是問答題、不考算式(AI W1 1:16:52;NLP W3 1:47:41、2:48:36)。所以: - 每段預設看得到的只有:白話摘要(2–4 句)+**一句生活比喻**(例:模擬退火像投資理財,年輕時敢冒險、越老越保守)+「考試可能怎麼問」一句。 - 數學推導、公式、手算、程式碼、座標圖,全部收進標題寫「(進階,可跳過)」的摺疊,例如「它到底怎麼運作?(進階,可跳過)」。每段最多一個進階摺疊,不要寫長篇計算。 - 演算法要能「用文字說出步驟」(考試可能要你描述),這一點放在預設看得到的地方,不用數字。 - **重心比例**:白話理論與概念模式(它在解決什麼問題、核心想法、跟別的方法差在哪、優缺點、生活比喻)占主要篇幅;數學與程式細節只用一兩句帶過,細節收進進階摺疊。 **圖文並茂(2026-09-26 主理人:不要只有文字)**: - 每章至少 2–3 個圖,放在**預設看得到**的地方,每個圖前後各用一兩句白話說明「這張圖在看什麼」。 - 流程、步驟、因果、比較 → 用 mermaid 流程圖(```mermaid,flowchart LR 或 TD;節點文字用中文、加雙引號;一張圖不超過 10 個節點)。 - 投影片上的示意圖、架構圖 → 用 [[IMG: …]] 放投影片圖。 - 仍守「每個 ## 段落最多一種視覺元素」。 ### 輸出兩個檔 1. `chNN.md`(Notion 寫法,不含頁面標題),結構固定: - 第一行:章節包第 1 節那行,原樣照抄。 - 第二行起(有數學段才寫):**跳過提示**,每段一行,讓主理人看影片時知道從哪跳到哪。用章節包第 3b 節的候選當提示,對照第 7 節逐字稿確認(只標老師連續講公式、推導、矩陣、微積分、機率計算、程式細節超過約 1 分鐘的段落;概念講解和比喻不算): `跳過提示:(1:31:02–1:35:40) 老師在推導梯度公式,聽不懂可以直接跳到 [1:35:40](YouTube 連結),接著講「步長 α 怎麼選」。` - `## 重點`:三點中文,每點一到兩句。 - `## Exam-ready`:3–10 行英文,**從章節包的投影片文字逐字抄**,每行 `- **Term**: "原句"(Ch3 p.14)`。老師有明確證據才在行尾加 `【老師強調】(h:mm:ss)`。 **每一行下面一定要有一行縮排的中文解釋**(主理人英文不好,看不懂的英文等於沒用): ``` - **Hill climbing**: "It keeps track of one current state and on each iteration moves to the neighboring state with highest value."(Ch4 p.5) - 中文:爬山法只記住「現在這一個狀態」,每一輪都移到分數最高的鄰居。白話:一直往比較高的地方走一步。 ``` 中文要先把句子意思講清楚,再補一句白話;最後用「英文(中文)」列出這句裡 1–3 個難字,例:sparse(稀疏)、distinct terms(不重複的字)。 **一行只放一句投影片原句**。同一頁有多句要考就拆成多行,每行各接一行中文;不要用分號串三句以上,不要把計算量 O(...) 塞進去。 - 章節包第 2 節的每一段:`## [h:mm:ss](連結) 標題`(照抄),下面 2–4 句白話摘要,其餘全部收進摺疊: ```
問句(例:用生活例子講,BFS 在做什麼?) 內容
``` 摺疊種類(需要才放):用生活例子講?/它到底怎麼運作?/要先懂什麼?(老師假設你會的數學或概念,短版教學)/老師原話是什麼?(「原話」(h:mm:ss),只放重要的,最多 5 句)。 - 「它到底怎麼運作?」要用一組小數字把這段的演算法**真的跑 1–3 步**(例:算出梯度、更新一次、比較兩個 α),不是只示範定義的加減乘除。全章盡量沿用同一組數字,讓前一段的答案能在下一段被驗證。 - 每段正文要回答讀者最可能卡住的一個「為什麼」。投影片公式方向跟題目相反、或投影片說「解不出來」時,用一兩句講出原因,自己補的標(我補充)。 - 投影片句子停在公式前(公式在圖裡)時:Exam-ready 在粗體詞條上補公式、引號內保持原句;正文寫出同一條式子。公式圖看章節包第 6 節列出的 PNG。 - `## Self-check`:2–4 題英文考題,答案收摺疊。**至少一題考老師強調的內容**;只出 explain/why/compare 這類問答題,**不出要代數字計算的題目**(考試不考算式);不出「老師和投影片哪裡不同」這類不會考的題目。每題格式: ```
Q1. English question?(中文:中文題目) **Answer**: English answer. 中文:把答案完整講一遍(不是只翻一句),讓看不懂英文的人也知道要怎麼答。
``` - **最後一行**:章節包第 1b 節那行(下一章連結),原樣照抄。讓讀完的人直接點下一章。 - 不要把章節包或這份規則裡的指示句寫進筆記(例如「寫筆記時照投影片寫」「已改正 ASR 錯字」)。 - 長度:全文不超過 16,000 字元(跟 check_note.py 同一個數字)。**不要為了壓字數反覆刪改**(實測一章最多花 12 輪在刪字);超過時只刪進階摺疊裡的第二組算例,比喻、比較表、圖說、「老師說不用背」的提醒都不刪。 - 預設看得到的正文不放計算量 O(...)、代號對照(例如 SMART 字母)、課本出處考據,一律移進進階摺疊。 2. `chNN.concepts.json`:JSON 陣列,4–12 個考試可能問的術語,每個物件: `name`(英文)、`zh`、`type`(概念/演算法/公式/人物事件/前置知識/行政)、`signal`("老師說會考"/"老師強調"/"核心(我判斷)"/"")、`evidence`(有 signal 前兩種時必填:原句+時間)、`definition_en`(投影片原句;沒有就註明 (textbook)/(lecture)/(my wording))、`plain`(一句中文)、`a4`(≤150 字元英文,可夾極短中文;期末拼貼用的小方塊)、`time`、`slides`、`prereq`(英文名陣列)。 ### 風格鐵律 - 不用 emoji 或裝飾符號(✓✗★⚠ 都不要;→ 可以)。不用 callout。不用 `$`。時間不要用 code 樣式。 - 每個 `##` 段落最多一種視覺元素:一張圖、或一個表格、或一個 mermaid。 - 摺疊標題是問句,前面不加符號。 - 圖片最多 3 張,只放文字取代不了的圖。放法:單獨一行 `[[IMG: | 中文圖說]]`,PNG 用 `slides_to_png.py <圖片資料夾> <頁> --dpi=110` 產生。 - 考試訊號只在老師明確說時標。老師只說「不用背」「不講」就寫「注意:……」。 - 老師口誤或跟投影片不同:照投影片寫,加「注意:老師口頭說的是……」。 - 引用老師的話時,ASR 錯字改成正確的字。 ### 沒有投影片時 不要憑記憶逐字重現課本段落或數值表。英文定義用自己的話寫、句尾標 (my wording);Exam-ready 每行標「(自擬,投影片待補)」。例子只用老師講的。 ### 寫完之後(只做一次) 跑檢查: `C:\Users\user\.cache\meeting-record\venv\Scripts\python.exe C:\Users\user\.claude\scripts\check_note.py --transcript <逐字稿> --slides <投影片 txt …> --start <起> --end <訖> --vid <影片 ID>` - STYLE/VISUAL/TIME/FORMAT:全部改掉。 - QUOTE:確認是不是你改正了 ASR 錯字(是就保留),不是就改成原文或拿掉引號。 - ENGLISH:確認是不是投影片斷行造成的(是就保留),不是就改成投影片原句。 **省額度守則**:章節包裡已經有你需要的全部資料。不要再去讀整份逐字稿、整份投影片、segments.json 或手冊。一次寫好整個檔(Write 一次),檢查後集中修改。