# 章節包:人工智慧導論(AI)W1(9/10)第 05 章「Agent、理性與任務環境」
影片 2:42:08–2:59:48,YouTube ID KWGgi100YLY。Notion 章節頁 https://app.notion.com/p/3e7fc631b0308166ab40e7f402602f69(頁 ID 3e7fc631-b030-8166-ab40-e7f402602f69),頁面標題「05 Agent、理性與任務環境(2:42–2:59)」。
## 1. 第一行(直接照抄,不要改)
[人工智慧導論](https://app.notion.com/p/3e6fc631b0308131b213f0a3d93fe91d) › [W1(9/10)](https://app.notion.com/p/3e7fc631b03081309a2adad7f8ae1e27) › 05|影片 [2:42:08–2:59:48](https://www.youtube.com/watch?v=KWGgi100YLY&t=9728s)|投影片 Ch2 p.2–12|上一章 [04 深度學習崛起與 AI 風險(2:07–2:31)](https://app.notion.com/p/3e7fc631b030813ba471f1cdc276f72c)|下一章 無
## 1b. 最後一行(直接照抄,放在 Self-check 後面,當全頁最後一行)
這週讀完了。下一週第一章:[01 HW1 提案寫法與分組(0:01–0:13)](https://app.notion.com/p/3e6fc631b030816cb5e8d1b405b4349e)|回到週頁:[W1(9/10)](https://app.notion.com/p/3e7fc631b03081309a2adad7f8ae1e27)
## 2. 各段標題(照順序;每段一個 ## 標題,直接照抄連結)
- `## [2:42:08](https://www.youtube.com/watch?v=KWGgi100YLY&t=9728s) Agent 不是新名詞` 老師講什麼:老師說 Ch2 也偏聊天;agent 這個概念在 AI 領域已經存在幾十年,不是 LLM 時代才出現的。
- `## [2:44:02](https://www.youtube.com/watch?v=KWGgi100YLY&t=9842s) Agent 的定義` 老師講什麼:透過 sensors 感知環境、透過 actuators 對環境採取行動的任何東西都是 agent,可以是系統、機器、一段程式甚至一個函式。sensor 不限溫度或濕度感測器,動作也可以只是回傳一串資料。
- `## [2:45:16](https://www.youtube.com/watch?v=KWGgi100YLY&t=9916s) Percept 與 agent function` 老師講什麼:agent 感知到的輸入叫 percept;agent function 就是把感知到的東西(percept sequence)對應到要做的動作。
- `## [2:46:28](https://www.youtube.com/watch?v=KWGgi100YLY&t=9988s) 吸塵器世界與查表的問題` 老師講什麼:世界只有 A、B 兩塊地磚,吸塵器可以左移、右移、吸塵或不動;最簡單的規則是「髒就吸,不然換到另一格」。如果加上時間維度,把所有情況列成表格會長到寫不完,所以用查表寫 agent 不是好辦法。
- `## [2:50:03](https://www.youtube.com/watch?v=KWGgi100YLY&t=10203s) 理性要看效能怎麼定義` 老師講什麼:rational agent 就是「把事情做對」:在已知資訊下讓效能最大。效能要依你想要的環境結果來定義,而不是規定 agent 該怎麼動;同一台吸塵器理不理性要「看情況」:目標是吸最多灰塵、維持地板乾淨,還是省電,答案都不同。
- `## [2:53:14](https://www.youtube.com/watch?v=KWGgi100YLY&t=10394s) 全知、學習與自主` 老師講什麼:老師口頭用 omniscient 描述「環境裡所有資訊都知道」,舉 NVIDIA 的 Omniverse 為例;課本的意思是理性不要求全知。理性 agent 還要能從經驗學習、自主補足不完整或錯誤的先驗知識。
- `## [2:55:04](https://www.youtube.com/watch?v=KWGgi100YLY&t=10504s) PEAS:計程車司機` 老師講什麼:描述任務環境要列出 Performance、Environment、Actuators、Sensors。計程車例子:環境是路況、紅綠燈、行人;動作是方向盤、油門、煞車;感測器是攝影機、GPS、速度計等;效能可以是最快、最順或最省錢。
- `## [2:57:15](https://www.youtube.com/watch?v=KWGgi100YLY&t=10635s) 環境屬性:前三組` 老師講什麼:fully vs partially observable(圍棋盤面全看得到,開車看不到全部)、single vs multi-agent(下棋有兩個 agent 互動)、deterministic vs stochastic(落子結果確定,開車轉向有不確定性)。其餘屬性下週再講。
## 3. 老師強調/會考/不考的地方(原句已驗證;寫進筆記時 ASR 錯字要改正)
- (2:50:21) [強調] 「最能夠落地應用的是所謂的rational agent的這一個派別」 → 再次提到 rational agent 是最能落地的一派(和 1:44:52 重複)
## 3b. 數學段候選(程式抓的,只是提示;寫「跳過提示」行用)
0 段候選(門檻 3.0 字/30 秒)
## 4. 這章摘要與重要度
定義 agent、percept 與 agent function,用吸塵器世界說明理性要看效能怎麼定義,再介紹全知與學習、PEAS 與前三組環境屬性。(核心)
## 5. 整堂課的提醒(ASR 錯字、老師口誤、投影片缺公式等;只用跟這章有關的)
- 影片 0:00:00–0:08:21 是在設定直播,沒有上課內容,直接從 0:08:21 開始看。
- 01 章(0:08–1:20)是行政:考試日期、作業時程、評分比例已經整理在課程頁,這章只補課程頁沒有的(衛星課程、選題建議、這門課教什麼不教什麼、Slido 問答精選)。
- 朝陽科大是衛星學校:作業和學期分數由朝陽的協同教師陳榮靜老師負責(逐字稿 ASR 寫成「長陽科大的陳榮進老師」,0:14:32)。
- 老師說 Ch1、Ch2 都偏「聊聊天」,真正核心從 Ch3 開始(2:59:31)。這週 Ch2 只講到 p.12,p.13 起在 W2 接著講。
- 本機的 Lecture 0 投影片 PDF 是去年版(p.2 寫 114 學年、p.19 寫 12/11 考試與 12/18 報告);今年老師口頭說的是 12/10 考試、12/24 報告,以老師口頭與 NTU COOL 為準。
- ASR 人名校名:「長陽科大的陳榮進」=朝陽科大陳榮靜(0:14:32);「鎮丘科大的施松春」=正修科大施松村;「高雄科大的蕭宏傑」投影片(去年版)寫戴鴻傑,今年是否換人不確定。
- ASR 術語:混程式授權=混成式授權;系統老師=協同教師;頭影片=投影片;TICA/拍卡=TAICA;期末卡=期末考;志工系館=資訊系館;AIDAIGOCAGO=Aidea、Aigo、Kaggle;Engineering AI/EngineeringAgent=Agentic AI;ntu庫/ntu酷/MTU COOL=NTU COOL;ChainGPT=ChatGPT;Olama=Ollama。
- ASR 歷史人名:McClouch/Macroch=McCulloch;Dim Edelman=Dean Edmonds;Marvin Vinsky=Minsky;Claudius Shannon=Claude Shannon;Harper Simon=Herbert Simon;Prowe=Judea Pearl;Yashua Bejo=Yoshua Bengio;Bartol=Barto;Rison and Hall=Bryson and Ho;Dendro=DENDRAL;MindC=MYCIN;Base Network=Bayesian network;被propagation=back-propagation;Geometric Theory Prover=Geometry Theorem Prover;ImgNet/Ingenet=ImageNet;Lewis/New Year's=NeurIPS;Hawking Face=Hugging Face。
- ASR Ch2:a curator/Equator=actuator;「回答他們提出一個系統叫Onimus/Oniverse」應是「輝達(NVIDIA)提出的 Omniverse」(2:53:52,推測);CyberCat=Tesla Cybercab;Athropic Cloud=Anthropic Claude。
- 老師口誤:2:06:22 說「billions of dollars in 1980年」,投影片 p.21 是 1988;0:47:36 說 ChatGPT「大概在 2020 年左右」出來,實際是 2022 年 11 月;2:15:14 附近說訓練出「語音辨識」模型,前後文是 ImageNet 影像辨識。
- Samuel 的程式投影片 p.15 寫 checkers(西洋棋),但 checkers 其實是西洋跳棋,老師口頭也說西洋棋;考試寫 checkers。
- Omniscience:老師口頭(2:53:45)講的 omniscient 比較像 fully observable(環境資訊全都知道);課本 p.7 的意思是「知道行動的真實結果」,並說理性不要求全知(rationality maximizes expected performance, while perfection maximizes actual performance)。考試寫課本版。
- 老師提到的 2026 年新聞(GPT-6 Astra、OpenAI 模型逃出沙盒侵入 Hugging Face、Meta 記錄員工滑鼠軌跡訓練模型)無法查證,筆記只當老師舉的例子轉述,不當事實寫。
- 本機 Lecture 0 PDF 是去年版:p.3 衛星學校列了 5 所(含南臺科大),今年老師口頭說只有 4 所(臺中科大、高雄科大、朝陽科大、正修科大);p.19 日期 12/11、12/18 也是去年的,今年是 12/10 考試、12/24 報告。
- Lecture 0 p.17 的圖(AI ⊃ ML ⊃ DL ⊃ GenAI)在本機是去年版;老師說今年的投影片在 GenAI 裡多畫了 Agentic AI(0:47:59)。
## 6. 投影片文字(這章範圍)
**這幾頁的公式或內容只在圖裡(文字檔抓不到),寫 Exam-ready 與公式前先用 Read 看這幾張圖:**
- Ch2 p.4 → C:\D槽\TAICA課程\_work\notes-v2\ai-w1\img\brief_Ch2_p004.png
- Ch2 p.6 → C:\D槽\TAICA課程\_work\notes-v2\ai-w1\img\brief_Ch2_p006.png
- Ch2 p.7 → C:\D槽\TAICA課程\_work\notes-v2\ai-w1\img\brief_Ch2_p007.png
- Ch2 p.8 → C:\D槽\TAICA課程\_work\notes-v2\ai-w1\img\brief_Ch2_p008.png
- Ch2 p.9 → C:\D槽\TAICA課程\_work\notes-v2\ai-w1\img\brief_Ch2_p009.png
- Ch2 p.10 → C:\D槽\TAICA課程\_work\notes-v2\ai-w1\img\brief_Ch2_p010.png
- Ch2 p.11 → C:\D槽\TAICA課程\_work\notes-v2\ai-w1\img\brief_Ch2_p011.png
- Ch2 p.12 → C:\D槽\TAICA課程\_work\notes-v2\ai-w1\img\brief_Ch2_p012.png
--- Ch2 p.2 ---
• An agent is anything that can be viewed as perceiving its environment
through sensors and acting upon that environment through actuators (促動
器).
Agents and Environments
2
--- Ch2 p.3 ---
• The term percept refers to the agent’s perceptual inputs at any given instant.
• An agent’s behavior is described by the agent function that maps any given
percept sequence to an action.
• A very simple example—the vacuum-cleaner world
Agents and Environments
3
--- Ch2 p.4 ---
• It can choose to move left, move right, suck up the dirt, or do nothing. One
very simple agent function: if the current square is dirty, then suck; otherwise,
move to the other square.
• What is the right way to fill out the table? What makes an agent good or bad,
intelligent or stupid?
Agents and Environments
4
--- Ch2 p.5 ---
• A rational agent is one that does the right thing.
• Right thing: The agent’s actions causes the environment to go through a
sequence of states. If the sequence is desirable, then the agent has performed
well. This notion of desirability is captured by a performance measure that
evaluates any given sequence of environment states.
• It is better to design performance measures according to what one actually
wants in the environment, rather than according to how one thinks the agent
should behave.
The Concept of Rationality
5
--- Ch2 p.6 ---
• Definition of a rational agent
• For each possible percept sequence, a rational agent should select an
action that is expected to maximize its performance measure, given the
evidence provided by the percept sequence and whatever built-in
knowledge the agent has.
• Consider the simple vacuum-cleaner agent. Is this a rational agent? That
depends!
• Performance measure: the amount of dirt being cleaned up
• Performance measure: a clean floor
Rationality
6
--- Ch2 p.7 ---
• Rationality maximizes expected performance, while perfection maximizes
actual performance.
• Our definition of rationality does not require omniscience (全知), because the
rational choice depends only on the percept sequence to date.
• Our definition requires a rational agent not only to gather information but
also to learn as much as possible from what it perceives.
Omniscience, Learning, and Autonomy
7
--- Ch2 p.8 ---
• A rational agent should be autonomous—it should learn what it can to
compensate for partial or incorrect prior knowledge.
• A vacuum-cleaning agent that learns to foresee where and when additional
dirt will appear will do better than one that does not.
• The incorporation of learning allows one to design a single rational agent that
will succeed in a vast variety of environments.
Omniscience, Learning, and Autonomy
8
--- Ch2 p.9 ---
• Task environment: we have to specify the performance measure, the
environment, and the agent’s actuators and sensors.
• PEAS (Performance, Environment, Actuators, Sensors)
Task Environments
9
--- Ch2 p.10 ---
Task Environments
10
[IMAGE-ONLY]
--- Ch2 p.11 ---
• Fully observable vs. partially observable
• Fully observable: if the sensors detect all aspects that are relevant to the
choice of action
• Single agent vs. multiagent
• The key distinction is whether B’s behavior is best described as
maximizing a performance measure whose value depends on agent A’s
behavior.
• Chess is a competitive multiagent environment
Properties of Task Environments
11
--- Ch2 p.12 ---
• Deterministic vs. stochastic
• If the next state of the environment is completely determined by the
current state and the action executed by the agent, then we say the
environment is deterministic; otherwise, it is stochastic.
• Taxi driving is clearly stochastic
• “Stochastic” generally implies that uncertainty about outcomes is
quantified in terms of probabilities
Properties of Task Environments
12
## 7. 逐字稿(2:42:08 前後各多 1 分鐘,原始行)
[02:42:08] 十幾分鐘時間
[02:42:10] 稍微講一下第二章
[02:42:12] 第二章呢
[02:42:18] 基本上也是在聊聊天的啦
[02:42:20] 好第二章
[02:42:22] 不見了
[02:42:57] OK好來
[02:42:59] 那我們第二章呢
[02:43:00] 要講的是Intelligent Agents
[02:43:03] 你看到這個
[02:43:05] 這個Chapter的Title
[02:43:07] 老師你不是說
[02:43:08] 不教一些最新的東西嗎
[02:43:10] 不是說不教Agent嗎
[02:43:12] 怎麼第二章就開始Intelligent Agents
[02:43:15] 事實上自己就
[02:43:16] 跟大家證明說
[02:43:18] 跟大家說明說
[02:43:19] 事實上代理人
[02:43:21] 或者是所謂的Agent這個觀念
[02:43:24] 是一個
[02:43:26] AI這個研究領域裡面
[02:43:29] 一直以來維持的一個概念
[02:43:31] 本來就已經有一個概念
[02:43:33] 那只是說在最近幾年
[02:43:36] 在這個世界
[02:43:39] 大家是要Large Language Model
[02:43:42] 來去實現出
[02:43:45] 你覺得所謂的Agent
[02:43:47] 就一定是現在GPT
[02:43:49] 所做的這些
[02:43:51] 或者是Cloud
[02:43:52] Athropic Cloud
[02:43:53] 他們在做的這些事情
[02:43:55] 但其實Agent這個概念
[02:43:58] 老早在幾十年來
[02:44:00] 就一直都有
[02:44:02] 好來
[02:44:03] 那我們來講一下
[02:44:04] 一個Agent
[02:44:06] Agent可以是任何的東西
[02:44:08] Anything
[02:44:09] Agent is anything
[02:44:10] that can be viewed as
[02:44:11] perceiving its environment
[02:44:13] through sensors
[02:44:16] and acting upon that environment
[02:44:19] through a curator
[02:44:21] Agent呢
[02:44:22] 就是在一個環境裡面
[02:44:25] 可以透過感測器
[02:44:28] 來感知到一些訊息
[02:44:31] 然後依照這些訊息
[02:44:33] 做一些動作的東西
[02:44:36] 都叫做Agent
[02:44:38] OK
[02:44:39] 聽起來非常的廣泛吧
[02:44:40] 好
[02:44:41] 那一般來講
[02:44:42] 你就把它想像成
[02:44:43] 它就是一個系統
[02:44:46] 或者是一個機器設備
[02:44:48] 或者說根本就只是一段程式
[02:44:51] 或者說根本就是
[02:44:52] 你所撰寫的某一個Function
[02:44:55] 某一個含釋
[02:44:56] 這些都可以是Agent
[02:44:59] 那這個Sensor
[02:45:00] 這個感測器
[02:45:01] 大家也不要覺得說
[02:45:02] 講的就是溫度感測器
[02:45:04] 濕度感測器喔
[02:45:05] 不是
[02:45:06] 你只要能夠感受到
[02:45:08] 某一個定義的範圍內的資訊
[02:45:13] 都是叫感測器
[02:45:15] OK
[02:45:16] 所以如果說
[02:45:21] 如果說畫一個示意圖的話
[02:45:24] 就像底下的這一個
[02:45:26] 一個Agent就是在一個環境裡面
[02:45:28] 那我們可以感測到一些資訊
[02:45:31] 然後呢感測到資訊之後呢
[02:45:33] 透過一個
[02:45:35] 某一種Function
[02:45:37] 或某一種邏輯
[02:45:38] 或某一個模型
[02:45:40] 來推動我的Equator
[02:45:43] Equator可能是在做一個動作
[02:45:46] 那這個動作也不見得一定是什麼
[02:45:47] 機器手臂怎麼移動喔
[02:45:49] 可能我只是在回傳一串資料
[02:45:51] 也是一個動作
[02:45:54] 這樣懂我意思嗎
[02:45:55] 所以它非常非常廣泛
[02:45:58] 那感受Perceive這個詞呢
[02:46:02] 它可以是很廣泛的
[02:46:05] 你任何的Input的形式都可以
[02:46:08] 那你感受到這個環境的資訊之後
[02:46:11] 你就透過一個Agent Function
[02:46:14] 你輸入這個感測的結果
[02:46:16] 你就會輸出你要做的動作
[02:46:19] Again這個動作不見得一定是移動
[02:46:23] 不見得一定是什麼
[02:46:25] 可能只是傳一個資料都是
[02:46:28] 好那為了讓大家知道一個
[02:46:31] 這是舉一個例子啦
[02:46:33] 這個例子呢
[02:46:34] 在本課本裡面
[02:46:35] 在未來會出現好幾次
[02:46:37] 就是一個非常簡單的吸塵器的例子
[02:46:40] 假設呢這個世界裡面呢
[02:46:42] 只有兩塊地磚A跟B
[02:46:45] 這兩塊地磚呢
[02:46:46] 地上都有可能有髒東西有灰塵
[02:46:50] 那這個吸塵器它可以做的事情就是
[02:46:53] 它可以吸塵
[02:46:55] 它也可以往右走
[02:46:57] 也可以往左走
[02:46:58] 這個就是它會做的事情
[02:47:00] 所以你看喔在這個來
[02:47:01] 以這個角度來講
[02:47:03] 這個環境就是兩塊地磚
[02:47:06] 這個世界就是兩塊地磚
[02:47:08] 這個Agent呢
[02:47:10] 其實就是運作在這個吸塵器上面
[02:47:15] 那這個吸塵器可能
[02:47:17] 根據你吸塵器的功能啊
[02:47:19] 你吸塵器可能可以感測的到
[02:47:23] 我現在所在地有沒有灰塵
[02:47:27] 那它可以移動它可以吸塵
[02:47:30] 它也可以左右移動這樣
[02:47:32] 那所以這裡就講說它可以往左移
[02:47:34] 往右移可以吸塵
[02:47:35] 或者說它根本什麼事都不做
[02:47:37] 這個就是一個Agent
[02:47:40] 那一個很簡單的一個Agent function
[02:47:43] 我們剛剛講Agent function是什麼
[02:47:45] Agent function就是說
[02:47:46] 當你感知到一些資訊之後
[02:47:48] 你要做什麼動作
[02:47:49] 你這中間的mapping
[02:47:51] 你從感知的資訊到做出什麼動作
[02:47:53] 這中間的mapping就叫做Agent function
[02:47:57] 一個非常簡單的Agent function就是說
[02:47:59] 我如果感知到我目前所在的
[02:48:02] 地磚是髒的
[02:48:04] 那我就吸塵
[02:48:05] 不然呢
[02:48:06] 我就移到另外一塊地磚
[02:48:08] 這是廢話嗎
[02:48:09] 這就是一個最最簡單的一個Agent function
[02:48:13] 好那可是實際上
[02:48:18] 這個是一個空間裡面
[02:48:22] 某一個瞬間
[02:48:24] 有兩塊地磚
[02:48:25] 那有可能有髒的有不髒的
[02:48:27] 那如果我們再多一個維度
[02:48:29] 是時間的話呢
[02:48:30] 比如說
[02:48:32] 經過五秒後
[02:48:34] 本來A地磚被你吸乾淨了
[02:48:36] 搞不好
[02:48:37] 我就
[02:48:38] 我吸乾淨了
[02:48:39] 我就跑到B地磚去嘛
[02:48:41] 搞不好五秒之後呢
[02:48:42] 天上又掉下來一些灰塵
[02:48:44] 又落在A地磚上面
[02:48:45] 所以A地磚可能又髒啊
[02:48:47] 所以說你再多一個維度
[02:48:48] 如果考慮到時間的話
[02:48:50] 你要在所有的時間
[02:48:52] 都要把
[02:48:54] 這個地都吸乾淨的話
[02:48:56] 那你可能
[02:48:57] 你如果用一個最笨的一個方法
[02:48:59] 你可能就要列出一個表格
[02:49:01] 是一個包含所有時間的一個表格
[02:49:06] 比如說
[02:49:07] 我在某一個瞬間
[02:49:08] 我可能是
[02:49:09] 我感測到我在A地磚
[02:49:11] 那它是乾淨的
[02:49:12] 那我就往右移
[02:49:13] 我可能在A地磚它是髒的
[02:49:15] 那我就吸塵
[02:49:16] 我在B地磚乾淨的
[02:49:18] 我就往左移
[02:49:19] 我是B地磚髒的
[02:49:21] 我就往右移
[02:49:22] 我如果在第一個時間
[02:49:24] 這時候多了一個時間的維度
[02:49:25] 第一個時間A地磚是乾淨的
[02:49:28] 然後呢
[02:49:30] 我可能
[02:49:32] 不動
[02:49:33] 或者怎麼樣
[02:49:34] 或者說我在第二個時間
[02:49:36] 它也是乾淨的
[02:49:38] 那我才往右移
[02:49:40] 依此類推
[02:49:41] 你可以把這個
[02:49:42] table寫得非常的長
[02:49:44] 來cover所有可能
[02:49:46] 在任何時間點
[02:49:47] 它可能連續時間
[02:49:49] 它可能出現了一個情況
[02:49:51] 那這個表格就寫得太長了
[02:49:54] 所以很顯然的
[02:49:55] 寫一個規則
[02:49:57] 來處理一個
[02:49:59] agent system
[02:50:00] 可能不是一個很好的一個選擇
[02:50:03] 好
[02:50:04] 那這時候我們就要代入到
[02:50:05] 剛剛我們前面介紹過
[02:50:07] agent呢
[02:50:10] 當我們在定義AI的時候
[02:50:12] 我們可以從怎麼進行思考
[02:50:14] 以及怎麼樣進行行為
[02:50:17] 這兩個不同的角度
[02:50:18] 其中我們
[02:50:19] 剛剛講的就是說
[02:50:21] 最能夠落地應用的
[02:50:24] 是所謂的rational agent的
[02:50:27] 這一個派別
[02:50:28] 它的意思就是說
[02:50:30] 它只要做出來的行為
[02:50:33] 是理性的
[02:50:35] 這樣子的話
[02:50:37] 我們就稱呼它是一個
[02:50:38] 可用的一個AI系統
[02:50:40] 那什麼叫做理性的agent呢
[02:50:44] 那就是它會把事情做對
[02:50:47] 怎麼樣叫做做對呢
[02:50:49] 那就是在你有限
[02:50:50] 你所取得的資訊的情況之下
[02:50:52] 它能夠盡可能的
[02:50:54] 讓它的效能最大化
[02:50:57] 那我們就說
[02:50:59] 這樣子的agent
[02:51:00] 是一個理性的agent
[02:51:02] 好
[02:51:03] 那接下來問題連環問
[02:51:05] 那什麼叫做效能最大化呢
[02:51:08] 那就看你怎麼去定義效能這件事情
[02:51:11] 定義效能這件事情
[02:51:13] 所以
[02:51:15] 所以呢
[02:51:16] 我們最好是定義出一個
[02:51:18] 效能的評判方式
[02:51:19] 而不是去定義
[02:51:21] 你這個agent
[02:51:22] 應該要怎麼去移動
[02:51:24] 怎麼去進行行為
[02:51:26] 講到這邊
[02:51:27] 大家有沒有覺得
[02:51:28] 我好像都是在講一些非常虛無縹緲的東西
[02:51:32] 到底在講什麼
[02:51:34] 但是我們這本書
[02:51:36] 因為畢竟是聖經本嘛
[02:51:37] 所以它前面都是屬於
[02:51:39] 很多這樣的一個描述
[02:51:41] 所以一個理性的agent
[02:51:43] 就是要去最大化它的效能
[02:51:46] 比如說
[02:51:49] 比如說一個
[02:51:50] 在剛剛的這個吸塵器的例子裡面
[02:51:54] 到底這個吸塵器
[02:51:56] 這個
[02:51:57] 如果
[02:51:58] 我現在的地磚是髒的
[02:52:00] 我就吸
[02:52:01] 不然呢
[02:52:02] 我就移到另外一塊地磚
[02:52:03] 請問
[02:52:04] 這樣子的吸塵器
[02:52:05] 是不是一個理性的吸塵器
[02:52:07] 是不是呢
[02:52:09] 答案是
[02:52:11] Depends
[02:52:13] 不一定
[02:52:14] 為什麼
[02:52:15] 因為根據你怎麼去定義你的效能
[02:52:17] 我們才能夠說它是不是夠理性
[02:52:20] 比如說
[02:52:21] 你的效能可能是
[02:52:22] 你能夠吸到的灰塵的最大的
[02:52:25] 你最多能夠吸多少灰塵的
[02:52:26] 我希望你能夠吸最多的灰塵
[02:52:31] 那就應該是怎麼樣
[02:52:32] 就是說
[02:52:33] 我應該一直不斷的左右移左右移
[02:52:36] 無時無刻一直在移
[02:52:37] 然後一直吸一直吸
[02:52:39] 這可能才會最大化你的效能
[02:52:42] 那也有可能是
[02:52:44] 我的目標是
[02:52:45] 我只要有一個
[02:52:47] 在某一個瞬間
[02:52:48] 有一個乾淨的地板
[02:52:49] 這樣就好啦
[02:52:50] 所以你能夠維持
[02:52:52] 越多時間是有乾淨地板的
[02:52:55] 那這可能也是一種效能模式
[02:52:57] 那或者是說呢
[02:52:58] 它現在已經快沒電了
[02:53:00] 你要進入省電模式
[02:53:02] 你要盡可能的少移動
[02:53:04] 這可能也是一種效能的一個最大化
[02:53:07] 所以說
[02:53:08] Rational Agents
[02:53:09] 到底一個Agent是不是Rational
[02:53:11] 其實是要根據你的效能怎麼定義而定
[02:53:14] 好
[02:53:15] 那當我們在考慮
[02:53:17] 這個所謂的效能的時候呢
[02:53:19] 我們有時候還要參考到
[02:53:23] 這整個環境
[02:53:25] 是不是
[02:53:27] 我們一直在講說
[02:53:29] 我們能夠感知到的資訊嗎
[02:53:31] 你感知到的資訊有分成
[02:53:34] 你到底是全部都感知到的
[02:53:36] 還是說你只能夠感知到部分的資訊
[02:53:39] 所以
[02:53:41] 有一些情境之下
[02:53:43] 它是所謂的
[02:53:45] Omniscient
[02:53:46] 全知全能的
[02:53:48] 意思是說
[02:53:49] 這個環境底下
[02:53:50] 我所有的資訊我都知道
[02:53:52] 大家是不是知道這個
[02:53:55] 回答他們提出一個系統
[02:53:57] 叫Onimus
[02:53:58] Oniverse
[02:53:59] Oniverse就是說一個虛擬的空間當中
[02:54:01] 事實上裡面的物件
[02:54:03] 都是模擬出來的
[02:54:04] 所有的參數全部都知道
[02:54:06] 所以他取這個名字
[02:54:07] Oniverse
[02:54:08] 那這Omniscient只是指說
[02:54:10] 我在這個某一個環境之下
[02:54:12] 他所有該得到的資訊都知道
[02:54:15] 這是一種狀況
[02:54:16] 也有可能是
[02:54:17] 我只知道部分資訊
[02:54:20] 那我們當然是希望說一個
[02:54:23] 更有更為有用的Rational Agents
[02:54:25] 他不只是會收集資訊
[02:54:27] 他還能夠根據
[02:54:29] 收集資訊做出理性的判斷
[02:54:31] 而且呢
[02:54:32] 他最好是能夠根據
[02:54:34] 過去的歷史
[02:54:36] 來學會
[02:54:37] 我剛剛以為
[02:54:39] 這樣子是一個最理性的判斷
[02:54:40] 其實到後來
[02:54:41] 我收集到更多資訊
[02:54:43] 看了更多的時間之後
[02:54:44] 我能夠做出來的判斷
[02:54:46] 所以說呢
[02:54:48] 我們也會希望
[02:54:50] 我們的Rational Agent
[02:54:51] 是有自動化的
[02:54:53] 他能夠
[02:54:54] Learn what he can do
[02:54:56] to compensate for partial
[02:54:58] or incorrect prior knowledge
[02:55:01] 那他需要具備有一些
[02:55:03] 學習的一個能力
[02:55:04] 好來這裡舉個例子
[02:55:07] 到底Agent可以有哪些情況呢
[02:55:10] 基本上我們在描述一個Agent的時候
[02:55:13] 我們可能會同時考慮的
[02:55:15] 的東西是PEAS
[02:55:18] Performance Environment Actuator & Sensor
[02:55:22] 比如說計程車司機
[02:55:25] 其實就是一種Agent
[02:55:27] 他的Environment是什麼
[02:55:30] 當然就是路上
[02:55:31] 他的這個道路的情況
[02:55:34] 路面的情況啦
[02:55:36] 紅綠燈啦
[02:55:38] 有沒有行人啊
[02:55:40] 旁邊有沒有其他人在騎腳踏車
[02:55:42] 這個就是他所面臨的環境
[02:55:45] 然後他的Actuator
[02:55:46] 他可以做什麼
[02:55:48] 他可以做的就是
[02:55:49] 轉動方向盤
[02:55:50] 加速跟煞車
[02:55:52] 對不對
[02:55:54] 然後他的Sensor是什麼
[02:55:56] 你要做一個系統
[02:56:00] 能夠像一個計程車司機
[02:56:02] 你的Sensor
[02:56:03] 如果一般的真人的計程車司機
[02:56:05] 他大概就是他的Sensor就是
[02:56:07] 他看得到聽得到
[02:56:09] 聞得到頂多
[02:56:11] 好那如果是像現在CyberCat
[02:56:13] 有沒有Tesla的CyberCat出來了
[02:56:16] 他就像一個計程車司機
[02:56:18] 他的Sensor可能就會有攝影機
[02:56:20] 有聲浪
[02:56:22] 有速度儀
[02:56:23] 有GPS
[02:56:24] 有加速器
[02:56:25] 等等等等等等的
[02:56:27] 當然CyberCat是目前
[02:56:29] 可能很多東西這裡沒有啦
[02:56:31] 好那他的Performance是什麼呢
[02:56:33] 評判一個計程車司機的效能
[02:56:37] 你可以有很多不同的評判方法
[02:56:39] 比如說我現在要去桃園機場
[02:56:41] 你用最快的方式給我過去
[02:56:43] 所以可能是抵達的時間
[02:56:45] 要越短越好
[02:56:47] 那有可能是
[02:56:49] 我走的路要能夠越通順越好
[02:56:53] 也有可能是
[02:56:55] 我花的錢越少越好
[02:57:00] 這可能都是他的Performance
[02:57:02] 所以這是計程車司機的這個例子
[02:57:05] 那還有很多其他的
[02:57:06] 你可以自己去Check一下
[02:57:08] 這些全部都是所謂的
[02:57:11] Agent可能的一個形式
[02:57:13] 好那所以在一個Task Environment裡面
[02:57:17] 他可能有一些屬性
[02:57:18] 你可以把你的問題
[02:57:20] 你可以明確定義出
[02:57:22] 他是Fully Observable
[02:57:24] 還是Partially Observable
[02:57:25] 你的資訊是全部可被觀察的
[02:57:27] 還是隻有一部分
[02:57:29] 比如說
[02:57:33] 比如說你要開發一個下圍棋的程式
[02:57:38] 下圍棋的時候
[02:57:39] 盤面一定是Fully Observable的嘛
[02:57:41] 對不對
[02:57:42] 你不可以跟人家下棋的時候
[02:57:43] 你故意把你的什麼地方蓋起來
[02:57:45] 不行嘛
[02:57:46] 他一定是Fully Observable
[02:57:48] 那有一些情況就不是
[02:57:51] 比如說你開車在路上
[02:57:54] 你很難說你坐在車裡面
[02:57:57] 你360度前後左右上下
[02:57:59] 你全部都看得到
[02:58:00] 所以開車是一個Partially Observable的一個環境
[02:58:05] 然後呢
[02:58:06] 你這個整個運作是Single Agent
[02:58:09] 還是Multi Agent
[02:58:10] 你是隻有
[02:58:11] 只要處理一個
[02:58:12] 你這個環境裡面只有一個Agent在做事嗎
[02:58:15] 還是有Multi Agent
[02:58:16] 比如說下棋對打
[02:58:19] 就是有AB兩個Agent
[02:58:22] 在互相
[02:58:24] 運作
[02:58:25] 互相互動
[02:58:27] 那所以這個環境不一樣
[02:58:31] Deterministic或者是Stochastic
[02:58:33] 那就是說呢
[02:58:34] 你下完一個動作之後
[02:58:37] 你下一個狀態是一定可被預期的
[02:58:41] 還是它有一些不確定性
[02:58:45] 比如說Taxi Driver其實是Stochastic
[02:58:49] Stochastic的意思就是說
[02:58:51] 有不確定性
[02:58:52] 有隨機性
[02:58:54] 你叫它往右轉
[02:58:56] 這個所謂的往右轉
[02:58:58] 是轉一點點呢
[02:59:01] 還是一下子轉很多呢
[02:59:03] 轉得快還是轉得慢呢
[02:59:05] 是不一定的
[02:59:06] 是Stochastic
[02:59:08] 那Deterministic是什麼
[02:59:09] 比如說下棋
[02:59:10] 我要在某一個位置下一個黑子
[02:59:13] 它下下去之後
[02:59:15] 它就一定就是黑子會在那個地方
[02:59:17] 它不會有別的情況
[02:59:19] 所以這個都有一些關係
[02:59:22] 我們時間差不多到了啦
[02:59:24] 那所以說呢
[02:59:25] 也許接下來其他的部分呢
[02:59:28] 我們下次再補
[02:59:31] 那第一章跟第二章都是這種聊聊天的
[02:59:34] 真正會比較進入到核心的那種
[02:59:37] 會從第三章開始
[02:59:40] OK
[02:59:41] 好
[02:59:42] 一樣最後有沒有什麼問題
[02:59:44] 有一些我都已經回覆很多了
[02:59:47] 那沒有問題的話
[02:59:48] 我們就下禮拜再見
## 8. 寫作規則
(這是 `_筆記SOP.md` 第 3.1、4、5、6 節的濃縮版。兩者衝突時以 SOP 為準。)
讀者:碩士生,兩門課期末是英文考試。要只看筆記就能學會,講得比老師好懂。畫面要簡潔。
**概念優先(2026-09-26 主理人)**:主理人只想懂概念,不想補數學、不想看程式碼和座標圖。兩門課的考試也都是問答題、不考算式(AI W1 1:16:52;NLP W3 1:47:41、2:48:36)。所以:
- 每段預設看得到的只有:白話摘要(2–4 句)+**一句生活比喻**(例:模擬退火像投資理財,年輕時敢冒險、越老越保守)+「考試可能怎麼問」一句。
- 數學推導、公式、手算、程式碼、座標圖,全部收進標題寫「(進階,可跳過)」的摺疊,例如「它到底怎麼運作?(進階,可跳過)」。每段最多一個進階摺疊,不要寫長篇計算。
- 演算法要能「用文字說出步驟」(考試可能要你描述),這一點放在預設看得到的地方,不用數字。
- **重心比例**:白話理論與概念模式(它在解決什麼問題、核心想法、跟別的方法差在哪、優缺點、生活比喻)占主要篇幅;數學與程式細節只用一兩句帶過,細節收進進階摺疊。
**圖文並茂(2026-09-26 主理人:不要只有文字)**:
- 每章至少 2–3 個圖,放在**預設看得到**的地方,每個圖前後各用一兩句白話說明「這張圖在看什麼」。
- 流程、步驟、因果、比較 → 用 mermaid 流程圖(```mermaid,flowchart LR 或 TD;節點文字用中文、加雙引號;一張圖不超過 10 個節點)。
- 投影片上的示意圖、架構圖 → 用 [[IMG: …]] 放投影片圖。
- 仍守「每個 ## 段落最多一種視覺元素」。
### 輸出兩個檔
1. `chNN.md`(Notion 寫法,不含頁面標題),結構固定:
- 第一行:章節包第 1 節那行,原樣照抄。
- 第二行起(有數學段才寫):**跳過提示**,每段一行,讓主理人看影片時知道從哪跳到哪。用章節包第 3b 節的候選當提示,對照第 7 節逐字稿確認(只標老師連續講公式、推導、矩陣、微積分、機率計算、程式細節超過約 1 分鐘的段落;概念講解和比喻不算):
`跳過提示:(1:31:02–1:35:40) 老師在推導梯度公式,聽不懂可以直接跳到 [1:35:40](YouTube 連結),接著講「步長 α 怎麼選」。`
- `## 重點`:三點中文,每點一到兩句。
- `## Exam-ready`:3–10 行英文,**從章節包的投影片文字逐字抄**,每行 `- **Term**: "原句"(Ch3 p.14)`。老師有明確證據才在行尾加 `【老師強調】(h:mm:ss)`。
**每一行下面一定要有一行縮排的中文解釋**(主理人英文不好,看不懂的英文等於沒用):
```
- **Hill climbing**: "It keeps track of one current state and on each iteration moves to the neighboring state with highest value."(Ch4 p.5)
- 中文:爬山法只記住「現在這一個狀態」,每一輪都移到分數最高的鄰居。白話:一直往比較高的地方走一步。
```
中文要先把句子意思講清楚,再補一句白話;最後用「英文(中文)」列出這句裡 1–3 個難字,例:sparse(稀疏)、distinct terms(不重複的字)。
**一行只放一句投影片原句**。同一頁有多句要考就拆成多行,每行各接一行中文;不要用分號串三句以上,不要把計算量 O(...) 塞進去。
- 章節包第 2 節的每一段:`## [h:mm:ss](連結) 標題`(照抄),下面 2–4 句白話摘要,其餘全部收進摺疊:
```
問句(例:用生活例子講,BFS 在做什麼?)
內容
```
摺疊種類(需要才放):用生活例子講?/它到底怎麼運作?/要先懂什麼?(老師假設你會的數學或概念,短版教學)/老師原話是什麼?(「原話」(h:mm:ss),只放重要的,最多 5 句)。
- 「它到底怎麼運作?」要用一組小數字把這段的演算法**真的跑 1–3 步**(例:算出梯度、更新一次、比較兩個 α),不是只示範定義的加減乘除。全章盡量沿用同一組數字,讓前一段的答案能在下一段被驗證。
- 每段正文要回答讀者最可能卡住的一個「為什麼」。投影片公式方向跟題目相反、或投影片說「解不出來」時,用一兩句講出原因,自己補的標(我補充)。
- 投影片句子停在公式前(公式在圖裡)時:Exam-ready 在粗體詞條上補公式、引號內保持原句;正文寫出同一條式子。公式圖看章節包第 6 節列出的 PNG。
- `## Self-check`:2–4 題英文考題,答案收摺疊。**至少一題考老師強調的內容**;只出 explain/why/compare 這類問答題,**不出要代數字計算的題目**(考試不考算式);不出「老師和投影片哪裡不同」這類不會考的題目。每題格式:
```
Q1. English question?(中文:中文題目)
**Answer**: English answer.
中文:把答案完整講一遍(不是只翻一句),讓看不懂英文的人也知道要怎麼答。
```
- **最後一行**:章節包第 1b 節那行(下一章連結),原樣照抄。讓讀完的人直接點下一章。
- 不要把章節包或這份規則裡的指示句寫進筆記(例如「寫筆記時照投影片寫」「已改正 ASR 錯字」)。
- 長度:全文不超過 16,000 字元(跟 check_note.py 同一個數字)。**不要為了壓字數反覆刪改**(實測一章最多花 12 輪在刪字);超過時只刪進階摺疊裡的第二組算例,比喻、比較表、圖說、「老師說不用背」的提醒都不刪。
- 預設看得到的正文不放計算量 O(...)、代號對照(例如 SMART 字母)、課本出處考據,一律移進進階摺疊。
2. `chNN.concepts.json`:JSON 陣列,4–12 個考試可能問的術語,每個物件:
`name`(英文)、`zh`、`type`(概念/演算法/公式/人物事件/前置知識/行政)、`signal`("老師說會考"/"老師強調"/"核心(我判斷)"/"")、`evidence`(有 signal 前兩種時必填:原句+時間)、`definition_en`(投影片原句;沒有就註明 (textbook)/(lecture)/(my wording))、`plain`(一句中文)、`a4`(≤150 字元英文,可夾極短中文;期末拼貼用的小方塊)、`time`、`slides`、`prereq`(英文名陣列)。
### 風格鐵律
- 不用 emoji 或裝飾符號(✓✗★⚠ 都不要;→ 可以)。不用 callout。不用 `$`。時間不要用 code 樣式。
- 每個 `##` 段落最多一種視覺元素:一張圖、或一個表格、或一個 mermaid。
- 摺疊標題是問句,前面不加符號。
- 圖片最多 3 張,只放文字取代不了的圖。放法:單獨一行 `[[IMG: | 中文圖說]]`,PNG 用 `slides_to_png.py <圖片資料夾> <頁> --dpi=110` 產生。
- 考試訊號只在老師明確說時標。老師只說「不用背」「不講」就寫「注意:……」。
- 老師口誤或跟投影片不同:照投影片寫,加「注意:老師口頭說的是……」。
- 引用老師的話時,ASR 錯字改成正確的字。
### 沒有投影片時
不要憑記憶逐字重現課本段落或數值表。英文定義用自己的話寫、句尾標 (my wording);Exam-ready 每行標「(自擬,投影片待補)」。例子只用老師講的。
### 寫完之後(只做一次)
跑檢查:
`C:\Users\user\.cache\meeting-record\venv\Scripts\python.exe C:\Users\user\.claude\scripts\check_note.py --transcript <逐字稿> --slides <投影片 txt …> --start <起> --end <訖> --vid <影片 ID>`
- STYLE/VISUAL/TIME/FORMAT:全部改掉。
- QUOTE:確認是不是你改正了 ASR 錯字(是就保留),不是就改成原文或拿掉引號。
- ENGLISH:確認是不是投影片斷行造成的(是就保留),不是就改成投影片原句。
**省額度守則**:章節包裡已經有你需要的全部資料。不要再去讀整份逐字稿、整份投影片、segments.json 或手冊。一次寫好整個檔(Write 一次),檢查後集中修改。