[人工智慧導論](https://app.notion.com/p/3e6fc631b0308131b213f0a3d93fe91d) › [W1(9/10)](https://app.notion.com/p/3e7fc631b03081309a2adad7f8ae1e27) › 05|影片 [2:42:08–2:59:48](https://www.youtube.com/watch?v=KWGgi100YLY&t=9728s)|投影片 Ch2 p.2–12|上一章 [04 深度學習崛起與 AI 風險(2:07–2:31)](https://app.notion.com/p/3e7fc631b030813ba471f1cdc276f72c)|下一章 無
## 重點
- Agent 是任何「用感測器感知環境、用促動器對環境做動作」的東西;agent function 把「到目前為止看到的一切」(percept sequence)對應到一個動作。
- 理性(rational)=用手上的資訊,選「預期」效能最高的動作。理不理性要看效能標準怎麼定,而且理性不要求全知;老師強調 rational agent 是最能落地應用的一派。
- 描述任務環境先寫 PEAS(效能、環境、促動器、感測器),再替環境分類:看得到全部還是部分、有沒有其他 agent、結果確定還是隨機。
## Exam-ready
- **Agent**: "An agent is anything that can be viewed as perceiving its environment through sensors and acting upon that environment through actuators (促動器)."(Ch2 p.2)
- 中文:凡是能被看成「用感測器感知環境、再用促動器對環境做動作」的東西,都叫 agent。白話:會看、會動的都算,不管是機器人還是一段程式。難字:perceiving(感知)、actuators(促動器,負責做動作的部件)。
- **Agent function**: "An agent’s behavior is described by the agent function that maps any given percept sequence to an action."(Ch2 p.3)
- 中文:agent 的行為用 agent function 描述,它把任何一段感知序列對應到一個動作。白話:輸入「到目前為止看到的一切」,輸出「現在要做什麼」。難字:maps(對應)、percept sequence(感知序列)。
- **Rational agent**: "A rational agent is one that does the right thing."(Ch2 p.5)【老師強調】(2:50:21)
- 中文:理性的 agent 就是會做對事情的 agent。白話:不看它想得像不像人,看它做出來的結果好不好。難字:rational(理性的)。
- **Performance measure**: "It is better to design performance measures according to what one actually wants in the environment, rather than according to how one thinks the agent should behave."(Ch2 p.5)
- 中文:設計效能標準時,最好依照「你真正希望環境變成什麼樣子」,而不是依照「你覺得 agent 該怎麼動」。白話:評分看結果,不規定過程。難字:performance measure(效能標準)、behave(行動、表現)。
- **Definition of a rational agent**: "For each possible percept sequence, a rational agent should select an action that is expected to maximize its performance measure, given the evidence provided by the percept sequence and whatever built-in knowledge the agent has."(Ch2 p.6)
- 中文:面對每一種可能的感知序列,理性 agent 要根據目前看到的證據和內建的知識,選出預期能讓效能標準最高的動作。白話:用手上有的資訊,挑平均來看最好的一步。難字:expected(預期的)、evidence(證據)、built-in knowledge(內建知識)。
- **Omniscience**: "Our definition of rationality does not require omniscience (全知), because the rational choice depends only on the percept sequence to date."(Ch2 p.7)
- 中文:理性的定義不要求全知,因為理性的選擇只看到目前為止的感知序列。白話:沒人能預知未來,用已知資訊做出最好的選擇就算理性。難字:omniscience(全知)、to date(到目前為止)。
- **Autonomy**: "A rational agent should be autonomous—it should learn what it can to compensate for partial or incorrect prior knowledge."(Ch2 p.8)
- 中文:理性 agent 應該要自主:盡量學習,用學到的東西彌補不完整或錯誤的事前知識。白話:不能只靠設計者先寫好的規則,要自己從經驗修正。難字:autonomous(自主的)、compensate(彌補)、prior knowledge(事前知識)。
- **PEAS**: "Task environment: we have to specify the performance measure, the environment, and the agent’s actuators and sensors."(Ch2 p.9)
- 中文:描述任務環境時,要寫清楚效能標準、環境、agent 的促動器和感測器,四樣合稱 PEAS。白話:設計 agent 前先回答「怎麼算做得好、在哪裡做、能做什麼、能看到什麼」。難字:specify(明確寫出)、task environment(任務環境)。
- **Fully observable**: "if the sensors detect all aspects that are relevant to the choice of action"(Ch2 p.11)
- 中文:如果感測器能偵測到跟選擇動作有關的所有面向,環境就是完全可觀察的。白話:做決定需要的資訊全都看得到,例如棋盤;看不到全部就是 partially observable(部分可觀察)。難字:detect(偵測)、relevant(相關的)。
- **Deterministic vs. stochastic**: "If the next state of the environment is completely determined by the current state and the action executed by the agent, then we say the environment is deterministic; otherwise, it is stochastic."(Ch2 p.12)
- 中文:如果環境的下一個狀態完全由「現在的狀態」加上「agent 做的動作」決定,就叫確定性環境,否則叫隨機性環境。白話:做完動作的結果百分之百可預測就是確定,會有意外就是隨機。難字:deterministic(確定性的)、stochastic(隨機的)、executed(執行的)。
## [2:42:08](https://www.youtube.com/watch?v=KWGgi100YLY&t=9728s) Agent 不是新名詞
老師用最後十幾分鐘開始講第二章 Intelligent Agents(智慧代理人),並說 Ch1、Ch2 都偏「聊聊天」,真正的核心從 Ch3 開始。學生可能會問:不是說不教最新的 agent 嗎?老師的回答是:agent(代理人,替你感知並行動的東西)在 AI 領域已經存在幾十年,只是最近大家用大型語言模型(LLM)來實作,才讓人以為 agent 就是 ChatGPT 或 Anthropic 的 Claude 在做的事。
比喻:「員工」這個詞用了幾百年,現在出現 AI 員工,不代表「員工」是新發明的概念。
考試可能怎麼問:這段本身是背景,但課本後面每一章都用 agent 的框架來講,後面的題目都會用到這個詞。
老師原話是什麼?
- 「但其實 Agent 這個概念,老早在幾十年來就一直都有」(2:43:55)
- 「第一章跟第二章都是這種聊聊天的,真正會比較進入到核心的那種,會從第三章開始」(2:59:31)
## [2:44:02](https://www.youtube.com/watch?v=KWGgi100YLY&t=9842s) Agent 的定義
只要能透過感測器(sensor)感知環境、透過促動器(actuator,負責做動作的部件)對環境採取行動,就是 agent。它可以是一個系統、一台機器、一段程式,甚至只是你寫的一個函式。為什麼範圍這麼廣?因為這個定義只看「收資訊、做動作」的角色,不管裡面是什麼做的:sensor 不限溫度或濕度感測器,只要能接收某個範圍的資訊都算;動作也不一定是機器手臂在動,回傳一串資料也算。
比喻:手機導航就是一個 agent:GPS 是它的眼睛(sensor),語音說「前方右轉」是它的手(actuator)。
考試可能怎麼問:Define an agent, and give an example of its sensors and actuators.
下面是課本的 agent 示意圖:左邊灰框是 agent,右邊是環境。環境的資訊(percepts)從感測器進來,中間的「?」決定要做什麼,再由促動器把動作(actions)送回環境。

圖上重點:Agent(代理人,左邊大灰框)、Environment(環境,右邊直立灰框);Percepts(感知,環境送進來的資訊)箭頭指向 Sensors(感測器);中間的「?」是決定要做什麼的地方;Actuators(促動器)把 Actions(動作)送回環境。這張圖在講:agent 就是一個「收資訊 → 想 → 做動作」的循環,做完的動作又會改變環境,下一輪再收新的資訊。
中間那個「?」就是下一段的 agent function。(我補充)整本課本其實都在教:這個「?」要怎麼填才聰明。
老師原話是什麼?
- 「你只要能夠感受到某一個定義的範圍內的資訊,都是叫感測器」(2:45:06)
- 「可能我只是在回傳一串資料,也是一個動作」(2:45:49)
## [2:45:16](https://www.youtube.com/watch?v=KWGgi100YLY&t=9916s) Percept 與 agent function
agent 在某一瞬間收到的輸入叫 percept(感知);從開始到現在收到的所有 percept 串起來,叫 percept sequence(感知序列)。agent function(代理人函數)就是一個對應關係:輸入感知序列,輸出要做的動作。為什麼要看「整段序列」,而不是只看現在這一刻?(我補充)因為有些決定需要記憶,例如「這格剛剛才吸過」,只看當下這一刻是看不出來的。
比喻:像醫生看診:percept 是你今天說的症狀,percept sequence 是你整本病歷,agent function 是醫生「看病歷、開處方」的判斷方式。
考試可能怎麼問:What is the difference between a percept and a percept sequence, and what does the agent function do?
要先懂什麼?
數學上的「函數」就是一個對應:給一個輸入,就得到一個固定的輸出。(我補充)另一個常見的區分是:agent function 是抽象的規格(什麼情況做什麼),agent program 是真正跑在機器上、實作這個規格的程式。
## [2:46:28](https://www.youtube.com/watch?v=KWGgi100YLY&t=9988s) 吸塵器世界與查表的問題
課本用一個最小的世界當例子,後面會反覆出現:只有 A、B 兩塊地磚,每塊都可能有灰塵。吸塵器能感測「我在哪一格、這格髒不髒」,動作有左移、右移、吸塵、不動;最簡單的 agent function 是「這格髒就吸,不然移到另一格」。問題是,如果把 agent function 寫成一張表(每種感知序列對應一個動作),加上時間維度後序列越來越長,表格就長到寫不完,所以用查表來寫 agent 不是好辦法。
比喻:用查表寫 agent,就像把「每一種可能的對話」都先背起來再去聊天:理論上可行,實際上永遠背不完。
考試可能怎麼問:Why is it impractical to implement an agent function as a lookup table?
下面是課本列出的部分 agent function:左欄是感知序列,右欄是動作,表中的省略號代表還有無限多列。

圖上重點:右上角是 A、B 兩格地磚,吸塵器在 A,兩格都有灰塵;第一句說吸塵器能左移(Left)、右移(Right)、吸塵(Suck)、不動,最簡單的規則是「這格髒就吸,不然移到另一格」;第二句問:這張表要怎麼填才對?什麼讓 agent 變好或變壞、聰明或笨?下面的表左欄 Percept sequence(感知序列)寫「在哪一格、乾淨(Clean)還是髒(Dirty)」,右欄 Action(動作),例如 [A, Dirty] → Suck;底下的 Figure 2.3 說這只是「部分列表」。這張圖在講:把 agent function 寫成一張「看到什麼 → 做什麼」的表長什麼樣,而表格會越列越長、永遠列不完。
注意:老師口頭舉例時說「B 地磚髒的就往右移」,應是口誤;投影片的表是 [B, Dirty] → Suck(吸塵)。
下面的進階摺疊在做什麼(白話):先讓吸塵器照那條一行規則實際跑三步,證明規則很短就能做完事;再數一數同樣的事改用查表要列幾列,結果十步就要約 140 萬列。結論就是:用規則(程式)寫 agent 可行,用查表寫 agent 不可行。
它到底怎麼運作?(進階,可跳過)
先用那條簡單規則跑三步。起點:A 髒、B 髒,吸塵器在 A。
- 第 1 步:感知 [A, Dirty] → Suck,A 變乾淨。
- 第 2 步:感知 [A, Clean] → Right,移到 B。
- 第 3 步:感知 [B, Dirty] → Suck,兩格都乾淨。
規則只有一行就跑完了。改用查表的話,每一步的感知只有 4 種(A 或 B,乾淨或髒),但表格的「鍵」是整段序列:
- 只看 1 步:4 列。
- 看到第 2 步:再多 4×4=16 列。
- 看到第 3 步:再多 64 列,合計 84 列。
- 看到第 10 步:合計約 140 萬列。
兩塊地磚就膨脹成這樣,開車時的攝影機畫面更不可能列完。(我補充)所以 AI 真正的難題是:用一小段程式做出理性行為,而不是列一張巨大的表。
## [2:50:03](https://www.youtube.com/watch?v=KWGgi100YLY&t=10203s) 理性要看效能怎麼定義
回到 Ch1 講的四種 AI 定義,老師再次強調「理性地行動」這一派(rational agent)最能落地應用:只要做出來的行為是理性的,就是可用的 AI 系統。rational agent 就是「把事情做對」:在已經取得的資訊下,盡可能讓效能最大。課本說的「做對」是看結果:agent 的動作讓環境經過一連串狀態,這串狀態是我們想要的,就算表現好;替這串狀態打分數的就是效能標準(performance measure)。效能要看你怎麼定義,而且最好依照「你希望環境變成什麼樣子」來定,不要規定 agent 該怎麼動。所以同一台「髒就吸,不然換格」的吸塵器理不理性,老師的答案是:看情況(depends)。
(第 1 週第 02 章學過:定義 AI 有四種取向,用「看思考過程還是看外在行為」和「標準是像人還是理性」兩個問題切成四格,「理性地行動」就是其中一格,也就是這裡說的 rational agent。見 [02 什麼是 AI:四種定義(1:35–1:49)](https://app.notion.com/p/3e7fc631b03081509ff5e74454b69167)。)
上面說的「狀態」(state)白話是:環境在某一刻的樣子。以吸塵器世界為例,「吸塵器在 A、A 髒、B 乾淨」就是一個狀態;吸塵器每做一個動作,環境就換到下一個狀態。效能標準就是替「一連串狀態」打分數。
比喻:同一個員工,用「業績」考核他很優秀,改用「每天準時下班」考核他可能不及格;員工沒變,是評分標準變了。
考試可能怎麼問:Is the simple vacuum-cleaner agent rational? Explain why the answer depends on the performance measure.
後面那個進階摺疊在做什麼(白話):拿同一條吸塵器規則,用兩種計分方式各算一次分數。只看地板乾不乾淨時,規則拿到最高分,算理性;改成每移動一次扣分時,規則會白白來回跑,分數輸給「停著不動」,就變成不理性。算出來代表:agent 沒變,換了評分標準,理不理性的答案就跟著變。
下面這張圖把老師舉的三種效能標準並排:同一台吸塵器,在不同標準下「理想的做法」完全不同。
```mermaid
flowchart LR
V["同一台吸塵器"] --> M1["標準一:吸到最多灰塵"]
V --> M2["標準二:乾淨地板的時間越長越好"]
V --> M3["標準三:快沒電,要省電"]
M1 --> R1["理想:不停左右移、一直吸"]
M2 --> R2["理想:髒了就吸,保持乾淨"]
M3 --> R3["理想:盡量少移動"]
```
用生活例子講,為什麼效能要看「結果」而不是規定「動作」?
(我補充)舉個極端的例子:如果用「吸了多少灰塵」評分,一台理性的吸塵器可能會把灰塵倒回地上再吸一次,因為這樣分數最高。改用「地板乾淨的程度」評分,就沒有這個漏洞。就像公司用「寫了幾行程式」考核工程師,大家就會寫得又臭又長;用「功能有沒有做好」考核才對。
它到底怎麼運作?(進階,可跳過)
沿用上一段的例子(A 髒、B 髒,從 A 出發),多走一步,用兩種計分方式比較(我補充):
- 計分 A:每一步結束時,每塊乾淨的地磚得 1 分。
- 計分 B:同上,但每移動一次扣 1 分(省電)。
簡單規則的四步是 Suck、Right、Suck、Left(第 4 步兩格都乾淨,規則仍要它換格):
- 計分 A:1+1+2+2=6 分。第 4 步改成不動也是 6 分,所以規則沒有吃虧,算理性。
- 計分 B:扣掉兩次移動,只剩 4 分;第 4 步改成不動可得 5 分。規則會在兩格之間一直來回白跑,在這個標準下就不理性。
老師原話是什麼?
- 「最能夠落地應用的是所謂的 rational agent 的這一個派別」(2:50:21)
- 「答案是 Depends,不一定」(2:52:09)
- 「到底一個 Agent 是不是 Rational,其實是要根據你的效能怎麼定義而定」(2:53:09)
## [2:53:14](https://www.youtube.com/watch?v=KWGgi100YLY&t=10394s) 全知、學習與自主
理性不等於全知。課本說:理性是讓「預期」效能最大,完美才是讓「實際」效能最大;理性的選擇只根據到目前為止看到的東西,所以不要求全知(omniscience,事先知道每個行動的真實結果)。為什麼這樣定才合理?因為沒有人能預知未來,要求全知等於要求 agent 做不到的事。但理性 agent 也不能只收資訊,還要從經驗學習、要自主(autonomous),用學到的補足設計者給的不完整或錯誤知識;例如學會預測「哪裡、何時會再有灰塵」的吸塵器,會比不會學的表現更好。課本還說,加入學習後,同一個理性 agent 就能在各式各樣的環境裡都成功,不必每換一個環境就重寫一次。
比喻:氣象說降雨機率 10%,你沒帶傘結果淋雨,這個決定仍然是理性的;只有全知的人才能保證不淋雨。
考試可能怎麼問:Explain the difference between rationality and perfection, and why a rational agent needs learning and autonomy.
| 概念 | 追求什麼 | 帶傘的例子 |
|---|---|---|
| 理性(rationality) | 用目前看到的資訊,選「預期」最好的動作 | 降雨機率 10%,不帶傘是合理的決定 |
| 完美(perfection) | 事後「實際」結果最好 | 剛好沒下雨,才算完美 |
| 全知(omniscience) | 事先知道每個動作的真實結果 | 出門前就知道會不會下雨,現實做不到 |
| 自主(autonomy) | 從經驗學習,修正事前知識 | 發現這城市午後常下雨,之後主動帶傘 |
注意:老師口頭說的 omniscient 是「這個環境底下所有的資訊我都知道」,並舉一個虛擬空間平台為例(應是 NVIDIA 的 Omniverse:裡面的物件全是模擬出來的,所有參數都已知);這比較接近下一節的 fully observable(完全可觀察)。課本的 omniscience 是「知道行動的真實結果」,考試寫課本版。
要先懂什麼?
「預期」(expected)的意思是:把所有可能的結果都考慮進來,平均來看哪個最好。降雨機率 10%,代表十次裡大約九次不帶傘也沒事,所以平均來看不帶傘比較划算。理性 agent 比的是這種平均,不是事後才知道的實際結果;運氣不好淋到雨,不代表它不理性。投影片原句是:"Rationality maximizes expected performance, while perfection maximizes actual performance."(Ch2 p.7)
老師原話是什麼?
- 「他不只是會收集資訊,他還能夠根據收集資訊做出理性的判斷」(2:54:24)
## [2:55:04](https://www.youtube.com/watch?v=KWGgi100YLY&t=10504s) PEAS:計程車司機
設計 agent 之前,先把任務環境寫清楚,課本用四個字母 PEAS:Performance(效能標準)、Environment(環境)、Actuators(促動器)、Sensors(感測器)。老師用計程車司機當例子:環境是路況、紅綠燈、行人和騎腳踏車的人;促動器是方向盤、油門、煞車;真人司機的感測器是眼睛、耳朵,自駕車(例如 Tesla 的 Cybercab)則有攝影機、聲納、速度計、GPS 等。效能標準可以有很多種:最快到桃園機場、路線最順、最省錢,這又呼應上一段「理性要看效能怎麼定義」。
比喻:PEAS 像徵才時寫的職務說明:績效怎麼考核(P)、在哪裡上班(E)、能用哪些工具(A)、能拿到哪些資訊(S)。
考試可能怎麼問:Give the PEAS description of an automated taxi driver (or another agent type).
表裡幾個不常見的感測器(我補充):聲納(sonar,發出聲波再聽回音來量距離,倒車雷達就是這個原理)、里程表(odometer,記錄車子總共開了多遠)、加速度計(accelerometer,量車子加速、煞車有多猛)。
| PEAS | 意思 | 投影片 p.9(自動計程車) | 老師口頭補充 |
|---|---|---|---|
| Performance | 怎麼算做得好 | 安全、快、合法、舒適、賺最多 | 最快到機場、路線最順、最省錢 |
| Environment | 在哪裡做事 | 道路、其他車輛、行人、乘客 | 路面狀況、紅綠燈、腳踏車 |
| Actuators | 能做哪些動作 | 方向盤、油門、煞車、方向燈、喇叭、顯示螢幕 | 轉方向盤、加速、煞車 |
| Sensors | 能拿到哪些資訊 | 攝影機、聲納、速度計、GPS、里程表、加速度計、引擎感測器、鍵盤 | 真人司機:看、聽,頂多聞 |
用生活例子講,還有哪些 agent 可以用 PEAS 描述?
投影片 p.10 還列了幾個例子:
- 醫療診斷系統:P 病人健康、降低成本;E 病人、醫院、醫護人員;A 顯示問題、檢查、診斷、治療、轉診;S 鍵盤輸入的症狀、檢查結果、病人回答。
- 英文家教程式:P 學生的考試分數;E 一群學生、考試機構;A 顯示練習題、建議、訂正;S 鍵盤輸入。
- 零件揀選機器人:P 零件放進正確箱子的比例;E 輸送帶上的零件、箱子;A 關節手臂和手;S 攝影機、關節角度感測器。
- 另外還有衛星影像分析系統(P 影像分類正確)和煉油廠控制器(P 純度、產量、安全)。
## [2:57:15](https://www.youtube.com/watch?v=KWGgi100YLY&t=10635s) 環境屬性:前三組
寫完 PEAS,還要替任務環境分類。這週講了三組:看不看得到全部(fully vs partially observable)、有沒有其他 agent(single vs multiagent)、結果確不確定(deterministic vs stochastic)。為什麼要分類?(我補充)因為環境類型決定 agent 要多複雜:看得到全部就不必猜,結果確定就能事先精準規劃,不確定就得準備好幾種狀況。其餘屬性在 p.13 之後,下週再講。
要先懂的一個詞:「機率」(probability)就是某件事發生的可能性有多大,例如降雨機率 10%。隨機性環境(stochastic)的意思是:同一個動作做下去,結果不只一種,只能說「大概七成會這樣、三成會那樣」,沒辦法百分之百預測。
比喻:下象棋像「明牌」,盤面全攤開、下哪就在哪;打麻將像「暗牌」,看不到別人的牌,摸牌又靠運氣。
考試可能怎麼問:Classify chess and taxi driving by observability, number of agents, and determinism, and explain why.
| 屬性 | 怎麼判斷 | 下棋 | 開計程車 |
|---|---|---|---|
| Fully vs partially observable | 感測器看不看得到做決定需要的全部資訊 | 完全可觀察:盤面全看得到,不能蓋起來 | 部分可觀察:坐在車裡看不到四面八方 |
| Single vs multiagent | 另一方是不是在追求「分數受我影響」的目標 | 多 agent:兩方對弈,互相競爭 | 多 agent:其他車也在開(我補充) |
| Deterministic vs stochastic | 下一個狀態是否完全由「現在狀態+動作」決定 | 確定:黑子下在哪就在哪 | 隨機:叫它右轉,轉多少、多快不一定 |
用生活例子講,路上的另一台車算不算 agent?
投影片 p.11 的判斷關鍵是:B 的行為,是不是最好描述成「在最大化一個會受 A 影響的效能標準」。另一台車想安全抵達,會因為你切進來而閃避,所以它是 agent;路邊的樹不會因為你而改變,只是環境的一部分。下棋時對手想贏,而他贏不贏取決於你怎麼下,所以是競爭型的多 agent 環境。另外,投影片說 stochastic 通常表示「結果的不確定性用機率來描述」。
## Self-check
Q1. What is a rational agent? Is the simple vacuum-cleaner agent ("if dirty, suck; otherwise move to the other square") rational?(中文:什麼是理性 agent?「髒就吸,不然換格」的吸塵器理性嗎?)
**Answer**: A rational agent does the right thing: for each possible percept sequence, it selects the action that is expected to maximize its performance measure, given the evidence from the percept sequence and its built-in knowledge. Whether the vacuum agent is rational depends on the performance measure. If the measure rewards clean squares over time, the simple rule does well; if every move costs energy, the agent keeps moving back and forth after both squares are clean, so it is not rational under that measure. The rational-agent approach is the most practical way to build AI, because we only need to judge the behavior.
中文:理性 agent 就是會做對事情的 agent:面對每一種感知序列,它根據目前看到的證據和內建知識,選出預期能讓效能標準最高的動作。那台吸塵器理不理性要看效能標準:如果標準是「地板保持乾淨的時間」,這條規則表現不錯;如果每移動一次都要耗電扣分,它在兩格都乾淨後還會一直來回跑,在這個標準下就不理性。老師強調,rational agent 是最能落地的做法,因為我們只需要判斷它的行為好不好。
Q2. Why does rationality not require omniscience? How is rationality different from perfection?(中文:為什麼理性不要求全知?理性和完美差在哪?)
**Answer**: Rationality maximizes expected performance, while perfection maximizes actual performance. A rational choice depends only on the percept sequence to date, so an agent cannot be expected to know the actual outcome of its actions in advance; omniscience is impossible in reality. Instead, a rational agent should gather information and learn from what it perceives, and it should be autonomous, learning to compensate for partial or incorrect prior knowledge.
中文:理性是讓「預期」效能最大,完美是讓「實際」效能最大。理性的選擇只能根據到目前為止看到的感知序列,不能要求 agent 事先知道行動的真實結果,因為現實中不可能全知。取而代之的要求是:理性 agent 要收集資訊、從感知中學習,並且要自主,用學到的東西彌補不完整或錯誤的事前知識。
Q3. What is PEAS? Give the PEAS description of an automated taxi.(中文:PEAS 是什麼?寫出自動計程車的 PEAS。)
**Answer**: PEAS stands for Performance measure, Environment, Actuators, and Sensors; we must specify all four to define a task environment. For an automated taxi: Performance: safe, fast, legal, comfortable trip, maximize profits. Environment: roads, other traffic, pedestrians, customers. Actuators: steering, accelerator, brake, signal, horn, display. Sensors: cameras, sonar, speedometer, GPS, odometer, accelerometer, engine sensors, keyboard.
中文:PEAS 是效能標準、環境、促動器、感測器四個字的縮寫,定義任務環境時四樣都要寫清楚。自動計程車的效能標準是安全、快、合法、舒適、賺最多;環境是道路、其他車輛、行人、乘客;促動器是方向盤、油門、煞車、方向燈、喇叭、顯示螢幕;感測器是攝影機、聲納、速度計、GPS、里程表、加速度計、引擎感測器、鍵盤。
Q4. Compare chess and taxi driving in terms of observability, number of agents, and determinism.(中文:從可觀察性、agent 數量、確定性比較下棋和開計程車。)
**Answer**: Chess is fully observable, because the sensors can see the whole board, which is all that matters for choosing a move. Taxi driving is partially observable, because the driver cannot see everything around the car. Both are multiagent: chess is a competitive multiagent environment, and a taxi shares the road with other drivers whose goals depend on its behavior. Chess is deterministic, because the next state is completely determined by the current state and the move; taxi driving is stochastic, because the result of an action such as turning is uncertain.
中文:下棋是完全可觀察,因為整個盤面都看得到,而盤面就是選下一步需要的全部資訊;開計程車是部分可觀察,因為坐在車裡看不到周圍所有東西。兩者都是多 agent:下棋是互相競爭的兩方,開車時路上其他駕駛的目標也會受你影響。下棋是確定性的,下一個狀態完全由目前盤面和你下的那步決定;開車是隨機性的,例如右轉要轉多少、多快,結果都不一定。
這週讀完了。下一週第一章:[01 HW1 提案寫法與分組(0:01–0:13)](https://app.notion.com/p/3e6fc631b030816cb5e8d1b405b4349e)|回到週頁:[W1(9/10)](https://app.notion.com/p/3e7fc631b03081309a2adad7f8ae1e27)