# videoplayback.m4a|長度 01:59:20|model large-v3 on cuda [00:00:36] 志願自由生涯、紅色教堂、青菜、甜點、黑色三文字、長調、光線、獨特、超級、威武、日常、抗流、開放、現實、靈活、 Forestry、超級純粹。 [00:00:47] 好 [00:01:25] 那個雖然還沒開始上課了 [00:01:27] 不過因為教室有點小 [00:01:31] 所以有些事情我可能就開始進行交代一下 [00:01:36] 那這個大家好 [00:01:40] 我是高鴻宇 [00:01:42] 那這門課呢是自然語言處理 [00:01:45] 那他也是TAICA的課程系列之一 [00:01:51] 那因為這門課呢 [00:01:54] 有線上直播跟錄影 [00:01:56] 大家也可以回看 [00:01:58] 所以 [00:01:59] 所以 [00:02:01] 所以學校才允許我在一百人的教室 [00:02:04] 開這麼多的學生論述 [00:02:06] 那今天呢可能就大家課那一下 [00:02:11] 或者是說等 [00:02:12] 我今天大概會上兩個小時的課 [00:02:15] 中間會休息一下 [00:02:17] 也許就可以用線上方式看 [00:02:20] 好 [00:02:22] 那我先就開始介紹這門課的內容 [00:02:26] 那這個 [00:02:27] sorry [00:02:30] 這個是 [00:02:31] 這個是課程的slido的連結 [00:02:35] 不過如果大家有修這門課呢 [00:02:37] 應該也可以在TAICA的NTU COOL上面 [00:02:41] 課程的 [00:02:42] 那個內容上可以看到說 [00:02:46] 有一個slido連結 [00:02:47] 那這個就是做課程Q&A的地方 [00:02:51] 那 [00:02:52] 大家可以在上面問一些問題這樣子 [00:02:55] 好 [00:02:59] 那我先做個自我介紹了 [00:03:01] 那我是高鴻宇 [00:03:02] 清大至宮的 [00:03:03] 老師 [00:03:05] 那 [00:03:06] 那我以前做研究是比較 [00:03:08] 偏自然源處理 [00:03:11] 那當然也導入一些資料探勘跟機器學習的部分 [00:03:16] 這個就供大家參考 [00:03:18] 那 [00:03:19] 這門課呢 [00:03:20] 他是TAICA應該是第三年開的課程 [00:03:24] 那從以前到現在 [00:03:27] 大概 [00:03:28] 修課人數大概都維持300到500人間了 [00:03:32] 然後 [00:03:33] 我們最後完成這門課的人數 [00:03:37] 大概八成 [00:03:39] 可能有到八成五億 [00:03:43] 那他主要的目的是涵蓋自然源 [00:03:47] 那自然源處理 [00:03:50] 大概在十年前跟在十年 [00:03:52] 這近十年的內容教材會完全不太一樣 [00:03:56] 那現在我們就會放大型元模型的部分 [00:04:00] 那這個是在TAICA的 [00:04:02] 的一開始的 [00:04:03] 規劃上 [00:04:04] 他們現在可能有點調整 [00:04:06] 而且可能大家可以上TAICA的網頁上看 [00:04:09] 有每個課程的難度 [00:04:12] 那他們好像現在把難度的Range拉大 [00:04:15] 好像有到八顆星這樣子 [00:04:18] 那 [00:04:19] 這門課呢 [00:04:20] 其實是比較放在後面進階的部分 [00:04:24] 所以 [00:04:26] 好像這個同時段學校有機器學習郭老師的課 [00:04:30] 所以 [00:04:31] 其實如果你還沒有機器學習 [00:04:33] 經驗的學生 [00:04:34] 其實你可以先修一下機器學習 [00:04:37] 或是Deep Learning的課程 [00:04:40] 因為我們這堂課呢 [00:04:42] 就會直接作業 [00:04:45] 就會直接教你寫模型訓練 [00:04:48] 然後當然就是處理文字的一些問題 [00:04:50] 這樣子 [00:04:52] 好 [00:04:56] 那這個大概就是 [00:04:58] 這是這一頁是當初給教育部長看的 [00:05:02] 就是這門課在做什麼 [00:05:03] 這樣子就是介紹一下這個 [00:05:06] 自然語言處理的 [00:05:08] 這個裡面到底在講什麼這樣子 [00:05:11] 當然自然語言處理 [00:05:12] 在 [00:05:14] 在這個ChatGPT還沒出來之前 [00:05:17] 它其實是一個算普通 [00:05:20] 也有點冷門的課的學問 [00:05:23] 只是說 [00:05:23] 大家後來發現 [00:05:25] 這個處理語言的方式 [00:05:28] 用Deep Learning用AI導入之後 [00:05:31] 它可以變得這麼厲害 [00:05:32] 這麼實用 [00:05:34] 所以它現在幾乎是 [00:05:36] 所有可以解決很多問題的一個基礎 [00:05:40] 所以我們就會在自然語言處理的課程裡面 [00:05:44] 去看如何讓電腦去理解人類的語言 [00:05:48] 跟如何跟人類互相溝通 [00:05:52] 那當然大家所熟知的大型語言模型 [00:05:55] 也會在這門課裡面介紹這樣子 [00:05:59] 好 [00:06:00] 那 [00:06:02] 當然 [00:06:04] 今天的課程有點是介紹 [00:06:06] 這個主要的 [00:06:07] 這門課會涵蓋的部分 [00:06:09] 那可能也讓有些同學可能不太知道自然語言處理在上什麼 [00:06:14] 然後可能讓你有個認知 [00:06:17] 也許這個可能不是你想象中會學到的東西 [00:06:20] 這樣子 [00:06:21] 那為什麼要學NLP [00:06:23] 那前面Nature Language就是語言 [00:06:27] 但是我們這邊語言 [00:06:29] 其實當然以前我們在做這件事情的時候 [00:06:32] 可能就處理中文 [00:06:34] 英文 [00:06:35] 或是說 [00:06:36] 你要做一點翻譯啊 [00:06:37] 或是 [00:06:38] low resource的language啊 [00:06:39] 就是也許你想做原住民語言 [00:06:42] 這個就是 [00:06:44] 你會target一個語言 [00:06:46] 那processing呢就是說 [00:06:48] 你要如何去讓電腦 [00:06:50] 其實我們現在就很focus在電腦 [00:06:52] 雖然NLP以前 [00:06:54] 有絕大部分的工作都是要人工介入 [00:06:58] 就是從語言學家來的那些domain know-how [00:07:01] 然後再加上一點點的運算去處理這些事情 [00:07:04] 所以 [00:07:06] 但是我們現在的電腦處理比重會越來越高 [00:07:09] 甚至人已經不太需要在裡面 [00:07:11] 這些domain的knowledge [00:07:14] 或是要跟人互動的部分會越來越減少 [00:07:17] 所以我們要講的是怎麼讓電腦去處理 [00:07:20] 怎麼讓電腦去理解這些語言的東西 [00:07:23] 好 [00:07:25] 我用這位這個Edward Harvey [00:07:29] 他是一個 [00:07:30] 他現在是不是有在CMU [00:07:32] 可能已經轉到別的學校 [00:07:34] 不過他是一個在NLP方面的學生 [00:07:36] 非常有名的 [00:07:37] 一個前輩 [00:07:38] 他在兩年前LockedIn的會議裡面的一個Keynote講的部分 [00:07:44] 雖然是兩年前講的部分 [00:07:46] 不過我每年去看一看覺得 [00:07:49] 他講的東西 [00:07:50] 還對 [00:07:50] 還適用這樣子 [00:07:52] 我想現在大家會來修這門課 [00:07:54] 或是說大家對 [00:07:56] 學校相關AI的課程都非常的 [00:07:59] 積極想要去聽一聽 [00:08:01] 其實大概都是因為 [00:08:04] 太多的新聞 [00:08:05] 在告訴你們AI會怎麼樣怎麼樣 [00:08:08] 你如果不會這個 [00:08:09] 就會怎麼樣怎麼樣 [00:08:10] 所以大家都非常焦慮 [00:08:12] 不只是你們 [00:08:13] 老師也都非常焦慮 [00:08:16] 當然焦慮有很多種 [00:08:18] 那我們來看一下 [00:08:19] 就是說 [00:08:20] 其實 [00:08:21] 大家會用 [00:08:22] ChangeGPT [00:08:23] 會用這些Gemini [00:08:24] 或是Cloud做一些事情 [00:08:26] 你會發現他怎麼這麼厲害 [00:08:28] 可以 [00:08:28] 可以做這麼多事情 [00:08:30] 那你還 [00:08:32] 就覺得他為什麼可以做 [00:08:34] 其實 [00:08:35] 當然我們這門課的目的是想 [00:08:38] 會告訴你一點說 [00:08:39] 他其實有一點線索有一點 [00:08:43] 理由 [00:08:44] 但是也沒有任何的定理 [00:08:45] 告訴你他為什麼可以做到這些事情 [00:08:48] 但是如果完全不懂 [00:08:51] Transformer完全不懂 [00:08:52] Deep Learning的話其實你可能就不知道 [00:08:55] 這個 [00:08:55] 他到底是一個 [00:08:57] 什麼神奇的東西是不是 [00:08:59] 後面有一堆的工讀生在回答你的問題這樣子 [00:09:03] 那但是有時候你可能會想一下說 [00:09:05] 其實 [00:09:06] ChangeGPT寫的報告也不是很好 [00:09:09] 有時候 [00:09:09] 我要改一大堆的Prong [00:09:11] 他也不能出現 [00:09:13] 我想要的 [00:09:14] 而且甚至你玩久了之後你就會發現 [00:09:16] 他其實有一點笨 [00:09:18] 有一點漏洞這樣子 [00:09:20] 他為什麼做不了這些 [00:09:22] 為什麼做不到 [00:09:23] 這個當然就是比較研究範圍 [00:09:25] 我們想知道說他目前的挑戰 [00:09:28] 目前 [00:09:29] 比如說幻覺的問題啊或是說 [00:09:32] 連簡單的加法都做不好 [00:09:34] 這到底是為什麼這樣子的問題呢? [00:09:35] 這樣子 [00:09:36] 或anyway [00:09:37] 其實很多東西我們都是 [00:09:39] 滿腦子問號這樣子 [00:09:41] OK [00:09:42] 那有些人當然 [00:09:43] 現在這 [00:09:45] 這個人比較少 [00:09:46] 就是覺得 [00:09:48] 大語言模型就是 [00:09:50] 就是一個 [00:09:52] 其實以後我會講到那個Tronsky [00:09:54] 他也會說大語言模型就是一個 [00:09:58] 合法的抄襲者這樣子 [00:10:00] 就是把所有的知識背在一起 [00:10:03] 然後告訴你這些東西 [00:10:04] 理論上以他的 [00:10:07] 訓練的方式來講的確是 [00:10:09] 但是 [00:10:11] 他的確目前是現在最聰明的一個系統 [00:10:14] 就是能夠消化人類的知識跟告訴你一些東西的系統 [00:10:19] 但是有些人其實不太care [00:10:21] 反正這個都是 [00:10:23] 過時的 [00:10:24] 不是過時啦 [00:10:25] 就以後會有新的東西取代掉 [00:10:26] 這不是一個真正的 [00:10:28] 真正的GAI的東西這樣子 [00:10:32] 但是呢 [00:10:33] 他做出來的東西 [00:10:34] 其實很容易就被LM取代 [00:10:38] 像我們常常會 [00:10:39] 會去 [00:10:40] 去跟業界 [00:10:41] 談一下他們需求 [00:10:43] 然後他們就覺得這個東西很難很難 [00:10:46] 我說這個東西好像現在你用Cloud用Gemini就可以做了 [00:10:50] 你可能只是Prong要寫的好一點 [00:10:53] Skill要設計的好一點這樣子 [00:10:55] 所以這個大語言模型的演變會使得原來大家覺得他自己做很厲害的東西 [00:11:01] 就不再這麼厲害 [00:11:02] 就是 [00:11:03] 這個 [00:11:04] istan [00:11:06] 一般老百姓這個都可以做到的事情 [00:11:07] 不過anyway [00:11:08] 就是這樣 [00:11:10] 那當然這個Harvey他其實有 [00:11:12] 舉出幾個方向 [00:11:14] 但 [00:11:14] 這方向當然很粗但是我覺得 [00:11:16] 好像還適用就是說我們現在學 [00:11:19] NLP [00:11:20] 其實 [00:11:21] 你應該把自己定位好 [00:11:23] 你自己的角色 [00:11:25] 就是說ok好以工程的角度來講我們知道說這個東西讓他有用就是如果以後你去業界工作 [00:11:31] 老闆說你幫公司的工作流 [00:11:34] 加速一下 [00:11:36] 這個聽說這些 [00:11:37] 龍蝦很厲害你能不能串一下這樣子 [00:11:40] 所以你就必須導入 [00:11:42] 導入 [00:11:43] 你跟老闆說 [00:11:44] 這個我們一個月要花 [00:11:46] 這個 [00:11:46] 五萬塊買Token這樣子老闆就說就從你薪水扣這樣子 [00:11:51] 所以你要想辦法降低這個成本 [00:11:55] 就讓他變得非常的便宜非常的有效率你如何做這件事情以工程的角度 [00:12:00] 我想這個電子的學生 [00:12:02] 每天都在做這件事情 [00:12:04] 那甚至有些 [00:12:06] 其實有蠻多硬體設計的人會想說那我就做 [00:12:10] Transformer加速的部分 [00:12:12] 讓他可以在硬體上加速 [00:12:14] 就可以做一些比較 [00:12:16] 特別的一些晶片 [00:12:18] 那就不用 [00:12:19] 跟Media買這麼貴的東西這樣子 [00:12:23] 那當然我們也是希望他能夠 [00:12:25] 做的 [00:12:26] 越有用越好 [00:12:27] 就是以前可以幫我們寫報告但是這個報告好像老師一看就知道是ChangeBee寫的 [00:12:33] 能不能做出一個報告是 [00:12:34] 老師覺得是我寫然後就寫的很好的東西 [00:12:37] 這是Useful [00:12:38] 就是他真正能夠產生價值 [00:12:41] 而不是一看就是 [00:12:43] 那個AI味很濃的東西這樣子 [00:12:46] 就是好像有講到東西但是 [00:12:48] 那個Value是相當低的東西 [00:12:51] 所以他如何跟Domain [00:12:53] 如何跟Local跟地端的東西 [00:12:57] 或是說跟人的知識結合這一塊 [00:12:59] 其實是在Application Label是 [00:13:02] 相當重要的 [00:13:03] 當然 [00:13:03] 後面這一段 [00:13:04] 就是這個Understandable [00:13:07] 就是說我們希望 [00:13:09] 他這麼厲害的東西 [00:13:11] 到底為什麼可以做到其實現在 [00:13:13] 有很多的很有名的學界大佬都說 [00:13:17] 這個現在AI的發展是沒有任何理論基礎 [00:13:22] 其實你大概就可以想這樣等我們教完就知道 [00:13:25] 其實就是Language Model [00:13:27] 那你沒有什麼基礎嗎 [00:13:29] 你沒有什麼理論嗎 [00:13:30] 可以用一條式子寫出來說 [00:13:32] 他可以最佳化什麼東西嗎 [00:13:33] 其實是沒有 [00:13:35] 其實是沒有 [00:13:36] 只是說他真的可以做到一些事 [00:13:39] 但是我們就想知道說 [00:13:42] 我們如何Garantee這件事情 [00:13:44] 比如說你要做一個 [00:13:47] 飛彈 [00:13:48] 軍事 [00:13:49] 的系統 [00:13:50] 你說我導入LM [00:13:53] 那個司令問你說這個東西 [00:13:56] 我們 [00:13:57] 會不會 [00:13:58] Garantee這個 [00:14:00] 殲滅敵人的機率是多少 [00:14:02] 你只能說 [00:14:03] 只要他在沒有幻覺情況底下 [00:14:05] 我們會成功這樣子 [00:14:07] 你就不太知道他怎麼運作 [00:14:09] 就不知道細部你如何Garantee他的Quality [00:14:12] 所以有很多研究會在於說我們如何把這個 [00:14:16] 黑盒子這個黑科技把他 [00:14:19] 理解的更透徹一點這樣子 [00:14:22] 那當然我想回到 [00:14:24] 比較 [00:14:25] 務實一點的層面就是一般我們NLP在講這件事情的時候 [00:14:29] 我們當然就會說因為現在文字是一個很 [00:14:33] 很Popular的 [00:14:34] 的一個Data [00:14:35] 就是你現在看到的東西你現在網路上看尤其是在 [00:14:40] 2000年網路泡沫的時候 [00:14:42] 開始有一些Webpages出來之後 [00:14:44] 其實有大量的文字 [00:14:46] 出現 [00:14:47] 那如何讓 [00:14:48] 電腦也能夠理解這些東西 [00:14:51] NLP的重要性越來越高 [00:14:53] 所以其實 [00:14:55] 你要看一個技術是否重要你可以回推到以前就是 [00:14:59] 從Google [00:15:01] 起來那個年代 [00:15:02] 搜尋引擎起來 [00:15:03] 那個年代為什麼 [00:15:05] 這麼重要 [00:15:06] NLP或是資訊檢索以前是一個非常冷門的以前是 [00:15:11] 叫做 [00:15:12] 以前是 [00:15:13] 圖書館系的人會去學的東西 [00:15:16] 如何有效的管理知識 [00:15:19] 就是把 [00:15:20] 圖書館的館藏 [00:15:21] 鎖音好 [00:15:22] 讓大家比較有效率的找到這些東西 [00:15:25] 但是這些東西如何套用在 [00:15:29] WireWave上的Tags [00:15:31] 就會變得更復雜更有學問 [00:15:33] 所以 [00:15:34] 就會有 [00:15:34] 大量的研究所以 [00:15:36] 搜尋引擎在2000年時候就 [00:15:38] 非常重要而且 [00:15:40] 也看到它的價值 [00:15:43] OK [00:15:43] 所以其實我們可以說NLP其實是 [00:15:46] 讓電腦去了解跟使用 [00:15:50] 當然你現在看到這一句你會覺得 [00:15:52] 這個 [00:15:53] common sense [00:15:54] 這個好像就是這樣 [00:15:56] 但是如果到30年前 [00:15:58] 其實大家 [00:15:59] 不會寫這句話 [00:16:00] 不敢寫這句話 [00:16:02] 因為 [00:16:02] 其實 [00:16:03] gap還非常的大這樣子 [00:16:07] 好 [00:16:07] 那為什麼很重要這個我想就 [00:16:10] 就看看就好了 [00:16:12] 因為這個你現在所有東西你現在 [00:16:15] 用的大語言模型你現在用的AI [00:16:18] 其實後端都是因為他能夠消化人類的所有知識 [00:16:22] 那為什麼他能夠消化 [00:16:25] 其實我說消化可能也不太對了 [00:16:27] 因為他真的能消化我也不知道 [00:16:29] 但是他至少知道人類所有的文字的東西 [00:16:32] 然後如何反饋如何摘要給你東西 [00:16:36] 這個對人類來講 [00:16:37] 是有用的這樣子 [00:16:39] 所以 [00:16:39] 從你的日常生活從你的 [00:16:42] 這個業界從這個學術界 [00:16:44] 你都會看到很多的 [00:16:47] 這個需求 [00:16:48] 但我們都很希望做到這件事情 [00:16:50] 就是我在旁邊然後 [00:16:53] AI就幫我做研究然後 [00:16:55] 按下去明天就一篇paper出來這樣子 [00:16:58] 其實這件事已經在發生 [00:17:00] 已經在發生了 [00:17:01] 其實如果大家有開始 [00:17:02] 因為這是研究所的課碼 [00:17:04] 可能在座應該百分之八九十都是研究所的學生 [00:17:08] 如果大家有在開始投稿就發現 [00:17:09] 現在這些頂會為什麼那個submission count都非常高 [00:17:13] 一個會議 [00:17:14] 就有一萬篇兩萬篇的paper [00:17:18] 在投稿這樣子 [00:17:19] 雖然有一些是被regret繼續投下一輪 [00:17:22] 但是其實我 [00:17:25] 以我審稿的經驗大概有 [00:17:27] 百分之二十的paper都是 [00:17:30] 全自動或者是半自動 [00:17:32] 產生的 [00:17:33] 就是人機協作過程中的產物 [00:17:36] 但是那個quality跟那個 [00:17:39] 鑑別度就是你已經 [00:17:41] 很難區分 [00:17:43] 那個AI的痕跡 [00:17:44] 那也是頭頭是道數據也非常清楚 [00:17:47] 那這件事情在發生 [00:17:50] OK [00:17:51] 那大家 [00:17:53] 如何善用 [00:17:53] 這是 [00:17:54] 就想象一下 [00:17:56] 那這個例子只是說 [00:17:59] 以前啊 [00:18:00] 在TradeGPT [00:18:01] 2022年 [00:18:02] 還沒出來的時候 [00:18:04] 其實我們大家有時候不會覺得 [00:18:06] 這幾個應用都比較像是研究所的碩士論文會做的 [00:18:09] 我們要做一個 [00:18:11] 這個 [00:18:12] 這個病例報告自動生成的系統 [00:18:14] 或者是說我要做一個法務這個合約判斷的系統 [00:18:18] 這個都可以在碩士論文裡面查到這樣的研究 [00:18:24] 但是從LM出來之後呢這些研究變得 [00:18:27] 落地性很高 [00:18:28] 就是你可以跟 [00:18:30] 廠商合作說我幫你做這件事 [00:18:32] 他也覺得你不是在騙錢的這樣子 [00:18:34] 你真的做得出來這樣子 [00:18:36] 所以這個gap [00:18:37] 這個中間的差距他不是一個很線性的 [00:18:40] 其實老實說 [00:18:41] 在LM出來之後 [00:18:43] 有很多的應用是往上漲 [00:18:45] 就是那個 [00:18:47] 以前 [00:18:47] 做不太到現在立刻就可以做了這樣子 [00:18:51] OK [00:18:52] 那當然我想這個 [00:18:54] 大家都熟悉大概四年前 [00:18:55] 11月應該就 [00:18:57] 就快滿四年了 [00:18:58] TradeGB出來的那一段 [00:19:00] 時間 [00:19:00] 造成了整個科技界的 [00:19:02] 轟動這樣子 [00:19:03] 那 [00:19:05] 可能 [00:19:06] 你們比較感應 [00:19:08] 沒有感受沒有那麼高 [00:19:10] 因為 [00:19:12] 當你們開始接觸科技的時候他就是有這個東西 [00:19:17] 所以你可以想象就很像 [00:19:19] 當初原始人 [00:19:21] 還不知道該用火的時候突然這個雷打下來他們發現這個火這麼好用 [00:19:27] 老師這個年紀大概就是那個原始人時代就突然覺得有一個這麼 [00:19:30] 上帝賦予的功能 [00:19:32] 工具的時候 [00:19:33] 他就是一個這種感覺 [00:19:35] 但是 [00:19:36] 如果你是在後面出生的人就覺得這個本來就是一個 [00:19:40] Must [00:19:41] 就是一定是要有一個這樣的東西就不覺得說 [00:19:45] 這個 [00:19:45] Revolution是相當的高 [00:19:48] 那當然 [00:19:49] 這個中間的歷史其實如果你有學過AI的課大概就會跟你談說從Deep Learning [00:19:54] 開始到所謂的生成式AI的部分 [00:19:58] 這邊我們沒有要細講每個模型 [00:20:00] 不過大家就可以 [00:20:01] 這個這個其實 [00:20:02] 每個模型也都很舊了 [00:20:04] 就是說 [00:20:05] 從 [00:20:06] Transformer出來之後有很多的 [00:20:09] 或是之前 [00:20:10] 或是之後 [00:20:11] 都有很多 [00:20:12] 講 [00:20:13] 這樣的 [00:20:14] 東西 [00:20:15] 不只是在做角色式的模型 [00:20:17] 它可以做 [00:20:18] Decoder可以產生的東西 [00:20:20] 所以它可以產生文字可以產生 [00:20:23] 音樂可以產生影像可以甚至可以呈示碼這樣子 [00:20:27] 所以這樣的東西的導入呢就可以讓你的應用 [00:20:30] 變化相當的多了 [00:20:32] 這很快的我就帶一下 [00:20:33] 不過這個例子都是 [00:20:36] 一年多前做的 [00:20:38] 現在看起來都非常的low這樣子 [00:20:40] 就是quad很差 [00:20:41] 然後AI味很重這樣子 [00:20:43] OK我想這個大家都用過 [00:20:45] Text to Image [00:20:46] 或是說 [00:20:47] 現在如果你們用Vibe Coding的時候 [00:20:50] 你叫AI幫你寫程式 [00:20:53] 其實這個東西現在已經非常普遍了 [00:20:56] 其實像我 [00:20:58] 面試學生或是 [00:21:00] 專題生 [00:21:01] 我都問他說 [00:21:02] 你現在Vibe Coding的比例是多少 [00:21:05] 當然學生 [00:21:06] 心裡馬上就跑一個東西 [00:21:09] 老是問這個事要試探我沒有自己寫程式嗎 [00:21:12] 然後就會 [00:21:13] 就會稍微說我都自己寫 [00:21:15] 我都很認真自己寫這樣子 [00:21:17] 然後 [00:21:18] 只有用AI問一下這樣寫對不對這樣子 [00:21:21] 當然以學習來講我覺得這是比較好的 [00:21:24] 但是對於 [00:21:26] 整個 [00:21:26] 你要寫程式的performance來講 [00:21:28] 或是以現在的趨勢來講 [00:21:31] 甚至在業界 [00:21:32] 他們現在可能都超過80甚至90 [00:21:35] 的比例 [00:21:35] 是Vibe Coding [00:21:37] 這也是為什麼現在資工系 [00:21:39] Fresh的學生 [00:21:41] 找不到工作 [00:21:42] 就是說 [00:21:42] 你會寫的東西 [00:21:44] 這個LM都可以做了這樣子 [00:21:46] 所以 [00:21:47] 你的必要性就會降低這樣子 [00:21:49] 不過anyway [00:21:51] 我覺得 [00:21:52] 資工系的訓練應該是要 [00:21:54] Based on這個東西再上去 [00:21:56] 因為你用過Vibe Coding就知道 [00:21:58] 其實最麻煩的可能就是後面 [00:22:01] 或是前面的 [00:22:02] 系統架構的部分 [00:22:03] 那一端應該就是 [00:22:05] 資工系 [00:22:06] 應該的強項 [00:22:09] 好 [00:22:10] 我這邊秀幾個畫面 [00:22:12] 不過老實說這個例子也是久的 [00:22:14] 這個比較像以前的 [00:22:16] 你在ID的環境 [00:22:17] 他做一些Auto Complete的動作這樣子 [00:22:21] 老實說 [00:22:22] 在NLP的課程講codegen [00:22:24] 好像不太合理 [00:22:25] 因為 [00:22:26] 這個跟我們中文英文無關 [00:22:29] 但是你要想像 [00:22:31] Program 程式也是一個語言 [00:22:33] 只是不是我們人類講話語言 [00:22:36] 但是他是一個 [00:22:37] 我們人類跟電腦的 [00:22:39] 互動的高階語言 [00:22:41] 所以現在的codegen模型的codegen能力已經非常好 [00:22:45] 為什麼你可以用Vibe Coding [00:22:46] 就是 [00:22:47] 他底下他已經瞭解這些 [00:22:50] 這些 [00:22:51] 寫程式的道理 [00:22:52] 所以他可以幫你做很多事情 [00:22:54] 不過當然 [00:22:55] 我覺得他問題還是很多 [00:22:57] 而且 [00:22:57] 大概只能做基礎的 [00:22:59] 能夠加速你一些的 [00:23:01] 的 [00:23:02] 的 [00:23:03] 開發時間 [00:23:05] 但是你要思考一下 [00:23:06] 從有Vibe Coding到現在 [00:23:09] 才過多久的時間 [00:23:12] 可能不到一年 [00:23:14] 就真正成熟到現在不到一年 [00:23:17] 一年就有這樣發展 [00:23:18] 你可以想像在接下一年或兩年 [00:23:21] 他會變成什麼樣子 [00:23:23] 甚至你也不需要下Program [00:23:26] OK [00:23:27] 所以這個演變大家可能要稍微 [00:23:30] 感受一下這樣子 [00:23:31] 當然這是以前舉的例子 [00:23:36] 就是說以前 [00:23:37] 會出一個作業叫大家寫 [00:23:40] 你用LN去包裝 [00:23:42] 產生一篇 [00:23:43] 一個 [00:23:45] Fake News [00:23:46] 這個其實 [00:23:47] 在速發部他有希望能夠去detect這樣的東西 [00:23:51] 網路上的 [00:23:52] 的訊息 [00:23:53] 靠AI產生的比例 [00:23:55] 虛假的訊息比例 [00:23:57] 那 [00:23:59] 這個檔案 [00:24:00] 現在你不會覺得他是一個很神奇的東西 [00:24:03] 因為 [00:24:03] 這個太容易做 [00:24:04] 只是說 [00:24:05] 你要 [00:24:06] 跳過他前面的一些 [00:24:09] filter [00:24:10] 就說你不能叫確定力教你 [00:24:12] 怎麼做炸彈 [00:24:13] 但是你可以 [00:24:15] 模仿一下 [00:24:16] 比如說 [00:24:17] 這個 [00:24:20] 像這個 [00:24:20] 這個是當初網路上 [00:24:22] 的新聞 [00:24:23] 就是說 [00:24:24] 在美國選舉的時候 [00:24:26] 有人用很多假新聞來做這件事情 [00:24:29] 但是如果你要直接叫LN用 [00:24:33] 叫他寫一篇關於某個候選人的假新聞的時候 [00:24:37] 其他不做 [00:24:39] 但是你如果用一個比較學術用討論的語氣說 [00:24:43] 你能不能模仿一下這個川普 [00:24:46] 去寫一個關於歐巴馬是 [00:24:48] 這個不是美國人這件事情 [00:24:50] 他就做了這樣子 [00:24:53] 就是 [00:24:53] 他是一個一板一眼的 [00:24:56] 互動的人這樣所以他就可以寫這樣的東西 [00:24:58] 你可以想像這樣東西在網路上流傳的時候 [00:25:01] 他造成的效益是多少 [00:25:03] 那大家應該也知道現在網路上有太多的訊息 [00:25:06] 都是AI產生的 [00:25:08] 但是可能這些訊息可能也都是AI在讀的這樣子 [00:25:12] 所以也是AI之間互相的溝通 [00:25:16] 這是也是當初一個例子就是講COVID-19的 [00:25:19] 就是有一些訊息說這個打疫苗不好 [00:25:23] 我應該要去吃什麼東西這樣子 [00:25:25] 他就用一個非常專業語氣在講這些事情 [00:25:28] 那這種東西所造成的負面效益其實非常大 [00:25:32] 不過我們並不太 [00:25:33] 大概會把Fake News這件事情擺在這門課講太多這樣子 [00:25:39] 當然還有什麼多麼太的 [00:25:41] 不過我們這門課比較不會牽扯到 [00:25:44] 影像的 [00:25:44] 或是Speech的部分 [00:25:46] 所以Multimodality的部分 [00:25:48] 其實不太會Cover到 [00:25:50] 不過基本上 [00:25:51] 現在你可以發現其實就是換掉一顆模型 [00:25:54] 換掉你的輸入的東西 [00:25:56] 其實後面的手法 [00:25:58] 其實都不會差太多這樣子 [00:26:00] 那當然有所謂做Action的 [00:26:03] 就不太是文字的 [00:26:05] 當你瞭解Transformer他在訓練的方式的時候 [00:26:08] 他讀文章進去訓練方式 [00:26:10] 你就可以發現說 [00:26:12] 那我不要給他文章了 [00:26:13] 我給他一堆的動作 [00:26:15] 比如說把桌面清乾淨這些Action [00:26:20] 輸入給他這樣子 [00:26:22] 那其實是一個非監督式的學習 [00:26:24] 就是有這樣的動作你就去看一下 [00:26:27] 原來 [00:26:28] 我要把手臂舉起來之前 [00:26:30] 我要做什麼事情 [00:26:31] 有一個標準的流程 [00:26:33] 這些流程其實就跟 [00:26:34] 你在寫一篇文章一樣 [00:26:36] 你要起承轉合 [00:26:38] 你要有動詞主持授詞 [00:26:40] 所以Action的 [00:26:41] Sequential的Action [00:26:43] 基本上也可以想像滿足語言特性的一些Pattern [00:26:48] 所以也有人用這樣概念在訓練所謂的Action Model [00:26:53] 那當然這個產生圖片這件事情 [00:26:56] 就大家都知道的事情 [00:26:58] 那我就 [00:27:00] 其實真的就是 [00:27:01] 你就換掉一顆 [00:27:02] VLM [00:27:03] 就是把LM換成一個VLM [00:27:05] 然後你就可以 [00:27:06] 讀影片 產生影片 [00:27:08] 或是 [00:27:08] 做 [00:27:09] 識別 做一些Grounding [00:27:11] 你就可以做不同的東西 [00:27:13] 所以 [00:27:15] 其實 [00:27:15] 現在模型的能力越來越Power [00:27:18] 你 [00:27:19] 遇到做的事情就會越來越少 [00:27:21] 但是大家可能就會發現你自己存在的必要就會越來越少 [00:27:26] 所以你就要開始找 [00:27:27] 你能夠 [00:27:28] 你的Niche在哪裡 [00:27:31] 這後面有一個新聞 [00:27:32] 這剛好我在 [00:27:34] 昨天在整理 [00:27:34] 在準備今天投影片的時候 [00:27:36] 發現一個新聞 [00:27:37] 當然 [00:27:38] 這個 [00:27:39] 這個 [00:27:40] 這一位 [00:27:41] 他其實 [00:27:41] 很常發新聞 [00:27:43] 但是你會發現他的新聞常常正負面 [00:27:46] 換來換去這樣子 [00:27:48] 跟那個Mask有拼這樣子 [00:27:51] 就是突然說什麼好的突然又說什麼不好這樣子 [00:27:54] 不過他講這件事我覺得是蠻有道理 [00:27:57] 就是說 [00:27:58] 現在AI的強大 [00:28:00] 其實他可以讓以前 [00:28:02] 點子非常多的這些人 [00:28:06] 但是他做不出來 [00:28:08] 的這些人 [00:28:09] 突然有很大的Performance出來 [00:28:12] 因為他可以 [00:28:13] 創造很多東西 [00:28:14] 因為你可以想他就是拿到一個Power Tool [00:28:18] 他可以做很多事情 [00:28:20] 所以現在有很多新創公司 [00:28:22] 那個 [00:28:23] 公司人數都是一個人兩個人而已 [00:28:25] 所以 [00:28:26] 其實現在 [00:28:27] 這是正在發生的事情 [00:28:31] OK不過當然這個Sam Altman也有一些 [00:28:33] 負面的他們OpenAI [00:28:35] 也不是在幹一些好事 [00:28:37] 這我就擺一個小小在這邊 [00:28:39] 這個是最近有一個新聞就是 [00:28:42] 就是有一個 [00:28:44] 老實說我看這個問題看很久我也不知道為什麼當初 [00:28:49] 這些數學家要討論這種問題 [00:28:51] 反正如果大家有興趣可以把這個關鍵字 [00:28:53] 搜尋一下 [00:28:54] 反正 [00:28:56] 說真的我不太知道這個問題我已經看很久了 [00:28:59] 反正就是一個存在的 [00:29:00] 很久的一個數學的問題這樣子 [00:29:03] 那這個過程這個故事就是說這個當初這個數學家 [00:29:09] 跟一位在Entropy公司工作的人 [00:29:12] 已經 [00:29:13] 把這問題已經 [00:29:14] 算解完了已經差不多 [00:29:17] 快結束了 [00:29:18] 然後呢 [00:29:19] 這個OpenAI的人就覺得不行 [00:29:22] 如果被Entropy公司先發表說他們模型就 [00:29:25] 就佔了版面這樣所以OpenAI就集全公司很大的算力去做這件事情 [00:29:31] 這樣聽起來好像是公平競爭 [00:29:33] 也還好 [00:29:34] 但是實際上如果大家有興趣可以去看一些細節 [00:29:37] 就是說 [00:29:39] 私底下他們有去跟這個數學家contact說 [00:29:43] 你要不要跟我們一起 [00:29:45] 發表這篇論文 [00:29:47] 不要理那個Entropy那個人這樣子 [00:29:49] 然後就 anyway就有點像利誘啊 [00:29:51] 你一樣可以拿到這個獎金 [00:29:53] 這好像有 [00:29:54] 一百萬美金一千萬美金 [00:29:56] 很多 [00:29:57] 那 [00:29:59] 那這個數學家當然就覺得 [00:30:01] 不道德 [00:30:02] 所以他還是繼續跟Entropy這樣 [00:30:03] 這個學者合作這樣子 [00:30:07] 然後就有點像同時解決這個問題 [00:30:10] 就OpenAI的模型也可以解決 [00:30:11] 然後 [00:30:12] 這個 [00:30:13] Entropy公司的模型可以解決這樣子 [00:30:16] 所以就有這個新聞 [00:30:18] 但是這個新聞其實後端 [00:30:20] 大家有一個在思考的點就是說 [00:30:23] 當初 [00:30:25] 這些data這些Entropy公司我也不知道為什麼 [00:30:28] 或者是這個數學家的東西 [00:30:30] 他好像有一些資料是擺在 [00:30:32] OpenAI上面 [00:30:33] 這樣子 [00:30:34] 好像anyway就是說有一點是這個leakage的問題 [00:30:39] 反正這 [00:30:40] 後端有一些這樣的故事 [00:30:42] 然後也有這種人性去 [00:30:44] 所以你可以知道現在模型發表 [00:30:46] 其實 [00:30:47] 都是講新聞版面 [00:30:49] 雖然大家會去在意那個Leaderboard的排名但是 [00:30:52] 但是有時候新聞大家覺得這個很厲害這個很厲害這樣子 [00:30:57] 這個就會影響他們的 [00:30:58] 那個 [00:30:59] 付費的 [00:31:01] 的 [00:31:01] Account [00:31:03] 好 [00:31:05] 我其實前面講這些其實並不是課程的重點 [00:31:09] 只是我想帶一下說AI這件事情在NLP [00:31:13] 的 [00:31:14] 施力點跟他現在改變的東西這樣子 [00:31:18] 那 [00:31:19] 我很快會把這邊講完 [00:31:21] 所以這邊其實不是我這個課的像比如說game [00:31:25] 其實從 [00:31:26] AI在做Generation這件這個概念並不是很common sense [00:31:32] 就是說 [00:31:33] 其實我要拿做AI做生成 [00:31:37] 以前是大家不會想都不會想 [00:31:39] 從GPT3之前 [00:31:42] 大家都不會說我可以用模型來寫一篇文章 [00:31:45] 這絕對不可能發生寫出來絕對一看就是電腦寫的 [00:31:49] 不是 [00:31:50] 文藝不通句子接不起來就是怪怪的這樣子就是論述也不對以前沒有這麼厲害 [00:31:57] 但是這件事情反而從影像那邊過來 [00:32:01] 好像做了出來然後文字 [00:32:03] 從GPT3之後 [00:32:04] 我發現好像可以說人話這樣子 [00:32:08] 那這個當然前面的歷史就會 [00:32:10] 更早以前 [00:32:11] 從 [00:32:12] 生成對抗網路這個大家如果 [00:32:14] 學過AI應該就知道 [00:32:15] 這是一個比較大家就知道說我可以讓電腦 [00:32:19] 自己 [00:32:20] 生成一些東西 [00:32:22] 這些生成東西不是人去做的 [00:32:24] 是電腦自己靠著一些規則靠你給他一些模型參數 [00:32:29] 他可以自己產生東西 [00:32:31] 當然這個game他主要是為來做對抗為來做自己模型的東西 [00:32:34] 調了更好的對抗的資料 [00:32:37] 但是你可以發現他可以生東西出來 [00:32:40] 而且是生東西出來是有用的這樣子 [00:32:43] 所以從game之後大家就覺得這個生成的東西實在太好用 [00:32:47] 所以我可以讓 [00:32:48] 電腦做什麼 [00:32:49] 其實這一塊很重要就是做訓練資料生成 [00:32:53] 或是擴充 [00:32:56] 大家如果學過AI就知道說其實訓練資料才是最寶貴的 [00:32:59] 雖然有很多非監督式學習的東西 [00:33:03] 但是 [00:33:04] 廠商給我就是十筆資料 [00:33:06] 病人醫院的資料就是那十筆 [00:33:09] 我怎麼樣去做一個很厲害的判斷的模型 [00:33:13] 所以你一定要有一個 [00:33:15] 可以產生更多有用的訓練資料方法 [00:33:18] 所以這GAI就在這些需求下就蓬勃發展這樣子 [00:33:23] 這個都比較是影像的應用 [00:33:25] 所以這個 [00:33:27] 大家可以想像一下這個東西 [00:33:30] 你可以想像這是2016年NIPS的一個tutorial講的東西 [00:33:34] 到現在十年了 [00:33:36] 雖然 [00:33:38] 現在大家不太用GAME來做生成 [00:33:41] 有更好的技術在做 [00:33:44] 所以其實你可以想像這件事情他的 [00:33:47] 他不只是幫你做一個很 [00:33:49] 要報告的圖片 [00:33:51] 做一個什麼東西的 [00:33:53] 文章 [00:33:54] 他可以 [00:33:55] 輔助到很多層面甚至他可以自己幫助自己在訓練的更好 [00:34:00] 所以GENERATION這件事情你不要太侷限 [00:34:03] 他的範疇 [00:34:04] 就是這樣子 [00:34:06] 但是在文字上 [00:34:07] 其實 [00:34:08] 這個時間軸可能要再拉更早以前 [00:34:11] 在文字上其實沒有 [00:34:13] 這麼聰明 [00:34:15] 沒有那影像當然是後面 [00:34:17] 但 [00:34:19] 做NLP大概會從這四個 [00:34:21] 四個軸開始 [00:34:23] 大家可以看一下 [00:34:24] 不過我們 [00:34:25] 並沒有講這些這麼細的東西因為現在不需要 [00:34:29] 我們會從最上面的Morphology構制 [00:34:32] 所以你會談到字的 [00:34:34] 前綴後綴這些東西 [00:34:36] 這個當然在中文是沒有 [00:34:39] 但是在任何拉丁語系都有 [00:34:43] 大家如果學過去考過 [00:34:45] 這個GRE英文就要背什麼 [00:34:47] 什麼前綴詞後綴詞這些東西 [00:34:51] 那甚至你要學所謂的stemming [00:34:53] 段字甚至後面的syntax你要學會 [00:34:57] 這個詞性 [00:34:58] 就是你要知道動詞主詞受詞這些東西 [00:35:01] 所以NLP的技術的發展是這樣的 [00:35:04] 每一個 [00:35:05] 每一個階段它都可以是一個非常重要的主題 [00:35:09] 所以 [00:35:09] 像以前 [00:35:10] 做Name Entity Recognition就是一篇文章裡面我如何知道 [00:35:15] 國立清華大學這六個字是在講一個學校的名字 [00:35:21] 如何去判斷一些詞之間是有關係的 [00:35:25] 國立清華大學跟清大 [00:35:27] 是 [00:35:28] 同樣講同樣的東西的 [00:35:30] 這個就是一個Numeration的問題 [00:35:33] 所以你會發現以前在 [00:35:34] 看NLP的問題的思考點就非常細 [00:35:39] 就是有點像你一步一步教會電腦去看這個句子 [00:35:44] 我們人是怎麼理解的我們人 [00:35:46] 學會文章是怎麼理解我現在就一步一步教會電腦去做這些事情 [00:35:52] 那以前的做法是這樣 [00:35:54] 但是到後來就 [00:35:56] 極限了遇到一個瓶頸 [00:35:59] 那 [00:36:00] 我都會舉這個例子就是在2017年應該也是10年前 [00:36:04] 就是國科衛辦了一個比賽 [00:36:07] 講了這件事情 [00:36:08] 你如何讓電腦去做閱讀理解 [00:36:11] 就是給他一個問題 [00:36:13] 然後給他選項 [00:36:14] 電腦能不能回答出這個答案 [00:36:18] 那以前的做法呢就是把選項呢去比對 [00:36:22] 比對文章算相似度這樣子 [00:36:25] 但是你會覺得這個很笨啊就是把它丟到checkgpt問一下 [00:36:29] 然後給他選項他就會回答 [00:36:31] 沒錯 [00:36:31] 但是你有沒有思考 [00:36:33] 這些模型是怎麼 [00:36:34] 怎麼做到這件事情 [00:36:37] 以前我們就只停留在說我要把每一個選項 [00:36:41] 去比對關鍵字 [00:36:43] 或者是把它轉換成一個項鍊 [00:36:46] 用一堆數字來表示這些文字 [00:36:49] 但是一樣在算相似度 [00:36:53] 那這個相似度呢就是在不同的Domain [00:36:55] 可能是你把它轉換成某一個 [00:36:58] Megaspaces的Domain去算相似度 [00:37:01] 你並沒有真正去理解說這個 [00:37:04] 他 [00:37:04] 前因後果是什麼這樣子 [00:37:07] 對 [00:37:08] 那 [00:37:11] 我們還是不要問 [00:37:12] 這個 [00:37:13] 這一題的答案其實不見得會固定 [00:37:16] 就是大家的idea [00:37:18] 覺得 [00:37:19] 這個是什麼 [00:37:20] 這個是從 [00:37:22] 這個國語文能力測驗出來的 [00:37:24] 大概是 [00:37:26] 中年級小學中年級的程度 [00:37:30] 那也會拿來去考外國人說他到底看得懂中文沒有這樣子 [00:37:35] 那當然以一般我們這個native speaker中文的native speaker來講 [00:37:39] 這應該蠻簡單但是 [00:37:41] 你可以回去讀一下 [00:37:42] 好像不是這麼容易 [00:37:46] 這是在2017年辦的比賽 [00:37:48] 然後 [00:37:49] 第一名獎金有1000萬 [00:37:51] 辦了兩屆這樣子 [00:37:53] 那 [00:37:53] 據說 [00:37:55] 第一名獎金都沒有發出去 [00:37:57] 不知道是國客會 [00:37:59] 沒有誠意還是 [00:38:00] 怎麼樣 [00:38:01] 這個好像有錄影 [00:38:03] 就是後來 [00:38:05] 後來那個 [00:38:05] 那個 [00:38:07] 那個 [00:38:08] 審查委員那個裁判 [00:38:10] 說的說大家都 [00:38:13] 都沒有做好 [00:38:14] 意思是這樣 [00:38:15] 就沒有做很好這樣所以第一名從缺這樣子 [00:38:17] anyway [00:38:19] 然後這是問CHATGPT的 [00:38:21] 他會告訴你答案 [00:38:22] 重點是大概可以解釋 [00:38:25] 科技大學當初分兩個階段 [00:38:27] 第一個是回答選擇題 [00:38:29] 第二個是你要告訴我為什麼 [00:38:32] 那你要能夠解釋這件事情是 [00:38:34] 在2017年是 [00:38:35] 大家覺得這根本是 [00:38:37] 聖盃啊根本是做不到的事情 [00:38:40] 但是你現在隨便拿一個 [00:38:42] 拿一個transformer decoder [00:38:44] 餵給他他就會 [00:38:46] 告訴你這些東西雖然不見得這麼好 [00:38:48] OK [00:38:51] 所以 [00:38:51] 你可以想像這個gap是 [00:38:53] 一個 [00:38:55] 非常discrete的jump上去 [00:38:57] 並不是一個很 [00:38:59] 連續的成長 [00:39:02] 那其實這件事情 [00:39:04] 以前啊就是 [00:39:05] 就是 [00:39:05] CHATGPT還沒出來之前 [00:39:08] 就有language model [00:39:11] 只是說老師這個就是我們現在把language model變大而已嘛 [00:39:15] 就是LLM [00:39:16] 沒錯的確他的精神是一樣的 [00:39:19] 是language model [00:39:20] 那以前我們在做NLP的人 [00:39:23] 不見得都會用到language model因為他 [00:39:27] 第一個是 [00:39:27] based on 機率的模型去講 [00:39:29] 而且通常我們訓練的語料也沒有很多 [00:39:32] 所以 [00:39:34] 這件事情 [00:39:35] 大家就 [00:39:36] 覺得他是理論的基礎 [00:39:38] 但是當初跟 [00:39:39] 語言模型有關的這兩位 [00:39:41] 可能在座如果以後要做speech或是做 [00:39:45] 治安的 [00:39:46] 同學你都會遇到這樣子 [00:39:48] 這非常有名的 [00:39:49] 尤其是 [00:39:50] Claude Shannon [00:39:50] 你看這個名字就知道 [00:39:52] 為什麼他有名 [00:39:54] 為了紀念他所以那個模型 [00:39:56] 就用他的名字 [00:39:58] OK [00:39:59] 好他們都有提到跟language model有關的東西 [00:40:02] language model其實 [00:40:04] 大家都知道啦就是 [00:40:06] 這種接龍遊戲 [00:40:08] TrackGP出來之後為什麼大家說要接龍遊戲就是這樣子 [00:40:10] 什麼東西前面是什麼 [00:40:12] 後面出來的機率 [00:40:14] 會不太一樣 [00:40:16] 那你就會去猜最好的 [00:40:17] 雖然這個我用Google當例子 [00:40:19] 不是很好 [00:40:20] 因為Google他其實會拿那個查詢詞的分佈去做統計 [00:40:24] 並不是所有文獻去做統計 [00:40:27] 不然你以為你可以發現不同地方臺南新竹臺中 [00:40:31] 好吃的 [00:40:31] 後面的排序是不太一樣的 [00:40:34] 對 [00:40:35] 所以 [00:40:36] 這個 [00:40:37] 你可以想像大家常常查的東西是什麼 [00:40:41] 所以他有個probability model [00:40:42] 所以大家知道language model [00:40:45] 就是一堆詞的關係 [00:40:47] 我這邊拿 [00:40:50] 周杰倫的 [00:40:51] 周杰倫的歌詞 [00:40:52] 應該沒有版權 [00:40:53] 我再舉個例子這樣子就是 [00:40:55] 他的詞之間的關係 [00:40:58] 那但是做完之後發現 [00:41:00] 例子不是很好不過居然都做了就把他擺出來這樣子 [00:41:04] 因為 [00:41:05] 那個 [00:41:06] 周杰倫的詞都 [00:41:07] 很跳 [00:41:08] 所以那個機率不太好算這樣子 [00:41:11] 那我當然有試過 [00:41:13] 這個用 [00:41:14] 黃淑駿的 [00:41:17] 在座我們聽過黃淑駿這一位 [00:41:19] 歌手 [00:41:20] 聽過舉手一下 [00:41:24] 不入你們年紀這樣子 [00:41:26] 我用黃淑駿來做那黃淑駿其實也不太好做 [00:41:30] 因為他他的詞非常多沒錯但是他的 [00:41:34] 他的 [00:41:35] 他的詞也是很特別就是所以 [00:41:37] Probability也不太好算 [00:41:38] 不過anyway [00:41:40] 語言模型他其實就在算這些N-gram之間的發生的條件機率 [00:41:46] 就是你看到這個詞之後 [00:41:48] 看到這個詞的Probability [00:41:50] 這個條件機率你都會算 [00:41:51] 其實這個就是基礎的Language Model [00:41:54] 只是說你可以想像你如果只知道這件事情 [00:41:58] 你現在就回去想說 [00:42:00] 老師給我一大堆的文獻 [00:42:03] 我自己要算這些機率會發生什麼問題 [00:42:05] 第一個這要量太大 [00:42:08] 第二個可能有些東西沒有發生過啊 [00:42:11] 那機率是不是0 [00:42:12] 機率是0要怎麼算這樣子 [00:42:14] 所以 [00:42:15] 你可以先 [00:42:16] 不用先看答案自己先 [00:42:18] 試著做一下你就知道說原來 [00:42:21] 我想得到這些問題都已經有人解過這樣子 [00:42:24] 所以你就可以成長得很快這樣子 [00:42:29] 好 [00:42:30] 不過anyway現在我們探討NLP不是用這樣的角度去看 [00:42:35] 這張圖 [00:42:36] AI位也很濃沒錯 [00:42:39] 這其實是我自己手工畫了一下之後 [00:42:42] 然後再叫AI幫我把它美化一下 [00:42:45] 就是我們看到的NLP的歷史 [00:42:48] 從AI的角度來看 [00:42:52] 那個站著的同學就不好意思 [00:42:54] 我也很快 [00:42:56] 第一階段就會講完了這樣子 [00:42:58] 你們就可以看怎麼樣 [00:43:00] 就這個歷史其實跟NLP有關的發展 [00:43:03] 其實 [00:43:05] 當然後面很快 [00:43:06] 但你會發現其實前面我們在講這些事情 [00:43:09] 這一位大家應該都知道 [00:43:11] 這個Turing [00:43:13] 他 [00:43:15] 做Turing本訓之後去 [00:43:18] 探討說這個language之間 [00:43:20] 什麼樣language [00:43:22] 不同的type [00:43:22] 當然跟Transcript的 [00:43:24] 這樣的hierarchy有關 [00:43:27] 所以在那個年代在 [00:43:29] 這個19501960年代 [00:43:31] 其實就希望能夠那時候 [00:43:34] 其實電腦還沒出來喔 [00:43:35] 你可以想像 [00:43:36] Turing那時候是沒有computer的 [00:43:39] 大家就有這樣的想法 [00:43:40] 需要讓 [00:43:43] 電腦用 [00:43:44] 運算的方式去處理這種 [00:43:47] 這種sequential的東西 [00:43:48] 然後去理解裡面的一些pattern [00:43:52] 所以其實 [00:43:54] 在Chomsky那個年代就有一個chipboard [00:43:57] 就有一個chipboard出來這樣子 [00:43:59] 但是真正跟我們比較有關的 [00:44:01] 你可以想像說 [00:44:03] 在網路泡沫化起來的時候 [00:44:05] 那時候有很多的網路泡沫化起來的時候 [00:44:06] 那時候有很多的網路泡沫化起來的時候 [00:44:07] 在2000年時候有搜尋引擎 [00:44:09] 但是那時候大家做的是什麼 [00:44:11] TFIDF [00:44:13] 這個萬用的非常厲害的Baseline的做法 [00:44:17] 然後到後來大家覺得 [00:44:19] 這個Benji有說 [00:44:20] 我們可以用 [00:44:21] 模型的角度 [00:44:22] 用NN的角度來看這件事情 [00:44:25] 來做language model [00:44:28] 我們不是在算剛才的機率 [00:44:29] 我們用Chain的方式來做 [00:44:31] 從這邊 [00:44:32] 就整個蓬勃發展一直到 [00:44:34] 最明顯大家可能現在用 [00:44:36] 用NLP的人會想到說 [00:44:39] 我有一個叫Wall-to-Vector的東西 [00:44:41] 大概在 [00:44:43] 14年前2013年出來的東西 [00:44:46] 這個階段就整個起來了 [00:44:50] 整個 [00:44:51] 重要性跟他的 [00:44:54] 一大堆人就進來做這件事 [00:44:55] 因為發現有Wall-to-Vector [00:44:57] 我可以知道說 [00:44:59] 狗跟貓其實是比較像的 [00:45:01] 狗跟卡車其實比較不像的 [00:45:03] 利用這種演算法的東西之後 [00:45:05] 我就可以 [00:45:06] 做非常多事情 [00:45:07] 有很多應用就往上跳一階 [00:45:10] 但是到真正改變這個歷史的是在2018年 [00:45:15] 就是Bert跟GPT [00:45:17] 那個年 [00:45:17] 那個 [00:45:18] 年份同時出來 [00:45:20] 但是當時GPT出來之後大家 [00:45:22] 不看好他 [00:45:24] 因為他就是一個Decoder的模型 [00:45:26] 但是Bert呢是Basic on [00:45:28] 這兩個都是Basic on Transformer [00:45:29] 但是Bert是一個Encoder模型 [00:45:32] 所以大家覺得Bert很好用啊 [00:45:35] 他可以取代以前的Wall-to-Vector [00:45:36] 做的很好 [00:45:38] 所以你可以發現2018年之後 [00:45:40] 就一大堆Bert-based的應用 [00:45:42] 就是全部都用Bert [00:45:44] 所以 [00:45:45] 這個 [00:45:46] 2018年之後就是整個的 [00:45:48] 整個的Annual-Pair應用就大起飛 [00:45:51] 因為發現這個 [00:45:53] 以前笨笨的Chadbot [00:45:55] 都可以變得非常聰明 [00:45:57] 但是呢 [00:45:59] 這邊要秀的是GPT他也是默默的發展 [00:46:03] 這樣講好像他是一個弱者 [00:46:05] 其實他不是 [00:46:05] 只是說他就 [00:46:06] 朝著他的Decoder路線繼續做 [00:46:09] 那 [00:46:11] GPT-2出來之後大家也覺得 [00:46:13] 好像比較厲害一點 [00:46:15] 因為他GPT-1 [00:46:16] 第一代實在不怎麼厲害 [00:46:18] 那2出來之後好像 [00:46:20] 值得做下去了 [00:46:21] 一直到他3 [00:46:23] 他3出來之後是 [00:46:25] 非常厲害一個轟動的 [00:46:27] 的產品 [00:46:28] 那個Paper列出來之後 [00:46:30] 大家覺得原來可以 [00:46:32] 不是他的模型 [00:46:33] 他的模型的確很厲害但是大家驚訝的是 [00:46:35] 他是 [00:46:36] OpenAI花了這麼多錢 [00:46:38] 花了這麼多錢來做這樣子 [00:46:41] 他們甚至有一個 [00:46:42] 那個paper如果大家有興趣去download那個paper [00:46:46] 裡面那個作者寫一句話說 [00:46:48] 他們知道這個實驗的過程 [00:46:51] 有一個DSA用錯了 [00:46:53] 那個使用方式錯誤這樣子 [00:46:56] 但是呢 [00:46:57] 實驗已經跑下去了 [00:46:58] 如果要重新跑又要花 [00:47:01] 多少錢他們就不跑了這樣子 [00:47:03] 所以 [00:47:04] 你就可以知道他們花了 [00:47:05] 成本有多少這樣子 [00:47:07] 那個一次性 [00:47:08] 要做的 [00:47:09] 成本有多少 [00:47:11] 那 [00:47:12] 其實這個年代大家可能可以記一下就是這個年代大家也是確GPT快出來的時候 [00:47:18] 那 [00:47:19] GB3出來之後大家就突然覺得 [00:47:21] 讓電腦去 [00:47:23] 寫人類的文章是可行的這件事情 [00:47:27] 大家突然 [00:47:28] 覺得 [00:47:29] 可以做 [00:47:29] 以前都不行以前就覺得這個一看就是AI寫電腦寫 [00:47:33] 那GB3之後就 [00:47:35] 突然一袋一堆 [00:47:37] 有一堆公司去專門包裝GPT3 [00:47:40] 然後去做一些 [00:47:41] 這個 [00:47:42] 文章的service這樣子 [00:47:45] 那當然後面就所謂的InstructGPT跟 [00:47:49] 它後面的 [00:47:51] 包裝後的ChatGPT [00:47:53] 所以這個2022年的時候ChatGB出來之後後面就就是大家所熟知的故事 [00:47:59] 就是 [00:47:59] 大概發展是這樣 [00:48:01] 當然你會覺得說這個 [00:48:02] 後面這個四五年 [00:48:04] 發展的很快 [00:48:05] 前面怎麼那麼慢 [00:48:07] 前面 [00:48:08] 都很混嗎 [00:48:08] 沒有其實 [00:48:10] 當然跟硬體的成長有關係 [00:48:12] 當然也跟所有 [00:48:13] 資料量變多了 [00:48:15] 所有運算能力變強也有關係這樣子 [00:48:18] 但是以前 [00:48:18] 這些技術發展其實也是很多 [00:48:21] 這邊有很多的模型大家可以 [00:48:23] 可以看一下如果你都可以知道 [00:48:26] 每一個icon是什麼樣模型那表示你還蠻熟的這樣子 [00:48:30] 我還 [00:48:31] 放一個新的這個 [00:48:33] K3的東西 [00:48:35] 這個AI位很濃的圖 [00:48:39] 我們就看一看就好了 [00:48:40] 從以前到現在這樣子 [00:48:42] 這個比較像給小朋友看的 [00:48:45] 那 [00:48:49] 這個我等一下再回過頭 [00:48:54] 我先秀一下我們這堂課 [00:48:56] 這堂課會教的東西 [00:48:58] 我們會有助教課 [00:49:01] 在助教課大概就是 [00:49:03] maybe是 [00:49:04] 三到六個小時 [00:49:06] 其實也是教大家 [00:49:08] 呃 [00:49:08] 怎麼用Python做NLP的東西 [00:49:12] 或是 [00:49:13] 像後面RAG的東西會教一些 [00:49:15] Hugging face上或是 [00:49:18] 這個怎麼呼叫模型的部分這樣子 [00:49:21] 或是教你用這些 [00:49:23] RAG的一些 [00:49:25] 一些framework這樣子 [00:49:27] 那基本上我們會從 [00:49:28] 基礎的NLP開始講起 [00:49:30] 然後從Square model [00:49:34] 從基本上的類成金網路Square model從 [00:49:38] RNN LSTM [00:49:40] 雖然你們現在也不太用這些模型 [00:49:41] 但是我們會從那邊開始講起 [00:49:43] 然後一直到 [00:49:44] Transformer然後到Transformer現在的LM [00:49:47] 大家都會介紹這樣子 [00:49:48] 那 [00:49:49] 這學期我是希望能夠增加一些reasoning的部分 [00:49:53] 因為畢竟 [00:49:54] 現在LM的發展我覺得他已經越來越成熟 [00:49:57] 所以他後來大家外面的包裝的部分 [00:50:00] 或是大家現在想看到的adj的部分 [00:50:03] 我們會 [00:50:04] 帶一下一些比較新的趨勢這樣子 [00:50:08] 但是我其實不會涵蓋到語音 [00:50:10] 也不會教你怎麼用prong [00:50:12] 也不會我們重新設計模型 [00:50:14] 這都比較在 [00:50:16] AI的課程或者是GI的課程會介紹的 [00:50:19] 那課程的 [00:50:21] 內容大概是這樣 [00:50:22] 這是 [00:50:23] 這兩年都是這樣子 [00:50:25] 會簡介然後 [00:50:26] 基礎的部分 [00:50:28] 然後講 [00:50:29] 從wall embedding開始 [00:50:30] 到這些 [00:50:33] sequential的model這樣子 [00:50:35] 然後會介紹這些 [00:50:37] Bloodbath的 [00:50:38] 一系列的東西 [00:50:41] 其實到這邊後面其實就有一點 [00:50:45] 有一點雜了 [00:50:46] 說真的因為他發展非常快 [00:50:48] 但是 [00:50:49] 有些東西又必須要提一下提一下這樣子 [00:50:52] 所以 [00:50:52] 其實會有點雜會有點多 [00:50:55] 但是我想研究所課多半還是這樣 [00:50:57] 就是 [00:50:58] 去 [00:51:00] 觸發就是點一把火讓你們繼續學習這樣子 [00:51:05] 那我們 [00:51:06] 這一次的課程會有一個部分 [00:51:08] 不一樣的地方就是 [00:51:10] 會有一個考試 [00:51:11] 這是 [00:51:13] 有老師建議的 [00:51:15] 就是也有考試因為 [00:51:17] 我也覺得 [00:51:18] 很好 [00:51:19] 因為為什麼呢 [00:51:20] 因為我們主要有四個作業 [00:51:23] 那作業我會叫你們回答一些問題寫一些心得 [00:51:27] 有時候都發現這些學生心得寫的非常好 [00:51:30] 這個 [00:51:31] 這個分析的非常 [00:51:32] 這個深入啊 [00:51:34] 但是看他 [00:51:35] 講的東西好像前面也沒做這些實驗他為什麼知道這些實驗呢 [00:51:37] 他為什麼知道這些實驗呢 [00:51:38] 他為什麼知道這些實驗呢 [00:51:39] 看起來是AI協助這樣子 [00:51:42] 那也不是不行但是我覺得你要跟AI同步成長 [00:51:47] 所以我們會多一個測驗這個測驗是 [00:51:49] in person實體的 [00:51:51] 所以TICA在做實體的考試會有點麻煩 [00:51:55] 因為 [00:51:55] 跨校 [00:51:56] 所以跨校會同時間考這樣子 [00:51:59] 那考試的範圍就是我們教的內容 [00:52:01] 當然不會叫你去記什麼模型什麼公式怎麼怎麼弄啊 [00:52:06] 那個 [00:52:08] 題目我們會再設計 [00:52:09] 但是會有個考試 [00:52:11] 這是這一次比較不一樣的地方 [00:52:14] 然後我們就取消了term project [00:52:16] 這個我們會再講 [00:52:18] 那最主要就是四個assignment [00:52:20] 這再佔75% [00:52:21] 然後一次的期中考 [00:52:23] 那為什麼取消term project呢 [00:52:24] 因為 [00:52:25] 第一個人很多然後 [00:52:27] 以前會花掉太多時間去幫各位分組 [00:52:31] 因為大家有時候也不太認識然後 [00:52:33] 組員也不太認識 [00:52:35] 然後到報告那天才說這個組員從來沒有參與過 [00:52:37] 然後到報告那天才說這個組員從來沒有參與過 [00:52:37] 然後到報告那天才說這個組員從來沒有參與過 [00:52:39] 然後就有點麻煩 [00:52:41] 然後因為時間也很短因為第四個作業做完到term project [00:52:45] 只剩 [00:52:46] 一個月 [00:52:47] 當然 [00:52:48] 我們term project是其中就公佈了但是 [00:52:51] 學生都認為是我應該是在第四個作業做完才做term project [00:52:55] 所以你會覺得非常壓縮非常短 [00:52:57] 沒錯 [00:52:59] 當然有些同學的 [00:53:02] 回饋都還不錯都覺得可以學到一些東西這樣子 [00:53:05] 我不知道是不是表面話還是說什麼 [00:53:07] 這樣 [00:53:08] 不過我們就把term project取消了的確 [00:53:11] 那個這個 [00:53:12] 很難去judge大家的貢獻 [00:53:15] 那這個是我剛才提到的 [00:53:17] 就是我們會考試是實體的 [00:53:20] 所以這門課如果你是清大有用xclass修的學生你可能要記住 [00:53:25] 這個時間我們雖然是立在第14周但是 [00:53:28] 應該是不太會變了不過可能我還沒有把它定案 [00:53:32] 我就儘量不要排在 [00:53:33] 期末考周 [00:53:35] 就在前面 [00:53:36] 那 [00:53:37] 如果你是xclass的學生你大概是要確定 [00:53:40] 那一個禮拜的考試時間你可以出席這樣子 [00:53:45] 好這是大家 [00:53:46] 最關心的分數的分佈這是去年 [00:53:49] 第一年你可以去dcard上找 [00:53:53] 大家說這門課很甜啊什麼什麼 [00:53:55] 所以 [00:53:56] 第二門就稍微 [00:53:57] 調整了一下normalize一下 [00:53:59] 這個樣子看起來還好 [00:54:01] 還好 [00:54:03] 就是中位數大概是接近80所以其實 [00:54:06] 不難 [00:54:07] 不難尤其是我覺得我們作業 [00:54:09] 的難度有一點點 [00:54:11] 中偏低 [00:54:13] 主要是有一些跨領域的學生來修啦所以我並沒有把它調得太難 [00:54:18] 但是有時候這跨領域本來比 [00:54:20] 這個電子學院都還厲害這樣子 [00:54:22] 所以他其實是 [00:54:26] 作業 [00:54:28] 沒有太高難度 [00:54:30] 所以大概的分佈是這樣所以供你們參考這樣子 [00:54:34] 那 [00:54:35] 通常這邊都是放棄的學生啦就是你作業沒進來的學生 [00:54:38] 就是你作業沒教 [00:54:39] 因為作業 [00:54:40] 四個作業嘛你一個沒教你就知道你的分數大概 [00:54:43] 就不會在 [00:54:44] 裡面這樣子 [00:54:46] 那 [00:54:47] 我們作業因為人數很多那就是 [00:54:51] 以前我們都試過用AI改 [00:54:53] 但是 [00:54:54] 有點難度所以我們現在都會一起協作啦還是有人 [00:54:58] 助教還是進去看然後 [00:55:01] AI可能就是看一些 [00:55:03] 程式的部分或是什麼 [00:55:04] 但是基本上是協作的這樣子 [00:55:07] 那的確以前的 [00:55:08] 大家都會反映說 [00:55:09] 作業的評分標準 [00:55:12] 不太明確這部分我們會再修正一下讓它變得更 [00:55:15] 更 [00:55:18] 大家被扣分會甘願一點我們會把寫清楚一點這樣子 [00:55:22] 那 [00:55:23] 研究所課我希望大家有一些討論分析 [00:55:26] 當然這一塊你們大家都會 [00:55:29] 跟AI協作但是我覺得 [00:55:32] 如果AI要講一些事情你又可以反饋到你自己前面再補做一些實驗 [00:55:37] 我覺得就很好這樣子 [00:55:41] 重點是要你自己的insight或者是說AI告訴你insight你可以瞭解原來對沒錯 [00:55:47] 這以前我沒想到AI的確 [00:55:49] 告訴我這些這樣子 [00:55:51] 那這大概是作業會的 [00:55:54] 類型這樣子 [00:55:56] 那當然我覺得 [00:55:57] 你要對文字有興趣啦因為這不是一個AI的課 [00:56:01] 所以如果你只想學Transformer你應該可以去 [00:56:05] AI或是Deep Learning的課去學那邊可能講得更細一點 [00:56:08] 我這邊Transformer的課是很簡單的 [00:56:09] Transformer其實不會講得那麼細 [00:56:11] 但是我還是會用NLP的角度去看整個模型的 [00:56:17] 運作方式跟重要性這樣子 [00:56:22] 好 [00:56:23] 這是幾個以前學生的意見啦就是 [00:56:26] 供你們參考當然有好的啦 [00:56:29] 有 [00:56:31] 覺得不錯的這樣子 [00:56:33] 那不過大家也會 [00:56:35] 說實在的有錄影有直播 [00:56:38] 大家可能平常就不會上課也不會來學 [00:56:41] 所以今天這個盛況大概是隻有一次這樣子 [00:56:47] 後來就越來越少大家覺得反正我 [00:56:50] 我課後用三倍數播放這樣 [00:56:53] 我就可以很快的讀完這門課 [00:56:55] 就是你會到寫作業時候才會去follow這件事情 [00:56:59] 那 [00:57:01] 如果你有程度其實還OK但是如果你本來程度沒有這麼跟那麼上的話會比較吃力一點 [00:57:08] 這大概是提醒大家一下 [00:57:10] 好這是一些基本的data [00:57:13] 就是 [00:57:14] 我的資料會在 [00:57:16] 臺卡在 [00:57:18] 臺大那個NTU COOL頁上都有 [00:57:20] 然後我的實驗室的Github的 [00:57:23] 這個課程網頁 [00:57:26] 會把這個也會同時Miro同時一樣的東西 [00:57:30] 然後這因為這邊有 [00:57:33] 這兩年的啦所以你也可以上去看這樣因為這是開放的 [00:57:37] 所以公開資料在這邊那 [00:57:39] 清大這邊的學校的eClass我就不放 [00:57:43] 不過我想你們可以透過臺卡這邊的NTU COOL去 [00:57:46] 去點到這個鏈接 [00:57:48] 你都可以拿到這個投影片跟影片這樣子 [00:57:53] 好 [00:57:54] 我想Sleep的介紹就到這邊了 [00:57:56] 那 [00:57:59] 我們看一下這個 [00:58:01] 這個slide上的 [00:58:04] 外校的學生的考試 [00:58:08] 我是沒有 [00:58:09] 實際放過但是根據臺卡辦公室的說法是每個學校的考試 [00:58:12] 每個學校會有一個考場 [00:58:14] 然後也會有監考老師 [00:58:17] 所以我看蠻多學校都只有一位學生 [00:58:20] 所以你就會很VIP式的被一個老師 [00:58:24] 帶去一個房間考試這樣子 [00:58:26] OK [00:58:31] OK好所以這位同學是沒有 [00:58:34] 沒有同步的網址 [00:58:36] 就是說 [00:58:37] 如果你有修這門課你應該可以從NTU COOL裡面去 [00:58:40] 看到我們的直播的網址跟 [00:58:42] 那個錄影的 [00:58:45] 鏈接 [00:58:46] 你就可以 [00:58:47] 就可以上去這樣子 [00:58:48] 那我們一定會就是在早上 [00:58:50] 那 [00:58:51] 這學期我們 [00:58:53] 運氣不好沒有放假 [00:58:55] 對啊就是 [00:58:57] 就是 [00:58:58] 如果遇到放假或是我不能有 [00:59:01] 不能上課的時候我還是會預錄 [00:59:03] 我還是會預錄這樣所以我們會上滿這個 [00:59:06] 16周的時間這樣子 [00:59:10] 同時間要開會 [00:59:12] 可以啊就是因為基本上Sclass就是否這個設計嘛就是 [00:59:17] 你可以同時間有重躺這樣子 [00:59:18] 雖然我也不知道這個學生需要 [00:59:22] 會很辛苦如果他 [00:59:23] 修了五門都在同個時間 [00:59:26] 這樣也是蠻厲害的 [00:59:29] 這個可能是舊資料啦可能是舊資料我後來把它改成75跟25這樣子 [00:59:36] 那但是作業老實說因為四個作業嘛75沒辦法整除嘛所以學生都會問我說 [00:59:42] 哪個作業比重是多少我現在其實還不 [00:59:45] 沒有寫出來啊 [00:59:47] 我到時候因為作業會有點調整 [00:59:49] 我會根據作業的難度跟他的loading會比重會稍微調整但是你可以想像就是 [00:59:55] 就是 [00:59:56] 75除以4的上下range [00:59:59] 但是我知道要寫清楚不然學生都會跟我來argue這件事情 [01:00:08] 應該是四個啦 [01:00:10] 四個 [01:00:12] 四個作業然後一次考試這樣子 [01:00:15] 五個作業會有點趕會綁得有點 [01:00:20] 對時間會有點吃力 [01:00:22] 同時修會沒有會不會很吃力我只能說看人對 [01:00:27] 對 [01:00:28] 如果你 [01:00:29] 你夠積極夠 [01:00:31] 這門課其實我覺得門檻不高 [01:00:34] 你只要有訓練過模型 [01:00:36] 不要說非常厲害你只要知道那怎麼寫就 [01:00:40] 我覺得應該是沒有問題 [01:00:41] 因為我們的作業會 [01:00:43] 有些甚至給你一個template [01:00:45] 不是叫你從無到有去寫所以 [01:00:48] 應該是還好 [01:00:49] 但是我還是建議你有點基礎來修這樣子 [01:00:52] 不然 [01:00:53] 人數有點多 [01:00:56] 跟DL一起修效果會更好嗎 [01:00:59] 我不知道可能會吧 [01:01:01] 可能會吧就是你 [01:01:04] 不過很有趣就是你會發現如果你修一大堆AI課你會發現 [01:01:07] 怎麼每個老師都講一樣的東西 [01:01:09] 都在講transformal [01:01:11] 都在講fine tune都在講這些東西這樣子 [01:01:14] 對那應該效果會比較好這樣 [01:01:18] 期末考的形式就是實體 [01:01:20] 坐在教室發考卷這樣子就是用寫的 [01:01:23] 然後斷網 [01:01:25] 不能用 [01:01:25] 沒有openbook這樣子 [01:01:27] 就要完全靠你自己腦袋這樣子 [01:01:29] GPU的等級 [01:01:32] 這的確是個好問題我們 [01:01:34] 我們會把作業的難度跟他資料的複雜度 [01:01:38] 降低到你們個人的電腦 [01:01:41] 或者是你的free的collab quota可以跑的 [01:01:45] 狀態 [01:01:47] 也就是說 [01:01:48] 如果你覺得你跑不動了 [01:01:50] 那一定你程式沒有寫好 [01:01:52] 當然如果你的實驗室有更powerful的環境 [01:01:56] 的確你可以更加速 [01:01:58] 但是我們都會讓 [01:01:59] 這個low resource的學生可以把這個作業做完 [01:02:03] 有一張投影片我沒有放就是Tica他其實有提供一些 [01:02:09] collab quota的獎勵 [01:02:11] 不過因為沒有很多就沒有辦法給每個學生 [01:02:14] 所以我會把它當成是作業的 [01:02:18] bonus就是說我們每次作業會有 [01:02:21] 評選可能前 [01:02:22] 前十位 [01:02:24] 會多發給你collab的 [01:02:26] quota這樣子 [01:02:30] 沒有ntu庫的賬號這個的確有不少學生來問我說他有選課但是還是沒有ntu庫的賬號 [01:02:37] 可能他們 [01:02:38] 從每個學校進來或者是 [01:02:40] 加退選的時間的賄賂的名單的時程上不是很同步因為他不是一個 [01:02:46] 不是全國一個系統所以他還需要各個學校去串資料 [01:02:51] 所以大家要等一下這樣子 [01:02:52] 如果 [01:02:54] 如果你已經可以 [01:02:57] 看到這個slide理論上你應該知道我的課程網頁 [01:03:01] 課程github那個網頁 [01:03:03] github網頁上面也有直播的連結你也可以從那邊上去這樣子 [01:03:10] 期末考內容大概形式就剛才提過就是一個實體的考試的形式 [01:03:16] 那至於要考什麼我現在也還沒有很具體的想法這樣子 [01:03:21] ntu庫不是臺大的校外沒辦法申請 [01:03:24] 應該有他應該有每個學校賄賂賬號 [01:03:28] 大家應該 [01:03:30] 應該都知道了應該他會 [01:03:33] 開通這樣子而且會 [01:03:35] 對 [01:03:36] 從ntu庫那邊我可以看到說他會他會寄一個通知信然後一個確認 [01:03:41] 所以我現在可以看到有多少學生 [01:03:43] 其實還沒有連上ntu庫這樣子 [01:03:47] 所以 [01:03:48] 你可以可能可以確認一下加簽應該可以因為 [01:03:52] 根據經驗還是會有些學生 [01:03:54] 退選所以人數上我們應該 [01:03:57] 可以控制在以前這個範圍這樣子 [01:04:00] 期末考會需要手寫code嗎 [01:04:02] 應該 [01:04:06] 我要思考一下 [01:04:10] 有些東西講出去就不能改了 [01:04:14] 可能會有一點點 [01:04:17] high level的東西anyway [01:04:18] 但是不會叫你要寫出一個沒有bug的code這樣子 [01:04:22] 不是沒有bug是語法要寫得非常精確的 [01:04:28] 這個 [01:04:30] 我再思考一下但是不會叫你 [01:04:33] 把transformer [01:04:35] 用c寫出來 [01:04:40] 手寫 [01:04:41] 會是層次嗎 [01:04:42] 就我覺得應該比較high level就是比較 [01:04:46] 比較 [01:04:47] 概念型的東西居多 [01:04:50] 居多不會叫你因為畢竟是closed-book [01:04:54] 我們不太需要讓大家去記這些東西我覺得沒有意義這樣子但是我會 [01:04:58] 希望知道你腦袋的東西 [01:05:00] 有沒有 [01:05:01] 學到這樣子 [01:05:02] 該學到放在你腦袋的東西到底有沒有這樣子 [01:05:06] 好 [01:05:09] 應該是這樣啦那 [01:05:13] 基本上我是不太會想說像有一些老師會說上課回答問題搶答然後有 [01:05:20] 有什麼獎品這樣子好像小朋友 [01:05:23] 給糖果這樣子 [01:05:24] 但是有時候好像是一個不錯的方法增加互動性 [01:05:27] 尤其是 [01:05:28] 鼓勵學生 [01:05:29] 實體來或是線上參加這樣子 [01:05:31] 我覺得是不錯啦 [01:05:33] 不然學生都是回去宿舍晚上 [01:05:36] 躺在那邊 [01:05:37] 開影片三倍速播放這樣子 [01:05:39] 互動性比較低所以也許會有一些 [01:05:42] 線上 [01:05:43] 實體的時候online我會有一些 [01:05:46] QA [01:05:47] 或者是投票會增加一些參與那但我們會從裡面 [01:05:52] 有一些獎勵之類的不好意思要做一些比較熟悉的事情 [01:05:58] 好這大概是課程的介紹 [01:06:01] 有沒有問題 [01:06:03] 可以啊 [01:06:06] 你是幫人家問的嗎 [01:06:09] 剛才我有回答 [01:06:12] 這門課看起來太容易對沒錯 [01:06:17] 這誰寫的 [01:06:20] 說真的我有點掙扎 [01:06:21] 因為 [01:06:23] 因為第一年分數給太高了 [01:06:25] 但是不給高 [01:06:27] 因為 [01:06:28] 第一個臺卡是一個很diverse的學生進來 [01:06:31] 不要說不同學校有不同科系的人進來 [01:06:35] 所以 [01:06:35] 他修課的程度雖然我們一定 [01:06:39] 有告訴同學說這個requirement你應該要會寫Python會 [01:06:43] 跑過基本的基礎學習的東西但是 [01:06:45] 有一些時候就 [01:06:47] 接不太起來這樣 [01:06:49] 所以我們作業 [01:06:50] 難度我覺得不高 [01:06:53] 那不過 [01:06:54] 衝著你這句話我們 [01:06:56] 把難度 [01:06:57] 加深一點這樣子 [01:06:58] 但是對我來講其實沒有 [01:07:01] 沒有太大意義了就是有鑑別性就好 [01:07:04] 我就是鑑別 [01:07:05] 大家的努力程度可以鑑別出來就好 [01:07:10] 當然不要說大家都 [01:07:12] 作業都滿分這樣子 [01:07:15] 還有沒有其他問題 [01:07:18] 有問題都可以在slide上問因為他是匿名的 [01:07:21] 當然你也可以說我要 [01:07:22] 具名這樣也可以 [01:07:23] 但是你可以匿名這樣子 [01:07:25] 你不用去dcard上 [01:07:27] 說一些 [01:07:28] 其他的話這樣 [01:07:29] 你在上面就可以問我問題這樣 [01:07:31] 有沒有其他問題 [01:07:36] 沒有問題我們就先休息10分鐘 [01:07:40] 然後最後等一下我會再上一節課的部分把一些引求答詢再帶一點 [01:07:45] 休息時間如果有要加簽或是Xclass要籤的人你要實體籤 [01:07:51] 可以給我籤這樣子 [01:07:53] 我們先休息 [01:08:07] 好那我們就繼續上了因為就我大概會再上一個小時的範圍 [01:09:19] 再回答一下剛才有人在slide上問的問題就是 [01:09:23] 主要處理中英文的語言嗎 [01:09:26] 那會不會有其他語言 [01:09:27] 其實 [01:09:28] 我們不會 [01:09:30] dedicate說處理哪一種language特別的問題啊 [01:09:33] 基本上 [01:09:34] 尤其是現在LN [01:09:35] 他其實也是marty lingo這樣子 [01:09:38] 只是說如果你是一個 [01:09:40] 一個比較 [01:09:41] 稀少資源的 [01:09:42] 我們說low resource language的話的確有時候 [01:09:45] LN他的理解度沒那麼好 [01:09:47] 那會有不同的 [01:09:49] 做法不同的 [01:09:50] 思考方式但是我們 [01:09:52] 不太會去 [01:09:53] 去 [01:09:54] 提到那些啦 [01:09:55] 不太會提到那些 [01:09:57] 沒訓練過模型也可以修得過嗎 [01:10:03] 這句話 [01:10:05] 我很難回答因為 [01:10:07] 有訓練過模型的也不見得修得過的 [01:10:10] 就是說因為現在訓練模型很容易嘛你只要 [01:10:14] 這個XY給他然後FIT就結束就可以 [01:10:17] 就說你有 [01:10:18] 你有訓練過模型的這樣子 [01:10:20] 但是你可能要了解NN的 [01:10:23] 的架構或什麼 [01:10:25] 就是 [01:10:26] 那個門檻不會在於有沒有訓練過 [01:10:31] 那 [01:10:32] 我只能說 [01:10:35] 看人 [01:10:37] 會不會點名 [01:10:38] 不會但是我們希望會有一些課堂的 [01:10:41] 參與的bonus就是實體在進行的時候會有一些 [01:10:46] 會有一些那個 [01:10:48] 回饋啊幹嘛的 [01:10:52] 會有考古題當然沒有啊因為之前都沒有考試這樣子 [01:10:56] 那 [01:10:57] 是可以寫sudo code嗎對 [01:11:00] 如果有的話啦如果有的話這樣子 [01:11:04] 我有沒有office hour [01:11:07] 我會把它寫上去啦會把它寫上去 [01:11:10] 那 [01:11:11] 不會如果如果要問問題其實用email或是在SIDEL上問很方便這樣子 [01:11:19] 那 [01:11:22] 對 [01:11:24] 大學生修這門課會答應嗎不會 [01:11:27] 不會 [01:11:29] 之前也有 [01:11:30] 甚至有大二的都修了這樣子 [01:11:33] 那有些助教代替回來我就不一一回復了 [01:11:37] 那 [01:11:40] 對剛剛有人 [01:11:42] 這個我再看一下 [01:11:45] 對他說可以稍微難一點想學東西這樣子 [01:11:48] 好 [01:11:49] 我會 [01:11:50] 盡力 [01:11:52] 對 [01:11:53] 好啦老實說這個這邊這些東西 [01:11:57] 已經蠻open的 [01:11:58] 基本上 [01:12:00] 是可以設取的範圍 [01:12:02] 所以他 [01:12:04] 老實說也也不容易啦 [01:12:06] 因為對我來講我也一直在學習 [01:12:08] 這個投影片位也要一直update所以 [01:12:10] 也是蠻辛苦的這樣子 [01:12:12] 所以 [01:12:13] 想學東西當然很好對我們一起來學這樣 [01:12:17] 好大概是這樣了反正有問題就儘量問 [01:12:21] 包含課堂上的東西或是 [01:12:25] 講的東西或是有一些 [01:12:27] 行政上的東西也都可以問這樣子喔 [01:12:30] 好 [01:12:36] 拜託 [01:12:38] 好啦這個 [01:12:40] Do your best [01:12:44] 不要在slide上哈拉啦 [01:12:46] 那個 [01:12:47] 這個要filter有點辛苦這樣子 [01:12:50] OK [01:12:51] 好啦我們就 [01:12:53] 把他拉到一個 [01:12:55] 一個標準這樣研究所課程的標準 [01:13:06] 好 [01:13:07] 這個投影片在 [01:13:09] 在NTU COOL或者是說在GitHub上都有 [01:13:13] PDF檔可以下載這樣子 [01:13:15] 那我 [01:13:16] 大家上去看可能可以看到一些 [01:13:18] 舊的就是去年的但是我可能都會 [01:13:21] 陸續的有一些 [01:13:22] 小小的更動這樣子 [01:13:24] 好 [01:13:25] 那 [01:13:26] 這個從剛才提到這些歷史啊 [01:13:28] 大家可以想像從這邊過後基本上所有的起手式都是 [01:13:34] 都是model了都已經是 [01:13:36] 而且尤其是 [01:13:37] 直接從Transformer [01:13:38] 開始下手了這樣子所以 [01:13:41] 你可以想像這件事情 [01:13:43] 好像是 [01:13:45] 必要的 [01:13:46] 所以以前在一些場合啊有些 [01:13:49] 老師也問我說那你現在NLP課程怎麼教 [01:13:52] 我說我就把以前NLP的要教的東西 [01:13:56] 在 [01:13:57] 前面 [01:13:58] 兩週上完 [01:14:00] 可能多一點三週兩週半上完這樣子 [01:14:03] 然後後面的就全部都是 [01:14:05] Pretrained Language Model的東西這樣子 [01:14:08] 是有一點 [01:14:09] 怪啦就是說如果有些人想學一些語言學的東西 [01:14:13] 卻沒有在這邊cover到這樣子 [01:14:15] 但是你會發現現在做NLP一定 [01:14:18] 標準起手式一定是從 [01:14:20] Pretrained Language Model下手這樣子 [01:14:23] 當然這邊如果你還沒有修過AI或是Deep Learning的時候 [01:14:27] 你可能會不太知道 [01:14:29] 這些圖表的意思啊基本上 [01:14:31] 它就是一個Transformer Bash然後透過一個Pretraining的部分 [01:14:36] 訓練出來然後再 [01:14:37] 你要 [01:14:38] 做你的微調的東西這個我們之後會再帶一下會講這部分啊 [01:14:43] 只是 [01:14:44] 再用這個圖告訴你說現在大家看的東西 [01:14:48] 就是從Pretrained Language Model下手 [01:14:51] 當然這裡面有一些 [01:14:53] 機器學習的基礎沒錯所以 [01:14:56] 你雖然知道Pretrained Language Model但是你不太知道說這個就是以前在做 [01:15:01] Machine Learning的時候提到的Transformer Learning [01:15:04] 就是做轉移學習 [01:15:06] 所以轉移學習就是 [01:15:08] 你會覺得好像現在Pretrained Language Model好像很 [01:15:11] 直覺嘛就是哪有 [01:15:13] LM然後fine-tune一下他就可以做我的問題 [01:15:15] 或是說LM本來就可以做很多事情 [01:15:18] 但是如果你以前從一個簡單的 [01:15:21] 小顆的NN Transform Scratch說我要做一個空氣汙染 [01:15:27] 預測的模型 [01:15:29] 那是參數都是空的然後 [01:15:31] 做監督室學習學習完之後這個模型的確會 [01:15:35] 回答你Yes No [01:15:36] 你給他一些參數他會回答Yes No這邊有沒有空汙這樣或是說 [01:15:40] 他可以告訴你空汙的指數多少 [01:15:42] 你可以做出 [01:15:42] 這樣的事情 [01:15:44] 你只要有監督室的 [01:15:46] 資料就可以做這件事情 [01:15:48] 但是你會發現你的模型做出來 [01:15:49] 只能回答空汙啊 [01:15:51] 他也沒辦法回答說那對健康有沒有影響 [01:15:55] 你就要拿另外的資料再去勸 [01:15:58] 那這個當然就是一般以前在做機器學習的 [01:16:02] 基本的做法就是會遇到這樣所以 [01:16:04] 有很多的方式包含 [01:16:06] Transformer Learning當然這個 [01:16:08] 可能會在機器學習課程 [01:16:10] 比較後面會談到的 [01:16:12] 就是說 [01:16:14] 舉個例子你就知道就是叫一個學生 [01:16:18] 去拿一本英文字典讀一讀 [01:16:20] 然後讀完之後他就會發文了這樣 [01:16:22] 這個就是Transformer Learning的精神 [01:16:24] 就是 [01:16:24] 你學會一件事情你就可以比照 [01:16:28] 你當初的這個 [01:16:30] 資料所學到的東西比照辦理去 [01:16:33] 去解決另外一個問題 [01:16:35] 他這個問題是你沒有Training Data或者是說 [01:16:38] 你沒有Supervised Training Data [01:16:40] 這個在當初在Transformer Learning [01:16:42] 可以講到這些 [01:16:43] 當然Transformer Learning其實也是一個大的東西 [01:16:46] 它裡面可以分很多很細 [01:16:48] 有沒有資料跟沒有資料的這樣子 [01:16:51] 所以 [01:16:53] 這個如果你有點 [01:16:55] 機器學習基礎是可以比較瞭解的 [01:16:57] 不過Anyway [01:16:59] 這個 [01:17:00] 大型語言模型基本上它就是透過一個預訓練 [01:17:04] 預訓練完預訓練只是看懂文章啊 [01:17:06] 但是他為什麼可以做QA [01:17:08] 可以幫我寫報告 [01:17:10] 他可能需要一點微調啊這文章是什麼文章啊 [01:17:11] 他可能需要一點微調啊這文章是什麼文章啊 [01:17:12] 微調的東西就是把原案的模型呢 [01:17:14] 校正一下到我的Domain去解決我的問題 [01:17:18] 這是Transformer Learning的概念 [01:17:20] 不過這個我們會再提 [01:17:23] 那這邊秀一下這個LM的發展圖 [01:17:26] 這個這張圖有點舊了 [01:17:28] 不過大家有興趣可以去這個網站上看 [01:17:31] 他其實 [01:17:32] 講了蠻多的東西 [01:17:34] 而且這張圖還在他的Github上 [01:17:37] 所以他好像也沒有繼續update [01:17:39] 但是他的資料是有一直update啦 [01:17:41] 但是他的資料是有一直update啦 [01:17:42] 那這個 [01:17:43] 中國大陸的模型也是舊的 [01:17:45] 現在有更多的 [01:17:47] 現在這個 [01:17:49] 這個Kimi的東西蠻強的 [01:17:51] 這是臺灣 [01:17:52] 臺灣當然沒有基礎從自己Transformer Scratch的 [01:17:55] PLM [01:17:56] 但是有Based on這些 [01:17:59] Open Model做的 [01:18:00] 像Tide或者是Breeze [01:18:02] 或是 [01:18:02] 這個 [01:18:03] 白龍 [01:18:05] 不過 [01:18:05] 其實 [01:18:07] 都不太容易啊 [01:18:08] 老實說我們就等於跟著這些Open Model跑啊 [01:18:11] 我們只能做 [01:18:12] 我們的在地資料的微調 [01:18:14] 或在地資料的CP [01:18:15] 我覺得會比較辛苦 [01:18:17] 當然這個 [01:18:19] 當初是覺得我們 [01:18:22] 以臺灣的Resource不太可能自己做一個PLM [01:18:26] 但是我覺得這件事情可能慢慢的可行 [01:18:30] 因為 [01:18:31] 現在的 [01:18:32] 現在的運算成本 [01:18:34] 比較低一點 [01:18:35] 當然還是很大 [01:18:36] 但是另外一個問題是 [01:18:39] 資料量 [01:18:40] 資料的問題這樣子 [01:18:42] 不過 [01:18:43] 另外一個還有一個問題就是說 [01:18:45] 我們能不能像 [01:18:47] 中國大陸一樣用 [01:18:49] 針灸的方式來做這件事情 [01:18:51] 這個就是另外一個故事 [01:18:56] 網路上有很多這樣資料 [01:18:58] 多擺一張這樣的圖 [01:19:00] 就是 [01:19:01] 一個Family Tree [01:19:03] 就是 [01:19:04] 你看到都是Transformer長出來的這樣子 [01:19:08] 當然如果你自己有研究過一些模型 [01:19:11] 你就知道說Transformer也不是唯一的選擇了 [01:19:13] 其實有什麼 [01:19:15] 比較著名的 [01:19:17] 像Mamba這樣的東西 [01:19:18] 但是 [01:19:19] 就是沒有辦法成為 [01:19:21] One of [01:19:22] 的 [01:19:23] 選項這樣子 [01:19:25] 所以是基本上還是Transformer [01:19:27] 所以現在 [01:19:28] 幾乎所有的 [01:19:29] 硬體加速 [01:19:30] 都是Based on Transformer [01:19:32] 在 [01:19:33] 做特別設計這樣子 [01:19:35] 那你可以 [01:19:36] 你可以去 [01:19:36] 你可以去這個網站這其實是可以動的 [01:19:39] 這個圖是可以動可以拉的 [01:19:40] 而且 [01:19:41] 點下去它可以告訴你那個模型的一些詳細資料之類的 [01:19:43] 這樣子 [01:19:45] 不過看起來 [01:19:48] 也沒有很新 [01:19:49] 因為最新的也都沒在上面這樣 [01:19:52] 那你就知道說這些 [01:19:54] 這些初步玩 [01:19:55] 大概每一個Quarter [01:19:57] 都有一個新的Model會說他們是最強的這樣子 [01:20:01] 當然對我們來講 [01:20:02] 我們要考量的不是他的能力因為現在這些能力其實已經 [01:20:07] 不會差太多了就是以你解決你的問題來講 [01:20:11] 他們都足夠只是說 [01:20:13] 他的大小啊 [01:20:15] 他的這個 [01:20:16] 這個Token的CP值是多少 [01:20:19] 你大概反而會考量這些東西這樣子 [01:20:24] 好 [01:20:25] 那接下來秀一下畢竟我們還是NLP的課我來想一下說 [01:20:30] 以前沒有大語言模型的時候 [01:20:32] 這些 [01:20:33] 這些NLP的人都在幹什麼事啊 [01:20:37] 那 [01:20:38] 以前的做法 [01:20:39] 你一定要先有語料 [01:20:42] 包括說我要做醫院的問題 [01:20:44] 我一定要跟醫院談說你有沒有 [01:20:46] 這個醫囑啊 [01:20:47] 有沒有病歷資料啊 [01:20:49] 我一定要有這些資料因為沒有一個 [01:20:51] 沒有一個 [01:20:52] 像現在的大圓 [01:20:54] Pretrained Language Model一樣 [01:20:56] 他已經有一些common的knowledge在裡面 [01:20:59] 我一定從空的開始做 [01:21:01] 從空的開始做我就一定要 [01:21:04] Domain的 [01:21:05] 知識 [01:21:05] 我就一定要有一些Collection [01:21:07] 那這Collection呢 [01:21:08] 包含annotation [01:21:10] 這些都是非常昂貴的 [01:21:11] 就是都是要人進去的 [01:21:13] 只要有人進去 [01:21:14] 都是貴 [01:21:15] 雖然你說老師沒有那個他們說 [01:21:19] 做VLA [01:21:20] 都是 [01:21:21] 去非洲 [01:21:22] 叫他們帶一個 [01:21:24] 這個 [01:21:24] 那個 [01:21:25] 那個 [01:21:26] 那個 [01:21:27] 眼部的camera [01:21:28] 然後就叫他們不斷在那邊折衣服這樣 [01:21:30] 然後就有一大堆折衣服的影片這樣 [01:21:33] 的確有一些Training Data都是來自於這種 [01:21:37] 這種國家啦 [01:21:39] 所以以前我們說這是血汗模型 [01:21:42] 這個 [01:21:43] 以前一部電影叫 [01:21:44] 血鑽石嘛 [01:21:45] 他們都叫這個 [01:21:46] 這個血模型 [01:21:47] 因為就是 [01:21:49] 但是後來 [01:21:50] 後來去看一看他們其實沒有這些 [01:21:53] 這些去非洲做這樣的工作的 [01:21:55] 的人其實在那邊 [01:21:57] 過得蠻舒服的 [01:21:57] 因為你要做這件事情在冷氣房 [01:22:00] 然後又做這些非勞力的動作 [01:22:02] 只是 [01:22:03] 操作一下電腦做一些動作而已 [01:22:04] 其實對他們來講是個不錯的工作 [01:22:07] 當然我不是在貶逼他們 [01:22:09] 而是說這件事情 [01:22:11] 的確是需要大量人力 [01:22:12] 尤其是現在在做Action model [01:22:14] 做這種機器人的東西 [01:22:16] 像有一條訓練的方式就是要靠不斷的 [01:22:20] 產生人類這個Action的影片讓他去學習 [01:22:24] 當然以文字來講也同樣有 [01:22:26] 需要很多annotation [01:22:28] 那 [01:22:29] 這些 [01:22:31] 我們拿到的東西我一定要全處理不然就是一堆垃圾不然就是一堆 [01:22:36] 也不知道在寫什麼東西所以我們要做 [01:22:38] Segmentation 斷字處理Stop War [01:22:41] 然後呢做Passing Tree做Stemming [01:22:43] 這英文有時候去 [01:22:44] 需要詞性的處理 [01:22:46] 需要做這些東西甚至再往前一步 [01:22:49] 我需要知道說 [01:22:50] 這個裡面的Entity到底是什麼 [01:22:53] 這個關係到底是什麼 [01:22:55] 這一句話到底取什麼 [01:22:57] 為什麼要做這些事情呢 [01:22:58] 因為你整句話未給模型他看不懂 [01:23:01] 你一定要事先幫他截取出來這樣子 [01:23:05] 那如果以你們現在有做過一點 [01:23:08] 大型元模型就覺得 [01:23:10] 以前人為什麼這麼 [01:23:12] 做這麼多 [01:23:13] 多餘的事情 [01:23:14] 為什麼要做這麼多餘的事情 [01:23:19] 整篇文章餵給人 [01:23:21] 他就可以知道這個 [01:23:23] 某個Entity叫什麼 [01:23:25] 這樣子 [01:23:26] 所以 [01:23:27] 這是大家Based on這個巨人肩膀上可以做很多事但是以前沒有這個巨人的時候我們都要自己 [01:23:33] 做這些事情 [01:23:35] 不然你喂進去電腦是完全不懂你的東西 [01:23:39] 接下來就要去 [01:23:40] 表示這個文字 [01:23:42] 你可能就要把它 [01:23:44] 向量化 [01:23:45] 那以前最簡單的One-Half Vector [01:23:47] 或是說你算一點權重的 [01:23:49] 這打錯了 [01:23:50] TFIDF [01:23:54] 那或者是 [01:23:56] 把它直接有一個已經Change好的Base的東西把它轉換成一個Vector [01:24:00] word2vec的東西 [01:24:02] 或者是說你有沒有把它轉換成更復雜一點 [01:24:06] 語義的Semantic Label的東西 [01:24:10] 這些都是 [01:24:12] 其實老實說在 [01:24:14] 在BERT還沒出來之前這些都還是一個 [01:24:17] 很大的研究重點 [01:24:20] 那當然你要怎麼建Domain Knowledge [01:24:23] 這個不是說叫人來標註一下就好 [01:24:26] 你這些知識怎麼讓 [01:24:28] 怎麼讓電腦去Access [01:24:29] 你是要建 [01:24:30] 建出一個結構 [01:24:32] 所以就會所謂的知識圖譜 [01:24:34] 就會一個Tree一個Graph的結構怎麼去Access怎麼讓 [01:24:39] 人只要輸入 [01:24:41] 這個 [01:24:42] 實比資料他可以自動 [01:24:44] 想出實物比的Knowledge [01:24:46] 這邊就有很多的這樣的Extension [01:24:48] 會在做 [01:24:49] 所以你可以想像這個 [01:24:51] 好像 [01:24:52] 去博物館看到以前這些原始人在 [01:24:55] 操作這些器具然後留下一些工具這種感覺 [01:25:00] 但是呢 [01:25:02] 有些方法 [01:25:03] 跟有些東西其實你們現在在做一些大語言模型分析的過程中 [01:25:10] 也會用到 [01:25:12] 或者說你要做一些 [01:25:14] 你要做一些Baseline的比較 [01:25:16] 比如說 [01:25:17] TFIDF [01:25:19] 這個真的很重要 [01:25:20] 因為他很簡單沒錯但是他是一個 [01:25:23] 非常萬用的Baseline [01:25:25] 也是一個非常Strong的Baseline [01:25:28] 就搞不好用TFIDF比你在那邊 [01:25:30] 轉換什麼Dense Vector在那邊算老半天都還好這樣子 [01:25:37] 那 [01:25:38] 有LM之後大家想像說那我就可以用這些模型啊 [01:25:42] 然後呢 [01:25:43] 自己在fine-tune我這邊畫兩個東西就是這是一個大語言模型這是你自己的下游模型 [01:25:49] 然後你把它串起來這樣子以後我們就會教你怎麼用BERT然後自己再做一個下游模型 [01:25:53] 做這件事情 [01:25:54] 然後 [01:25:56] 你再透過你自己的資料 [01:25:58] 我這邊的標 [01:25:59] 標註資料就是這樣這是兩個不同顏色就是 [01:26:02] Input跟Output這樣子 [01:26:04] 就是你這是一個supervised的Data [01:26:07] 比如說QA [01:26:09] 我就會有原來的文章 [01:26:11] 跟問題就會有答案這樣子 [01:26:12] 就是 [01:26:13] 你一定有Input跟Output你是一個supervised的Data [01:26:18] 所謂supervised的Data就是 [01:26:19] 我是在做問答系統 [01:26:21] 或是說我是做摘要的 [01:26:23] 我一定有原來的文章跟摘要出來的文章 [01:26:27] 我一定要這些東西 [01:26:29] 然後才能去fine-tune我自己小顆的模型 [01:26:31] 然後我可以利用BERT或是更大的模型 [01:26:34] 來做我這件事情 [01:26:37] 這個做法大概是在 [01:26:41] BERT大概2019 [01:26:43] 2020年之後 [01:26:44] 的 [01:26:45] 一大票大概90%的 [01:26:48] 大概 [01:26:51] 這個六七十的 [01:26:52] BERT的 [01:26:54] NLP的研究 [01:26:55] 就是follow這個路徑 [01:26:57] 因為發現BERT進來之後可以把原來的效果翻上一番這樣子 [01:27:02] 所以就會做這樣的事情 [01:27:04] 重點就會在你怎麼去微調這個模型這個模型要怎麼設計 [01:27:07] 才能搭配原來的BERT Transform能夠 [01:27:10] 做出 [01:27:11] 更好的摘要模型 [01:27:13] 更好的QA這樣子 [01:27:15] 當然以你們現在角度來看這個東西又好像是去博物館看到這些原始人留下這些工具一樣 [01:27:21] 以前人家做這樣的事 [01:27:23] 就是為什麼要鑽木取火為什麼不在瓦斯路上直接按個開關火就出來了這樣子 [01:27:29] 你們的感覺就會像這個樣子 [01:27:31] 但是現在其實這個 [01:27:32] 這樣的一個flow [01:27:33] 還是會 [01:27:34] 還是在特定的領域會做 [01:27:38] 但現在可能大家會這樣反正也能夠強了 [01:27:41] 我就不用做這樣一件事 [01:27:43] 我就不用勸了 [01:27:44] 我就用原來的PROM [01:27:45] 原來的PLM來做 [01:27:48] 然後我直接把他PROM [01:27:49] 就這樣 [01:27:50] 請幫我摘要今天的 [01:27:53] 老師上課的重點 [01:27:54] 然後 [01:27:56] 這個只要PROM寫好把今天投影片喂進去他就會告訴你 [01:28:00] 一頁的摘要這樣子 [01:28:01] 就本來的這些 [01:28:03] 這一顆 [01:28:04] 就能做這些事情 [01:28:07] 而不用再去微調 [01:28:09] 做這些事情 [01:28:11] 但是你想說哇這個 [01:28:12] 這一顆這麼萬人這樣他當初怎麼訓練 [01:28:15] 那 [01:28:16] 我們這堂課就會告訴你說當初在做這個Pretrain [01:28:20] 或是在做最後他Pretrain完之後 [01:28:22] 做一些 [01:28:23] Instruction Fine Tuning的時候 [01:28:25] 怎麼會做好這件事情 [01:28:27] 為什麼 [01:28:28] 好像萬用一樣 [01:28:29] 就是 [01:28:31] 給他不同任務他就可以回答出不同問題 [01:28:35] 是不是當初他有一大堆的Torago的這些監督師資料幫他勸 [01:28:41] 某種程度上 [01:28:42] 是有一點點但是不全然對這樣子 [01:28:45] 就是他是透過 [01:28:47] 透過 [01:28:48] 當初他對文獻的理解跟 [01:28:51] 透過Instruction Fine Tuning的時候 [01:28:53] 他可以理解說原來你現在要做摘要 [01:28:55] 所以我要去看以前的東西做什麼樣的 [01:28:58] 輸出這樣子 [01:28:59] 他並不見得有 [01:29:01] 完整的摘要的supervised data [01:29:04] 好不過anyway這個這個其實就會有一些問題就是包括所謂的input [01:29:09] 就是你所謂的context [01:29:11] 你位給他的這個 [01:29:13] 長度是多少 [01:29:15] 所以你會發現現在的模型的readable看出來 [01:29:18] 他會有個column [01:29:20] 在描述說這個模型的context有多寬 [01:29:24] 他可以處理多大的 [01:29:25] 的內容 [01:29:26] 當然有些模型很大 [01:29:29] 但是有些模型可能沒那麼大但是他其實比較厲害 [01:29:32] 這不見得因為他可能本來的 [01:29:35] 裡面的 [01:29:36] 這種 [01:29:37] 我們叫 [01:29:38] Positional embedding的 [01:29:40] 處理方式不同 [01:29:41] 或是說他特別有處理所謂的 [01:29:44] 位置的這種lost in the middle的問題啊這個我們之後可能會提到 [01:29:49] 就是模型在看 [01:29:51] 文章 [01:29:52] 這麼長的時候 [01:29:53] 他不是equal weight [01:29:55] 他不是equal weight就是 [01:29:57] 你一開始給他的東西跟最後提到的東西對他講可能選中比較重要 [01:30:02] 中間的東西他就不見了 [01:30:04] 中間的東西他覺得算了看看就好 [01:30:07] 就像各位同學在上課一樣 [01:30:09] 一進來教室覺得 [01:30:10] 誒這個 [01:30:11] 聽聽看老師啊後來就體力不支睡著 [01:30:14] 然後一直到快下課的時候誒感覺要吃飯 [01:30:16] 精神又來了這樣子 [01:30:18] 所以你只有在頭跟尾的時候 [01:30:20] 對老師講的東西比較清楚 [01:30:22] 中間的東西都忘記了這樣子 [01:30:24] 這個就是模型的 [01:30:26] Lost in the middle的問題 [01:30:27] 這個問題現在其實 [01:30:29] 有被解決一些但是其實還是有 [01:30:31] 還是有還是有一些研究在探討說 [01:30:34] 他為什麼對中間的東西 [01:30:36] 這麼不sensitive這樣子 [01:30:38] 好不過anyway [01:30:39] 這個只是另外一種做法就是完全不fine tune完全就只是靠prime或是in context learning的部分 [01:30:45] 直接 [01:30:46] 做我要的任務的問題 [01:30:49] 那或者說誒這個 [01:30:50] 當然就是說 [01:30:51] 哦原來 [01:30:52] 這只是one of我們好像都 [01:30:54] 都是這樣做然後把它包成A群然後做什麼事情 [01:30:57] 沒有 [01:30:58] 這個是演變下來 [01:31:00] 模型的能力變強之後他就變成這樣做這樣子 [01:31:05] 好啊 [01:31:06] 這本來是擺在前面啦不過我通常show這個目的是 [01:31:09] 就是說 [01:31:10] 我沒有要講這些這樣子 [01:31:12] 因為NLP以前的課程會講這些東西 [01:31:15] 我會講 [01:31:17] 文字結構 [01:31:18] 詞性 [01:31:19] 然後呢 [01:31:20] 做 [01:31:21] 做這種語法的分析啦 [01:31:24] 然後去理解跟情感分析 [01:31:26] 所以前面一二呢我們現在其實 [01:31:29] 不太帶了因為基本上 [01:31:33] 講的你們也不用 [01:31:34] 對雖然他還是很有用 [01:31:37] 還是很有用 [01:31:38] 這個 [01:31:40] 這個經驗我有口試過一個學生 [01:31:42] 他裡面LM裡面的參數或是input裡面有用到 [01:31:47] POS tagging的東西 [01:31:48] 對我眼睛為之一亮 [01:31:50] 這個 [01:31:52] 這個學生 [01:31:54] 不一樣 [01:31:55] 然後發現有用 [01:31:57] 這個東西有用這樣子 [01:31:59] 就是其實你會發現如果你只是告訴 [01:32:03] LM [01:32:04] 文章的東西 [01:32:06] 然後就要回答 [01:32:07] 這個就是大家的做法 [01:32:08] 如果你 [01:32:09] 想要知道 [01:32:10] 你要告訴他說我現在比較重視什麼 [01:32:13] 你就會多放一些東西在你的prong裡面 [01:32:16] 但這prong可能是自動生成或是讓他學來的東西 [01:32:20] anyway [01:32:21] 但這東西如果是多一點句子裡面的特性包含說我的結構 [01:32:26] 或是詞性 [01:32:27] 可能LM就會覺得好原來你在意這些 [01:32:30] 那我就 [01:32:32] 我就會 [01:32:32] focus [01:32:33] 更多一點在這個 [01:32:35] 那就看你的應用有些時候 [01:32:37] 這樣的效果就會好很多 [01:32:39] 所以變化在個人因為工具就在那裡 [01:32:45] 那這比較像是我們會講到的Transformer跟 [01:32:48] 我會從RN開始 [01:32:50] 應該是 [01:32:52] Transformer應該在這後面 [01:32:53] 從RN跟LSTM開始 [01:32:55] 雖然這個 [01:32:56] 這已經非常老了這個在Deep Learning以前就有的NN的Model這樣子 [01:33:00] 但是 [01:33:01] 他其實非常重要 [01:33:03] 尤其是 [01:33:04] 你可以從RN跟LSTM去了解 [01:33:07] 這種Sequential的 [01:33:09] Data進去怎麼去Train的過程這樣子 [01:33:13] 然後 [01:33:14] Sequence to sequence Model其實 [01:33:16] 非常重要但是 [01:33:18] Google提出這個之後 [01:33:20] 後來因為 [01:33:21] 太多有名的東西出來之後大家就忘了它的重要性但其他 [01:33:25] 我覺得他是比較 [01:33:26] 奠定現在 [01:33:28] 現在這種 [01:33:32] 這種Large Language Model使用的 [01:33:35] 生態的一種 [01:33:36] 的做法的一種 [01:33:38] 創始者 [01:33:39] 就是給你一段序列你要output一段序列 [01:33:43] 而且是 [01:33:44] 任何的配對這樣子 [01:33:47] OK [01:33:48] 那當然講完這些Transformer之後從BERT打完之後我們就會帶到它延伸的 [01:33:54] 但是我不會講到細部的 [01:33:56] 其實 [01:33:57] 有一個網站 [01:33:58] 蠻有趣的 [01:33:59] 他就講到所有尤其是很新的模型 [01:34:03] 他會給你一個架構圖 [01:34:05] 每一個模型的架構圖 [01:34:06] 當然是Open Model的 [01:34:08] 他就會更新的模型 [01:34:09] 告訴你這個模型做什麼 [01:34:11] 他的 [01:34:13] 他的什麼 [01:34:14] Positional Embedding是用什麼 [01:34:16] 然後他是有做額外的Filter [01:34:19] 這個我再把連接擺上 [01:34:21] 我覺得這個蠻有趣 [01:34:23] 那當然會講一下這個如果你想做一些fine-tune [01:34:27] 或是想做一些CP就是 [01:34:29] 繼續continuous pretraining的時候 [01:34:32] 大概 [01:34:33] 怎麼樣情況可以適合做或是 [01:34:36] 你做得動這樣子 [01:34:37] 當然會提一下Lora [01:34:39] 像這種PFT的方式 [01:34:42] 但是這個其實也都需要資源 [01:34:44] 所以 [01:34:45] 以前本來希望有一些Lora的 [01:34:47] Homework [01:34:49] 但是後來發現 [01:34:52] 需要一點Resource [01:34:53] 就是比較不容易設計 [01:34:55] 那或是Income但是這個可能就會牽扯到 [01:35:02] 不會教你做Prong但是可能會帶你說現在大家重視像Reasoning [01:35:07] 或是Test Time Scaling的想法 [01:35:09] 他們怎麼去 [01:35:11] 不再 [01:35:12] 調整模型的情況下讓模型變厲害 [01:35:15] 的概念這樣子 [01:35:18] 好 [01:35:19] 這個就介紹我們 [01:35:20] 上一節課講的部分 [01:35:23] 好 [01:35:24] 那我們Sleepless大概就帶到這邊了那這個這個投影片其實都在這兩個網站 [01:35:30] 那 [01:35:31] 這個大家可以去assets [01:35:36] 有沒有問題 [01:35:39] 好 [01:35:41] 作業可以反覆提交優化嗎 [01:35:45] 應該是可以只要在截止之前 [01:35:48] 可以在截止之前 [01:35:50] 我們應該 [01:35:51] 沒有限制上傳次數 [01:35:54] 我們的作業比較沒有 [01:35:57] 不像有一些沒有 [01:36:00] 沒有標準單 [01:36:01] 然後就用Leaderboard去排這樣子 [01:36:03] 所以 [01:36:03] 通常是 [01:36:05] 還好但的確也會有一些Performance的數據 [01:36:08] 那我們會有一個 [01:36:10] 可能會有一個 [01:36:11] 標準告訴你一定要做到多少以上這樣子 [01:36:16] SLM [01:36:17] 你講的是small language model嗎 [01:36:20] 應該是不會 [01:36:21] 應該是不會 [01:36:22] 不會特別講啦 [01:36:24] 不會特別講 [01:36:28] 通常我們講SLM的情況底下是希望說 [01:36:32] 探討說怎麼做出這個SLM [01:36:35] 或是說 [01:36:36] 怎麼用一個比較笨的 [01:36:38] 模型來做 [01:36:40] 比較厲害的事情 [01:36:42] 大概這樣但是我們這堂課目前是沒有 [01:36:48] 這是同一位學生嗎 [01:36:50] 難度要再拉高的話 [01:36:56] 怎麼跳掉 [01:36:59] 所以應該是另外一位學生 [01:37:13] 好 [01:37:14] 我只能說這個同學加油 [01:37:19] 持交扣分我們會有一個那個penalty的一個list [01:37:23] 就幾天 [01:37:24] 扣百分之多少 [01:37:26] 那 [01:37:28] 不會是直接零分啦但是我也不希望說你說 [01:37:32] 我已經扣到百分之百那我要不要交 [01:37:36] 那 [01:37:37] 其實我是希望 [01:37:38] 你都能夠補交但是補交應該 [01:37:41] 最後會有一個基本的分數因為你 [01:37:43] 你不交就是沒有分數但是我又不希望學生 [01:37:46] 一次沒交後來就放棄這樣子我覺得是很可惜 [01:37:50] 很可惜 [01:38:01] 摩克斯喔 [01:38:02] 摩克斯很可惜 [01:38:02] 摩克斯 [01:38:03] 是當初拿 [01:38:05] 這邊的課程的前半 [01:38:07] 應該是前半然後 [01:38:09] 好像是比較簡單的部分我記得是比較簡單因為 [01:38:13] 我們摩克斯上面有做一些 [01:38:16] 課堂練習但是 [01:38:18] 我是覺得那邊 [01:38:20] 有啊那個教材 [01:38:22] 是subset的樣子我記得是subset [01:38:27] 我可以這個這個比較境界這個老實說我也不是很熟不過我可以去看看 [01:38:34] 的確我們現在有做所謂的watermarking的研究 [01:38:37] 就是說 [01:38:39] 尤其是我們要找 [01:38:41] 授權廠商要讓他拿出資料 [01:38:44] 來讓我們訓練的時候他們說那我們的好處是什麼 [01:38:48] 那我們訓練完之後對手會不會拿去這個東西他們都很在意這些東西所以 [01:38:53] 會希望把 [01:38:54] training的data加上一些watermark [01:38:57] 影像的東西抓watermark [01:38:59] 反而比較直覺 [01:39:01] 文字的東西以前其實有做watermark [01:39:03] 就是說 [01:39:05] 我會加一些特殊的符號 [01:39:07] 就是這邊不太可能會出現這個符號我這邊出現這個字 [01:39:12] 其實在今年 [01:39:14] 去年 [01:39:16] ICML還是什麼 [01:39:18] 那個會議呢因為他他覺得審稿的人都 [01:39:21] 都沒有認真審都把paper [01:39:24] 丟給trekGPT然後叫他提供這個審稿意見然後就上傳 [01:39:28] 所以他們就在 [01:39:30] 論文的內容上加上一些特殊的文件 [01:39:33] 但是實際上看不到的 [01:39:36] 但這些文字呢 [01:39:37] 模型的會識別 [01:39:40] 模型讀到之後呢他在 [01:39:42] 做de-coding的時候呢他就會 [01:39:44] 對那些文字 [01:39:46] 特別敏感然後就會產生出一些 [01:39:49] 不太可能在一般review [01:39:51] 出現的文字 [01:39:52] 所以那次就抓到一堆就是使用 [01:39:55] AI審稿的 [01:39:57] 的人這樣子 [01:39:59] 就是 [01:40:00] 好險沒有被抓到這樣子 [01:40:02] OK [01:40:04] 所以 [01:40:04] 處罰非常嚴重喔 [01:40:06] 你被抓到你的submission是被直接deskregent [01:40:12] 但我覺得現在大家還是會多少用AI模型去輔助啦 [01:40:16] 就畢竟 [01:40:18] 這麼短時間內那個paper都做了非常多怎麼可能去看出重點 [01:40:23] 其實 [01:40:23] 都會用AI輔助但是 [01:40:26] 的確我們都還是得消化一下到底 [01:40:28] AI的summary跟 [01:40:30] 他到底重點是什麼 [01:40:31] 而不是直接把 [01:40:32] 這種東西 [01:40:33] 直接教他產生review然後上傳這樣子 [01:40:36] 所以他會有所謂的這個也 [01:40:37] 某種程度叫watermarking [01:40:40] 但現在的確有很多watermarking研究是說 [01:40:44] 他會讓 [01:40:46] 因為如果你們勸過 [01:40:47] 勸過這些人或是 [01:40:49] 勸過language model知道說 [01:40:51] 我不見得每次都要選機率最高的嗎 [01:40:54] 他就 [01:40:55] 他就有一個選項 [01:40:56] 是會有一個table [01:40:58] 或是一個機率的演算法 [01:41:00] 他會去選擇 [01:41:02] 他的分部內的 [01:41:03] 字 [01:41:04] 去讓他說你這次就不要選這個字要選那個字 [01:41:08] 讓他學完之後呢這個模型 [01:41:11] 做出來東西就 [01:41:12] 比較像A公司的資料會講的話 [01:41:15] 所以以後如果這個模型被盜用了 [01:41:18] 他就說你這個 [01:41:21] 你這個模型的dispution [01:41:23] 是我用我公司的資料 [01:41:26] 勸出來的模型 [01:41:28] 但這件事情也不是100%在法律上站得住腳 [01:41:32] 因為畢竟 [01:41:33] 很多東西都可以mask [01:41:35] 但是的確 [01:41:36] 現在有很多的判例 [01:41:38] 不過很多的判例是 [01:41:40] 當你這公司賺錢的時候你就會被告 [01:41:42] 沒有賺錢他也不再想理你這樣子 [01:41:45] 就是他知道說你有拿他們的資料去Chain這樣子 [01:41:51] 那 [01:41:52] watermarking [01:41:54] 可能也許可以補充一下因為 [01:41:56] 有一些在做Pretraining會用到這些東西 [01:42:00] 會做到fine-tune [01:42:02] 然後後續的RIL設計 [01:42:04] 會提到啦但是不太會叫你們做RIL [01:42:07] 因為要叫你們做RIL [01:42:09] 如果只是講RIL那也沒什麼好講的話 [01:42:12] 畫一張圖就好了 [01:42:14] 如果要練習 [01:42:15] 那你們 [01:42:16] 沒有資源可以Chain RIL這樣子 [01:42:24] 研究上使用AI輔助的界限在哪裡 [01:42:28] 這看個人的道德吧 [01:42:32] 說實在的 [01:42:34] 說實在的 [01:42:35] AI現在越來越強沒錯 [01:42:38] 但是 [01:42:39] 實際上你要做出有用的東西 [01:42:42] 不是靠簡單的 [01:42:43] 一次性兩次性的Prong就可以解決的 [01:42:47] 這個學校老師也沒那麼笨 [01:42:49] 你把這個結果給老師看老師一定會 [01:42:53] 問題很多這樣子 [01:42:55] 但是你如果善用你如果跟他互動非常頻繁而且你能夠問出 [01:43:00] 問題的重點 [01:43:02] 我覺得他的確給你一些 [01:43:04] 方向或是意見 [01:43:05] 甚至告訴你一個 [01:43:07] 也許不是你Final solution的樣子 [01:43:11] 但他的確是有幫助的 [01:43:14] 但這件事情的確有點 [01:43:18] 那個 [01:43:19] 說這到底 [01:43:20] 是AI做的還是你做的這樣子 [01:43:23] 這個 [01:43:25] 有點 [01:43:25] 有點難界定 [01:43:27] 說真的有點難界定因為畢竟你是跟他互動 [01:43:30] 你是跟他 [01:43:31] 討論 [01:43:32] 後的而且如果沒有你的這些feedback [01:43:34] 他是做不出來的 [01:43:36] 所以 [01:43:37] 其實 [01:43:38] 其實上理論上你是有contribution的這樣子 [01:43:42] 但是現在的確 [01:43:44] 你 [01:43:45] 不太會去標註說我百分之多少是AI協助的 [01:43:51] 對 [01:43:52] 如果以學習上或是 [01:43:54] 基本的研究上 [01:43:55] 我覺得 [01:43:57] 你不要只是把AI給你東西直接交上去就好了 [01:44:01] 我覺得你要消化要調整 [01:44:04] 我覺得 [01:44:04] 那樣我覺得是還OK的這樣子 [01:44:09] 考試比較偏理論還是計算 [01:44:13] 我覺得都不是吧 [01:44:16] 可能是比較深論啦就是回答一些概念的啦我不太可能叫你們算 [01:44:22] 但也許會有一題叫你們算一下 [01:44:25] TFIDF [01:44:26] 好像 [01:44:27] 不太有意義 [01:44:28] 有點low [01:44:32] 那個NTU酷的問題呢可能我會請辦公室那邊加速處理啦因為 [01:44:37] 老師說真的很麻煩因為每個學校的修課系統啊名單匯入系統又不一樣啊 [01:44:44] 其實他們Tiger真的很辛苦 [01:44:46] 要Sync [01:44:47] 所有的學校 [01:44:48] 就是很麻煩 [01:44:50] 因為每個學校的行政流程都不太一樣 [01:44:54] 現在還好現在 [01:44:56] 每個大學開學日期都差不多了 [01:44:59] 我們第1次開課的時候 [01:45:01] 有些學校就晚一週甚至還兩週那個我們已經都快要寫第1個作業他還沒有NTU酷的賬號這樣子 [01:45:07] 好啦大家怎麼很擔心考試的奇怪 [01:45:15] 好啦我大概會 [01:45:18] 真的是 [01:45:23] 會跟你們講一下可能會考什麼 [01:45:33] 作業會給多少時間完成 [01:45:35] 助教有回啊通常是一個月前會公佈啦 [01:45:40] 但是你們你們通常是前一週才會開始做嗎 [01:45:43] 不過 [01:45:44] 我們就是提早公佈你要你要前一天做 [01:45:46] 我們也沒有意見 [01:45:48] 這門課作業會調分 [01:45:51] 好問題 [01:45:52] 因為 [01:45:53] 因為有學生反應說 [01:45:55] 這個 [01:45:56] 我的學習成績跟我當初作業老師公佈的百分比算出來不太一樣這樣子 [01:46:01] 但是通常是會往上嘛對不對 [01:46:05] 本來80分我給你85分你不會來抗議嘛對不對 [01:46:08] 那 [01:46:09] 可能會調啦因為就是做一個Normalization這樣子 [01:46:14] 但是會不會調低 [01:46:16] 通常不會 [01:46:18] 因為 [01:46:20] 調高你們就 [01:46:21] 比較不會有怨氣嘛 [01:46:22] 所以我們都會把作業弄難一點 [01:46:25] 然後把它調高這樣你們會覺得 [01:46:27] 老師的恩澤這樣子 [01:46:28] 但是如果本來都很高分然後最後把它調低你們 [01:46:32] 大概低卡我就看不完 [01:46:36] 重點都還是在於鑑別度跟 [01:46:39] 這個整個 [01:46:41] 比重 [01:46:43] 好啦應該 [01:46:44] 沒有有些我可能就 [01:46:46] 有些我們就是 [01:46:53] offline再回一下好了 [01:46:57] 大概是這樣 [01:47:00] S一點 [01:47:14] 我秀一下我們 [01:47:15] 第一張內容前面一點點就好了 [01:47:19] 畢竟 [01:47:21] 畢竟是 [01:47:24] 直播錄影的 [01:47:26] 有沒有啊 [01:47:28] 嗯? [01:47:34] 關了嗎 [01:47:41] 好 [01:47:42] 這個就是另外一份投影片喔就是我標W1的 [01:47:48] 就通常 [01:47:49] 那個投影片的前面那個week [01:47:51] W就是通常會是上課的週數 [01:47:54] 不過後來也不太準 [01:47:55] 所以大概就是照這個這個編號的順序 [01:47:59] 上下來 [01:48:01] 好 [01:48:02] 那我只秀一下這個 [01:48:06] 好可以嗎 [01:48:07] 好 [01:48:16] 這邊主要是講Introduction [01:48:18] 但這Introduction的內容大概也 [01:48:22] 大概也涵蓋以前NLP會上的所有東西這樣子 [01:48:25] 就是講 [01:48:27] 這個基本的處理方法這樣子 [01:48:29] 但是我把 [01:48:30] 這個Embedding [01:48:32] 或是Vault to Vector擺在 [01:48:33] 下一個部分 [01:48:34] 這邊會提到一下這樣子 [01:48:37] 所以他重點會 [01:48:39] 先 [01:48:40] 讓你看看一些應用 [01:48:42] 然後會告訴你說一般我們在做文字處理的時候 [01:48:45] 會做什麼樣的事情 [01:48:47] 但是 [01:48:48] 可能你們現在都不覺得 [01:48:50] 該做這些事情 [01:48:51] 因為也不太需要反正餵給LM就好 [01:48:54] 但是有時候 [01:48:55] 這裡面的道理 [01:48:56] 還是得懂 [01:48:57] 那會先提一下LSA [01:48:59] 就是 [01:49:01] 以前 [01:49:02] 在做NLP的人 [01:49:04] 沒有Vault to Vector [01:49:05] 沒有Vault to Vector這些東西的時候 [01:49:07] 我們怎麼去了解語義的部分 [01:49:10] 我們怎麼知道貓跟狗比較像貓跟卡車比較不像這件事情 [01:49:14] 以前到底用什麼方法來做的 [01:49:17] 所以你們可能 [01:49:18] 又要 [01:49:19] 參觀一下博物館看一下說以前這些原始人 [01:49:22] 做的這些 [01:49:23] 工具到底是什麼 [01:49:24] 然後我們會秀一下Vault Embedding [01:49:27] 當然你會覺得說 [01:49:29] 這個不是LM [01:49:31] 沒錯 [01:49:32] 但是 [01:49:33] 他的確是談到了處理文字的重要的 [01:49:38] 精神 [01:49:39] 所以 [01:49:40] 你懂了這個脈絡之後 [01:49:43] 你就可以 [01:49:43] 比較知道 [01:49:45] 痛點是什麼 [01:49:46] 這個難的地方在哪裡 [01:49:48] 不然老實說你現在有 [01:49:51] 掛個API [01:49:52] 做進去 [01:49:53] 寫分析 [01:49:54] 100行Viber Coding [01:49:56] 一個晚上就做完了 [01:49:57] 你覺得那會有價值嗎 [01:49:59] 其實 [01:49:59] 很難 [01:50:01] 我就講這張圖就好了這張圖其實 [01:50:04] 其實是一個不是很舊的paper 2021年的一篇paper但是他 [01:50:08] 他秀了一個過程我覺得還蠻適合講NLP的發展過程 [01:50:13] 其實四個階段你看到這四個時間點 [01:50:16] 從 [01:50:17] 1960到2010 [01:50:18] 這樣子 [01:50:19] 那上面兩個比較舊 [01:50:21] 上面兩個比較舊但是他做出來的東西會 [01:50:24] 比較 [01:50:25] Human friendly就是 [01:50:26] 因為就是都要人進去做 [01:50:28] 所以人 [01:50:30] 對自己做出來的東西比較能夠理解說對這樣有用這樣的確有他的道理 [01:50:34] 但是越來越後發現 [01:50:36] 這好像 [01:50:37] cost太高了所以我們希望靠著一些大量 [01:50:40] 用統計 [01:50:41] 甚至靠訓練的方式來做 [01:50:43] 但是做出來的東西的確有一點難解釋難表示但是機器看得懂 [01:50:50] 機器看得懂 [01:50:51] 所以這大概是幾個階段 [01:50:55] 我們看一下就是從一開始 [01:50:58] 這個語言學的人 [01:51:01] 這個會希望說從語法上去分析所以你會看到一顆tree [01:51:06] 這是原來的 [01:51:07] 整個句子 [01:51:08] 然後他會有noun phrase [01:51:10] verb phrase [01:51:11] 去做下來的 [01:51:12] 就以前我們 [01:51:13] 做nlp [01:51:16] 起手式 [01:51:17] 就是會建passing tree [01:51:19] 甚至會建所謂的dependency的關係 [01:51:22] 所謂dependency就是說 [01:51:23] 這個形容詞是形容這個名詞 [01:51:26] 會有一個這樣的topple出來這樣子 [01:51:28] 所以 [01:51:29] 有一些工具就可以讓你pass出一個句子裡面 [01:51:33] 這樣的關係是什麼 [01:51:35] 他的結構是什麼 [01:51:36] 你也知道一些詞性 [01:51:38] 這個是很久以前 [01:51:40] 這個語言學進來的 [01:51:41] 在做的事情 [01:51:43] 的確那時候也覺得 [01:51:45] 讓電腦搞懂這件事情的確應該要這樣做 [01:51:49] 他才知道說 [01:51:50] 有些形容詞是形容某個名詞片語 [01:51:53] 或是這個句子的 [01:51:56] 重點是什麼 [01:51:57] 因為我們知道英文重點你要看主詞 [01:52:01] 然後看他動作是什麼 [01:52:02] 所以就比較知道 [01:52:04] 怎麼樣這個句子的keyword [01:52:07] 或是 [01:52:08] 想要表達意思是什麼 [01:52:10] 後來就覺得 [01:52:12] 那 [01:52:12] 應該要讓他聰明一點 [01:52:14] 所以我們就人也進去 [01:52:16] 建立一些explicit [01:52:18] 但是explicit比較像是 [01:52:20] 資料形式用人建 [01:52:23] 所以如果你大概學過知識圖譜 [01:52:25] 就知道 [01:52:26] 這看起來就有點 [01:52:28] 有點結構化的句子有點但是他其實是一個比較 [01:52:32] 比較像free text [01:52:33] 不是句子 [01:52:34] 不是句子但是他是結構化的知識 [01:52:37] 所以比如說 [01:52:38] 你會看到這些節點 [01:52:40] 節點的部分 [01:52:43] 節點的部分 [01:52:45] 然後他有所謂的age的關係 [01:52:48] 比如說這個是COVID-19 [01:52:50] 他其實是 [01:52:51] 這個 [01:52:51] 某個這種 [01:52:53] 疾病的這種instance [01:52:55] 然後他會有什麼症狀就這些 [01:52:58] 那這些東西是靠人建的或者是說你可以從句子裡面去 [01:53:02] 截取出來 [01:53:04] 比如說有人說 [01:53:05] 我得了COVID-19然後覺得狀況怎麼樣那你就可以在這樣的一個age [01:53:10] 去建立這樣的 [01:53:12] 的knowledge出來 [01:53:14] 那這樣knowledge出來之後其實很有用啊 [01:53:16] 就是 [01:53:17] 我可以trace啊因為比如說 [01:53:19] 我搞不好還有另外一個這個 [01:53:22] communicable [01:53:24] communicable [01:53:26] disease的 [01:53:27] 疾病 [01:53:28] 然後這個疾病呢 [01:53:29] 他可能跟COVID-19有點關係 [01:53:32] 那我可以 [01:53:32] 從這樣的trace裡面知道說搞不好 [01:53:35] 他也會有類似的症狀 [01:53:37] 就是說我從 [01:53:39] 已知資料建立出來的結構 [01:53:42] 我可以再去漲 [01:53:44] 再去學 [01:53:47] 這些knowledge出來 [01:53:49] 這就是為什麼當初 [01:53:52] 在那個AlphaGo出來之前 [01:53:55] 有一些非常聰明的系統 [01:53:57] 也蠻亮眼的 [01:53:58] 那裡面他的學法 [01:54:00] 就是像IBM那樣子有個系統 [01:54:03] 就是 [01:54:05] 他會去學說 [01:54:07] 水是液體 [01:54:09] 然後液體的特性是什麼 [01:54:10] 他會從高處往低處流 [01:54:13] 所以我就可以去推論說 [01:54:15] 水也會從高處往低處流 [01:54:18] 我就可以從這樣的知識圖譜裡面去做這樣的推論這樣的聯想 [01:54:23] 或是讓電腦自己去長出那些知識 [01:54:26] 有點像人在學知識的過程 [01:54:28] 所以這個以前 [01:54:30] 就是希望我們可以靠著 [01:54:32] 人給他一點的 [01:54:34] 這種seed [01:54:35] 然後讓他去建構這樣的東西 [01:54:40] 那後來發現這實在成本太高了啊 [01:54:42] 因為人建出來的量少 [01:54:45] 而且quality也不一 [01:54:47] 有些人 [01:54:48] 隨便做做 [01:54:49] 有些人 [01:54:49] 而且 [01:54:50] 你很難去 [01:54:51] 很難去連貫啊 [01:54:52] 因為不同人做的 [01:54:54] 他寫的字也不太一樣啊 [01:54:56] 不同字的概念又不太一樣 [01:54:58] 其實 [01:54:59] 很難去merge [01:55:00] 但是有很多 [01:55:01] 你可以去找一些開放的 [01:55:03] 那種 [01:55:05] 像Freebase這樣的比較大的 [01:55:07] 的資料庫來 [01:55:09] 去漲 [01:55:10] 但是其實上 [01:55:11] 還是 [01:55:12] 有限還是有限 [01:55:14] 所以後來就希望用大量的統計資料來選 [01:55:18] 所以這個其實點 [01:55:20] 後來 [01:55:21] 其實based on [01:55:22] 為什麼有這些東西因為就是網路 [01:55:25] 發達就是 [01:55:26] World Wide Web起來之後有一大堆的文章一大堆文字是可以被accessible [01:55:31] 所以這些東西可以被取得了可以被統計的 [01:55:34] 所以後來就有一些統計的做法 [01:55:36] 像我們提到要提的what vector [01:55:39] 就是基本上我可以用統計的做法知道說 [01:55:41] 其實我不用告訴大家 [01:55:42] COVID-19是什麼 [01:55:44] 不用告訴他這些症狀是什麼 [01:55:45] 他可以靠著文章中的 [01:55:48] 貢獻性的關係所謂貢獻性是 [01:55:50] 同樣在一個句子裡面被描述出來的時候 [01:55:53] 我可以拉近這些關係 [01:55:56] 我就可以拉近說這個這個字詞其實存在一個關係 [01:56:00] 靠這些關係他就可以去推論 [01:56:03] 一些 [01:56:04] 語義 [01:56:05] 一些概念在裡面 [01:56:07] 這個是後來 [01:56:09] 大家覺得這個做法非常厲害甚至 [01:56:11] 他可以拿來 [01:56:12] 翻譯 [01:56:14] 就是完全英文的東西對照出法文或是其他語言 [01:56:18] 就可以翻譯 [01:56:20] 那後來 [01:56:21] 想說把這個東西再擴大一點我們做 [01:56:25] 用學的方式 [01:56:27] 用一個大模型 [01:56:29] 不過這時候還沒有很大 [01:56:32] 就是用model的方式去圈 [01:56:34] 圈完之後這些參數 [01:56:36] 是 [01:56:37] 只有機器看得懂人看不懂 [01:56:39] 所以你可以想象大語言模型那個幾個b連的參數 [01:56:42] 裡面 [01:56:44] 以前的確有一些人去研究啊 [01:56:46] 就是 [01:56:47] 每一層的transformal參數 [01:56:49] 有沒有一些特性有沒有一些分佈 [01:56:51] 但是都比較像是一廂情願的做法 [01:56:53] 這個這個 [01:56:54] 這一層好像在做什麼 [01:56:55] 那一層在做什麼 [01:56:57] 但是 [01:56:58] 的確有一些benchmark可以驗證但是 [01:57:01] Who knows [01:57:02] 就是你又不是LM你怎麼知道他在想什麼 [01:57:04] 就是他怎麼靠那堆參數來做出這麼厲害的事情 [01:57:09] 就是有各式各樣的 [01:57:10] 的做法這樣子 [01:57:12] 但是我們希望說 [01:57:13] 他能夠把這麼大量的東西濃縮在幾個b連的參數裡面 [01:57:18] 學會 [01:57:19] 所以這一篇 [01:57:21] 當然如果你有興趣看這篇paper可以看一下因為前面會講比較多一點 [01:57:25] 他只是說這樣的一個history的過程 [01:57:28] 你就可以連貫說這個原來以前 [01:57:32] 這個 [01:57:33] 這些學者 [01:57:34] 都在幹這些傻事這樣子 [01:57:37] 但是也不得不幹這些傻事 [01:57:39] 因為當時的resource [01:57:41] 跟 [01:57:41] 跟資料 [01:57:42] 跟算力也只能做這樣的事情 [01:57:46] 好 [01:57:47] 我想 [01:57:48] 就到這邊好了 [01:57:49] 就是 [01:57:50] 做個開場 [01:57:51] 然後我們下禮拜就從 [01:57:54] 這邊開始講起 [01:57:56] 那應該是在 [01:57:59] 一週到 [01:58:00] maybe是第3周就可以講到water vector [01:58:02] 然後我們就會有第1個homework這樣子 [01:58:05] 好 [01:58:08] 有沒有問題 [01:58:09] 有沒有問題 [01:58:14] 沒有 [01:58:16] 不會告訴你 [01:58:17] 通常你算出來 [01:58:18] 東西就 [01:58:19] 他的我們會有 [01:58:21] 會有test data [01:58:23] 你就可以去評估 [01:58:25] 是不是 [01:58:25] 每個作業不太一樣 [01:58:27] 每個作業不太一樣 [01:58:29] 但是比較不像是那種去看Leaderboard或是什麼的 [01:58:34] 的data這樣 [01:58:36] 不要擔心作業沒有很難 [01:58:40] 現在看到的是舊的 [01:58:42] 沒錯 [01:58:43] 我現在看到的是舊的但是有些後面東西 [01:58:46] 我覺得更新的機率也不會高 [01:58:50] 大概就是 [01:58:51] 一兩頁這樣子 [01:58:52] 但是可能會有一些 [01:58:54] 新的章節這樣子 [01:58:58] 好吧 [01:58:59] 有沒有其他問題 [01:59:03] 那我們今天就到這邊 [01:59:05] 我希望下禮拜可以看到各位 [01:59:07] 謝謝