[0:00:36] 志願自由生涯、紅色教堂、青菜、甜點、黑色三文字、長調、光線、獨特、超級、威武、日常、抗流、開放、現實、靈活、 Forestry、超級純粹。好那個雖然還沒開始上課了不過因為教室有點小所以有些事情我可能就開始進行交代一下那這個大家好我是高鴻宇那這門課呢是自然語言處理那他也是TAICA的課程系列之一那因為這門課呢有線上直播跟錄影大家也可以回看所以所以所以學校才允許我在一百人的教室開這麼多的學生論述 [0:02:06] 那今天呢可能就大家課那一下或者是說等我今天大概會上兩個小時的課中間會休息一下也許就可以用線上方式看好那我先就開始介紹這門課的內容那這個sorry這個是這個是課程的slido的連結不過如果大家有修這門課呢應該也可以在TAICA的NTU COOL上面課程的那個內容上可以看到說有一個slido連結那這個就是做課程Q&A的地方那大家可以在上面問一些問題這樣子好那我先做個自我介紹了那我是高鴻宇清大至宮的老師那那我以前做研究是比較偏自然源處理那當然也導入一些資料探勘跟機器學習的部分這個就供大家參考那這門課呢他是TAICA應該是第三年開的課程那從以前到現在大概修課人數大概都維持300到500人間了然後我們最後完成這門課的人數 [0:03:37] 大概八成可能有到八成五億那他主要的目的是涵蓋自然源那自然源處理大概在十年前跟在十年這近十年的內容教材會完全不太一樣那現在我們就會放大型元模型的部分那這個是在TAICA的的一開始的規劃上他們現在可能有點調整而且可能大家可以上TAICA的網頁上看有每個課程的難度那他們好像現在把難度的Range拉大好像有到八顆星這樣子那這門課呢其實是比較放在後面進階的部分所以好像這個同時段學校有機器學習郭老師的課所以其實如果你還沒有機器學習經驗的學生其實你可以先修一下機器學習或是Deep Learning的課程因為我們這堂課呢就會直接作業就會直接教你寫模型訓練然後當然就是處理文字的一些問題這樣子好那這個大概就是這是這一頁是當初給教育部長看的就是這門課在做什麼這樣子就是介紹一下這個自然語言處理的 [0:05:08] 這個裡面到底在講什麼這樣子當然自然語言處理在在這個ChatGPT還沒出來之前它其實是一個算普通也有點冷門的課的學問只是說大家後來發現這個處理語言的方式用Deep Learning用AI導入之後它可以變得這麼厲害這麼實用所以它現在幾乎是所有可以解決很多問題的一個基礎所以我們就會在自然語言處理的課程裡面去看如何讓電腦去理解人類的語言跟如何跟人類互相溝通那當然大家所熟知的大型語言模型也會在這門課裡面介紹這樣子好那當然今天的課程有點是介紹這個主要的這門課會涵蓋的部分那可能也讓有些同學可能不太知道自然語言處理在上什麼然後可能讓你有個認知也許這個可能不是你想象中會學到的東西這樣子那為什麼要學NLP那前面Nature Language就是語言但是我們這邊語言其實當然以前我們在做這件事情的時候可能就處理中文英文或是說你要做一點翻譯啊或是 [0:06:38] low resource的language啊就是也許你想做原住民語言這個就是你會target一個語言那processing呢就是說你要如何去讓電腦其實我們現在就很focus在電腦雖然NLP以前有絕大部分的工作都是要人工介入就是從語言學家來的那些domain know-how然後再加上一點點的運算去處理這些事情所以但是我們現在的電腦處理比重會越來越高甚至人已經不太需要在裡面這些domain的knowledge或是要跟人互動的部分會越來越減少所以我們要講的是怎麼讓電腦去處理怎麼讓電腦去理解這些語言的東西好我用這位這個Edward Harvey他是一個他現在是不是有在CMU可能已經轉到別的學校不過他是一個在NLP方面的學生非常有名的一個前輩他在兩年前LockedIn的會議裡面的一個Keynote講的部分雖然是兩年前講的部分不過我每年去看一看覺得他講的東西還對還適用這樣子我想現在大家會來修這門課或是說大家對學校相關AI的課程都非常的積極想要去聽一聽其實大概都是因為太多的新聞在告訴你們AI會怎麼樣怎麼樣 [0:08:08] 你如果不會這個就會怎麼樣怎麼樣所以大家都非常焦慮不只是你們老師也都非常焦慮當然焦慮有很多種那我們來看一下就是說其實大家會用ChangeGPT會用這些Gemini或是Cloud做一些事情你會發現他怎麼這麼厲害可以可以做這麼多事情那你還就覺得他為什麼可以做其實當然我們這門課的目的是想會告訴你一點說他其實有一點線索有一點理由但是也沒有任何的定理告訴你他為什麼可以做到這些事情但是如果完全不懂Transformer完全不懂Deep Learning的話其實你可能就不知道這個他到底是一個什麼神奇的東西是不是後面有一堆的工讀生在回答你的問題這樣子那但是有時候你可能會想一下說其實ChangeGPT寫的報告也不是很好有時候我要改一大堆的Prong他也不能出現我想要的而且甚至你玩久了之後你就會發現他其實有一點笨有一點漏洞這樣子他為什麼做不了這些為什麼做不到這個當然就是比較研究範圍我們想知道說他目前的挑戰目前比如說幻覺的問題啊或是說連簡單的加法都做不好這到底是為什麼這樣子的問題呢?這樣子或anyway其實很多東西我們都是 [0:09:39] 滿腦子問號這樣子OK那有些人當然現在這這個人比較少就是覺得大語言模型就是就是一個其實以後我會講到那個Tronsky他也會說大語言模型就是一個合法的抄襲者這樣子就是把所有的知識背在一起然後告訴你這些東西理論上以他的訓練的方式來講的確是但是他的確目前是現在最聰明的一個系統就是能夠消化人類的知識跟告訴你一些東西的系統但是有些人其實不太care反正這個都是過時的不是過時啦就以後會有新的東西取代掉這不是一個真正的真正的GAI的東西這樣子但是呢他做出來的東西其實很容易就被LM取代像我們常常會會去去跟業界談一下他們需求然後他們就覺得這個東西很難很難我說這個東西好像現在你用Cloud用Gemini就可以做了你可能只是Prong要寫的好一點Skill要設計的好一點這樣子所以這個大語言模型的演變會使得原來大家覺得他自己做很厲害的東西就不再這麼厲害就是這個istan一般老百姓這個都可以做到的事情不過anyway就是這樣 [0:11:10] 那當然這個Harvey他其實有舉出幾個方向但這方向當然很粗但是我覺得好像還適用就是說我們現在學NLP其實你應該把自己定位好你自己的角色就是說ok好以工程的角度來講我們知道說這個東西讓他有用就是如果以後你去業界工作老闆說你幫公司的工作流加速一下這個聽說這些龍蝦很厲害你能不能串一下這樣子所以你就必須導入導入你跟老闆說這個我們一個月要花這個五萬塊買Token這樣子老闆就說就從你薪水扣這樣子所以你要想辦法降低這個成本就讓他變得非常的便宜非常的有效率你如何做這件事情以工程的角度我想這個電子的學生每天都在做這件事情那甚至有些其實有蠻多硬體設計的人會想說那我就做Transformer加速的部分讓他可以在硬體上加速就可以做一些比較特別的一些晶片那就不用跟Media買這麼貴的東西這樣子那當然我們也是希望他能夠做的越有用越好就是以前可以幫我們寫報告但是這個報告好像老師一看就知道是ChangeBee寫的能不能做出一個報告是老師覺得是我寫然後就寫的很好的東西這是Useful就是他真正能夠產生價值 [0:12:41] 而不是一看就是那個AI味很濃的東西這樣子就是好像有講到東西但是那個Value是相當低的東西所以他如何跟Domain如何跟Local跟地端的東西或是說跟人的知識結合這一塊其實是在Application Label是相當重要的當然後面這一段就是這個Understandable就是說我們希望他這麼厲害的東西到底為什麼可以做到其實現在有很多的很有名的學界大佬都說這個現在AI的發展是沒有任何理論基礎其實你大概就可以想這樣等我們教完就知道其實就是Language Model那你沒有什麼基礎嗎你沒有什麼理論嗎可以用一條式子寫出來說他可以最佳化什麼東西嗎其實是沒有其實是沒有只是說他真的可以做到一些事但是我們就想知道說我們如何Garantee這件事情比如說你要做一個飛彈軍事的系統你說我導入LM那個司令問你說這個東西我們會不會Garantee這個殲滅敵人的機率是多少你只能說只要他在沒有幻覺情況底下我們會成功這樣子你就不太知道他怎麼運作就不知道細部你如何Garantee他的Quality [0:14:12] 所以有很多研究會在於說我們如何把這個黑盒子這個黑科技把他理解的更透徹一點這樣子那當然我想回到比較務實一點的層面就是一般我們NLP在講這件事情的時候我們當然就會說因為現在文字是一個很很Popular的的一個Data就是你現在看到的東西你現在網路上看尤其是在2000年網路泡沫的時候開始有一些Webpages出來之後其實有大量的文字出現那如何讓電腦也能夠理解這些東西NLP的重要性越來越高所以其實你要看一個技術是否重要你可以回推到以前就是從Google起來那個年代搜尋引擎起來那個年代為什麼這麼重要NLP或是資訊檢索以前是一個非常冷門的以前是叫做以前是圖書館系的人會去學的東西如何有效的管理知識就是把圖書館的館藏鎖音好讓大家比較有效率的找到這些東西但是這些東西如何套用在WireWave上的Tags就會變得更復雜更有學問所以就會有大量的研究所以搜尋引擎在2000年時候就非常重要而且也看到它的價值 [0:15:43] OK所以其實我們可以說NLP其實是讓電腦去了解跟使用當然你現在看到這一句你會覺得這個common sense這個好像就是這樣但是如果到30年前其實大家不會寫這句話不敢寫這句話因為其實gap還非常的大這樣子好那為什麼很重要這個我想就就看看就好了因為這個你現在所有東西你現在用的大語言模型你現在用的AI其實後端都是因為他能夠消化人類的所有知識那為什麼他能夠消化其實我說消化可能也不太對了因為他真的能消化我也不知道但是他至少知道人類所有的文字的東西然後如何反饋如何摘要給你東西這個對人類來講是有用的這樣子所以從你的日常生活從你的這個業界從這個學術界你都會看到很多的這個需求但我們都很希望做到這件事情就是我在旁邊然後AI就幫我做研究然後按下去明天就一篇paper出來這樣子其實這件事已經在發生已經在發生了其實如果大家有開始因為這是研究所的課碼可能在座應該百分之八九十都是研究所的學生如果大家有在開始投稿就發現現在這些頂會為什麼那個submission count都非常高 [0:17:13] 一個會議就有一萬篇兩萬篇的paper在投稿這樣子雖然有一些是被regret繼續投下一輪但是其實我以我審稿的經驗大概有百分之二十的paper都是全自動或者是半自動產生的就是人機協作過程中的產物但是那個quality跟那個鑑別度就是你已經很難區分那個AI的痕跡那也是頭頭是道數據也非常清楚那這件事情在發生OK那大家如何善用這是就想象一下那這個例子只是說以前啊在TradeGPT2022年還沒出來的時候其實我們大家有時候不會覺得這幾個應用都比較像是研究所的碩士論文會做的我們要做一個這個這個病例報告自動生成的系統或者是說我要做一個法務這個合約判斷的系統這個都可以在碩士論文裡面查到這樣的研究但是從LM出來之後呢這些研究變得落地性很高就是你可以跟廠商合作說我幫你做這件事他也覺得你不是在騙錢的這樣子你真的做得出來這樣子所以這個gap這個中間的差距他不是一個很線性的其實老實說在LM出來之後 [0:18:43] 有很多的應用是往上漲就是那個以前做不太到現在立刻就可以做了這樣子OK那當然我想這個大家都熟悉大概四年前11月應該就就快滿四年了TradeGB出來的那一段時間造成了整個科技界的轟動這樣子那可能你們比較感應沒有感受沒有那麼高因為當你們開始接觸科技的時候他就是有這個東西所以你可以想象就很像當初原始人還不知道該用火的時候突然這個雷打下來他們發現這個火這麼好用老師這個年紀大概就是那個原始人時代就突然覺得有一個這麼上帝賦予的功能工具的時候他就是一個這種感覺但是如果你是在後面出生的人就覺得這個本來就是一個Must就是一定是要有一個這樣的東西就不覺得說這個Revolution是相當的高那當然這個中間的歷史其實如果你有學過AI的課大概就會跟你談說從Deep Learning開始到所謂的生成式AI的部分這邊我們沒有要細講每個模型不過大家就可以這個這個其實每個模型也都很舊了就是說從Transformer出來之後有很多的或是之前或是之後都有很多講 [0:20:13] 這樣的東西不只是在做角色式的模型它可以做Decoder可以產生的東西所以它可以產生文字可以產生音樂可以產生影像可以甚至可以呈示碼這樣子所以這樣的東西的導入呢就可以讓你的應用變化相當的多了這很快的我就帶一下不過這個例子都是一年多前做的現在看起來都非常的low這樣子就是quad很差然後AI味很重這樣子OK我想這個大家都用過Text to Image或是說現在如果你們用Vibe Coding的時候你叫AI幫你寫程式其實這個東西現在已經非常普遍了其實像我面試學生或是專題生我都問他說你現在Vibe Coding的比例是多少當然學生心裡馬上就跑一個東西老是問這個事要試探我沒有自己寫程式嗎然後就會就會稍微說我都自己寫我都很認真自己寫這樣子然後只有用AI問一下這樣寫對不對這樣子當然以學習來講我覺得這是比較好的但是對於整個你要寫程式的performance來講或是以現在的趨勢來講甚至在業界他們現在可能都超過80甚至90的比例是Vibe Coding這也是為什麼現在資工系Fresh的學生找不到工作就是說你會寫的東西 [0:21:44] 這個LM都可以做了這樣子所以你的必要性就會降低這樣子不過anyway我覺得資工系的訓練應該是要Based on這個東西再上去因為你用過Vibe Coding就知道其實最麻煩的可能就是後面或是前面的系統架構的部分那一端應該就是資工系應該的強項好我這邊秀幾個畫面不過老實說這個例子也是久的這個比較像以前的你在ID的環境他做一些Auto Complete的動作這樣子老實說在NLP的課程講codegen好像不太合理因為這個跟我們中文英文無關但是你要想像Program 程式也是一個語言只是不是我們人類講話語言但是他是一個我們人類跟電腦的互動的高階語言所以現在的codegen模型的codegen能力已經非常好為什麼你可以用Vibe Coding就是他底下他已經瞭解這些這些寫程式的道理所以他可以幫你做很多事情不過當然我覺得他問題還是很多而且大概只能做基礎的能夠加速你一些的的的開發時間但是你要思考一下從有Vibe Coding到現在才過多久的時間可能不到一年 [0:23:14] 就真正成熟到現在不到一年一年就有這樣發展你可以想像在接下一年或兩年他會變成什麼樣子甚至你也不需要下ProgramOK所以這個演變大家可能要稍微感受一下這樣子當然這是以前舉的例子就是說以前會出一個作業叫大家寫你用LN去包裝產生一篇一個Fake News這個其實在速發部他有希望能夠去detect這樣的東西網路上的的訊息靠AI產生的比例虛假的訊息比例那這個檔案現在你不會覺得他是一個很神奇的東西因為這個太容易做只是說你要跳過他前面的一些filter就說你不能叫確定力教你怎麼做炸彈但是你可以模仿一下比如說這個像這個這個是當初網路上的新聞就是說在美國選舉的時候有人用很多假新聞來做這件事情但是如果你要直接叫LN用叫他寫一篇關於某個候選人的假新聞的時候其他不做但是你如果用一個比較學術用討論的語氣說你能不能模仿一下這個川普 [0:24:46] 去寫一個關於歐巴馬是這個不是美國人這件事情他就做了這樣子就是他是一個一板一眼的互動的人這樣所以他就可以寫這樣的東西你可以想像這樣東西在網路上流傳的時候他造成的效益是多少那大家應該也知道現在網路上有太多的訊息都是AI產生的但是可能這些訊息可能也都是AI在讀的這樣子所以也是AI之間互相的溝通這是也是當初一個例子就是講COVID-19的就是有一些訊息說這個打疫苗不好我應該要去吃什麼東西這樣子他就用一個非常專業語氣在講這些事情那這種東西所造成的負面效益其實非常大不過我們並不太大概會把Fake News這件事情擺在這門課講太多這樣子當然還有什麼多麼太的不過我們這門課比較不會牽扯到影像的或是Speech的部分所以Multimodality的部分其實不太會Cover到不過基本上現在你可以發現其實就是換掉一顆模型換掉你的輸入的東西其實後面的手法其實都不會差太多這樣子那當然有所謂做Action的就不太是文字的當你瞭解Transformer他在訓練的方式的時候他讀文章進去訓練方式你就可以發現說那我不要給他文章了我給他一堆的動作比如說把桌面清乾淨這些Action [0:26:20] 輸入給他這樣子那其實是一個非監督式的學習就是有這樣的動作你就去看一下原來我要把手臂舉起來之前我要做什麼事情有一個標準的流程這些流程其實就跟你在寫一篇文章一樣你要起承轉合你要有動詞主持授詞所以Action的Sequential的Action基本上也可以想像滿足語言特性的一些Pattern所以也有人用這樣概念在訓練所謂的Action Model那當然這個產生圖片這件事情就大家都知道的事情那我就其實真的就是你就換掉一顆VLM就是把LM換成一個VLM然後你就可以讀影片 產生影片或是做識別 做一些Grounding你就可以做不同的東西所以其實現在模型的能力越來越Power你遇到做的事情就會越來越少但是大家可能就會發現你自己存在的必要就會越來越少所以你就要開始找你能夠你的Niche在哪裡這後面有一個新聞這剛好我在昨天在整理在準備今天投影片的時候發現一個新聞當然這個這個這一位他其實很常發新聞但是你會發現他的新聞常常正負面換來換去這樣子跟那個Mask有拼這樣子 [0:27:51] 就是突然說什麼好的突然又說什麼不好這樣子不過他講這件事我覺得是蠻有道理就是說現在AI的強大其實他可以讓以前點子非常多的這些人但是他做不出來的這些人突然有很大的Performance出來因為他可以創造很多東西因為你可以想他就是拿到一個Power Tool他可以做很多事情所以現在有很多新創公司那個公司人數都是一個人兩個人而已所以其實現在這是正在發生的事情OK不過當然這個Sam Altman也有一些負面的他們OpenAI也不是在幹一些好事這我就擺一個小小在這邊這個是最近有一個新聞就是就是有一個老實說我看這個問題看很久我也不知道為什麼當初這些數學家要討論這種問題反正如果大家有興趣可以把這個關鍵字搜尋一下反正說真的我不太知道這個問題我已經看很久了反正就是一個存在的很久的一個數學的問題這樣子那這個過程這個故事就是說這個當初這個數學家跟一位在Entropy公司工作的人已經把這問題已經算解完了已經差不多快結束了然後呢這個OpenAI的人就覺得不行 [0:29:22] 如果被Entropy公司先發表說他們模型就就佔了版面這樣所以OpenAI就集全公司很大的算力去做這件事情這樣聽起來好像是公平競爭也還好但是實際上如果大家有興趣可以去看一些細節就是說私底下他們有去跟這個數學家contact說你要不要跟我們一起發表這篇論文不要理那個Entropy那個人這樣子然後就 anyway就有點像利誘啊你一樣可以拿到這個獎金這好像有一百萬美金一千萬美金很多那那這個數學家當然就覺得不道德所以他還是繼續跟Entropy這樣這個學者合作這樣子然後就有點像同時解決這個問題就OpenAI的模型也可以解決然後這個Entropy公司的模型可以解決這樣子所以就有這個新聞但是這個新聞其實後端大家有一個在思考的點就是說當初這些data這些Entropy公司我也不知道為什麼或者是這個數學家的東西他好像有一些資料是擺在OpenAI上面這樣子好像anyway就是說有一點是這個leakage的問題反正這後端有一些這樣的故事然後也有這種人性去所以你可以知道現在模型發表其實都是講新聞版面雖然大家會去在意那個Leaderboard的排名但是 [0:30:52] 但是有時候新聞大家覺得這個很厲害這個很厲害這樣子這個就會影響他們的那個付費的的Account好我其實前面講這些其實並不是課程的重點只是我想帶一下說AI這件事情在NLP的施力點跟他現在改變的東西這樣子那我很快會把這邊講完所以這邊其實不是我這個課的像比如說game其實從AI在做Generation這件這個概念並不是很common sense就是說其實我要拿做AI做生成以前是大家不會想都不會想從GPT3之前大家都不會說我可以用模型來寫一篇文章這絕對不可能發生寫出來絕對一看就是電腦寫的不是文藝不通句子接不起來就是怪怪的這樣子就是論述也不對以前沒有這麼厲害但是這件事情反而從影像那邊過來好像做了出來然後文字從GPT3之後我發現好像可以說人話這樣子那這個當然前面的歷史就會更早以前從生成對抗網路這個大家如果學過AI應該就知道這是一個比較大家就知道說我可以讓電腦自己生成一些東西 [0:32:22] 這些生成東西不是人去做的是電腦自己靠著一些規則靠你給他一些模型參數他可以自己產生東西當然這個game他主要是為來做對抗為來做自己模型的東西調了更好的對抗的資料但是你可以發現他可以生東西出來而且是生東西出來是有用的這樣子所以從game之後大家就覺得這個生成的東西實在太好用所以我可以讓電腦做什麼其實這一塊很重要就是做訓練資料生成或是擴充大家如果學過AI就知道說其實訓練資料才是最寶貴的雖然有很多非監督式學習的東西但是廠商給我就是十筆資料病人醫院的資料就是那十筆我怎麼樣去做一個很厲害的判斷的模型所以你一定要有一個可以產生更多有用的訓練資料方法所以這GAI就在這些需求下就蓬勃發展這樣子這個都比較是影像的應用所以這個大家可以想像一下這個東西你可以想像這是2016年NIPS的一個tutorial講的東西到現在十年了雖然現在大家不太用GAME來做生成有更好的技術在做所以其實你可以想像這件事情他的他不只是幫你做一個很要報告的圖片做一個什麼東西的 [0:33:53] 文章他可以輔助到很多層面甚至他可以自己幫助自己在訓練的更好所以GENERATION這件事情你不要太侷限他的範疇就是這樣子但是在文字上其實這個時間軸可能要再拉更早以前在文字上其實沒有這麼聰明沒有那影像當然是後面但做NLP大概會從這四個四個軸開始大家可以看一下不過我們並沒有講這些這麼細的東西因為現在不需要我們會從最上面的Morphology構制所以你會談到字的前綴後綴這些東西這個當然在中文是沒有但是在任何拉丁語系都有大家如果學過去考過這個GRE英文就要背什麼什麼前綴詞後綴詞這些東西那甚至你要學所謂的stemming段字甚至後面的syntax你要學會這個詞性就是你要知道動詞主詞受詞這些東西所以NLP的技術的發展是這樣的每一個每一個階段它都可以是一個非常重要的主題所以像以前做Name Entity Recognition就是一篇文章裡面我如何知道國立清華大學這六個字是在講一個學校的名字如何去判斷一些詞之間是有關係的 [0:35:25] 國立清華大學跟清大是同樣講同樣的東西的這個就是一個Numeration的問題所以你會發現以前在看NLP的問題的思考點就非常細就是有點像你一步一步教會電腦去看這個句子我們人是怎麼理解的我們人學會文章是怎麼理解我現在就一步一步教會電腦去做這些事情那以前的做法是這樣但是到後來就極限了遇到一個瓶頸那我都會舉這個例子就是在2017年應該也是10年前就是國科衛辦了一個比賽講了這件事情你如何讓電腦去做閱讀理解就是給他一個問題然後給他選項電腦能不能回答出這個答案那以前的做法呢就是把選項呢去比對比對文章算相似度這樣子但是你會覺得這個很笨啊就是把它丟到checkgpt問一下然後給他選項他就會回答沒錯但是你有沒有思考這些模型是怎麼怎麼做到這件事情以前我們就只停留在說我要把每一個選項去比對關鍵字或者是把它轉換成一個項鍊用一堆數字來表示這些文字但是一樣在算相似度那這個相似度呢就是在不同的Domain [0:36:55] 可能是你把它轉換成某一個Megaspaces的Domain去算相似度你並沒有真正去理解說這個他前因後果是什麼這樣子對那我們還是不要問這個這一題的答案其實不見得會固定就是大家的idea覺得這個是什麼這個是從這個國語文能力測驗出來的大概是中年級小學中年級的程度那也會拿來去考外國人說他到底看得懂中文沒有這樣子那當然以一般我們這個native speaker中文的native speaker來講這應該蠻簡單但是你可以回去讀一下好像不是這麼容易這是在2017年辦的比賽然後第一名獎金有1000萬辦了兩屆這樣子那據說第一名獎金都沒有發出去不知道是國客會沒有誠意還是怎麼樣這個好像有錄影就是後來後來那個那個那個審查委員那個裁判說的說大家都都沒有做好意思是這樣就沒有做很好這樣所以第一名從缺這樣子anyway然後這是問CHATGPT的他會告訴你答案重點是大概可以解釋 [0:38:25] 科技大學當初分兩個階段第一個是回答選擇題第二個是你要告訴我為什麼那你要能夠解釋這件事情是在2017年是大家覺得這根本是聖盃啊根本是做不到的事情但是你現在隨便拿一個拿一個transformer decoder餵給他他就會告訴你這些東西雖然不見得這麼好OK所以你可以想像這個gap是一個非常discrete的jump上去並不是一個很連續的成長那其實這件事情以前啊就是就是CHATGPT還沒出來之前就有language model只是說老師這個就是我們現在把language model變大而已嘛就是LLM沒錯的確他的精神是一樣的是language model那以前我們在做NLP的人不見得都會用到language model因為他第一個是based on 機率的模型去講而且通常我們訓練的語料也沒有很多所以這件事情大家就覺得他是理論的基礎但是當初跟語言模型有關的這兩位可能在座如果以後要做speech或是做治安的同學你都會遇到這樣子這非常有名的尤其是Claude Shannon你看這個名字就知道為什麼他有名為了紀念他所以那個模型 [0:39:56] 就用他的名字OK好他們都有提到跟language model有關的東西language model其實大家都知道啦就是這種接龍遊戲TrackGP出來之後為什麼大家說要接龍遊戲就是這樣子什麼東西前面是什麼後面出來的機率會不太一樣那你就會去猜最好的雖然這個我用Google當例子不是很好因為Google他其實會拿那個查詢詞的分佈去做統計並不是所有文獻去做統計不然你以為你可以發現不同地方臺南新竹臺中好吃的後面的排序是不太一樣的對所以這個你可以想像大家常常查的東西是什麼所以他有個probability model所以大家知道language model就是一堆詞的關係我這邊拿周杰倫的周杰倫的歌詞應該沒有版權我再舉個例子這樣子就是他的詞之間的關係那但是做完之後發現例子不是很好不過居然都做了就把他擺出來這樣子因為那個周杰倫的詞都很跳所以那個機率不太好算這樣子那我當然有試過這個用黃淑駿的在座我們聽過黃淑駿這一位歌手聽過舉手一下不入你們年紀這樣子 [0:41:26] 我用黃淑駿來做那黃淑駿其實也不太好做因為他他的詞非常多沒錯但是他的他的他的詞也是很特別就是所以Probability也不太好算不過anyway語言模型他其實就在算這些N-gram之間的發生的條件機率就是你看到這個詞之後看到這個詞的Probability這個條件機率你都會算其實這個就是基礎的Language Model只是說你可以想像你如果只知道這件事情你現在就回去想說老師給我一大堆的文獻我自己要算這些機率會發生什麼問題第一個這要量太大第二個可能有些東西沒有發生過啊那機率是不是0機率是0要怎麼算這樣子所以你可以先不用先看答案自己先試著做一下你就知道說原來我想得到這些問題都已經有人解過這樣子所以你就可以成長得很快這樣子好不過anyway現在我們探討NLP不是用這樣的角度去看這張圖AI位也很濃沒錯這其實是我自己手工畫了一下之後然後再叫AI幫我把它美化一下就是我們看到的NLP的歷史從AI的角度來看那個站著的同學就不好意思我也很快 [0:42:56] 第一階段就會講完了這樣子你們就可以看怎麼樣就這個歷史其實跟NLP有關的發展其實當然後面很快但你會發現其實前面我們在講這些事情這一位大家應該都知道這個Turing他做Turing本訓之後去探討說這個language之間什麼樣language不同的type當然跟Transcript的這樣的hierarchy有關所以在那個年代在這個19501960年代其實就希望能夠那時候其實電腦還沒出來喔你可以想像Turing那時候是沒有computer的大家就有這樣的想法需要讓電腦用運算的方式去處理這種這種sequential的東西然後去理解裡面的一些pattern所以其實在Chomsky那個年代就有一個chipboard就有一個chipboard出來這樣子但是真正跟我們比較有關的你可以想像說在網路泡沫化起來的時候那時候有很多的網路泡沫化起來的時候那時候有很多的網路泡沫化起來的時候在2000年時候有搜尋引擎但是那時候大家做的是什麼TFIDF這個萬用的非常厲害的Baseline的做法然後到後來大家覺得這個Benji有說我們可以用模型的角度用NN的角度來看這件事情來做language model [0:44:28] 我們不是在算剛才的機率我們用Chain的方式來做從這邊就整個蓬勃發展一直到最明顯大家可能現在用用NLP的人會想到說我有一個叫Wall-to-Vector的東西大概在14年前2013年出來的東西這個階段就整個起來了整個重要性跟他的一大堆人就進來做這件事因為發現有Wall-to-Vector我可以知道說狗跟貓其實是比較像的狗跟卡車其實比較不像的利用這種演算法的東西之後我就可以做非常多事情有很多應用就往上跳一階但是到真正改變這個歷史的是在2018年就是Bert跟GPT那個年那個年份同時出來但是當時GPT出來之後大家不看好他因為他就是一個Decoder的模型但是Bert呢是Basic on這兩個都是Basic on Transformer但是Bert是一個Encoder模型所以大家覺得Bert很好用啊他可以取代以前的Wall-to-Vector做的很好所以你可以發現2018年之後就一大堆Bert-based的應用就是全部都用Bert所以這個2018年之後就是整個的整個的Annual-Pair應用就大起飛因為發現這個以前笨笨的Chadbot都可以變得非常聰明但是呢 [0:45:59] 這邊要秀的是GPT他也是默默的發展這樣講好像他是一個弱者其實他不是只是說他就朝著他的Decoder路線繼續做那GPT-2出來之後大家也覺得好像比較厲害一點因為他GPT-1第一代實在不怎麼厲害那2出來之後好像值得做下去了一直到他3他3出來之後是非常厲害一個轟動的的產品那個Paper列出來之後大家覺得原來可以不是他的模型他的模型的確很厲害但是大家驚訝的是他是OpenAI花了這麼多錢花了這麼多錢來做這樣子他們甚至有一個那個paper如果大家有興趣去download那個paper裡面那個作者寫一句話說他們知道這個實驗的過程有一個DSA用錯了那個使用方式錯誤這樣子但是呢實驗已經跑下去了如果要重新跑又要花多少錢他們就不跑了這樣子所以你就可以知道他們花了成本有多少這樣子那個一次性要做的成本有多少那其實這個年代大家可能可以記一下就是這個年代大家也是確GPT快出來的時候那GB3出來之後大家就突然覺得讓電腦去寫人類的文章是可行的這件事情大家突然覺得 [0:47:29] 可以做以前都不行以前就覺得這個一看就是AI寫電腦寫那GB3之後就突然一袋一堆有一堆公司去專門包裝GPT3然後去做一些這個文章的service這樣子那當然後面就所謂的InstructGPT跟它後面的包裝後的ChatGPT所以這個2022年的時候ChatGB出來之後後面就就是大家所熟知的故事就是大概發展是這樣當然你會覺得說這個後面這個四五年發展的很快前面怎麼那麼慢前面都很混嗎沒有其實當然跟硬體的成長有關係當然也跟所有資料量變多了所有運算能力變強也有關係這樣子但是以前這些技術發展其實也是很多這邊有很多的模型大家可以可以看一下如果你都可以知道每一個icon是什麼樣模型那表示你還蠻熟的這樣子我還放一個新的這個K3的東西這個AI位很濃的圖我們就看一看就好了從以前到現在這樣子這個比較像給小朋友看的那這個我等一下再回過頭我先秀一下我們這堂課這堂課會教的東西我們會有助教課 [0:49:01] 在助教課大概就是maybe是三到六個小時其實也是教大家呃怎麼用Python做NLP的東西或是像後面RAG的東西會教一些Hugging face上或是這個怎麼呼叫模型的部分這樣子或是教你用這些RAG的一些一些framework這樣子那基本上我們會從基礎的NLP開始講起然後從Square model從基本上的類成金網路Square model從RNN LSTM雖然你們現在也不太用這些模型但是我們會從那邊開始講起然後一直到Transformer然後到Transformer現在的LM大家都會介紹這樣子那這學期我是希望能夠增加一些reasoning的部分因為畢竟現在LM的發展我覺得他已經越來越成熟所以他後來大家外面的包裝的部分或是大家現在想看到的adj的部分我們會帶一下一些比較新的趨勢這樣子但是我其實不會涵蓋到語音也不會教你怎麼用prong也不會我們重新設計模型這都比較在AI的課程或者是GI的課程會介紹的那課程的內容大概是這樣這是這兩年都是這樣子會簡介然後基礎的部分然後講從wall embedding開始到這些 [0:50:33] sequential的model這樣子然後會介紹這些Bloodbath的一系列的東西其實到這邊後面其實就有一點有一點雜了說真的因為他發展非常快但是有些東西又必須要提一下提一下這樣子所以其實會有點雜會有點多但是我想研究所課多半還是這樣就是去觸發就是點一把火讓你們繼續學習這樣子那我們這一次的課程會有一個部分不一樣的地方就是會有一個考試這是有老師建議的就是也有考試因為我也覺得很好因為為什麼呢因為我們主要有四個作業那作業我會叫你們回答一些問題寫一些心得有時候都發現這些學生心得寫的非常好這個這個分析的非常這個深入啊但是看他講的東西好像前面也沒做這些實驗他為什麼知道這些實驗呢他為什麼知道這些實驗呢他為什麼知道這些實驗呢看起來是AI協助這樣子那也不是不行但是我覺得你要跟AI同步成長所以我們會多一個測驗這個測驗是in person實體的所以TICA在做實體的考試會有點麻煩因為跨校所以跨校會同時間考這樣子那考試的範圍就是我們教的內容當然不會叫你去記什麼模型什麼公式怎麼怎麼弄啊 [0:52:06] 那個題目我們會再設計但是會有個考試這是這一次比較不一樣的地方然後我們就取消了term project這個我們會再講那最主要就是四個assignment這再佔75%然後一次的期中考那為什麼取消term project呢因為第一個人很多然後以前會花掉太多時間去幫各位分組因為大家有時候也不太認識然後組員也不太認識然後到報告那天才說這個組員從來沒有參與過然後到報告那天才說這個組員從來沒有參與過然後到報告那天才說這個組員從來沒有參與過然後就有點麻煩然後因為時間也很短因為第四個作業做完到term project只剩一個月當然我們term project是其中就公佈了但是學生都認為是我應該是在第四個作業做完才做term project所以你會覺得非常壓縮非常短沒錯當然有些同學的回饋都還不錯都覺得可以學到一些東西這樣子我不知道是不是表面話還是說什麼這樣不過我們就把term project取消了的確那個這個很難去judge大家的貢獻那這個是我剛才提到的就是我們會考試是實體的所以這門課如果你是清大有用xclass修的學生你可能要記住這個時間我們雖然是立在第14周但是應該是不太會變了不過可能我還沒有把它定案我就儘量不要排在期末考周就在前面 [0:53:36] 那如果你是xclass的學生你大概是要確定那一個禮拜的考試時間你可以出席這樣子好這是大家最關心的分數的分佈這是去年第一年你可以去dcard上找大家說這門課很甜啊什麼什麼所以第二門就稍微調整了一下normalize一下這個樣子看起來還好還好就是中位數大概是接近80所以其實不難不難尤其是我覺得我們作業的難度有一點點中偏低主要是有一些跨領域的學生來修啦所以我並沒有把它調得太難但是有時候這跨領域本來比這個電子學院都還厲害這樣子所以他其實是作業沒有太高難度所以大概的分佈是這樣所以供你們參考這樣子那通常這邊都是放棄的學生啦就是你作業沒進來的學生就是你作業沒教因為作業四個作業嘛你一個沒教你就知道你的分數大概就不會在裡面這樣子那我們作業因為人數很多那就是以前我們都試過用AI改但是有點難度所以我們現在都會一起協作啦還是有人助教還是進去看然後AI可能就是看一些程式的部分或是什麼但是基本上是協作的這樣子 [0:55:07] 那的確以前的大家都會反映說作業的評分標準不太明確這部分我們會再修正一下讓它變得更更大家被扣分會甘願一點我們會把寫清楚一點這樣子那研究所課我希望大家有一些討論分析當然這一塊你們大家都會跟AI協作但是我覺得如果AI要講一些事情你又可以反饋到你自己前面再補做一些實驗我覺得就很好這樣子重點是要你自己的insight或者是說AI告訴你insight你可以瞭解原來對沒錯這以前我沒想到AI的確告訴我這些這樣子那這大概是作業會的類型這樣子那當然我覺得你要對文字有興趣啦因為這不是一個AI的課所以如果你只想學Transformer你應該可以去AI或是Deep Learning的課去學那邊可能講得更細一點我這邊Transformer的課是很簡單的Transformer其實不會講得那麼細但是我還是會用NLP的角度去看整個模型的運作方式跟重要性這樣子好這是幾個以前學生的意見啦就是供你們參考當然有好的啦有覺得不錯的這樣子那不過大家也會說實在的有錄影有直播 [0:56:38] 大家可能平常就不會上課也不會來學所以今天這個盛況大概是隻有一次這樣子後來就越來越少大家覺得反正我我課後用三倍數播放這樣我就可以很快的讀完這門課就是你會到寫作業時候才會去follow這件事情那如果你有程度其實還OK但是如果你本來程度沒有這麼跟那麼上的話會比較吃力一點這大概是提醒大家一下好這是一些基本的data就是我的資料會在臺卡在臺大那個NTU COOL頁上都有然後我的實驗室的Github的這個課程網頁會把這個也會同時Miro同時一樣的東西然後這因為這邊有這兩年的啦所以你也可以上去看這樣因為這是開放的所以公開資料在這邊那清大這邊的學校的eClass我就不放不過我想你們可以透過臺卡這邊的NTU COOL去去點到這個鏈接你都可以拿到這個投影片跟影片這樣子好我想Sleep的介紹就到這邊了那我們看一下這個這個slide上的外校的學生的考試 [0:58:08] 我是沒有實際放過但是根據臺卡辦公室的說法是每個學校的考試每個學校會有一個考場然後也會有監考老師所以我看蠻多學校都只有一位學生所以你就會很VIP式的被一個老師帶去一個房間考試這樣子OKOK好所以這位同學是沒有沒有同步的網址就是說如果你有修這門課你應該可以從NTU COOL裡面去看到我們的直播的網址跟那個錄影的鏈接你就可以就可以上去這樣子那我們一定會就是在早上那這學期我們運氣不好沒有放假對啊就是就是如果遇到放假或是我不能有不能上課的時候我還是會預錄我還是會預錄這樣所以我們會上滿這個16周的時間這樣子同時間要開會可以啊就是因為基本上Sclass就是否這個設計嘛就是你可以同時間有重躺這樣子雖然我也不知道這個學生需要會很辛苦如果他修了五門都在同個時間這樣也是蠻厲害的這個可能是舊資料啦可能是舊資料我後來把它改成75跟25這樣子那但是作業老實說因為四個作業嘛75沒辦法整除嘛所以學生都會問我說 [0:59:42] 哪個作業比重是多少我現在其實還不沒有寫出來啊我到時候因為作業會有點調整我會根據作業的難度跟他的loading會比重會稍微調整但是你可以想像就是就是75除以4的上下range但是我知道要寫清楚不然學生都會跟我來argue這件事情應該是四個啦四個四個作業然後一次考試這樣子五個作業會有點趕會綁得有點對時間會有點吃力同時修會沒有會不會很吃力我只能說看人對對如果你你夠積極夠這門課其實我覺得門檻不高你只要有訓練過模型不要說非常厲害你只要知道那怎麼寫就我覺得應該是沒有問題因為我們的作業會有些甚至給你一個template不是叫你從無到有去寫所以應該是還好但是我還是建議你有點基礎來修這樣子不然人數有點多跟DL一起修效果會更好嗎我不知道可能會吧可能會吧就是你不過很有趣就是你會發現如果你修一大堆AI課你會發現怎麼每個老師都講一樣的東西都在講transformal都在講fine tune都在講這些東西這樣子 [1:01:14] 對那應該效果會比較好這樣期末考的形式就是實體坐在教室發考卷這樣子就是用寫的然後斷網不能用沒有openbook這樣子就要完全靠你自己腦袋這樣子GPU的等級這的確是個好問題我們我們會把作業的難度跟他資料的複雜度降低到你們個人的電腦或者是你的free的collab quota可以跑的狀態也就是說如果你覺得你跑不動了那一定你程式沒有寫好當然如果你的實驗室有更powerful的環境的確你可以更加速但是我們都會讓這個low resource的學生可以把這個作業做完有一張投影片我沒有放就是Tica他其實有提供一些collab quota的獎勵不過因為沒有很多就沒有辦法給每個學生所以我會把它當成是作業的bonus就是說我們每次作業會有評選可能前前十位會多發給你collab的quota這樣子沒有ntu庫的賬號這個的確有不少學生來問我說他有選課但是還是沒有ntu庫的賬號可能他們從每個學校進來或者是加退選的時間的賄賂的名單的時程上不是很同步因為他不是一個 [1:02:46] 不是全國一個系統所以他還需要各個學校去串資料所以大家要等一下這樣子如果如果你已經可以看到這個slide理論上你應該知道我的課程網頁課程github那個網頁github網頁上面也有直播的連結你也可以從那邊上去這樣子期末考內容大概形式就剛才提過就是一個實體的考試的形式那至於要考什麼我現在也還沒有很具體的想法這樣子ntu庫不是臺大的校外沒辦法申請應該有他應該有每個學校賄賂賬號大家應該應該都知道了應該他會開通這樣子而且會對從ntu庫那邊我可以看到說他會他會寄一個通知信然後一個確認所以我現在可以看到有多少學生其實還沒有連上ntu庫這樣子所以你可以可能可以確認一下加簽應該可以因為根據經驗還是會有些學生退選所以人數上我們應該可以控制在以前這個範圍這樣子期末考會需要手寫code嗎應該我要思考一下有些東西講出去就不能改了可能會有一點點 [1:04:17] high level的東西anyway但是不會叫你要寫出一個沒有bug的code這樣子不是沒有bug是語法要寫得非常精確的這個我再思考一下但是不會叫你把transformer用c寫出來手寫會是層次嗎就我覺得應該比較high level就是比較比較概念型的東西居多居多不會叫你因為畢竟是closed-book我們不太需要讓大家去記這些東西我覺得沒有意義這樣子但是我會希望知道你腦袋的東西有沒有學到這樣子該學到放在你腦袋的東西到底有沒有這樣子好應該是這樣啦那基本上我是不太會想說像有一些老師會說上課回答問題搶答然後有有什麼獎品這樣子好像小朋友給糖果這樣子但是有時候好像是一個不錯的方法增加互動性尤其是鼓勵學生實體來或是線上參加這樣子我覺得是不錯啦不然學生都是回去宿舍晚上躺在那邊開影片三倍速播放這樣子互動性比較低所以也許會有一些線上實體的時候online我會有一些QA [1:05:47] 或者是投票會增加一些參與那但我們會從裡面有一些獎勵之類的不好意思要做一些比較熟悉的事情好這大概是課程的介紹有沒有問題可以啊你是幫人家問的嗎剛才我有回答這門課看起來太容易對沒錯這誰寫的說真的我有點掙扎因為因為第一年分數給太高了但是不給高因為第一個臺卡是一個很diverse的學生進來不要說不同學校有不同科系的人進來所以他修課的程度雖然我們一定有告訴同學說這個requirement你應該要會寫Python會跑過基本的基礎學習的東西但是有一些時候就接不太起來這樣所以我們作業難度我覺得不高那不過衝著你這句話我們把難度加深一點這樣子但是對我來講其實沒有沒有太大意義了就是有鑑別性就好我就是鑑別大家的努力程度可以鑑別出來就好當然不要說大家都作業都滿分這樣子還有沒有其他問題 [1:07:18] 有問題都可以在slide上問因為他是匿名的當然你也可以說我要具名這樣也可以但是你可以匿名這樣子你不用去dcard上說一些其他的話這樣你在上面就可以問我問題這樣有沒有其他問題沒有問題我們就先休息10分鐘然後最後等一下我會再上一節課的部分把一些引求答詢再帶一點休息時間如果有要加簽或是Xclass要籤的人你要實體籤可以給我籤這樣子我們先休息好那我們就繼續上了因為就我大概會再上一個小時的範圍 [1:09:19] 再回答一下剛才有人在slide上問的問題就是主要處理中英文的語言嗎那會不會有其他語言其實我們不會dedicate說處理哪一種language特別的問題啊基本上尤其是現在LN他其實也是marty lingo這樣子只是說如果你是一個一個比較稀少資源的我們說low resource language的話的確有時候LN他的理解度沒那麼好那會有不同的做法不同的思考方式但是我們不太會去去提到那些啦不太會提到那些沒訓練過模型也可以修得過嗎這句話我很難回答因為有訓練過模型的也不見得修得過的就是說因為現在訓練模型很容易嘛你只要這個XY給他然後FIT就結束就可以就說你有你有訓練過模型的這樣子但是你可能要了解NN的的架構或什麼就是那個門檻不會在於有沒有訓練過那我只能說看人會不會點名不會但是我們希望會有一些課堂的參與的bonus就是實體在進行的時候會有一些會有一些那個回饋啊幹嘛的 [1:10:52] 會有考古題當然沒有啊因為之前都沒有考試這樣子那是可以寫sudo code嗎對如果有的話啦如果有的話這樣子我有沒有office hour我會把它寫上去啦會把它寫上去那不會如果如果要問問題其實用email或是在SIDEL上問很方便這樣子那對大學生修這門課會答應嗎不會不會之前也有甚至有大二的都修了這樣子那有些助教代替回來我就不一一回復了那對剛剛有人這個我再看一下對他說可以稍微難一點想學東西這樣子好我會盡力對好啦老實說這個這邊這些東西已經蠻open的基本上是可以設取的範圍所以他老實說也也不容易啦因為對我來講我也一直在學習這個投影片位也要一直update所以也是蠻辛苦的這樣子所以想學東西當然很好對我們一起來學這樣好大概是這樣了反正有問題就儘量問包含課堂上的東西或是 [1:12:25] 講的東西或是有一些行政上的東西也都可以問這樣子喔好拜託好啦這個Do your best不要在slide上哈拉啦那個這個要filter有點辛苦這樣子OK好啦我們就把他拉到一個一個標準這樣研究所課程的標準好這個投影片在在NTU COOL或者是說在GitHub上都有PDF檔可以下載這樣子那我大家上去看可能可以看到一些舊的就是去年的但是我可能都會陸續的有一些小小的更動這樣子好那這個從剛才提到這些歷史啊大家可以想像從這邊過後基本上所有的起手式都是都是model了都已經是而且尤其是直接從Transformer開始下手了這樣子所以你可以想像這件事情好像是必要的所以以前在一些場合啊有些老師也問我說那你現在NLP課程怎麼教我說我就把以前NLP的要教的東西 [1:13:56] 在前面兩週上完可能多一點三週兩週半上完這樣子然後後面的就全部都是Pretrained Language Model的東西這樣子是有一點怪啦就是說如果有些人想學一些語言學的東西卻沒有在這邊cover到這樣子但是你會發現現在做NLP一定標準起手式一定是從Pretrained Language Model下手這樣子當然這邊如果你還沒有修過AI或是Deep Learning的時候你可能會不太知道這些圖表的意思啊基本上它就是一個Transformer Bash然後透過一個Pretraining的部分訓練出來然後再你要做你的微調的東西這個我們之後會再帶一下會講這部分啊只是再用這個圖告訴你說現在大家看的東西就是從Pretrained Language Model下手當然這裡面有一些機器學習的基礎沒錯所以你雖然知道Pretrained Language Model但是你不太知道說這個就是以前在做Machine Learning的時候提到的Transformer Learning就是做轉移學習所以轉移學習就是你會覺得好像現在Pretrained Language Model好像很直覺嘛就是哪有LM然後fine-tune一下他就可以做我的問題或是說LM本來就可以做很多事情但是如果你以前從一個簡單的小顆的NN Transform Scratch說我要做一個空氣汙染 [1:15:27] 預測的模型那是參數都是空的然後做監督室學習學習完之後這個模型的確會回答你Yes No你給他一些參數他會回答Yes No這邊有沒有空汙這樣或是說他可以告訴你空汙的指數多少你可以做出這樣的事情你只要有監督室的資料就可以做這件事情但是你會發現你的模型做出來只能回答空汙啊他也沒辦法回答說那對健康有沒有影響你就要拿另外的資料再去勸那這個當然就是一般以前在做機器學習的基本的做法就是會遇到這樣所以有很多的方式包含Transformer Learning當然這個可能會在機器學習課程比較後面會談到的就是說舉個例子你就知道就是叫一個學生去拿一本英文字典讀一讀然後讀完之後他就會發文了這樣這個就是Transformer Learning的精神就是你學會一件事情你就可以比照你當初的這個資料所學到的東西比照辦理去去解決另外一個問題他這個問題是你沒有Training Data或者是說你沒有Supervised Training Data這個在當初在Transformer Learning可以講到這些當然Transformer Learning其實也是一個大的東西它裡面可以分很多很細有沒有資料跟沒有資料的這樣子所以這個如果你有點機器學習基礎是可以比較瞭解的 [1:16:57] 不過Anyway這個大型語言模型基本上它就是透過一個預訓練預訓練完預訓練只是看懂文章啊但是他為什麼可以做QA可以幫我寫報告他可能需要一點微調啊這文章是什麼文章啊他可能需要一點微調啊這文章是什麼文章啊微調的東西就是把原案的模型呢校正一下到我的Domain去解決我的問題這是Transformer Learning的概念不過這個我們會再提那這邊秀一下這個LM的發展圖這個這張圖有點舊了不過大家有興趣可以去這個網站上看他其實講了蠻多的東西而且這張圖還在他的Github上所以他好像也沒有繼續update但是他的資料是有一直update啦但是他的資料是有一直update啦那這個中國大陸的模型也是舊的現在有更多的現在這個這個Kimi的東西蠻強的這是臺灣臺灣當然沒有基礎從自己Transformer Scratch的PLM但是有Based on這些Open Model做的像Tide或者是Breeze或是這個白龍不過其實都不太容易啊老實說我們就等於跟著這些Open Model跑啊我們只能做我們的在地資料的微調或在地資料的CP我覺得會比較辛苦當然這個當初是覺得我們以臺灣的Resource不太可能自己做一個PLM但是我覺得這件事情可能慢慢的可行 [1:18:30] 因為現在的現在的運算成本比較低一點當然還是很大但是另外一個問題是資料量資料的問題這樣子不過另外一個還有一個問題就是說我們能不能像中國大陸一樣用針灸的方式來做這件事情這個就是另外一個故事網路上有很多這樣資料多擺一張這樣的圖就是一個Family Tree就是你看到都是Transformer長出來的這樣子當然如果你自己有研究過一些模型你就知道說Transformer也不是唯一的選擇了其實有什麼比較著名的像Mamba這樣的東西但是就是沒有辦法成為One of的選項這樣子所以是基本上還是Transformer所以現在幾乎所有的硬體加速都是Based on Transformer在做特別設計這樣子那你可以你可以去你可以去這個網站這其實是可以動的這個圖是可以動可以拉的而且點下去它可以告訴你那個模型的一些詳細資料之類的這樣子不過看起來也沒有很新因為最新的也都沒在上面這樣那你就知道說這些這些初步玩大概每一個Quarter都有一個新的Model會說他們是最強的這樣子 [1:20:01] 當然對我們來講我們要考量的不是他的能力因為現在這些能力其實已經不會差太多了就是以你解決你的問題來講他們都足夠只是說他的大小啊他的這個這個Token的CP值是多少你大概反而會考量這些東西這樣子好那接下來秀一下畢竟我們還是NLP的課我來想一下說以前沒有大語言模型的時候這些這些NLP的人都在幹什麼事啊那以前的做法你一定要先有語料包括說我要做醫院的問題我一定要跟醫院談說你有沒有這個醫囑啊有沒有病歷資料啊我一定要有這些資料因為沒有一個沒有一個像現在的大圓Pretrained Language Model一樣他已經有一些common的knowledge在裡面我一定從空的開始做從空的開始做我就一定要Domain的知識我就一定要有一些Collection那這Collection呢包含annotation這些都是非常昂貴的就是都是要人進去的只要有人進去都是貴雖然你說老師沒有那個他們說做VLA都是去非洲叫他們帶一個這個那個那個那個眼部的camera然後就叫他們不斷在那邊折衣服這樣然後就有一大堆折衣服的影片這樣 [1:21:33] 的確有一些Training Data都是來自於這種這種國家啦所以以前我們說這是血汗模型這個以前一部電影叫血鑽石嘛他們都叫這個這個血模型因為就是但是後來後來去看一看他們其實沒有這些這些去非洲做這樣的工作的的人其實在那邊過得蠻舒服的因為你要做這件事情在冷氣房然後又做這些非勞力的動作只是操作一下電腦做一些動作而已其實對他們來講是個不錯的工作當然我不是在貶逼他們而是說這件事情的確是需要大量人力尤其是現在在做Action model做這種機器人的東西像有一條訓練的方式就是要靠不斷的產生人類這個Action的影片讓他去學習當然以文字來講也同樣有需要很多annotation那這些我們拿到的東西我一定要全處理不然就是一堆垃圾不然就是一堆也不知道在寫什麼東西所以我們要做Segmentation 斷字處理Stop War然後呢做Passing Tree做Stemming這英文有時候去需要詞性的處理需要做這些東西甚至再往前一步我需要知道說這個裡面的Entity到底是什麼這個關係到底是什麼這一句話到底取什麼為什麼要做這些事情呢因為你整句話未給模型他看不懂你一定要事先幫他截取出來這樣子 [1:23:05] 那如果以你們現在有做過一點大型元模型就覺得以前人為什麼這麼做這麼多多餘的事情為什麼要做這麼多餘的事情整篇文章餵給人他就可以知道這個某個Entity叫什麼這樣子所以這是大家Based on這個巨人肩膀上可以做很多事但是以前沒有這個巨人的時候我們都要自己做這些事情不然你喂進去電腦是完全不懂你的東西接下來就要去表示這個文字你可能就要把它向量化那以前最簡單的One-Half Vector或是說你算一點權重的這打錯了TFIDF那或者是把它直接有一個已經Change好的Base的東西把它轉換成一個Vectorword2vec的東西或者是說你有沒有把它轉換成更復雜一點語義的Semantic Label的東西這些都是其實老實說在在BERT還沒出來之前這些都還是一個很大的研究重點那當然你要怎麼建Domain Knowledge這個不是說叫人來標註一下就好你這些知識怎麼讓怎麼讓電腦去Access你是要建建出一個結構所以就會所謂的知識圖譜就會一個Tree一個Graph的結構怎麼去Access怎麼讓 [1:24:39] 人只要輸入這個實比資料他可以自動想出實物比的Knowledge這邊就有很多的這樣的Extension會在做所以你可以想像這個好像去博物館看到以前這些原始人在操作這些器具然後留下一些工具這種感覺但是呢有些方法跟有些東西其實你們現在在做一些大語言模型分析的過程中也會用到或者說你要做一些你要做一些Baseline的比較比如說TFIDF這個真的很重要因為他很簡單沒錯但是他是一個非常萬用的Baseline也是一個非常Strong的Baseline就搞不好用TFIDF比你在那邊轉換什麼Dense Vector在那邊算老半天都還好這樣子那有LM之後大家想像說那我就可以用這些模型啊然後呢自己在fine-tune我這邊畫兩個東西就是這是一個大語言模型這是你自己的下游模型然後你把它串起來這樣子以後我們就會教你怎麼用BERT然後自己再做一個下游模型做這件事情然後你再透過你自己的資料我這邊的標標註資料就是這樣這是兩個不同顏色就是Input跟Output這樣子就是你這是一個supervised的Data比如說QA [1:26:09] 我就會有原來的文章跟問題就會有答案這樣子就是你一定有Input跟Output你是一個supervised的Data所謂supervised的Data就是我是在做問答系統或是說我是做摘要的我一定有原來的文章跟摘要出來的文章我一定要這些東西然後才能去fine-tune我自己小顆的模型然後我可以利用BERT或是更大的模型來做我這件事情這個做法大概是在BERT大概20192020年之後的一大票大概90%的大概這個六七十的BERT的NLP的研究就是follow這個路徑因為發現BERT進來之後可以把原來的效果翻上一番這樣子所以就會做這樣的事情重點就會在你怎麼去微調這個模型這個模型要怎麼設計才能搭配原來的BERT Transform能夠做出更好的摘要模型更好的QA這樣子當然以你們現在角度來看這個東西又好像是去博物館看到這些原始人留下這些工具一樣以前人家做這樣的事就是為什麼要鑽木取火為什麼不在瓦斯路上直接按個開關火就出來了這樣子你們的感覺就會像這個樣子但是現在其實這個這樣的一個flow還是會還是在特定的領域會做但現在可能大家會這樣反正也能夠強了 [1:27:41] 我就不用做這樣一件事我就不用勸了我就用原來的PROM原來的PLM來做然後我直接把他PROM就這樣請幫我摘要今天的老師上課的重點然後這個只要PROM寫好把今天投影片喂進去他就會告訴你一頁的摘要這樣子就本來的這些這一顆就能做這些事情而不用再去微調做這些事情但是你想說哇這個這一顆這麼萬人這樣他當初怎麼訓練那我們這堂課就會告訴你說當初在做這個Pretrain或是在做最後他Pretrain完之後做一些Instruction Fine Tuning的時候怎麼會做好這件事情為什麼好像萬用一樣就是給他不同任務他就可以回答出不同問題是不是當初他有一大堆的Torago的這些監督師資料幫他勸某種程度上是有一點點但是不全然對這樣子就是他是透過透過當初他對文獻的理解跟透過Instruction Fine Tuning的時候他可以理解說原來你現在要做摘要所以我要去看以前的東西做什麼樣的輸出這樣子他並不見得有完整的摘要的supervised data好不過anyway這個這個其實就會有一些問題就是包括所謂的input就是你所謂的context [1:29:11] 你位給他的這個長度是多少所以你會發現現在的模型的readable看出來他會有個column在描述說這個模型的context有多寬他可以處理多大的的內容當然有些模型很大但是有些模型可能沒那麼大但是他其實比較厲害這不見得因為他可能本來的裡面的這種我們叫Positional embedding的處理方式不同或是說他特別有處理所謂的位置的這種lost in the middle的問題啊這個我們之後可能會提到就是模型在看文章這麼長的時候他不是equal weight他不是equal weight就是你一開始給他的東西跟最後提到的東西對他講可能選中比較重要中間的東西他就不見了中間的東西他覺得算了看看就好就像各位同學在上課一樣一進來教室覺得誒這個聽聽看老師啊後來就體力不支睡著然後一直到快下課的時候誒感覺要吃飯精神又來了這樣子所以你只有在頭跟尾的時候對老師講的東西比較清楚中間的東西都忘記了這樣子這個就是模型的Lost in the middle的問題這個問題現在其實有被解決一些但是其實還是有還是有還是有一些研究在探討說他為什麼對中間的東西這麼不sensitive這樣子好不過anyway這個只是另外一種做法就是完全不fine tune完全就只是靠prime或是in context learning的部分 [1:30:45] 直接做我要的任務的問題那或者說誒這個當然就是說哦原來這只是one of我們好像都都是這樣做然後把它包成A群然後做什麼事情沒有這個是演變下來模型的能力變強之後他就變成這樣做這樣子好啊這本來是擺在前面啦不過我通常show這個目的是就是說我沒有要講這些這樣子因為NLP以前的課程會講這些東西我會講文字結構詞性然後呢做做這種語法的分析啦然後去理解跟情感分析所以前面一二呢我們現在其實不太帶了因為基本上講的你們也不用對雖然他還是很有用還是很有用這個這個經驗我有口試過一個學生他裡面LM裡面的參數或是input裡面有用到POS tagging的東西對我眼睛為之一亮這個這個學生不一樣然後發現有用這個東西有用這樣子就是其實你會發現如果你只是告訴LM文章的東西然後就要回答這個就是大家的做法如果你想要知道你要告訴他說我現在比較重視什麼你就會多放一些東西在你的prong裡面 [1:32:16] 但這prong可能是自動生成或是讓他學來的東西anyway但這東西如果是多一點句子裡面的特性包含說我的結構或是詞性可能LM就會覺得好原來你在意這些那我就我就會focus更多一點在這個那就看你的應用有些時候這樣的效果就會好很多所以變化在個人因為工具就在那裡那這比較像是我們會講到的Transformer跟我會從RN開始應該是Transformer應該在這後面從RN跟LSTM開始雖然這個這已經非常老了這個在Deep Learning以前就有的NN的Model這樣子但是他其實非常重要尤其是你可以從RN跟LSTM去了解這種Sequential的Data進去怎麼去Train的過程這樣子然後Sequence to sequence Model其實非常重要但是Google提出這個之後後來因為太多有名的東西出來之後大家就忘了它的重要性但其他我覺得他是比較奠定現在現在這種這種Large Language Model使用的生態的一種的做法的一種創始者就是給你一段序列你要output一段序列而且是任何的配對這樣子 [1:33:47] OK那當然講完這些Transformer之後從BERT打完之後我們就會帶到它延伸的但是我不會講到細部的其實有一個網站蠻有趣的他就講到所有尤其是很新的模型他會給你一個架構圖每一個模型的架構圖當然是Open Model的他就會更新的模型告訴你這個模型做什麼他的他的什麼Positional Embedding是用什麼然後他是有做額外的Filter這個我再把連接擺上我覺得這個蠻有趣那當然會講一下這個如果你想做一些fine-tune或是想做一些CP就是繼續continuous pretraining的時候大概怎麼樣情況可以適合做或是你做得動這樣子當然會提一下Lora像這種PFT的方式但是這個其實也都需要資源所以以前本來希望有一些Lora的Homework但是後來發現需要一點Resource就是比較不容易設計那或是Income但是這個可能就會牽扯到不會教你做Prong但是可能會帶你說現在大家重視像Reasoning或是Test Time Scaling的想法他們怎麼去不再調整模型的情況下讓模型變厲害的概念這樣子 [1:35:18] 好這個就介紹我們上一節課講的部分好那我們Sleepless大概就帶到這邊了那這個這個投影片其實都在這兩個網站那這個大家可以去assets有沒有問題好作業可以反覆提交優化嗎應該是可以只要在截止之前可以在截止之前我們應該沒有限制上傳次數我們的作業比較沒有不像有一些沒有沒有標準單然後就用Leaderboard去排這樣子所以通常是還好但的確也會有一些Performance的數據那我們會有一個可能會有一個標準告訴你一定要做到多少以上這樣子SLM你講的是small language model嗎應該是不會應該是不會不會特別講啦不會特別講通常我們講SLM的情況底下是希望說探討說怎麼做出這個SLM或是說怎麼用一個比較笨的模型來做比較厲害的事情大概這樣但是我們這堂課目前是沒有 [1:36:48] 這是同一位學生嗎難度要再拉高的話怎麼跳掉所以應該是另外一位學生好我只能說這個同學加油持交扣分我們會有一個那個penalty的一個list就幾天扣百分之多少那不會是直接零分啦但是我也不希望說你說我已經扣到百分之百那我要不要交那其實我是希望你都能夠補交但是補交應該最後會有一個基本的分數因為你你不交就是沒有分數但是我又不希望學生一次沒交後來就放棄這樣子我覺得是很可惜很可惜摩克斯喔摩克斯很可惜摩克斯是當初拿這邊的課程的前半應該是前半然後好像是比較簡單的部分我記得是比較簡單因為我們摩克斯上面有做一些課堂練習但是 [1:38:18] 我是覺得那邊有啊那個教材是subset的樣子我記得是subset我可以這個這個比較境界這個老實說我也不是很熟不過我可以去看看的確我們現在有做所謂的watermarking的研究就是說尤其是我們要找授權廠商要讓他拿出資料來讓我們訓練的時候他們說那我們的好處是什麼那我們訓練完之後對手會不會拿去這個東西他們都很在意這些東西所以會希望把training的data加上一些watermark影像的東西抓watermark反而比較直覺文字的東西以前其實有做watermark就是說我會加一些特殊的符號就是這邊不太可能會出現這個符號我這邊出現這個字其實在今年去年ICML還是什麼那個會議呢因為他他覺得審稿的人都都沒有認真審都把paper丟給trekGPT然後叫他提供這個審稿意見然後就上傳所以他們就在論文的內容上加上一些特殊的文件但是實際上看不到的但這些文字呢模型的會識別模型讀到之後呢他在做de-coding的時候呢他就會對那些文字特別敏感然後就會產生出一些 [1:39:49] 不太可能在一般review出現的文字所以那次就抓到一堆就是使用AI審稿的的人這樣子就是好險沒有被抓到這樣子OK所以處罰非常嚴重喔你被抓到你的submission是被直接deskregent但我覺得現在大家還是會多少用AI模型去輔助啦就畢竟這麼短時間內那個paper都做了非常多怎麼可能去看出重點其實都會用AI輔助但是的確我們都還是得消化一下到底AI的summary跟他到底重點是什麼而不是直接把這種東西直接教他產生review然後上傳這樣子所以他會有所謂的這個也某種程度叫watermarking但現在的確有很多watermarking研究是說他會讓因為如果你們勸過勸過這些人或是勸過language model知道說我不見得每次都要選機率最高的嗎他就他就有一個選項是會有一個table或是一個機率的演算法他會去選擇他的分部內的字去讓他說你這次就不要選這個字要選那個字讓他學完之後呢這個模型做出來東西就比較像A公司的資料會講的話所以以後如果這個模型被盜用了他就說你這個 [1:41:21] 你這個模型的dispution是我用我公司的資料勸出來的模型但這件事情也不是100%在法律上站得住腳因為畢竟很多東西都可以mask但是的確現在有很多的判例不過很多的判例是當你這公司賺錢的時候你就會被告沒有賺錢他也不再想理你這樣子就是他知道說你有拿他們的資料去Chain這樣子那watermarking可能也許可以補充一下因為有一些在做Pretraining會用到這些東西會做到fine-tune然後後續的RIL設計會提到啦但是不太會叫你們做RIL因為要叫你們做RIL如果只是講RIL那也沒什麼好講的話畫一張圖就好了如果要練習那你們沒有資源可以Chain RIL這樣子研究上使用AI輔助的界限在哪裡這看個人的道德吧說實在的說實在的AI現在越來越強沒錯但是實際上你要做出有用的東西不是靠簡單的一次性兩次性的Prong就可以解決的這個學校老師也沒那麼笨你把這個結果給老師看老師一定會 [1:42:53] 問題很多這樣子但是你如果善用你如果跟他互動非常頻繁而且你能夠問出問題的重點我覺得他的確給你一些方向或是意見甚至告訴你一個也許不是你Final solution的樣子但他的確是有幫助的但這件事情的確有點那個說這到底是AI做的還是你做的這樣子這個有點有點難界定說真的有點難界定因為畢竟你是跟他互動你是跟他討論後的而且如果沒有你的這些feedback他是做不出來的所以其實其實上理論上你是有contribution的這樣子但是現在的確你不太會去標註說我百分之多少是AI協助的對如果以學習上或是基本的研究上我覺得你不要只是把AI給你東西直接交上去就好了我覺得你要消化要調整我覺得那樣我覺得是還OK的這樣子考試比較偏理論還是計算我覺得都不是吧可能是比較深論啦就是回答一些概念的啦我不太可能叫你們算但也許會有一題叫你們算一下 [1:44:25] TFIDF好像不太有意義有點low那個NTU酷的問題呢可能我會請辦公室那邊加速處理啦因為老師說真的很麻煩因為每個學校的修課系統啊名單匯入系統又不一樣啊其實他們Tiger真的很辛苦要Sync所有的學校就是很麻煩因為每個學校的行政流程都不太一樣現在還好現在每個大學開學日期都差不多了我們第1次開課的時候有些學校就晚一週甚至還兩週那個我們已經都快要寫第1個作業他還沒有NTU酷的賬號這樣子好啦大家怎麼很擔心考試的奇怪好啦我大概會真的是會跟你們講一下可能會考什麼作業會給多少時間完成助教有回啊通常是一個月前會公佈啦但是你們你們通常是前一週才會開始做嗎不過我們就是提早公佈你要你要前一天做我們也沒有意見這門課作業會調分好問題因為因為有學生反應說 [1:45:55] 這個我的學習成績跟我當初作業老師公佈的百分比算出來不太一樣這樣子但是通常是會往上嘛對不對本來80分我給你85分你不會來抗議嘛對不對那可能會調啦因為就是做一個Normalization這樣子但是會不會調低通常不會因為調高你們就比較不會有怨氣嘛所以我們都會把作業弄難一點然後把它調高這樣你們會覺得老師的恩澤這樣子但是如果本來都很高分然後最後把它調低你們大概低卡我就看不完重點都還是在於鑑別度跟這個整個比重好啦應該沒有有些我可能就有些我們就是offline再回一下好了大概是這樣S一點我秀一下我們第一張內容前面一點點就好了畢竟畢竟是直播錄影的 [1:47:26] 有沒有啊嗯?關了嗎好這個就是另外一份投影片喔就是我標W1的就通常那個投影片的前面那個weekW就是通常會是上課的週數不過後來也不太準所以大概就是照這個這個編號的順序上下來好那我只秀一下這個好可以嗎好這邊主要是講Introduction但這Introduction的內容大概也大概也涵蓋以前NLP會上的所有東西這樣子就是講這個基本的處理方法這樣子但是我把這個Embedding或是Vault to Vector擺在下一個部分這邊會提到一下這樣子所以他重點會先讓你看看一些應用然後會告訴你說一般我們在做文字處理的時候會做什麼樣的事情但是可能你們現在都不覺得該做這些事情因為也不太需要反正餵給LM就好但是有時候這裡面的道理 [1:48:56] 還是得懂那會先提一下LSA就是以前在做NLP的人沒有Vault to Vector沒有Vault to Vector這些東西的時候我們怎麼去了解語義的部分我們怎麼知道貓跟狗比較像貓跟卡車比較不像這件事情以前到底用什麼方法來做的所以你們可能又要參觀一下博物館看一下說以前這些原始人做的這些工具到底是什麼然後我們會秀一下Vault Embedding當然你會覺得說這個不是LM沒錯但是他的確是談到了處理文字的重要的精神所以你懂了這個脈絡之後你就可以比較知道痛點是什麼這個難的地方在哪裡不然老實說你現在有掛個API做進去寫分析100行Viber Coding一個晚上就做完了你覺得那會有價值嗎其實很難我就講這張圖就好了這張圖其實其實是一個不是很舊的paper 2021年的一篇paper但是他他秀了一個過程我覺得還蠻適合講NLP的發展過程其實四個階段你看到這四個時間點從1960到2010這樣子那上面兩個比較舊上面兩個比較舊但是他做出來的東西會比較Human friendly就是 [1:50:26] 因為就是都要人進去做所以人對自己做出來的東西比較能夠理解說對這樣有用這樣的確有他的道理但是越來越後發現這好像cost太高了所以我們希望靠著一些大量用統計甚至靠訓練的方式來做但是做出來的東西的確有一點難解釋難表示但是機器看得懂機器看得懂所以這大概是幾個階段我們看一下就是從一開始這個語言學的人這個會希望說從語法上去分析所以你會看到一顆tree這是原來的整個句子然後他會有noun phraseverb phrase去做下來的就以前我們做nlp起手式就是會建passing tree甚至會建所謂的dependency的關係所謂dependency就是說這個形容詞是形容這個名詞會有一個這樣的topple出來這樣子所以有一些工具就可以讓你pass出一個句子裡面這樣的關係是什麼他的結構是什麼你也知道一些詞性這個是很久以前這個語言學進來的在做的事情的確那時候也覺得讓電腦搞懂這件事情的確應該要這樣做他才知道說有些形容詞是形容某個名詞片語或是這個句子的 [1:51:56] 重點是什麼因為我們知道英文重點你要看主詞然後看他動作是什麼所以就比較知道怎麼樣這個句子的keyword或是想要表達意思是什麼後來就覺得那應該要讓他聰明一點所以我們就人也進去建立一些explicit但是explicit比較像是資料形式用人建所以如果你大概學過知識圖譜就知道這看起來就有點有點結構化的句子有點但是他其實是一個比較比較像free text不是句子不是句子但是他是結構化的知識所以比如說你會看到這些節點節點的部分節點的部分然後他有所謂的age的關係比如說這個是COVID-19他其實是這個某個這種疾病的這種instance然後他會有什麼症狀就這些那這些東西是靠人建的或者是說你可以從句子裡面去截取出來比如說有人說我得了COVID-19然後覺得狀況怎麼樣那你就可以在這樣的一個age去建立這樣的的knowledge出來那這樣knowledge出來之後其實很有用啊就是我可以trace啊因為比如說我搞不好還有另外一個這個communicablecommunicable [1:53:26] disease的疾病然後這個疾病呢他可能跟COVID-19有點關係那我可以從這樣的trace裡面知道說搞不好他也會有類似的症狀就是說我從已知資料建立出來的結構我可以再去漲再去學這些knowledge出來這就是為什麼當初在那個AlphaGo出來之前有一些非常聰明的系統也蠻亮眼的那裡面他的學法就是像IBM那樣子有個系統就是他會去學說水是液體然後液體的特性是什麼他會從高處往低處流所以我就可以去推論說水也會從高處往低處流我就可以從這樣的知識圖譜裡面去做這樣的推論這樣的聯想或是讓電腦自己去長出那些知識有點像人在學知識的過程所以這個以前就是希望我們可以靠著人給他一點的這種seed然後讓他去建構這樣的東西那後來發現這實在成本太高了啊因為人建出來的量少而且quality也不一有些人隨便做做有些人而且你很難去很難去連貫啊因為不同人做的他寫的字也不太一樣啊 [1:54:56] 不同字的概念又不太一樣其實很難去merge但是有很多你可以去找一些開放的那種像Freebase這樣的比較大的的資料庫來去漲但是其實上還是有限還是有限所以後來就希望用大量的統計資料來選所以這個其實點後來其實based on為什麼有這些東西因為就是網路發達就是World Wide Web起來之後有一大堆的文章一大堆文字是可以被accessible所以這些東西可以被取得了可以被統計的所以後來就有一些統計的做法像我們提到要提的what vector就是基本上我可以用統計的做法知道說其實我不用告訴大家COVID-19是什麼不用告訴他這些症狀是什麼他可以靠著文章中的貢獻性的關係所謂貢獻性是同樣在一個句子裡面被描述出來的時候我可以拉近這些關係我就可以拉近說這個這個字詞其實存在一個關係靠這些關係他就可以去推論一些語義一些概念在裡面這個是後來大家覺得這個做法非常厲害甚至他可以拿來翻譯就是完全英文的東西對照出法文或是其他語言就可以翻譯那後來想說把這個東西再擴大一點我們做用學的方式 [1:56:27] 用一個大模型不過這時候還沒有很大就是用model的方式去圈圈完之後這些參數是只有機器看得懂人看不懂所以你可以想象大語言模型那個幾個b連的參數裡面以前的確有一些人去研究啊就是每一層的transformal參數有沒有一些特性有沒有一些分佈但是都比較像是一廂情願的做法這個這個這一層好像在做什麼那一層在做什麼但是的確有一些benchmark可以驗證但是Who knows就是你又不是LM你怎麼知道他在想什麼就是他怎麼靠那堆參數來做出這麼厲害的事情就是有各式各樣的的做法這樣子但是我們希望說他能夠把這麼大量的東西濃縮在幾個b連的參數裡面學會所以這一篇當然如果你有興趣看這篇paper可以看一下因為前面會講比較多一點他只是說這樣的一個history的過程你就可以連貫說這個原來以前這個這些學者都在幹這些傻事這樣子但是也不得不幹這些傻事因為當時的resource跟跟資料跟算力也只能做這樣的事情好我想就到這邊好了就是做個開場然後我們下禮拜就從這邊開始講起那應該是在 [1:57:59] 一週到maybe是第3周就可以講到water vector然後我們就會有第1個homework這樣子好有沒有問題有沒有問題沒有不會告訴你通常你算出來東西就他的我們會有會有test data你就可以去評估是不是每個作業不太一樣每個作業不太一樣但是比較不像是那種去看Leaderboard或是什麼的的data這樣不要擔心作業沒有很難現在看到的是舊的沒錯我現在看到的是舊的但是有些後面東西我覺得更新的機率也不會高大概就是一兩頁這樣子但是可能會有一些新的章節這樣子好吧有沒有其他問題那我們今天就到這邊我希望下禮拜可以看到各位謝謝