# videoplayback.m4a|長度 01:59:20|model large-v3 on cuda [00:00:36] 志願自由生涯、紅色教堂、青菜、甜點、黑色三文字、長調、光線、獨特、超級、威武、日常、抗流、開放、現實、靈活、 Forestry、超級純粹。 [00:00:47] 好 [00:01:25] 那个虽然还没开始上课了 [00:01:27] 不过因为教室有点小 [00:01:31] 所以有些事情我可能就开始进行交代一下 [00:01:36] 那这个大家好 [00:01:40] 我是高鸿宇 [00:01:42] 那这门课呢是自然语言处理 [00:01:45] 那他也是TECA的课程系列之一 [00:01:51] 那因为这门课呢 [00:01:54] 有线上直播跟录影 [00:01:56] 大家也可以回看 [00:01:58] 所以 [00:01:59] 所以 [00:02:01] 所以学校才允许我在一百人的教室 [00:02:04] 开这么多的学生论述 [00:02:06] 那今天呢可能就大家课那一下 [00:02:11] 或者是说等 [00:02:12] 我今天大概会上两个小时的课 [00:02:15] 中间会休息一下 [00:02:17] 也许就可以用线上方式看 [00:02:20] 好 [00:02:22] 那我先就开始介绍这门课的内容 [00:02:26] 那这个 [00:02:27] sorry [00:02:30] 这个是 [00:02:31] 这个是课程的slido的连结 [00:02:35] 不过如果大家有修这门课呢 [00:02:37] 应该也可以在TECA的NTU COOL上面 [00:02:41] 课程的 [00:02:42] 那个内容上可以看到说 [00:02:46] 有一个slido连结 [00:02:47] 那这个就是做课程Q&A的地方 [00:02:51] 那 [00:02:52] 大家可以在上面问一些问题这样子 [00:02:55] 好 [00:02:59] 那我先做个自我介绍了 [00:03:01] 那我是高鸿宇 [00:03:02] 清大至宫的 [00:03:03] 老师 [00:03:05] 那 [00:03:06] 那我以前做研究是比较 [00:03:08] 偏自然源处理 [00:03:11] 那当然也导入一些资料探勘跟机器学习的部分 [00:03:16] 这个就供大家参考 [00:03:18] 那 [00:03:19] 这门课呢 [00:03:20] 他是TECA应该是第三年开的课程 [00:03:24] 那从以前到现在 [00:03:27] 大概 [00:03:28] 修课人数大概都维持300到500人间了 [00:03:32] 然后 [00:03:33] 我们最后完成这门课的人数 [00:03:37] 大概八成 [00:03:39] 可能有到八成五亿 [00:03:43] 那他主要的目的是涵盖自然源 [00:03:47] 那自然源处理 [00:03:50] 大概在十年前跟在十年 [00:03:52] 这近十年的内容教材会完全不太一样 [00:03:56] 那现在我们就会放大型元模型的部分 [00:04:00] 那这个是在TECA的 [00:04:02] 的一开始的 [00:04:03] 规划上 [00:04:04] 他们现在可能有点调整 [00:04:06] 而且可能大家可以上TECA的网页上看 [00:04:09] 有每个课程的难度 [00:04:12] 那他们好像现在把难度的Range拉大 [00:04:15] 好像有到八颗星这样子 [00:04:18] 那 [00:04:19] 这门课呢 [00:04:20] 其实是比较放在后面进阶的部分 [00:04:24] 所以 [00:04:26] 好像这个同时段学校有机器学习郭老师的课 [00:04:30] 所以 [00:04:31] 其实如果你还没有机器学习 [00:04:33] 经验的学生 [00:04:34] 其实你可以先修一下机器学习 [00:04:37] 或是Deep Learning的课程 [00:04:40] 因为我们这堂课呢 [00:04:42] 就会直接作业 [00:04:45] 就会直接教你写模型训练 [00:04:48] 然后当然就是处理文字的一些问题 [00:04:50] 这样子 [00:04:52] 好 [00:04:56] 那这个大概就是 [00:04:58] 这是这一页是当初给教育部长看的 [00:05:02] 就是这门课在做什么 [00:05:03] 这样子就是介绍一下这个 [00:05:06] 自然语言处理的 [00:05:08] 这个里面到底在讲什么这样子 [00:05:11] 当然自然语言处理 [00:05:12] 在 [00:05:14] 在这个ChatGPT还没出来之前 [00:05:17] 它其实是一个算普通 [00:05:20] 也有点冷门的课的学问 [00:05:23] 只是说 [00:05:23] 大家后来发现 [00:05:25] 这个处理语言的方式 [00:05:28] 用Deep Learning用AI导入之后 [00:05:31] 它可以变得这么厉害 [00:05:32] 这么实用 [00:05:34] 所以它现在几乎是 [00:05:36] 所有可以解决很多问题的一个基础 [00:05:40] 所以我们就会在自然语言处理的课程里面 [00:05:44] 去看如何让电脑去理解人类的语言 [00:05:48] 跟如何跟人类互相沟通 [00:05:52] 那当然大家所熟知的大型语言模型 [00:05:55] 也会在这门课里面介绍这样子 [00:05:59] 好 [00:06:00] 那 [00:06:02] 当然 [00:06:04] 今天的课程有点是介绍 [00:06:06] 这个主要的 [00:06:07] 这门课会涵盖的部分 [00:06:09] 那可能也让有些同学可能不太知道自然语言处理在上什么 [00:06:14] 然后可能让你有个认知 [00:06:17] 也许这个可能不是你想象中会学到的东西 [00:06:20] 这样子 [00:06:21] 那为什么要学NLP [00:06:23] 那前面Nature Language就是语言 [00:06:27] 但是我们这边语言 [00:06:29] 其实当然以前我们在做这件事情的时候 [00:06:32] 可能就处理中文 [00:06:34] 英文 [00:06:35] 或是说 [00:06:36] 你要做一点翻译啊 [00:06:37] 或是 [00:06:38] low resource的language啊 [00:06:39] 就是也许你想做原住民语言 [00:06:42] 这个就是 [00:06:44] 你会target一个语言 [00:06:46] 那processing呢就是说 [00:06:48] 你要如何去让电脑 [00:06:50] 其实我们现在就很focus在电脑 [00:06:52] 虽然NLP以前 [00:06:54] 有绝大部分的工作都是要人工介入 [00:06:58] 就是从语言学家来的那些domain know-how [00:07:01] 然后再加上一点点的运算去处理这些事情 [00:07:04] 所以 [00:07:06] 但是我们现在的电脑处理比重会越来越高 [00:07:09] 甚至人已经不太需要在里面 [00:07:11] 这些domain的knowledge [00:07:14] 或是要跟人互动的部分会越来越减少 [00:07:17] 所以我们要讲的是怎么让电脑去处理 [00:07:20] 怎么让电脑去理解这些语言的东西 [00:07:23] 好 [00:07:25] 我用这位这个Edward Harvey [00:07:29] 他是一个 [00:07:30] 他现在是不是有在CMU [00:07:32] 可能已经转到别的学校 [00:07:34] 不过他是一个在NLP方面的学生 [00:07:36] 非常有名的 [00:07:37] 一个前辈 [00:07:38] 他在两年前LockedIn的会议里面的一个Keynote讲的部分 [00:07:44] 虽然是两年前讲的部分 [00:07:46] 不过我每年去看一看觉得 [00:07:49] 他讲的东西 [00:07:50] 还对 [00:07:50] 还适用这样子 [00:07:52] 我想现在大家会来修这门课 [00:07:54] 或是说大家对 [00:07:56] 学校相关AI的课程都非常的 [00:07:59] 积极想要去听一听 [00:08:01] 其实大概都是因为 [00:08:04] 太多的新闻 [00:08:05] 在告诉你们AI会怎么样怎么样 [00:08:08] 你如果不会这个 [00:08:09] 就会怎么样怎么样 [00:08:10] 所以大家都非常焦虑 [00:08:12] 不只是你们 [00:08:13] 老师也都非常焦虑 [00:08:16] 当然焦虑有很多种 [00:08:18] 那我们来看一下 [00:08:19] 就是说 [00:08:20] 其实 [00:08:21] 大家会用 [00:08:22] ChangeGPT [00:08:23] 会用这些Gemini [00:08:24] 或是Cloud做一些事情 [00:08:26] 你会发现他怎么这么厉害 [00:08:28] 可以 [00:08:28] 可以做这么多事情 [00:08:30] 那你还 [00:08:32] 就觉得他为什么可以做 [00:08:34] 其实 [00:08:35] 当然我们这门课的目的是想 [00:08:38] 会告诉你一点说 [00:08:39] 他其实有一点线索有一点 [00:08:43] 理由 [00:08:44] 但是也没有任何的定理 [00:08:45] 告诉你他为什么可以做到这些事情 [00:08:48] 但是如果完全不懂 [00:08:51] Transformer完全不懂 [00:08:52] Deep Learning的话其实你可能就不知道 [00:08:55] 这个 [00:08:55] 他到底是一个 [00:08:57] 什么神奇的东西是不是 [00:08:59] 后面有一堆的工读生在回答你的问题这样子 [00:09:03] 那但是有时候你可能会想一下说 [00:09:05] 其实 [00:09:06] ChangeGPT写的报告也不是很好 [00:09:09] 有时候 [00:09:09] 我要改一大堆的Prong [00:09:11] 他也不能出现 [00:09:13] 我想要的 [00:09:14] 而且甚至你玩久了之后你就会发现 [00:09:16] 他其实有一点笨 [00:09:18] 有一点漏洞这样子 [00:09:20] 他为什么做不了这些 [00:09:22] 为什么做不到 [00:09:23] 这个当然就是比较研究范围 [00:09:25] 我们想知道说他目前的挑战 [00:09:28] 目前 [00:09:29] 比如说幻觉的问题啊或是说 [00:09:32] 连简单的加法都做不好 [00:09:34] 这到底是为什么这样子的问题呢? [00:09:35] 这样子 [00:09:36] 或anyway [00:09:37] 其实很多东西我们都是 [00:09:39] 满脑子问号这样子 [00:09:41] OK [00:09:42] 那有些人当然 [00:09:43] 现在这 [00:09:45] 这个人比较少 [00:09:46] 就是觉得 [00:09:48] 大语言模型就是 [00:09:50] 就是一个 [00:09:52] 其实以后我会讲到那个Tronsky [00:09:54] 他也会说大语言模型就是一个 [00:09:58] 合法的抄袭者这样子 [00:10:00] 就是把所有的知识背在一起 [00:10:03] 然后告诉你这些东西 [00:10:04] 理论上以他的 [00:10:07] 训练的方式来讲的确是 [00:10:09] 但是 [00:10:11] 他的确目前是现在最聪明的一个系统 [00:10:14] 就是能够消化人类的知识跟告诉你一些东西的系统 [00:10:19] 但是有些人其实不太care [00:10:21] 反正这个都是 [00:10:23] 过时的 [00:10:24] 不是过时啦 [00:10:25] 就以后会有新的东西取代掉 [00:10:26] 这不是一个真正的 [00:10:28] 真正的GAI的东西这样子 [00:10:32] 但是呢 [00:10:33] 他做出来的东西 [00:10:34] 其实很容易就被LM取代 [00:10:38] 像我们常常会 [00:10:39] 会去 [00:10:40] 去跟业界 [00:10:41] 谈一下他们需求 [00:10:43] 然后他们就觉得这个东西很难很难 [00:10:46] 我说这个东西好像现在你用Cloud用Gemini就可以做了 [00:10:50] 你可能只是Prong要写的好一点 [00:10:53] Skill要设计的好一点这样子 [00:10:55] 所以这个大语言模型的演变会使得原来大家觉得他自己做很厉害的东西 [00:11:01] 就不再这么厉害 [00:11:02] 就是 [00:11:03] 这个 [00:11:04] istan [00:11:06] 一般老百姓这个都可以做到的事情 [00:11:07] 不过anyway [00:11:08] 就是这样 [00:11:10] 那当然这个Harvey他其实有 [00:11:12] 举出几个方向 [00:11:14] 但 [00:11:14] 这方向当然很粗但是我觉得 [00:11:16] 好像还适用就是说我们现在学 [00:11:19] NLP [00:11:20] 其实 [00:11:21] 你应该把自己定位好 [00:11:23] 你自己的角色 [00:11:25] 就是说ok好以工程的角度来讲我们知道说这个东西让他有用就是如果以后你去业界工作 [00:11:31] 老板说你帮公司的工作流 [00:11:34] 加速一下 [00:11:36] 这个听说这些 [00:11:37] 龙虾很厉害你能不能串一下这样子 [00:11:40] 所以你就必须导入 [00:11:42] 导入 [00:11:43] 你跟老板说 [00:11:44] 这个我们一个月要花 [00:11:46] 这个 [00:11:46] 五万块买Token这样子老板就说就从你薪水扣这样子 [00:11:51] 所以你要想办法降低这个成本 [00:11:55] 就让他变得非常的便宜非常的有效率你如何做这件事情以工程的角度 [00:12:00] 我想这个电子的学生 [00:12:02] 每天都在做这件事情 [00:12:04] 那甚至有些 [00:12:06] 其实有蛮多硬体设计的人会想说那我就做 [00:12:10] Transformer加速的部分 [00:12:12] 让他可以在硬体上加速 [00:12:14] 就可以做一些比较 [00:12:16] 特别的一些晶片 [00:12:18] 那就不用 [00:12:19] 跟Media买这么贵的东西这样子 [00:12:23] 那当然我们也是希望他能够 [00:12:25] 做的 [00:12:26] 越有用越好 [00:12:27] 就是以前可以帮我们写报告但是这个报告好像老师一看就知道是ChangeBee写的 [00:12:33] 能不能做出一个报告是 [00:12:34] 老师觉得是我写然后就写的很好的东西 [00:12:37] 这是Useful [00:12:38] 就是他真正能够产生价值 [00:12:41] 而不是一看就是 [00:12:43] 那个AI味很浓的东西这样子 [00:12:46] 就是好像有讲到东西但是 [00:12:48] 那个Value是相当低的东西 [00:12:51] 所以他如何跟Domain [00:12:53] 如何跟Local跟地端的东西 [00:12:57] 或是说跟人的知识结合这一块 [00:12:59] 其实是在Application Label是 [00:13:02] 相当重要的 [00:13:03] 当然 [00:13:03] 后面这一段 [00:13:04] 就是这个Understandable [00:13:07] 就是说我们希望 [00:13:09] 他这么厉害的东西 [00:13:11] 到底为什么可以做到其实现在 [00:13:13] 有很多的很有名的学界大佬都说 [00:13:17] 这个现在AI的发展是没有任何理论基础 [00:13:22] 其实你大概就可以想这样等我们教完就知道 [00:13:25] 其实就是Language Model [00:13:27] 那你没有什么基础吗 [00:13:29] 你没有什么理论吗 [00:13:30] 可以用一条式子写出来说 [00:13:32] 他可以最佳化什么东西吗 [00:13:33] 其实是没有 [00:13:35] 其实是没有 [00:13:36] 只是说他真的可以做到一些事 [00:13:39] 但是我们就想知道说 [00:13:42] 我们如何Garantee这件事情 [00:13:44] 比如说你要做一个 [00:13:47] 飞弹 [00:13:48] 军事 [00:13:49] 的系统 [00:13:50] 你说我导入LM [00:13:53] 那个司令问你说这个东西 [00:13:56] 我们 [00:13:57] 会不会 [00:13:58] Garantee这个 [00:14:00] 殲灭敌人的机率是多少 [00:14:02] 你只能说 [00:14:03] 只要他在没有幻觉情况底下 [00:14:05] 我们会成功这样子 [00:14:07] 你就不太知道他怎么运作 [00:14:09] 就不知道细部你如何Garantee他的Quality [00:14:12] 所以有很多研究会在于说我们如何把这个 [00:14:16] 黑盒子这个黑科技把他 [00:14:19] 理解的更透彻一点这样子 [00:14:22] 那当然我想回到 [00:14:24] 比较 [00:14:25] 务实一点的层面就是一般我们NLP在讲这件事情的时候 [00:14:29] 我们当然就会说因为现在文字是一个很 [00:14:33] 很Popular的 [00:14:34] 的一个Data [00:14:35] 就是你现在看到的东西你现在网路上看尤其是在 [00:14:40] 2000年网路泡沫的时候 [00:14:42] 开始有一些Webpages出来之后 [00:14:44] 其实有大量的文字 [00:14:46] 出现 [00:14:47] 那如何让 [00:14:48] 电脑也能够理解这些东西 [00:14:51] NLP的重要性越来越高 [00:14:53] 所以其实 [00:14:55] 你要看一个技术是否重要你可以回推到以前就是 [00:14:59] 从Google [00:15:01] 起来那个年代 [00:15:02] 搜寻引擎起来 [00:15:03] 那个年代为什么 [00:15:05] 这么重要 [00:15:06] NLP或是资讯检索以前是一个非常冷门的以前是 [00:15:11] 叫做 [00:15:12] 以前是 [00:15:13] 图书馆系的人会去学的东西 [00:15:16] 如何有效的管理知识 [00:15:19] 就是把 [00:15:20] 图书馆的馆藏 [00:15:21] 锁音好 [00:15:22] 让大家比较有效率的找到这些东西 [00:15:25] 但是这些东西如何套用在 [00:15:29] WireWave上的Tags [00:15:31] 就会变得更复杂更有学问 [00:15:33] 所以 [00:15:34] 就会有 [00:15:34] 大量的研究所以 [00:15:36] 搜寻引擎在2000年时候就 [00:15:38] 非常重要而且 [00:15:40] 也看到它的价值 [00:15:43] OK [00:15:43] 所以其实我们可以说NLP其实是 [00:15:46] 让电脑去了解跟使用 [00:15:50] 当然你现在看到这一句你会觉得 [00:15:52] 这个 [00:15:53] common sense [00:15:54] 这个好像就是这样 [00:15:56] 但是如果到30年前 [00:15:58] 其实大家 [00:15:59] 不会写这句话 [00:16:00] 不敢写这句话 [00:16:02] 因为 [00:16:02] 其实 [00:16:03] gap还非常的大这样子 [00:16:07] 好 [00:16:07] 那为什么很重要这个我想就 [00:16:10] 就看看就好了 [00:16:12] 因为这个你现在所有东西你现在 [00:16:15] 用的大语言模型你现在用的AI [00:16:18] 其实后端都是因为他能够消化人类的所有知识 [00:16:22] 那为什么他能够消化 [00:16:25] 其实我说消化可能也不太对了 [00:16:27] 因为他真的能消化我也不知道 [00:16:29] 但是他至少知道人类所有的文字的东西 [00:16:32] 然后如何反馈如何摘要给你东西 [00:16:36] 这个对人类来讲 [00:16:37] 是有用的这样子 [00:16:39] 所以 [00:16:39] 从你的日常生活从你的 [00:16:42] 这个业界从这个学术界 [00:16:44] 你都会看到很多的 [00:16:47] 这个需求 [00:16:48] 但我们都很希望做到这件事情 [00:16:50] 就是我在旁边然后 [00:16:53] AI就帮我做研究然后 [00:16:55] 按下去明天就一篇paper出来这样子 [00:16:58] 其实这件事已经在发生 [00:17:00] 已经在发生了 [00:17:01] 其实如果大家有开始 [00:17:02] 因为这是研究所的课码 [00:17:04] 可能在座应该百分之八九十都是研究所的学生 [00:17:08] 如果大家有在开始投稿就发现 [00:17:09] 现在这些顶会为什么那个submission count都非常高 [00:17:13] 一个会议 [00:17:14] 就有一万篇两万篇的paper [00:17:18] 在投稿这样子 [00:17:19] 虽然有一些是被regret继续投下一轮 [00:17:22] 但是其实我 [00:17:25] 以我审稿的经验大概有 [00:17:27] 百分之二十的paper都是 [00:17:30] 全自动或者是半自动 [00:17:32] 产生的 [00:17:33] 就是人机协作过程中的产物 [00:17:36] 但是那个quality跟那个 [00:17:39] 鉴别度就是你已经 [00:17:41] 很难区分 [00:17:43] 那个AI的痕迹 [00:17:44] 那也是头头是道数据也非常清楚 [00:17:47] 那这件事情在发生 [00:17:50] OK [00:17:51] 那大家 [00:17:53] 如何善用 [00:17:53] 这是 [00:17:54] 就想象一下 [00:17:56] 那这个例子只是说 [00:17:59] 以前啊 [00:18:00] 在TradeGBT [00:18:01] 2022年 [00:18:02] 还没出来的时候 [00:18:04] 其实我们大家有时候不会觉得 [00:18:06] 这几个应用都比较像是研究所的硕士论文会做的 [00:18:09] 我们要做一个 [00:18:11] 这个 [00:18:12] 这个病例报告自动生成的系统 [00:18:14] 或者是说我要做一个法务这个合约判断的系统 [00:18:18] 这个都可以在硕士论文里面查到这样的研究 [00:18:24] 但是从LM出来之后呢这些研究变得 [00:18:27] 落地性很高 [00:18:28] 就是你可以跟 [00:18:30] 厂商合作说我帮你做这件事 [00:18:32] 他也觉得你不是在骗钱的这样子 [00:18:34] 你真的做得出来这样子 [00:18:36] 所以这个gap [00:18:37] 这个中间的差距他不是一个很线性的 [00:18:40] 其实老实说 [00:18:41] 在LM出来之后 [00:18:43] 有很多的应用是往上涨 [00:18:45] 就是那个 [00:18:47] 以前 [00:18:47] 做不太到现在立刻就可以做了这样子 [00:18:51] OK [00:18:52] 那当然我想这个 [00:18:54] 大家都熟悉大概四年前 [00:18:55] 11月应该就 [00:18:57] 就快满四年了 [00:18:58] TradeGB出来的那一段 [00:19:00] 时间 [00:19:00] 造成了整个科技界的 [00:19:02] 轰动这样子 [00:19:03] 那 [00:19:05] 可能 [00:19:06] 你们比较感应 [00:19:08] 没有感受没有那么高 [00:19:10] 因为 [00:19:12] 当你们开始接触科技的时候他就是有这个东西 [00:19:17] 所以你可以想象就很像 [00:19:19] 当初原始人 [00:19:21] 还不知道该用火的时候突然这个雷打下来他们发现这个火这么好用 [00:19:27] 老师这个年纪大概就是那个原始人时代就突然觉得有一个这么 [00:19:30] 上帝赋予的功能 [00:19:32] 工具的时候 [00:19:33] 他就是一个这种感觉 [00:19:35] 但是 [00:19:36] 如果你是在后面出生的人就觉得这个本来就是一个 [00:19:40] Must [00:19:41] 就是一定是要有一个这样的东西就不觉得说 [00:19:45] 这个 [00:19:45] Revolution是相当的高 [00:19:48] 那当然 [00:19:49] 这个中间的历史其实如果你有学过AI的课大概就会跟你谈说从Deep Learning [00:19:54] 开始到所谓的生成式AI的部分 [00:19:58] 这边我们没有要细讲每个模型 [00:20:00] 不过大家就可以 [00:20:01] 这个这个其实 [00:20:02] 每个模型也都很旧了 [00:20:04] 就是说 [00:20:05] 从 [00:20:06] Transformer出来之后有很多的 [00:20:09] 或是之前 [00:20:10] 或是之后 [00:20:11] 都有很多 [00:20:12] 讲 [00:20:13] 这样的 [00:20:14] 东西 [00:20:15] 不只是在做角色式的模型 [00:20:17] 它可以做 [00:20:18] Decoder可以产生的东西 [00:20:20] 所以它可以产生文字可以产生 [00:20:23] 音乐可以产生影像可以甚至可以呈示码这样子 [00:20:27] 所以这样的东西的导入呢就可以让你的应用 [00:20:30] 变化相当的多了 [00:20:32] 这很快的我就带一下 [00:20:33] 不过这个例子都是 [00:20:36] 一年多前做的 [00:20:38] 现在看起来都非常的low这样子 [00:20:40] 就是quad很差 [00:20:41] 然后AI味很重这样子 [00:20:43] OK我想这个大家都用过 [00:20:45] Text to Image [00:20:46] 或是说 [00:20:47] 现在如果你们用Vibe Coding的时候 [00:20:50] 你叫AI帮你写程式 [00:20:53] 其实这个东西现在已经非常普遍了 [00:20:56] 其实像我 [00:20:58] 面试学生或是 [00:21:00] 专题生 [00:21:01] 我都问他说 [00:21:02] 你现在Vibe Coding的比例是多少 [00:21:05] 当然学生 [00:21:06] 心里马上就跑一个东西 [00:21:09] 老是问这个事要试探我没有自己写程式吗 [00:21:12] 然后就会 [00:21:13] 就会稍微说我都自己写 [00:21:15] 我都很认真自己写这样子 [00:21:17] 然后 [00:21:18] 只有用AI问一下这样写对不对这样子 [00:21:21] 当然以学习来讲我觉得这是比较好的 [00:21:24] 但是对于 [00:21:26] 整个 [00:21:26] 你要写程式的performance来讲 [00:21:28] 或是以现在的趋势来讲 [00:21:31] 甚至在业界 [00:21:32] 他们现在可能都超过80甚至90 [00:21:35] 的比例 [00:21:35] 是Vibe Coding [00:21:37] 这也是为什么现在资工系 [00:21:39] Fresh的学生 [00:21:41] 找不到工作 [00:21:42] 就是说 [00:21:42] 你会写的东西 [00:21:44] 这个LM都可以做了这样子 [00:21:46] 所以 [00:21:47] 你的必要性就会降低这样子 [00:21:49] 不过anyway [00:21:51] 我觉得 [00:21:52] 资工系的训练应该是要 [00:21:54] Based on这个东西再上去 [00:21:56] 因为你用过Vibe Coding就知道 [00:21:58] 其实最麻烦的可能就是后面 [00:22:01] 或是前面的 [00:22:02] 系统架构的部分 [00:22:03] 那一端应该就是 [00:22:05] 资工系 [00:22:06] 应该的强项 [00:22:09] 好 [00:22:10] 我这边秀几个画面 [00:22:12] 不过老实说这个例子也是久的 [00:22:14] 这个比较像以前的 [00:22:16] 你在ID的环境 [00:22:17] 他做一些Auto Complete的动作这样子 [00:22:21] 老实说 [00:22:22] 在NLP的课程讲codegen [00:22:24] 好像不太合理 [00:22:25] 因为 [00:22:26] 这个跟我们中文英文无关 [00:22:29] 但是你要想像 [00:22:31] Program 程式也是一个语言 [00:22:33] 只是不是我们人类讲话语言 [00:22:36] 但是他是一个 [00:22:37] 我们人类跟电脑的 [00:22:39] 互动的高阶语言 [00:22:41] 所以现在的codegen模型的codegen能力已经非常好 [00:22:45] 为什么你可以用Vibe Coding [00:22:46] 就是 [00:22:47] 他底下他已经了解这些 [00:22:50] 这些 [00:22:51] 写程式的道理 [00:22:52] 所以他可以帮你做很多事情 [00:22:54] 不过当然 [00:22:55] 我觉得他问题还是很多 [00:22:57] 而且 [00:22:57] 大概只能做基础的 [00:22:59] 能够加速你一些的 [00:23:01] 的 [00:23:02] 的 [00:23:03] 开发时间 [00:23:05] 但是你要思考一下 [00:23:06] 从有Vibe Coding到现在 [00:23:09] 才过多久的时间 [00:23:12] 可能不到一年 [00:23:14] 就真正成熟到现在不到一年 [00:23:17] 一年就有这样发展 [00:23:18] 你可以想像在接下一年或两年 [00:23:21] 他会变成什么样子 [00:23:23] 甚至你也不需要下Program [00:23:26] OK [00:23:27] 所以这个演变大家可能要稍微 [00:23:30] 感受一下这样子 [00:23:31] 当然这是以前举的例子 [00:23:36] 就是说以前 [00:23:37] 会出一个作业叫大家写 [00:23:40] 你用LN去包装 [00:23:42] 产生一篇 [00:23:43] 一个 [00:23:45] Fake News [00:23:46] 这个其实 [00:23:47] 在速发部他有希望能够去detect这样的东西 [00:23:51] 网路上的 [00:23:52] 的讯息 [00:23:53] 靠AI产生的比例 [00:23:55] 虚假的讯息比例 [00:23:57] 那 [00:23:59] 这个档案 [00:24:00] 现在你不会觉得他是一个很神奇的东西 [00:24:03] 因为 [00:24:03] 这个太容易做 [00:24:04] 只是说 [00:24:05] 你要 [00:24:06] 跳过他前面的一些 [00:24:09] filter [00:24:10] 就说你不能叫确定力教你 [00:24:12] 怎么做炸弹 [00:24:13] 但是你可以 [00:24:15] 模仿一下 [00:24:16] 比如说 [00:24:17] 这个 [00:24:20] 像这个 [00:24:20] 这个是当初网路上 [00:24:22] 的新闻 [00:24:23] 就是说 [00:24:24] 在美国选举的时候 [00:24:26] 有人用很多假新闻来做这件事情 [00:24:29] 但是如果你要直接叫LN用 [00:24:33] 叫他写一篇关于某个候选人的假新闻的时候 [00:24:37] 其他不做 [00:24:39] 但是你如果用一个比较学术用讨论的语气说 [00:24:43] 你能不能模仿一下这个川普 [00:24:46] 去写一个关于欧巴马是 [00:24:48] 这个不是美国人这件事情 [00:24:50] 他就做了这样子 [00:24:53] 就是 [00:24:53] 他是一个一板一眼的 [00:24:56] 互动的人这样所以他就可以写这样的东西 [00:24:58] 你可以想像这样东西在网路上流传的时候 [00:25:01] 他造成的效益是多少 [00:25:03] 那大家应该也知道现在网路上有太多的讯息 [00:25:06] 都是AI产生的 [00:25:08] 但是可能这些讯息可能也都是AI在读的这样子 [00:25:12] 所以也是AI之间互相的沟通 [00:25:16] 这是也是当初一个例子就是讲COVID-19的 [00:25:19] 就是有一些讯息说这个打疫苗不好 [00:25:23] 我应该要去吃什么东西这样子 [00:25:25] 他就用一个非常专业语气在讲这些事情 [00:25:28] 那这种东西所造成的负面效益其实非常大 [00:25:32] 不过我们并不太 [00:25:33] 大概会把Fake News这件事情摆在这门课讲太多这样子 [00:25:39] 当然还有什么多么太的 [00:25:41] 不过我们这门课比较不会牵扯到 [00:25:44] 影像的 [00:25:44] 或是Speech的部分 [00:25:46] 所以Multimodality的部分 [00:25:48] 其实不太会Cover到 [00:25:50] 不过基本上 [00:25:51] 现在你可以发现其实就是换掉一颗模型 [00:25:54] 换掉你的输入的东西 [00:25:56] 其实后面的手法 [00:25:58] 其实都不会差太多这样子 [00:26:00] 那当然有所谓做Action的 [00:26:03] 就不太是文字的 [00:26:05] 当你了解Transformal他在训练的方式的时候 [00:26:08] 他读文章进去训练方式 [00:26:10] 你就可以发现说 [00:26:12] 那我不要给他文章了 [00:26:13] 我给他一堆的动作 [00:26:15] 比如说把桌面清干净这些Action [00:26:20] 输入给他这样子 [00:26:22] 那其实是一个非监督式的学习 [00:26:24] 就是有这样的动作你就去看一下 [00:26:27] 原来 [00:26:28] 我要把手臂举起来之前 [00:26:30] 我要做什么事情 [00:26:31] 有一个标准的流程 [00:26:33] 这些流程其实就跟 [00:26:34] 你在写一篇文章一样 [00:26:36] 你要起承转合 [00:26:38] 你要有动词主持授词 [00:26:40] 所以Action的 [00:26:41] Sequential的Action [00:26:43] 基本上也可以想像满足语言特性的一些Pattern [00:26:48] 所以也有人用这样概念在训练所谓的Action Model [00:26:53] 那当然这个产生图片这件事情 [00:26:56] 就大家都知道的事情 [00:26:58] 那我就 [00:27:00] 其实真的就是 [00:27:01] 你就换掉一颗 [00:27:02] VLM [00:27:03] 就是把LM换成一个VLM [00:27:05] 然后你就可以 [00:27:06] 读影片 产生影片 [00:27:08] 或是 [00:27:08] 做 [00:27:09] 识别 做一些Grounding [00:27:11] 你就可以做不同的东西 [00:27:13] 所以 [00:27:15] 其实 [00:27:15] 现在模型的能力越来越Power [00:27:18] 你 [00:27:19] 遇到做的事情就会越来越少 [00:27:21] 但是大家可能就会发现你自己存在的必要就会越来越少 [00:27:26] 所以你就要开始找 [00:27:27] 你能够 [00:27:28] 你的Niche在哪里 [00:27:31] 这后面有一个新闻 [00:27:32] 这刚好我在 [00:27:34] 昨天在整理 [00:27:34] 在准备今天投影片的时候 [00:27:36] 发现一个新闻 [00:27:37] 当然 [00:27:38] 这个 [00:27:39] 这个 [00:27:40] 这一位 [00:27:41] 他其实 [00:27:41] 很常发新闻 [00:27:43] 但是你会发现他的新闻常常正负面 [00:27:46] 换来换去这样子 [00:27:48] 跟那个Mask有拼这样子 [00:27:51] 就是突然说什么好的突然又说什么不好这样子 [00:27:54] 不过他讲这件事我觉得是蛮有道理 [00:27:57] 就是说 [00:27:58] 现在AI的强大 [00:28:00] 其实他可以让以前 [00:28:02] 点子非常多的这些人 [00:28:06] 但是他做不出来 [00:28:08] 的这些人 [00:28:09] 突然有很大的Performance出来 [00:28:12] 因为他可以 [00:28:13] 创造很多东西 [00:28:14] 因为你可以想他就是拿到一个Power Tool [00:28:18] 他可以做很多事情 [00:28:20] 所以现在有很多新创公司 [00:28:22] 那个 [00:28:23] 公司人数都是一个人两个人而已 [00:28:25] 所以 [00:28:26] 其实现在 [00:28:27] 这是正在发生的事情 [00:28:31] OK不过当然这个Sam Altman也有一些 [00:28:33] 负面的他们OpenAI [00:28:35] 也不是在干一些好事 [00:28:37] 这我就摆一个小小在这边 [00:28:39] 这个是最近有一个新闻就是 [00:28:42] 就是有一个 [00:28:44] 老实说我看这个问题看很久我也不知道为什么当初 [00:28:49] 这些数学家要讨论这种问题 [00:28:51] 反正如果大家有兴趣可以把这个关键字 [00:28:53] 搜寻一下 [00:28:54] 反正 [00:28:56] 说真的我不太知道这个问题我已经看很久了 [00:28:59] 反正就是一个存在的 [00:29:00] 很久的一个数学的问题这样子 [00:29:03] 那这个过程这个故事就是说这个当初这个数学家 [00:29:09] 跟一位在Entropy公司工作的人 [00:29:12] 已经 [00:29:13] 把这问题已经 [00:29:14] 算解完了已经差不多 [00:29:17] 快结束了 [00:29:18] 然后呢 [00:29:19] 这个OpenAI的人就觉得不行 [00:29:22] 如果被Entropy公司先发表说他们模型就 [00:29:25] 就占了版面这样所以OpenAI就集全公司很大的算力去做这件事情 [00:29:31] 这样听起来好像是公平竞争 [00:29:33] 也还好 [00:29:34] 但是实际上如果大家有兴趣可以去看一些细节 [00:29:37] 就是说 [00:29:39] 私底下他们有去跟这个数学家contact说 [00:29:43] 你要不要跟我们一起 [00:29:45] 发表这篇论文 [00:29:47] 不要理那个Entropy那个人这样子 [00:29:49] 然后就 anyway就有点像利诱啊 [00:29:51] 你一样可以拿到这个奖金 [00:29:53] 这好像有 [00:29:54] 一百万美金一千万美金 [00:29:56] 很多 [00:29:57] 那 [00:29:59] 那这个数学家当然就觉得 [00:30:01] 不道德 [00:30:02] 所以他还是继续跟Entropy这样 [00:30:03] 这个学者合作这样子 [00:30:07] 然后就有点像同时解决这个问题 [00:30:10] 就OpenAI的模型也可以解决 [00:30:11] 然后 [00:30:12] 这个 [00:30:13] Entropy公司的模型可以解决这样子 [00:30:16] 所以就有这个新闻 [00:30:18] 但是这个新闻其实后端 [00:30:20] 大家有一个在思考的点就是说 [00:30:23] 当初 [00:30:25] 这些data这些Entropy公司我也不知道为什么 [00:30:28] 或者是这个数学家的东西 [00:30:30] 他好像有一些资料是摆在 [00:30:32] OpenAI上面 [00:30:33] 这样子 [00:30:34] 好像anyway就是说有一点是这个leakage的问题 [00:30:39] 反正这 [00:30:40] 后端有一些这样的故事 [00:30:42] 然后也有这种人性去 [00:30:44] 所以你可以知道现在模型发表 [00:30:46] 其实 [00:30:47] 都是讲新闻版面 [00:30:49] 虽然大家会去在意那个Leaderboard的排名但是 [00:30:52] 但是有时候新闻大家觉得这个很厉害这个很厉害这样子 [00:30:57] 这个就会影响他们的 [00:30:58] 那个 [00:30:59] 付费的 [00:31:01] 的 [00:31:01] Account [00:31:03] 好 [00:31:05] 我其实前面讲这些其实并不是课程的重点 [00:31:09] 只是我想带一下说AI这件事情在NLP [00:31:13] 的 [00:31:14] 施力点跟他现在改变的东西这样子 [00:31:18] 那 [00:31:19] 我很快会把这边讲完 [00:31:21] 所以这边其实不是我这个课的像比如说game [00:31:25] 其实从 [00:31:26] AI在做Generation这件这个概念并不是很common sense [00:31:32] 就是说 [00:31:33] 其实我要拿做AI做生成 [00:31:37] 以前是大家不会想都不会想 [00:31:39] 从GBT3之前 [00:31:42] 大家都不会说我可以用模型来写一篇文章 [00:31:45] 这绝对不可能发生写出来绝对一看就是电脑写的 [00:31:49] 不是 [00:31:50] 文艺不通句子接不起来就是怪怪的这样子就是论述也不对以前没有这么厉害 [00:31:57] 但是这件事情反而从影像那边过来 [00:32:01] 好像做了出来然后文字 [00:32:03] 从GBT3之后 [00:32:04] 我发现好像可以说人话这样子 [00:32:08] 那这个当然前面的历史就会 [00:32:10] 更早以前 [00:32:11] 从 [00:32:12] 生成对抗网路这个大家如果 [00:32:14] 学过AI应该就知道 [00:32:15] 这是一个比较大家就知道说我可以让电脑 [00:32:19] 自己 [00:32:20] 生成一些东西 [00:32:22] 这些生成东西不是人去做的 [00:32:24] 是电脑自己靠着一些规则靠你给他一些模型参数 [00:32:29] 他可以自己产生东西 [00:32:31] 当然这个game他主要是为来做对抗为来做自己模型的东西 [00:32:34] 调了更好的对抗的资料 [00:32:37] 但是你可以发现他可以生东西出来 [00:32:40] 而且是生东西出来是有用的这样子 [00:32:43] 所以从game之后大家就觉得这个生成的东西实在太好用 [00:32:47] 所以我可以让 [00:32:48] 电脑做什么 [00:32:49] 其实这一块很重要就是做训练资料生成 [00:32:53] 或是扩充 [00:32:56] 大家如果学过AI就知道说其实训练资料才是最宝贵的 [00:32:59] 虽然有很多非监督式学习的东西 [00:33:03] 但是 [00:33:04] 厂商给我就是十笔资料 [00:33:06] 病人医院的资料就是那十笔 [00:33:09] 我怎么样去做一个很厉害的判断的模型 [00:33:13] 所以你一定要有一个 [00:33:15] 可以产生更多有用的训练资料方法 [00:33:18] 所以这GAI就在这些需求下就蓬勃发展这样子 [00:33:23] 这个都比较是影像的应用 [00:33:25] 所以这个 [00:33:27] 大家可以想像一下这个东西 [00:33:30] 你可以想像这是2016年NIPS的一个tutorial讲的东西 [00:33:34] 到现在十年了 [00:33:36] 虽然 [00:33:38] 现在大家不太用GAME来做生成 [00:33:41] 有更好的技术在做 [00:33:44] 所以其实你可以想像这件事情他的 [00:33:47] 他不只是帮你做一个很 [00:33:49] 要报告的图片 [00:33:51] 做一个什么东西的 [00:33:53] 文章 [00:33:54] 他可以 [00:33:55] 辅助到很多层面甚至他可以自己帮助自己在训练的更好 [00:34:00] 所以GENERATION这件事情你不要太局限 [00:34:03] 他的范畴 [00:34:04] 就是这样子 [00:34:06] 但是在文字上 [00:34:07] 其实 [00:34:08] 这个时间轴可能要再拉更早以前 [00:34:11] 在文字上其实没有 [00:34:13] 这么聪明 [00:34:15] 没有那影像当然是后面 [00:34:17] 但 [00:34:19] 做NLP大概会从这四个 [00:34:21] 四个轴开始 [00:34:23] 大家可以看一下 [00:34:24] 不过我们 [00:34:25] 并没有讲这些这么细的东西因为现在不需要 [00:34:29] 我们会从最上面的Morphology构制 [00:34:32] 所以你会谈到字的 [00:34:34] 前缀后缀这些东西 [00:34:36] 这个当然在中文是没有 [00:34:39] 但是在任何拉丁语系都有 [00:34:43] 大家如果学过去考过 [00:34:45] 这个GRE英文就要背什么 [00:34:47] 什么前缀词后缀词这些东西 [00:34:51] 那甚至你要学所谓的stemming [00:34:53] 段字甚至后面的syntax你要学会 [00:34:57] 这个词性 [00:34:58] 就是你要知道动词主词受词这些东西 [00:35:01] 所以NLP的技术的发展是这样的 [00:35:04] 每一个 [00:35:05] 每一个阶段它都可以是一个非常重要的主题 [00:35:09] 所以 [00:35:09] 像以前 [00:35:10] 做Name Entity Recognition就是一篇文章里面我如何知道 [00:35:15] 国立清华大学这六个字是在讲一个学校的名字 [00:35:21] 如何去判断一些词之间是有关系的 [00:35:25] 国立清华大学跟清大 [00:35:27] 是 [00:35:28] 同样讲同样的东西的 [00:35:30] 这个就是一个Numeration的问题 [00:35:33] 所以你会发现以前在 [00:35:34] 看NLP的问题的思考点就非常细 [00:35:39] 就是有点像你一步一步教会电脑去看这个句子 [00:35:44] 我们人是怎么理解的我们人 [00:35:46] 学会文章是怎么理解我现在就一步一步教会电脑去做这些事情 [00:35:52] 那以前的做法是这样 [00:35:54] 但是到后来就 [00:35:56] 极限了遇到一个瓶颈 [00:35:59] 那 [00:36:00] 我都会举这个例子就是在2017年应该也是10年前 [00:36:04] 就是国科卫办了一个比赛 [00:36:07] 讲了这件事情 [00:36:08] 你如何让电脑去做阅读理解 [00:36:11] 就是给他一个问题 [00:36:13] 然后给他选项 [00:36:14] 电脑能不能回答出这个答案 [00:36:18] 那以前的做法呢就是把选项呢去比对 [00:36:22] 比对文章算相似度这样子 [00:36:25] 但是你会觉得这个很笨啊就是把它丢到checkgpt问一下 [00:36:29] 然后给他选项他就会回答 [00:36:31] 没错 [00:36:31] 但是你有没有思考 [00:36:33] 这些模型是怎么 [00:36:34] 怎么做到这件事情 [00:36:37] 以前我们就只停留在说我要把每一个选项 [00:36:41] 去比对关键字 [00:36:43] 或者是把它转换成一个项链 [00:36:46] 用一堆数字来表示这些文字 [00:36:49] 但是一样在算相似度 [00:36:53] 那这个相似度呢就是在不同的Domain [00:36:55] 可能是你把它转换成某一个 [00:36:58] Megaspaces的Domain去算相似度 [00:37:01] 你并没有真正去理解说这个 [00:37:04] 他 [00:37:04] 前因后果是什么这样子 [00:37:07] 对 [00:37:08] 那 [00:37:11] 我们还是不要问 [00:37:12] 这个 [00:37:13] 这一题的答案其实不见得会固定 [00:37:16] 就是大家的idea [00:37:18] 觉得 [00:37:19] 这个是什么 [00:37:20] 这个是从 [00:37:22] 这个国语文能力测验出来的 [00:37:24] 大概是 [00:37:26] 中年级小学中年级的程度 [00:37:30] 那也会拿来去考外国人说他到底看得懂中文没有这样子 [00:37:35] 那当然以一般我们这个native speaker中文的native speaker来讲 [00:37:39] 这应该蛮简单但是 [00:37:41] 你可以回去读一下 [00:37:42] 好像不是这么容易 [00:37:46] 这是在2017年办的比赛 [00:37:48] 然后 [00:37:49] 第一名奖金有1000万 [00:37:51] 办了两届这样子 [00:37:53] 那 [00:37:53] 据说 [00:37:55] 第一名奖金都没有发出去 [00:37:57] 不知道是国客会 [00:37:59] 没有诚意还是 [00:38:00] 怎么样 [00:38:01] 这个好像有录影 [00:38:03] 就是后来 [00:38:05] 后来那个 [00:38:05] 那个 [00:38:07] 那个 [00:38:08] 审查委员那个裁判 [00:38:10] 说的说大家都 [00:38:13] 都没有做好 [00:38:14] 意思是这样 [00:38:15] 就没有做很好这样所以第一名从缺这样子 [00:38:17] anyway [00:38:19] 然后这是问CHATGBT的 [00:38:21] 他会告诉你答案 [00:38:22] 重点是大概可以解释 [00:38:25] 科技大学当初分两个阶段 [00:38:27] 第一个是回答选择题 [00:38:29] 第二个是你要告诉我为什么 [00:38:32] 那你要能够解释这件事情是 [00:38:34] 在2017年是 [00:38:35] 大家觉得这根本是 [00:38:37] 圣杯啊根本是做不到的事情 [00:38:40] 但是你现在随便拿一个 [00:38:42] 拿一个transformer decoder [00:38:44] 喂给他他就会 [00:38:46] 告诉你这些东西虽然不见得这么好 [00:38:48] OK [00:38:51] 所以 [00:38:51] 你可以想像这个gap是 [00:38:53] 一个 [00:38:55] 非常discrete的jump上去 [00:38:57] 并不是一个很 [00:38:59] 连续的成长 [00:39:02] 那其实这件事情 [00:39:04] 以前啊就是 [00:39:05] 就是 [00:39:05] CHATGBT还没出来之前 [00:39:08] 就有language model [00:39:11] 只是说老师这个就是我们现在把language model变大而已嘛 [00:39:15] 就是LLM [00:39:16] 没错的确他的精神是一样的 [00:39:19] 是language model [00:39:20] 那以前我们在做NLP的人 [00:39:23] 不见得都会用到language model因为他 [00:39:27] 第一个是 [00:39:27] based on 几率的模型去讲 [00:39:29] 而且通常我们训练的语料也没有很多 [00:39:32] 所以 [00:39:34] 这件事情 [00:39:35] 大家就 [00:39:36] 觉得他是理论的基础 [00:39:38] 但是当初跟 [00:39:39] 语言模型有关的这两位 [00:39:41] 可能在座如果以后要做speech或是做 [00:39:45] 治安的 [00:39:46] 同学你都会遇到这样子 [00:39:48] 这非常有名的 [00:39:49] 尤其是 [00:39:50] Claude Shannon [00:39:50] 你看这个名字就知道 [00:39:52] 为什么他有名 [00:39:54] 为了纪念他所以那个模型 [00:39:56] 就用他的名字 [00:39:58] OK [00:39:59] 好他们都有提到跟language model有关的东西 [00:40:02] language model其实 [00:40:04] 大家都知道啦就是 [00:40:06] 这种接龙游戏 [00:40:08] TrackGP出来之后为什么大家说要接龙游戏就是这样子 [00:40:10] 什么东西前面是什么 [00:40:12] 后面出来的几率 [00:40:14] 会不太一样 [00:40:16] 那你就会去猜最好的 [00:40:17] 虽然这个我用Google当例子 [00:40:19] 不是很好 [00:40:20] 因为Google他其实会拿那个查询词的分布去做统计 [00:40:24] 并不是所有文献去做统计 [00:40:27] 不然你以为你可以发现不同地方台南新竹台中 [00:40:31] 好吃的 [00:40:31] 后面的排序是不太一样的 [00:40:34] 对 [00:40:35] 所以 [00:40:36] 这个 [00:40:37] 你可以想像大家常常查的东西是什么 [00:40:41] 所以他有个probability model [00:40:42] 所以大家知道language model [00:40:45] 就是一堆词的关系 [00:40:47] 我这边拿 [00:40:50] 周杰伦的 [00:40:51] 周杰伦的歌词 [00:40:52] 应该没有版权 [00:40:53] 我再举个例子这样子就是 [00:40:55] 他的词之间的关系 [00:40:58] 那但是做完之后发现 [00:41:00] 例子不是很好不过居然都做了就把他摆出来这样子 [00:41:04] 因为 [00:41:05] 那个 [00:41:06] 周杰伦的词都 [00:41:07] 很跳 [00:41:08] 所以那个几率不太好算这样子 [00:41:11] 那我当然有试过 [00:41:13] 这个用 [00:41:14] 黄淑骏的 [00:41:17] 在座我们听过黄淑骏这一位 [00:41:19] 歌手 [00:41:20] 听过举手一下 [00:41:24] 不入你们年纪这样子 [00:41:26] 我用黄淑骏来做那黄淑骏其实也不太好做 [00:41:30] 因为他他的词非常多没错但是他的 [00:41:34] 他的 [00:41:35] 他的词也是很特别就是所以 [00:41:37] Probability也不太好算 [00:41:38] 不过anyway [00:41:40] 语言模型他其实就在算这些N-gram之间的发生的条件几率 [00:41:46] 就是你看到这个词之后 [00:41:48] 看到这个词的Probability [00:41:50] 这个条件几率你都会算 [00:41:51] 其实这个就是基础的Language Model [00:41:54] 只是说你可以想像你如果只知道这件事情 [00:41:58] 你现在就回去想说 [00:42:00] 老师给我一大堆的文献 [00:42:03] 我自己要算这些几率会发生什么问题 [00:42:05] 第一个这要量太大 [00:42:08] 第二个可能有些东西没有发生过啊 [00:42:11] 那几率是不是0 [00:42:12] 几率是0要怎么算这样子 [00:42:14] 所以 [00:42:15] 你可以先 [00:42:16] 不用先看答案自己先 [00:42:18] 试着做一下你就知道说原来 [00:42:21] 我想得到这些问题都已经有人解过这样子 [00:42:24] 所以你就可以成长得很快这样子 [00:42:29] 好 [00:42:30] 不过anyway现在我们探讨NLP不是用这样的角度去看 [00:42:35] 这张图 [00:42:36] AI位也很浓没错 [00:42:39] 这其实是我自己手工画了一下之后 [00:42:42] 然后再叫AI帮我把它美化一下 [00:42:45] 就是我们看到的NLP的历史 [00:42:48] 从AI的角度来看 [00:42:52] 那个站着的同学就不好意思 [00:42:54] 我也很快 [00:42:56] 第一阶段就会讲完了这样子 [00:42:58] 你们就可以看怎么样 [00:43:00] 就这个历史其实跟NLP有关的发展 [00:43:03] 其实 [00:43:05] 当然后面很快 [00:43:06] 但你会发现其实前面我们在讲这些事情 [00:43:09] 这一位大家应该都知道 [00:43:11] 这个Turing [00:43:13] 他 [00:43:15] 做Turing本训之后去 [00:43:18] 探讨说这个language之间 [00:43:20] 什么样language [00:43:22] 不同的type [00:43:22] 当然跟Transcript的 [00:43:24] 这样的hierarchy有关 [00:43:27] 所以在那个年代在 [00:43:29] 这个19501960年代 [00:43:31] 其实就希望能够那时候 [00:43:34] 其实电脑还没出来喔 [00:43:35] 你可以想像 [00:43:36] Turing那时候是没有computer的 [00:43:39] 大家就有这样的想法 [00:43:40] 需要让 [00:43:43] 电脑用 [00:43:44] 运算的方式去处理这种 [00:43:47] 这种sequential的东西 [00:43:48] 然后去理解里面的一些pattern [00:43:52] 所以其实 [00:43:54] 在Chomsky那个年代就有一个chipboard [00:43:57] 就有一个chipboard出来这样子 [00:43:59] 但是真正跟我们比较有关的 [00:44:01] 你可以想像说 [00:44:03] 在网路泡沫化起来的时候 [00:44:05] 那时候有很多的网路泡沫化起来的时候 [00:44:06] 那时候有很多的网路泡沫化起来的时候 [00:44:07] 在2000年时候有搜寻引擎 [00:44:09] 但是那时候大家做的是什么 [00:44:11] TFIDF [00:44:13] 这个万用的非常厉害的Baseline的做法 [00:44:17] 然后到后来大家觉得 [00:44:19] 这个Benji有说 [00:44:20] 我们可以用 [00:44:21] 模型的角度 [00:44:22] 用NN的角度来看这件事情 [00:44:25] 来做language model [00:44:28] 我们不是在算刚才的几率 [00:44:29] 我们用Chain的方式来做 [00:44:31] 从这边 [00:44:32] 就整个蓬勃发展一直到 [00:44:34] 最明显大家可能现在用 [00:44:36] 用NLP的人会想到说 [00:44:39] 我有一个叫Wall-to-Vector的东西 [00:44:41] 大概在 [00:44:43] 14年前2013年出来的东西 [00:44:46] 这个阶段就整个起来了 [00:44:50] 整个 [00:44:51] 重要性跟他的 [00:44:54] 一大堆人就进来做这件事 [00:44:55] 因为发现有Wall-to-Vector [00:44:57] 我可以知道说 [00:44:59] 狗跟猫其实是比较像的 [00:45:01] 狗跟卡车其实比较不像的 [00:45:03] 利用这种算法的东西之后 [00:45:05] 我就可以 [00:45:06] 做非常多事情 [00:45:07] 有很多应用就往上跳一阶 [00:45:10] 但是到真正改变这个历史的是在2018年 [00:45:15] 就是Bert跟GBT [00:45:17] 那个年 [00:45:17] 那个 [00:45:18] 年份同时出来 [00:45:20] 但是当时GBT出来之后大家 [00:45:22] 不看好他 [00:45:24] 因为他就是一个Decoder的模型 [00:45:26] 但是Bert呢是Basic on [00:45:28] 这两个都是Basic on Transformer [00:45:29] 但是Bert是一个Encoder模型 [00:45:32] 所以大家觉得Bert很好用啊 [00:45:35] 他可以取代以前的Wall-to-Vector [00:45:36] 做的很好 [00:45:38] 所以你可以发现2018年之后 [00:45:40] 就一大堆Bert-based的应用 [00:45:42] 就是全部都用Bert [00:45:44] 所以 [00:45:45] 这个 [00:45:46] 2018年之后就是整个的 [00:45:48] 整个的Annual-Pair应用就大起飞 [00:45:51] 因为发现这个 [00:45:53] 以前笨笨的Chadbot [00:45:55] 都可以变得非常聪明 [00:45:57] 但是呢 [00:45:59] 这边要秀的是GBT他也是默默的发展 [00:46:03] 这样讲好像他是一个弱者 [00:46:05] 其实他不是 [00:46:05] 只是说他就 [00:46:06] 朝着他的Decoder路线继续做 [00:46:09] 那 [00:46:11] GBT-2出来之后大家也觉得 [00:46:13] 好像比较厉害一点 [00:46:15] 因为他GBT-1 [00:46:16] 第一代实在不怎么厉害 [00:46:18] 那2出来之后好像 [00:46:20] 值得做下去了 [00:46:21] 一直到他3 [00:46:23] 他3出来之后是 [00:46:25] 非常厉害一个轰动的 [00:46:27] 的产品 [00:46:28] 那个Paper列出来之后 [00:46:30] 大家觉得原来可以 [00:46:32] 不是他的模型 [00:46:33] 他的模型的确很厉害但是大家惊讶的是 [00:46:35] 他是 [00:46:36] OpenAI花了这么多钱 [00:46:38] 花了这么多钱来做这样子 [00:46:41] 他们甚至有一个 [00:46:42] 那个paper如果大家有兴趣去download那个paper [00:46:46] 里面那个作者写一句话说 [00:46:48] 他们知道这个实验的过程 [00:46:51] 有一个DSA用错了 [00:46:53] 那个使用方式错误这样子 [00:46:56] 但是呢 [00:46:57] 实验已经跑下去了 [00:46:58] 如果要重新跑又要花 [00:47:01] 多少钱他们就不跑了这样子 [00:47:03] 所以 [00:47:04] 你就可以知道他们花了 [00:47:05] 成本有多少这样子 [00:47:07] 那个一次性 [00:47:08] 要做的 [00:47:09] 成本有多少 [00:47:11] 那 [00:47:12] 其实这个年代大家可能可以记一下就是这个年代大家也是确GBT快出来的时候 [00:47:18] 那 [00:47:19] GB3出来之后大家就突然觉得 [00:47:21] 让电脑去 [00:47:23] 写人类的文章是可行的这件事情 [00:47:27] 大家突然 [00:47:28] 觉得 [00:47:29] 可以做 [00:47:29] 以前都不行以前就觉得这个一看就是AI写电脑写 [00:47:33] 那GB3之后就 [00:47:35] 突然一袋一堆 [00:47:37] 有一堆公司去专门包装GBT3 [00:47:40] 然后去做一些 [00:47:41] 这个 [00:47:42] 文章的service这样子 [00:47:45] 那当然后面就所谓的InstructGBT跟 [00:47:49] 它后面的 [00:47:51] 包装后的ChatGBT [00:47:53] 所以这个2022年的时候ChatGB出来之后后面就就是大家所熟知的故事 [00:47:59] 就是 [00:47:59] 大概发展是这样 [00:48:01] 当然你会觉得说这个 [00:48:02] 后面这个四五年 [00:48:04] 发展的很快 [00:48:05] 前面怎么那么慢 [00:48:07] 前面 [00:48:08] 都很混吗 [00:48:08] 没有其实 [00:48:10] 当然跟硬体的成长有关系 [00:48:12] 当然也跟所有 [00:48:13] 资料量变多了 [00:48:15] 所有运算能力变强也有关系这样子 [00:48:18] 但是以前 [00:48:18] 这些技术发展其实也是很多 [00:48:21] 这边有很多的模型大家可以 [00:48:23] 可以看一下如果你都可以知道 [00:48:26] 每一个icon是什么样模型那表示你还蛮熟的这样子 [00:48:30] 我还 [00:48:31] 放一个新的这个 [00:48:33] K3的东西 [00:48:35] 这个AI位很浓的图 [00:48:39] 我们就看一看就好了 [00:48:40] 从以前到现在这样子 [00:48:42] 这个比较像给小朋友看的 [00:48:45] 那 [00:48:49] 这个我等一下再回过头 [00:48:54] 我先秀一下我们这堂课 [00:48:56] 这堂课会教的东西 [00:48:58] 我们会有助教课 [00:49:01] 在助教课大概就是 [00:49:03] maybe是 [00:49:04] 三到六个小时 [00:49:06] 其实也是教大家 [00:49:08] 呃 [00:49:08] 怎么用Python做NLP的东西 [00:49:12] 或是 [00:49:13] 像后面RAG的东西会教一些 [00:49:15] Hugging face上或是 [00:49:18] 这个怎么呼叫模型的部分这样子 [00:49:21] 或是教你用这些 [00:49:23] RAG的一些 [00:49:25] 一些framework这样子 [00:49:27] 那基本上我们会从 [00:49:28] 基础的NLP开始讲起 [00:49:30] 然后从Square model [00:49:34] 从基本上的类成金网路Square model从 [00:49:38] RNN LSTM [00:49:40] 虽然你们现在也不太用这些模型 [00:49:41] 但是我们会从那边开始讲起 [00:49:43] 然后一直到 [00:49:44] Transformer然后到Transformer现在的LM [00:49:47] 大家都会介绍这样子 [00:49:48] 那 [00:49:49] 这学期我是希望能够增加一些reasoning的部分 [00:49:53] 因为毕竟 [00:49:54] 现在LM的发展我觉得他已经越来越成熟 [00:49:57] 所以他后来大家外面的包装的部分 [00:50:00] 或是大家现在想看到的adj的部分 [00:50:03] 我们会 [00:50:04] 带一下一些比较新的趋势这样子 [00:50:08] 但是我其实不会涵盖到语音 [00:50:10] 也不会教你怎么用prong [00:50:12] 也不会我们重新设计模型 [00:50:14] 这都比较在 [00:50:16] AI的课程或者是GI的课程会介绍的 [00:50:19] 那课程的 [00:50:21] 内容大概是这样 [00:50:22] 这是 [00:50:23] 这两年都是这样子 [00:50:25] 会简介然后 [00:50:26] 基础的部分 [00:50:28] 然后讲 [00:50:29] 从wall embedding开始 [00:50:30] 到这些 [00:50:33] sequential的model这样子 [00:50:35] 然后会介绍这些 [00:50:37] Bloodbath的 [00:50:38] 一系列的东西 [00:50:41] 其实到这边后面其实就有一点 [00:50:45] 有一点杂了 [00:50:46] 说真的因为他发展非常快 [00:50:48] 但是 [00:50:49] 有些东西又必须要提一下提一下这样子 [00:50:52] 所以 [00:50:52] 其实会有点杂会有点多 [00:50:55] 但是我想研究所课多半还是这样 [00:50:57] 就是 [00:50:58] 去 [00:51:00] 触发就是点一把火让你们继续学习这样子 [00:51:05] 那我们 [00:51:06] 这一次的课程会有一个部分 [00:51:08] 不一样的地方就是 [00:51:10] 会有一个考试 [00:51:11] 这是 [00:51:13] 有老师建议的 [00:51:15] 就是也有考试因为 [00:51:17] 我也觉得 [00:51:18] 很好 [00:51:19] 因为为什么呢 [00:51:20] 因为我们主要有四个作业 [00:51:23] 那作业我会叫你们回答一些问题写一些心得 [00:51:27] 有时候都发现这些学生心得写的非常好 [00:51:30] 这个 [00:51:31] 这个分析的非常 [00:51:32] 这个深入啊 [00:51:34] 但是看他 [00:51:35] 讲的东西好像前面也没做这些实验他为什么知道这些实验呢 [00:51:37] 他为什么知道这些实验呢 [00:51:38] 他为什么知道这些实验呢 [00:51:39] 看起来是AI协助这样子 [00:51:42] 那也不是不行但是我觉得你要跟AI同步成长 [00:51:47] 所以我们会多一个测验这个测验是 [00:51:49] in person实体的 [00:51:51] 所以TICA在做实体的考试会有点麻烦 [00:51:55] 因为 [00:51:55] 跨校 [00:51:56] 所以跨校会同时间考这样子 [00:51:59] 那考试的范围就是我们教的内容 [00:52:01] 当然不会叫你去记什么模型什么公式怎么怎么弄啊 [00:52:06] 那个 [00:52:08] 题目我们会再设计 [00:52:09] 但是会有个考试 [00:52:11] 这是这一次比较不一样的地方 [00:52:14] 然后我们就取消了term project [00:52:16] 这个我们会再讲 [00:52:18] 那最主要就是四个assignment [00:52:20] 这再占75% [00:52:21] 然后一次的期中考 [00:52:23] 那为什么取消term project呢 [00:52:24] 因为 [00:52:25] 第一个人很多然后 [00:52:27] 以前会花掉太多时间去帮各位分组 [00:52:31] 因为大家有时候也不太认识然后 [00:52:33] 组员也不太认识 [00:52:35] 然后到报告那天才说这个组员从来没有参与过 [00:52:37] 然后到报告那天才说这个组员从来没有参与过 [00:52:37] 然后到报告那天才说这个组员从来没有参与过 [00:52:39] 然后就有点麻烦 [00:52:41] 然后因为时间也很短因为第四个作业做完到term project [00:52:45] 只剩 [00:52:46] 一个月 [00:52:47] 当然 [00:52:48] 我们term project是其中就公布了但是 [00:52:51] 学生都认为是我应该是在第四个作业做完才做term project [00:52:55] 所以你会觉得非常压缩非常短 [00:52:57] 没错 [00:52:59] 当然有些同学的 [00:53:02] 回馈都还不错都觉得可以学到一些东西这样子 [00:53:05] 我不知道是不是表面话还是说什么 [00:53:07] 这样 [00:53:08] 不过我们就把term project取消了的确 [00:53:11] 那个这个 [00:53:12] 很难去judge大家的贡献 [00:53:15] 那这个是我刚才提到的 [00:53:17] 就是我们会考试是实体的 [00:53:20] 所以这门课如果你是清大有用xclass修的学生你可能要记住 [00:53:25] 这个时间我们虽然是立在第14周但是 [00:53:28] 应该是不太会变了不过可能我还没有把它定案 [00:53:32] 我就尽量不要排在 [00:53:33] 期末考周 [00:53:35] 就在前面 [00:53:36] 那 [00:53:37] 如果你是xclass的学生你大概是要确定 [00:53:40] 那一个礼拜的考试时间你可以出席这样子 [00:53:45] 好这是大家 [00:53:46] 最关心的分数的分布这是去年 [00:53:49] 第一年你可以去dcard上找 [00:53:53] 大家说这门课很甜啊什么什么 [00:53:55] 所以 [00:53:56] 第二门就稍微 [00:53:57] 调整了一下normalize一下 [00:53:59] 这个样子看起来还好 [00:54:01] 还好 [00:54:03] 就是中位数大概是接近80所以其实 [00:54:06] 不难 [00:54:07] 不难尤其是我觉得我们作业 [00:54:09] 的难度有一点点 [00:54:11] 中偏低 [00:54:13] 主要是有一些跨领域的学生来修啦所以我并没有把它调得太难 [00:54:18] 但是有时候这跨领域本来比 [00:54:20] 这个电子学院都还厉害这样子 [00:54:22] 所以他其实是 [00:54:26] 作业 [00:54:28] 没有太高难度 [00:54:30] 所以大概的分布是这样所以供你们参考这样子 [00:54:34] 那 [00:54:35] 通常这边都是放弃的学生啦就是你作业没进来的学生 [00:54:38] 就是你作业没教 [00:54:39] 因为作业 [00:54:40] 四个作业嘛你一个没教你就知道你的分数大概 [00:54:43] 就不会在 [00:54:44] 里面这样子 [00:54:46] 那 [00:54:47] 我们作业因为人数很多那就是 [00:54:51] 以前我们都试过用AI改 [00:54:53] 但是 [00:54:54] 有点难度所以我们现在都会一起协作啦还是有人 [00:54:58] 助教还是进去看然后 [00:55:01] AI可能就是看一些 [00:55:03] 程式的部分或是什么 [00:55:04] 但是基本上是协作的这样子 [00:55:07] 那的确以前的 [00:55:08] 大家都会反映说 [00:55:09] 作业的评分标准 [00:55:12] 不太明确这部分我们会再修正一下让它变得更 [00:55:15] 更 [00:55:18] 大家被扣分会甘愿一点我们会把写清楚一点这样子 [00:55:22] 那 [00:55:23] 研究所课我希望大家有一些讨论分析 [00:55:26] 当然这一块你们大家都会 [00:55:29] 跟AI协作但是我觉得 [00:55:32] 如果AI要讲一些事情你又可以反馈到你自己前面再补做一些实验 [00:55:37] 我觉得就很好这样子 [00:55:41] 重点是要你自己的insight或者是说AI告诉你insight你可以了解原来对没错 [00:55:47] 这以前我没想到AI的确 [00:55:49] 告诉我这些这样子 [00:55:51] 那这大概是作业会的 [00:55:54] 类型这样子 [00:55:56] 那当然我觉得 [00:55:57] 你要对文字有兴趣啦因为这不是一个AI的课 [00:56:01] 所以如果你只想学Transformal你应该可以去 [00:56:05] AI或是Deep Learning的课去学那边可能讲得更细一点 [00:56:08] 我这边Transformal的课是很简单的 [00:56:09] Transformal其实不会讲得那么细 [00:56:11] 但是我还是会用NLP的角度去看整个模型的 [00:56:17] 运作方式跟重要性这样子 [00:56:22] 好 [00:56:23] 这是几个以前学生的意见啦就是 [00:56:26] 供你们参考当然有好的啦 [00:56:29] 有 [00:56:31] 觉得不错的这样子 [00:56:33] 那不过大家也会 [00:56:35] 说实在的有录影有直播 [00:56:38] 大家可能平常就不会上课也不会来学 [00:56:41] 所以今天这个盛况大概是只有一次这样子 [00:56:47] 后来就越来越少大家觉得反正我 [00:56:50] 我课后用三倍数播放这样 [00:56:53] 我就可以很快的读完这门课 [00:56:55] 就是你会到写作业时候才会去follow这件事情 [00:56:59] 那 [00:57:01] 如果你有程度其实还OK但是如果你本来程度没有这么跟那么上的话会比较吃力一点 [00:57:08] 这大概是提醒大家一下 [00:57:10] 好这是一些基本的data [00:57:13] 就是 [00:57:14] 我的资料会在 [00:57:16] 台卡在 [00:57:18] 台大那个NTU库页上都有 [00:57:20] 然后我的实验室的Github的 [00:57:23] 这个课程网页 [00:57:26] 会把这个也会同时Miro同时一样的东西 [00:57:30] 然后这因为这边有 [00:57:33] 这两年的啦所以你也可以上去看这样因为这是开放的 [00:57:37] 所以公开资料在这边那 [00:57:39] 清大这边的学校的eClass我就不放 [00:57:43] 不过我想你们可以透过台卡这边的NTU库去 [00:57:46] 去点到这个链接 [00:57:48] 你都可以拿到这个投影片跟影片这样子 [00:57:53] 好 [00:57:54] 我想Sleep的介绍就到这边了 [00:57:56] 那 [00:57:59] 我们看一下这个 [00:58:01] 这个slide上的 [00:58:04] 外校的学生的考试 [00:58:08] 我是没有 [00:58:09] 实际放过但是根据台卡办公室的说法是每个学校的考试 [00:58:12] 每个学校会有一个考场 [00:58:14] 然后也会有监考老师 [00:58:17] 所以我看蛮多学校都只有一位学生 [00:58:20] 所以你就会很VIP式的被一个老师 [00:58:24] 带去一个房间考试这样子 [00:58:26] OK [00:58:31] OK好所以这位同学是没有 [00:58:34] 没有同步的网址 [00:58:36] 就是说 [00:58:37] 如果你有修这门课你应该可以从NTU库里面去 [00:58:40] 看到我们的直播的网址跟 [00:58:42] 那个录影的 [00:58:45] 链接 [00:58:46] 你就可以 [00:58:47] 就可以上去这样子 [00:58:48] 那我们一定会就是在早上 [00:58:50] 那 [00:58:51] 这学期我们 [00:58:53] 运气不好没有放假 [00:58:55] 对啊就是 [00:58:57] 就是 [00:58:58] 如果遇到放假或是我不能有 [00:59:01] 不能上课的时候我还是会预录 [00:59:03] 我还是会预录这样所以我们会上满这个 [00:59:06] 16周的时间这样子 [00:59:10] 同时间要开会 [00:59:12] 可以啊就是因为基本上Sclass就是否这个设计嘛就是 [00:59:17] 你可以同时间有重躺这样子 [00:59:18] 虽然我也不知道这个学生需要 [00:59:22] 会很辛苦如果他 [00:59:23] 修了五门都在同个时间 [00:59:26] 这样也是蛮厉害的 [00:59:29] 这个可能是旧资料啦可能是旧资料我后来把它改成75跟25这样子 [00:59:36] 那但是作业老实说因为四个作业嘛75没办法整除嘛所以学生都会问我说 [00:59:42] 哪个作业比重是多少我现在其实还不 [00:59:45] 没有写出来啊 [00:59:47] 我到时候因为作业会有点调整 [00:59:49] 我会根据作业的难度跟他的loading会比重会稍微调整但是你可以想像就是 [00:59:55] 就是 [00:59:56] 75除以4的上下range [00:59:59] 但是我知道要写清楚不然学生都会跟我来argue这件事情 [01:00:08] 应该是四个啦 [01:00:10] 四个 [01:00:12] 四个作业然后一次考试这样子 [01:00:15] 五个作业会有点赶会绑得有点 [01:00:20] 对时间会有点吃力 [01:00:22] 同时修会没有会不会很吃力我只能说看人对 [01:00:27] 对 [01:00:28] 如果你 [01:00:29] 你够积极够 [01:00:31] 这门课其实我觉得门槛不高 [01:00:34] 你只要有训练过模型 [01:00:36] 不要说非常厉害你只要知道那怎么写就 [01:00:40] 我觉得应该是没有问题 [01:00:41] 因为我们的作业会 [01:00:43] 有些甚至给你一个template [01:00:45] 不是叫你从无到有去写所以 [01:00:48] 应该是还好 [01:00:49] 但是我还是建议你有点基础来修这样子 [01:00:52] 不然 [01:00:53] 人数有点多 [01:00:56] 跟DL一起修效果会更好吗 [01:00:59] 我不知道可能会吧 [01:01:01] 可能会吧就是你 [01:01:04] 不过很有趣就是你会发现如果你修一大堆AI课你会发现 [01:01:07] 怎么每个老师都讲一样的东西 [01:01:09] 都在讲transformal [01:01:11] 都在讲fine tune都在讲这些东西这样子 [01:01:14] 对那应该效果会比较好这样 [01:01:18] 期末考的形式就是实体 [01:01:20] 坐在教室发考卷这样子就是用写的 [01:01:23] 然后断网 [01:01:25] 不能用 [01:01:25] 没有openbook这样子 [01:01:27] 就要完全靠你自己脑袋这样子 [01:01:29] GPU的等级 [01:01:32] 这的确是个好问题我们 [01:01:34] 我们会把作业的难度跟他资料的复杂度 [01:01:38] 降低到你们个人的电脑 [01:01:41] 或者是你的free的collab quota可以跑的 [01:01:45] 状态 [01:01:47] 也就是说 [01:01:48] 如果你觉得你跑不动了 [01:01:50] 那一定你程式没有写好 [01:01:52] 当然如果你的实验室有更powerful的环境 [01:01:56] 的确你可以更加速 [01:01:58] 但是我们都会让 [01:01:59] 这个low resource的学生可以把这个作业做完 [01:02:03] 有一张投影片我没有放就是Tica他其实有提供一些 [01:02:09] collab quota的奖励 [01:02:11] 不过因为没有很多就没有办法给每个学生 [01:02:14] 所以我会把它当成是作业的 [01:02:18] bonus就是说我们每次作业会有 [01:02:21] 评选可能前 [01:02:22] 前十位 [01:02:24] 会多发给你collab的 [01:02:26] quota这样子 [01:02:30] 没有ntu库的账号这个的确有不少学生来问我说他有选课但是还是没有ntu库的账号 [01:02:37] 可能他们 [01:02:38] 从每个学校进来或者是 [01:02:40] 加退选的时间的贿赂的名单的时程上不是很同步因为他不是一个 [01:02:46] 不是全国一个系统所以他还需要各个学校去串资料 [01:02:51] 所以大家要等一下这样子 [01:02:52] 如果 [01:02:54] 如果你已经可以 [01:02:57] 看到这个slide理论上你应该知道我的课程网页 [01:03:01] 课程github那个网页 [01:03:03] github网页上面也有直播的连结你也可以从那边上去这样子 [01:03:10] 期末考内容大概形式就刚才提过就是一个实体的考试的形式 [01:03:16] 那至于要考什么我现在也还没有很具体的想法这样子 [01:03:21] ntu库不是台大的校外没办法申请 [01:03:24] 应该有他应该有每个学校贿赂账号 [01:03:28] 大家应该 [01:03:30] 应该都知道了应该他会 [01:03:33] 开通这样子而且会 [01:03:35] 对 [01:03:36] 从ntu库那边我可以看到说他会他会寄一个通知信然后一个确认 [01:03:41] 所以我现在可以看到有多少学生 [01:03:43] 其实还没有连上ntu库这样子 [01:03:47] 所以 [01:03:48] 你可以可能可以确认一下加签应该可以因为 [01:03:52] 根据经验还是会有些学生 [01:03:54] 退选所以人数上我们应该 [01:03:57] 可以控制在以前这个范围这样子 [01:04:00] 期末考会需要手写code吗 [01:04:02] 应该 [01:04:06] 我要思考一下 [01:04:10] 有些东西讲出去就不能改了 [01:04:14] 可能会有一点点 [01:04:17] high level的东西anyway [01:04:18] 但是不会叫你要写出一个没有bug的code这样子 [01:04:22] 不是没有bug是语法要写得非常精确的 [01:04:28] 这个 [01:04:30] 我再思考一下但是不会叫你 [01:04:33] 把transformer [01:04:35] 用c写出来 [01:04:40] 手写 [01:04:41] 会是层次吗 [01:04:42] 就我觉得应该比较high level就是比较 [01:04:46] 比较 [01:04:47] 概念型的东西居多 [01:04:50] 居多不会叫你因为毕竟是crossbook [01:04:54] 我们不太需要让大家去记这些东西我觉得没有意义这样子但是我会 [01:04:58] 希望知道你脑袋的东西 [01:05:00] 有没有 [01:05:01] 学到这样子 [01:05:02] 该学到放在你脑袋的东西到底有没有这样子 [01:05:06] 好 [01:05:09] 应该是这样啦那 [01:05:13] 基本上我是不太会想说像有一些老师会说上课回答问题抢答然后有 [01:05:20] 有什么奖品这样子好像小朋友 [01:05:23] 给糖果这样子 [01:05:24] 但是有时候好像是一个不错的方法增加互动性 [01:05:27] 尤其是 [01:05:28] 鼓励学生 [01:05:29] 实体来或是线上参加这样子 [01:05:31] 我觉得是不错啦 [01:05:33] 不然学生都是回去宿舍晚上 [01:05:36] 躺在那边 [01:05:37] 开影片三倍速播放这样子 [01:05:39] 互动性比较低所以也许会有一些 [01:05:42] 线上 [01:05:43] 实体的时候online我会有一些 [01:05:46] QA [01:05:47] 或者是投票会增加一些参与那但我们会从里面 [01:05:52] 有一些奖励之类的不好意思要做一些比较熟悉的事情 [01:05:58] 好这大概是课程的介绍 [01:06:01] 有没有问题 [01:06:03] 可以啊 [01:06:06] 你是帮人家问的吗 [01:06:09] 刚才我有回答 [01:06:12] 这门课看起来太容易对没错 [01:06:17] 这谁写的 [01:06:20] 说真的我有点挣扎 [01:06:21] 因为 [01:06:23] 因为第一年分数给太高了 [01:06:25] 但是不给高 [01:06:27] 因为 [01:06:28] 第一个台卡是一个很diverse的学生进来 [01:06:31] 不要说不同学校有不同科系的人进来 [01:06:35] 所以 [01:06:35] 他修课的程度虽然我们一定 [01:06:39] 有告诉同学说这个requirement你应该要会写Python会 [01:06:43] 跑过基本的基础学习的东西但是 [01:06:45] 有一些时候就 [01:06:47] 接不太起来这样 [01:06:49] 所以我们作业 [01:06:50] 难度我觉得不高 [01:06:53] 那不过 [01:06:54] 冲着你这句话我们 [01:06:56] 把难度 [01:06:57] 加深一点这样子 [01:06:58] 但是对我来讲其实没有 [01:07:01] 没有太大意义了就是有鉴别性就好 [01:07:04] 我就是鉴别 [01:07:05] 大家的努力程度可以鉴别出来就好 [01:07:10] 当然不要说大家都 [01:07:12] 作业都满分这样子 [01:07:15] 还有没有其他问题 [01:07:18] 有问题都可以在slide上问因为他是匿名的 [01:07:21] 当然你也可以说我要 [01:07:22] 具名这样也可以 [01:07:23] 但是你可以匿名这样子 [01:07:25] 你不用去dcard上 [01:07:27] 说一些 [01:07:28] 其他的话这样 [01:07:29] 你在上面就可以问我问题这样 [01:07:31] 有没有其他问题 [01:07:36] 没有问题我们就先休息10分钟 [01:07:40] 然后最后等一下我会再上一节课的部分把一些引求答询再带一点 [01:07:45] 休息时间如果有要加签或是Xclass要签的人你要实体签 [01:07:51] 可以给我签这样子 [01:07:53] 我们先休息 [01:08:07] 好那我们就继续上了因为就我大概会再上一个小时的范围 [01:09:19] 再回答一下刚才有人在slide上问的问题就是 [01:09:23] 主要处理中英文的语言吗 [01:09:26] 那会不会有其他语言 [01:09:27] 其实 [01:09:28] 我们不会 [01:09:30] dedicate说处理哪一种language特别的问题啊 [01:09:33] 基本上 [01:09:34] 尤其是现在LN [01:09:35] 他其实也是marty lingo这样子 [01:09:38] 只是说如果你是一个 [01:09:40] 一个比较 [01:09:41] 稀少资源的 [01:09:42] 我们说low resource language的话的确有时候 [01:09:45] LN他的理解度没那么好 [01:09:47] 那会有不同的 [01:09:49] 做法不同的 [01:09:50] 思考方式但是我们 [01:09:52] 不太会去 [01:09:53] 去 [01:09:54] 提到那些啦 [01:09:55] 不太会提到那些 [01:09:57] 没训练过模型也可以修得过吗 [01:10:03] 这句话 [01:10:05] 我很难回答因为 [01:10:07] 有训练过模型的也不见得修得过的 [01:10:10] 就是说因为现在训练模型很容易嘛你只要 [01:10:14] 这个XY给他然后FIT就结束就可以 [01:10:17] 就说你有 [01:10:18] 你有训练过模型的这样子 [01:10:20] 但是你可能要了解NN的 [01:10:23] 的架构或什么 [01:10:25] 就是 [01:10:26] 那个门槛不会在于有没有训练过 [01:10:31] 那 [01:10:32] 我只能说 [01:10:35] 看人 [01:10:37] 会不会点名 [01:10:38] 不会但是我们希望会有一些课堂的 [01:10:41] 参与的bonus就是实体在进行的时候会有一些 [01:10:46] 会有一些那个 [01:10:48] 回馈啊干嘛的 [01:10:52] 会有考古题当然没有啊因为之前都没有考试这样子 [01:10:56] 那 [01:10:57] 是可以写sudo code吗对 [01:11:00] 如果有的话啦如果有的话这样子 [01:11:04] 我有没有office hour [01:11:07] 我会把它写上去啦会把它写上去 [01:11:10] 那 [01:11:11] 不会如果如果要问问题其实用email或是在SIDEL上问很方便这样子 [01:11:19] 那 [01:11:22] 对 [01:11:24] 大学生修这门课会答应吗不会 [01:11:27] 不会 [01:11:29] 之前也有 [01:11:30] 甚至有大二的都修了这样子 [01:11:33] 那有些助教代替回来我就不一一回复了 [01:11:37] 那 [01:11:40] 对刚刚有人 [01:11:42] 这个我再看一下 [01:11:45] 对他说可以稍微难一点想学东西这样子 [01:11:48] 好 [01:11:49] 我会 [01:11:50] 尽力 [01:11:52] 对 [01:11:53] 好啦老实说这个这边这些东西 [01:11:57] 已经蛮open的 [01:11:58] 基本上 [01:12:00] 是可以设取的范围 [01:12:02] 所以他 [01:12:04] 老实说也也不容易啦 [01:12:06] 因为对我来讲我也一直在学习 [01:12:08] 这个投影片位也要一直update所以 [01:12:10] 也是蛮辛苦的这样子 [01:12:12] 所以 [01:12:13] 想学东西当然很好对我们一起来学这样 [01:12:17] 好大概是这样了反正有问题就尽量问 [01:12:21] 包含课堂上的东西或是 [01:12:25] 讲的东西或是有一些 [01:12:27] 行政上的东西也都可以问这样子喔 [01:12:30] 好 [01:12:36] 拜托 [01:12:38] 好啦这个 [01:12:40] Do your best [01:12:44] 不要在slide上哈拉啦 [01:12:46] 那个 [01:12:47] 这个要filter有点辛苦这样子 [01:12:50] OK [01:12:51] 好啦我们就 [01:12:53] 把他拉到一个 [01:12:55] 一个标准这样研究所课程的标准 [01:13:06] 好 [01:13:07] 这个投影片在 [01:13:09] 在NTU库或者是说在GitHub上都有 [01:13:13] PDF档可以下载这样子 [01:13:15] 那我 [01:13:16] 大家上去看可能可以看到一些 [01:13:18] 旧的就是去年的但是我可能都会 [01:13:21] 陆续的有一些 [01:13:22] 小小的更动这样子 [01:13:24] 好 [01:13:25] 那 [01:13:26] 这个从刚才提到这些历史啊 [01:13:28] 大家可以想像从这边过后基本上所有的起手式都是 [01:13:34] 都是model了都已经是 [01:13:36] 而且尤其是 [01:13:37] 直接从Transformer [01:13:38] 开始下手了这样子所以 [01:13:41] 你可以想像这件事情 [01:13:43] 好像是 [01:13:45] 必要的 [01:13:46] 所以以前在一些场合啊有些 [01:13:49] 老师也问我说那你现在NLP课程怎么教 [01:13:52] 我说我就把以前NLP的要教的东西 [01:13:56] 在 [01:13:57] 前面 [01:13:58] 两周上完 [01:14:00] 可能多一点三周两周半上完这样子 [01:14:03] 然后后面的就全部都是 [01:14:05] Pretrained Language Model的东西这样子 [01:14:08] 是有一点 [01:14:09] 怪啦就是说如果有些人想学一些语言学的东西 [01:14:13] 却没有在这边cover到这样子 [01:14:15] 但是你会发现现在做NLP一定 [01:14:18] 标准起手式一定是从 [01:14:20] Pretrained Language Model下手这样子 [01:14:23] 当然这边如果你还没有修过AI或是Deep Learning的时候 [01:14:27] 你可能会不太知道 [01:14:29] 这些图表的意思啊基本上 [01:14:31] 它就是一个Transformer Bash然后透过一个Pretraining的部分 [01:14:36] 训练出来然后再 [01:14:37] 你要 [01:14:38] 做你的微调的东西这个我们之后会再带一下会讲这部分啊 [01:14:43] 只是 [01:14:44] 再用这个图告诉你说现在大家看的东西 [01:14:48] 就是从Pretrained Language Model下手 [01:14:51] 当然这里面有一些 [01:14:53] 机器学习的基础没错所以 [01:14:56] 你虽然知道Pretrained Language Model但是你不太知道说这个就是以前在做 [01:15:01] Machine Learning的时候提到的Transformer Learning [01:15:04] 就是做转移学习 [01:15:06] 所以转移学习就是 [01:15:08] 你会觉得好像现在Pretrained Language Model好像很 [01:15:11] 直觉嘛就是哪有 [01:15:13] LM然后Fintune一下他就可以做我的问题 [01:15:15] 或是说LM本来就可以做很多事情 [01:15:18] 但是如果你以前从一个简单的 [01:15:21] 小颗的NN Transform Scratch说我要做一个空气污染 [01:15:27] 预测的模型 [01:15:29] 那是参数都是空的然后 [01:15:31] 做监督室学习学习完之后这个模型的确会 [01:15:35] 回答你Yes No [01:15:36] 你给他一些参数他会回答Yes No这边有没有空污这样或是说 [01:15:40] 他可以告诉你空污的指数多少 [01:15:42] 你可以做出 [01:15:42] 这样的事情 [01:15:44] 你只要有监督室的 [01:15:46] 资料就可以做这件事情 [01:15:48] 但是你会发现你的模型做出来 [01:15:49] 只能回答空污啊 [01:15:51] 他也没办法回答说那对健康有没有影响 [01:15:55] 你就要拿另外的资料再去劝 [01:15:58] 那这个当然就是一般以前在做机器学习的 [01:16:02] 基本的做法就是会遇到这样所以 [01:16:04] 有很多的方式包含 [01:16:06] Transformer Learning当然这个 [01:16:08] 可能会在机器学习课程 [01:16:10] 比较后面会谈到的 [01:16:12] 就是说 [01:16:14] 举个例子你就知道就是叫一个学生 [01:16:18] 去拿一本英文字典读一读 [01:16:20] 然后读完之后他就会发文了这样 [01:16:22] 这个就是Transformer Learning的精神 [01:16:24] 就是 [01:16:24] 你学会一件事情你就可以比照 [01:16:28] 你当初的这个 [01:16:30] 资料所学到的东西比照办理去 [01:16:33] 去解决另外一个问题 [01:16:35] 他这个问题是你没有Training Data或者是说 [01:16:38] 你没有Supervised Training Data [01:16:40] 这个在当初在Transformer Learning [01:16:42] 可以讲到这些 [01:16:43] 当然Transformer Learning其实也是一个大的东西 [01:16:46] 它里面可以分很多很细 [01:16:48] 有没有资料跟没有资料的这样子 [01:16:51] 所以 [01:16:53] 这个如果你有点 [01:16:55] 机器学习基础是可以比较了解的 [01:16:57] 不过Anyway [01:16:59] 这个 [01:17:00] 大型语言模型基本上它就是透过一个预训练 [01:17:04] 预训练完预训练只是看懂文章啊 [01:17:06] 但是他为什么可以做QA [01:17:08] 可以帮我写报告 [01:17:10] 他可能需要一点微调啊这文章是什么文章啊 [01:17:11] 他可能需要一点微调啊这文章是什么文章啊 [01:17:12] 微调的东西就是把原案的模型呢 [01:17:14] 校正一下到我的Domain去解决我的问题 [01:17:18] 这是Transformer Learning的概念 [01:17:20] 不过这个我们会再提 [01:17:23] 那这边秀一下这个LM的发展图 [01:17:26] 这个这张图有点旧了 [01:17:28] 不过大家有兴趣可以去这个网站上看 [01:17:31] 他其实 [01:17:32] 讲了蛮多的东西 [01:17:34] 而且这张图还在他的Github上 [01:17:37] 所以他好像也没有继续update [01:17:39] 但是他的资料是有一直update啦 [01:17:41] 但是他的资料是有一直update啦 [01:17:42] 那这个 [01:17:43] 中国大陆的模型也是旧的 [01:17:45] 现在有更多的 [01:17:47] 现在这个 [01:17:49] 这个Kimi的东西蛮强的 [01:17:51] 这是台湾 [01:17:52] 台湾当然没有基础从自己Transformer Scratch的 [01:17:55] PLM [01:17:56] 但是有Based on这些 [01:17:59] Open Model做的 [01:18:00] 像Tide或者是Breeze [01:18:02] 或是 [01:18:02] 这个 [01:18:03] 白龙 [01:18:05] 不过 [01:18:05] 其实 [01:18:07] 都不太容易啊 [01:18:08] 老实说我们就等于跟着这些Open Model跑啊 [01:18:11] 我们只能做 [01:18:12] 我们的在地资料的微调 [01:18:14] 或在地资料的CP [01:18:15] 我觉得会比较辛苦 [01:18:17] 当然这个 [01:18:19] 当初是觉得我们 [01:18:22] 以台湾的Resource不太可能自己做一个PLM [01:18:26] 但是我觉得这件事情可能慢慢的可行 [01:18:30] 因为 [01:18:31] 现在的 [01:18:32] 现在的运算成本 [01:18:34] 比较低一点 [01:18:35] 当然还是很大 [01:18:36] 但是另外一个问题是 [01:18:39] 资料量 [01:18:40] 资料的问题这样子 [01:18:42] 不过 [01:18:43] 另外一个还有一个问题就是说 [01:18:45] 我们能不能像 [01:18:47] 中国大陆一样用 [01:18:49] 针灸的方式来做这件事情 [01:18:51] 这个就是另外一个故事 [01:18:56] 网路上有很多这样资料 [01:18:58] 多摆一张这样的图 [01:19:00] 就是 [01:19:01] 一个Family Tree [01:19:03] 就是 [01:19:04] 你看到都是Transformer长出来的这样子 [01:19:08] 当然如果你自己有研究过一些模型 [01:19:11] 你就知道说Transformer也不是唯一的选择了 [01:19:13] 其实有什么 [01:19:15] 比较著名的 [01:19:17] 像Mamba这样的东西 [01:19:18] 但是 [01:19:19] 就是没有办法成为 [01:19:21] One of [01:19:22] 的 [01:19:23] 选项这样子 [01:19:25] 所以是基本上还是Transformer [01:19:27] 所以现在 [01:19:28] 几乎所有的 [01:19:29] 硬体加速 [01:19:30] 都是Based on Transformer [01:19:32] 在 [01:19:33] 做特别设计这样子 [01:19:35] 那你可以 [01:19:36] 你可以去 [01:19:36] 你可以去这个网站这其实是可以动的 [01:19:39] 这个图是可以动可以拉的 [01:19:40] 而且 [01:19:41] 点下去它可以告诉你那个模型的一些详细资料之类的 [01:19:43] 这样子 [01:19:45] 不过看起来 [01:19:48] 也没有很新 [01:19:49] 因为最新的也都没在上面这样 [01:19:52] 那你就知道说这些 [01:19:54] 这些初步玩 [01:19:55] 大概每一个Quarter [01:19:57] 都有一个新的Model会说他们是最强的这样子 [01:20:01] 当然对我们来讲 [01:20:02] 我们要考量的不是他的能力因为现在这些能力其实已经 [01:20:07] 不会差太多了就是以你解决你的问题来讲 [01:20:11] 他们都足够只是说 [01:20:13] 他的大小啊 [01:20:15] 他的这个 [01:20:16] 这个Token的CP值是多少 [01:20:19] 你大概反而会考量这些东西这样子 [01:20:24] 好 [01:20:25] 那接下来秀一下毕竟我们还是NLP的课我来想一下说 [01:20:30] 以前没有大圆模型的时候 [01:20:32] 这些 [01:20:33] 这些NLP的人都在干什么事啊 [01:20:37] 那 [01:20:38] 以前的做法 [01:20:39] 你一定要先有语料 [01:20:42] 包括说我要做医院的问题 [01:20:44] 我一定要跟医院谈说你有没有 [01:20:46] 这个医嘱啊 [01:20:47] 有没有病历资料啊 [01:20:49] 我一定要有这些资料因为没有一个 [01:20:51] 没有一个 [01:20:52] 像现在的大圆 [01:20:54] Pretrained Language Model一样 [01:20:56] 他已经有一些common的knowledge在里面 [01:20:59] 我一定从空的开始做 [01:21:01] 从空的开始做我就一定要 [01:21:04] Domain的 [01:21:05] 知识 [01:21:05] 我就一定要有一些Collection [01:21:07] 那这Collection呢 [01:21:08] 包含annotation [01:21:10] 这些都是非常昂贵的 [01:21:11] 就是都是要人进去的 [01:21:13] 只要有人进去 [01:21:14] 都是贵 [01:21:15] 虽然你说老师没有那个他们说 [01:21:19] 做VLA [01:21:20] 都是 [01:21:21] 去非洲 [01:21:22] 叫他们带一个 [01:21:24] 这个 [01:21:24] 那个 [01:21:25] 那个 [01:21:26] 那个 [01:21:27] 眼部的camera [01:21:28] 然后就叫他们不断在那边折衣服这样 [01:21:30] 然后就有一大堆折衣服的影片这样 [01:21:33] 的确有一些Training Data都是来自于这种 [01:21:37] 这种国家啦 [01:21:39] 所以以前我们说这是血汗模型 [01:21:42] 这个 [01:21:43] 以前一部电影叫 [01:21:44] 血钻石嘛 [01:21:45] 他们都叫这个 [01:21:46] 这个血模型 [01:21:47] 因为就是 [01:21:49] 但是后来 [01:21:50] 后来去看一看他们其实没有这些 [01:21:53] 这些去非洲做这样的工作的 [01:21:55] 的人其实在那边 [01:21:57] 过得蛮舒服的 [01:21:57] 因为你要做这件事情在冷气房 [01:22:00] 然后又做这些非劳力的动作 [01:22:02] 只是 [01:22:03] 操作一下电脑做一些动作而已 [01:22:04] 其实对他们来讲是个不错的工作 [01:22:07] 当然我不是在贬逼他们 [01:22:09] 而是说这件事情 [01:22:11] 的确是需要大量人力 [01:22:12] 尤其是现在在做Action model [01:22:14] 做这种机器人的东西 [01:22:16] 像有一条训练的方式就是要靠不断的 [01:22:20] 产生人类这个Action的影片让他去学习 [01:22:24] 当然以文字来讲也同样有 [01:22:26] 需要很多annotation [01:22:28] 那 [01:22:29] 这些 [01:22:31] 我们拿到的东西我一定要全处理不然就是一堆垃圾不然就是一堆 [01:22:36] 也不知道在写什么东西所以我们要做 [01:22:38] Segmentation 断字处理Stop War [01:22:41] 然后呢做Passing Tree做Stemming [01:22:43] 这英文有时候去 [01:22:44] 需要磁性的处理 [01:22:46] 需要做这些东西甚至再往前一步 [01:22:49] 我需要知道说 [01:22:50] 这个里面的Entity到底是什么 [01:22:53] 这个关系到底是什么 [01:22:55] 这一句话到底取什么 [01:22:57] 为什么要做这些事情呢 [01:22:58] 因为你整句话未给模型他看不懂 [01:23:01] 你一定要事先帮他截取出来这样子 [01:23:05] 那如果以你们现在有做过一点 [01:23:08] 大型元模型就觉得 [01:23:10] 以前人为什么这么 [01:23:12] 做这么多 [01:23:13] 多余的事情 [01:23:14] 为什么要做这么多余的事情 [01:23:19] 整篇文章喂给人 [01:23:21] 他就可以知道这个 [01:23:23] 某个Entity叫什么 [01:23:25] 这样子 [01:23:26] 所以 [01:23:27] 这是大家Based on这个巨人肩膀上可以做很多事但是以前没有这个巨人的时候我们都要自己 [01:23:33] 做这些事情 [01:23:35] 不然你喂进去电脑是完全不懂你的东西 [01:23:39] 接下来就要去 [01:23:40] 表示这个文字 [01:23:42] 你可能就要把它 [01:23:44] 向量化 [01:23:45] 那以前最简单的One-Half Vector [01:23:47] 或是说你算一点权重的 [01:23:49] 这打错了 [01:23:50] TFIDF [01:23:54] 那或者是 [01:23:56] 把它直接有一个已经Change好的Base的东西把它转换成一个Vector [01:24:00] Water Vector的东西 [01:24:02] 或者是说你有没有把它转换成更复杂一点 [01:24:06] 语义的Semantic Label的东西 [01:24:10] 这些都是 [01:24:12] 其实老实说在 [01:24:14] 在BERT还没出来之前这些都还是一个 [01:24:17] 很大的研究重点 [01:24:20] 那当然你要怎么建Domain Knowledge [01:24:23] 这个不是说叫人来标注一下就好 [01:24:26] 你这些知识怎么让 [01:24:28] 怎么让电脑去Access [01:24:29] 你是要建 [01:24:30] 建出一个结构 [01:24:32] 所以就会所谓的知识图谱 [01:24:34] 就会一个Tree一个Graph的结构怎么去Access怎么让 [01:24:39] 人只要输入 [01:24:41] 这个 [01:24:42] 实比资料他可以自动 [01:24:44] 想出实物比的Knowledge [01:24:46] 这边就有很多的这样的Extension [01:24:48] 会在做 [01:24:49] 所以你可以想像这个 [01:24:51] 好像 [01:24:52] 去博物馆看到以前这些原始人在 [01:24:55] 操作这些器具然后留下一些工具这种感觉 [01:25:00] 但是呢 [01:25:02] 有些方法 [01:25:03] 跟有些东西其实你们现在在做一些大语言模型分析的过程中 [01:25:10] 也会用到 [01:25:12] 或者说你要做一些 [01:25:14] 你要做一些Baseline的比较 [01:25:16] 比如说 [01:25:17] TFIDF [01:25:19] 这个真的很重要 [01:25:20] 因为他很简单没错但是他是一个 [01:25:23] 非常万用的Baseline [01:25:25] 也是一个非常Strong的Baseline [01:25:28] 就搞不好用TFIDF比你在那边 [01:25:30] 转换什么Dense Vector在那边算老半天都还好这样子 [01:25:37] 那 [01:25:38] 有LM之后大家想像说那我就可以用这些模型啊 [01:25:42] 然后呢 [01:25:43] 自己在Fintune我这边画两个东西就是这是一个大语言模型这是你自己的下游模型 [01:25:49] 然后你把它串起来这样子以后我们就会教你怎么用Bird然后自己再做一个下游模型 [01:25:53] 做这件事情 [01:25:54] 然后 [01:25:56] 你再透过你自己的资料 [01:25:58] 我这边的标 [01:25:59] 标注资料就是这样这是两个不同颜色就是 [01:26:02] Input跟Output这样子 [01:26:04] 就是你这是一个supervised的Data [01:26:07] 比如说QA [01:26:09] 我就会有原来的文章 [01:26:11] 跟问题就会有答案这样子 [01:26:12] 就是 [01:26:13] 你一定有Input跟Output你是一个supervised的Data [01:26:18] 所谓supervised的Data就是 [01:26:19] 我是在做问答系统 [01:26:21] 或是说我是做摘要的 [01:26:23] 我一定有原来的文章跟摘要出来的文章 [01:26:27] 我一定要这些东西 [01:26:29] 然后才能去Fintune我自己小颗的模型 [01:26:31] 然后我可以利用Bird或是更大的模型 [01:26:34] 来做我这件事情 [01:26:37] 这个做法大概是在 [01:26:41] Bird大概2019 [01:26:43] 2020年之后 [01:26:44] 的 [01:26:45] 一大票大概90%的 [01:26:48] 大概 [01:26:51] 这个六七十的 [01:26:52] Bird的 [01:26:54] NLP的研究 [01:26:55] 就是follow这个路径 [01:26:57] 因为发现Bird进来之后可以把原来的效果翻上一番这样子 [01:27:02] 所以就会做这样的事情 [01:27:04] 重点就会在你怎么去微调这个模型这个模型要怎么设计 [01:27:07] 才能搭配原来的Bird Transform能够 [01:27:10] 做出 [01:27:11] 更好的摘要模型 [01:27:13] 更好的QA这样子 [01:27:15] 当然以你们现在角度来看这个东西又好像是去博物馆看到这些原始人留下这些工具一样 [01:27:21] 以前人家做这样的事 [01:27:23] 就是为什么要钻木取火为什么不在瓦斯路上直接按个开关火就出来了这样子 [01:27:29] 你们的感觉就会像这个样子 [01:27:31] 但是现在其实这个 [01:27:32] 这样的一个flow [01:27:33] 还是会 [01:27:34] 还是在特定的领域会做 [01:27:38] 但现在可能大家会这样反正也能够强了 [01:27:41] 我就不用做这样一件事 [01:27:43] 我就不用劝了 [01:27:44] 我就用原来的PROM [01:27:45] 原来的PLM来做 [01:27:48] 然后我直接把他PROM [01:27:49] 就这样 [01:27:50] 请帮我摘要今天的 [01:27:53] 老师上课的重点 [01:27:54] 然后 [01:27:56] 这个只要PROM写好把今天投影片喂进去他就会告诉你 [01:28:00] 一页的摘要这样子 [01:28:01] 就本来的这些 [01:28:03] 这一颗 [01:28:04] 就能做这些事情 [01:28:07] 而不用再去微调 [01:28:09] 做这些事情 [01:28:11] 但是你想说哇这个 [01:28:12] 这一颗这么万人这样他当初怎么训练 [01:28:15] 那 [01:28:16] 我们这堂课就会告诉你说当初在做这个Pretrain [01:28:20] 或是在做最后他Pretrain完之后 [01:28:22] 做一些 [01:28:23] Instruction Fine Tuning的时候 [01:28:25] 怎么会做好这件事情 [01:28:27] 为什么 [01:28:28] 好像万用一样 [01:28:29] 就是 [01:28:31] 给他不同任务他就可以回答出不同问题 [01:28:35] 是不是当初他有一大堆的Torago的这些监督师资料帮他劝 [01:28:41] 某种程度上 [01:28:42] 是有一点点但是不全然对这样子 [01:28:45] 就是他是透过 [01:28:47] 透过 [01:28:48] 当初他对文献的理解跟 [01:28:51] 透过Instruction Fine Tuning的时候 [01:28:53] 他可以理解说原来你现在要做摘要 [01:28:55] 所以我要去看以前的东西做什么样的 [01:28:58] 输出这样子 [01:28:59] 他并不见得有 [01:29:01] 完整的摘要的supervised data [01:29:04] 好不过anyway这个这个其实就会有一些问题就是包括所谓的input [01:29:09] 就是你所谓的context [01:29:11] 你位给他的这个 [01:29:13] 长度是多少 [01:29:15] 所以你会发现现在的模型的readable看出来 [01:29:18] 他会有个column [01:29:20] 在描述说这个模型的context有多宽 [01:29:24] 他可以处理多大的 [01:29:25] 的内容 [01:29:26] 当然有些模型很大 [01:29:29] 但是有些模型可能没那么大但是他其实比较厉害 [01:29:32] 这不见得因为他可能本来的 [01:29:35] 里面的 [01:29:36] 这种 [01:29:37] 我们叫 [01:29:38] Positional embedding的 [01:29:40] 处理方式不同 [01:29:41] 或是说他特别有处理所谓的 [01:29:44] 位置的这种lost in the middle的问题啊这个我们之后可能会提到 [01:29:49] 就是模型在看 [01:29:51] 文章 [01:29:52] 这么长的时候 [01:29:53] 他不是equal weight [01:29:55] 他不是equal weight就是 [01:29:57] 你一开始给他的东西跟最后提到的东西对他讲可能选中比较重要 [01:30:02] 中间的东西他就不见了 [01:30:04] 中间的东西他觉得算了看看就好 [01:30:07] 就像各位同学在上课一样 [01:30:09] 一进来教室觉得 [01:30:10] 诶这个 [01:30:11] 听听看老师啊后来就体力不支睡着 [01:30:14] 然后一直到快下课的时候诶感觉要吃饭 [01:30:16] 精神又来了这样子 [01:30:18] 所以你只有在头跟尾的时候 [01:30:20] 对老师讲的东西比较清楚 [01:30:22] 中间的东西都忘记了这样子 [01:30:24] 这个就是模型的 [01:30:26] Lost in the middle的问题 [01:30:27] 这个问题现在其实 [01:30:29] 有被解决一些但是其实还是有 [01:30:31] 还是有还是有一些研究在探讨说 [01:30:34] 他为什么对中间的东西 [01:30:36] 这么不sensitive这样子 [01:30:38] 好不过anyway [01:30:39] 这个只是另外一种做法就是完全不fine tune完全就只是靠prime或是in context learning的部分 [01:30:45] 直接 [01:30:46] 做我要的任务的问题 [01:30:49] 那或者说诶这个 [01:30:50] 当然就是说 [01:30:51] 哦原来 [01:30:52] 这只是one of我们好像都 [01:30:54] 都是这样做然后把它包成A群然后做什么事情 [01:30:57] 没有 [01:30:58] 这个是演变下来 [01:31:00] 模型的能力变强之后他就变成这样做这样子 [01:31:05] 好啊 [01:31:06] 这本来是摆在前面啦不过我通常show这个目的是 [01:31:09] 就是说 [01:31:10] 我没有要讲这些这样子 [01:31:12] 因为NLP以前的课程会讲这些东西 [01:31:15] 我会讲 [01:31:17] 文字结构 [01:31:18] 词性 [01:31:19] 然后呢 [01:31:20] 做 [01:31:21] 做这种语法的分析啦 [01:31:24] 然后去理解跟情感分析 [01:31:26] 所以前面一二呢我们现在其实 [01:31:29] 不太带了因为基本上 [01:31:33] 讲的你们也不用 [01:31:34] 对虽然他还是很有用 [01:31:37] 还是很有用 [01:31:38] 这个 [01:31:40] 这个经验我有口试过一个学生 [01:31:42] 他里面LM里面的参数或是input里面有用到 [01:31:47] POS tagging的东西 [01:31:48] 对我眼睛为之一亮 [01:31:50] 这个 [01:31:52] 这个学生 [01:31:54] 不一样 [01:31:55] 然后发现有用 [01:31:57] 这个东西有用这样子 [01:31:59] 就是其实你会发现如果你只是告诉 [01:32:03] LM [01:32:04] 文章的东西 [01:32:06] 然后就要回答 [01:32:07] 这个就是大家的做法 [01:32:08] 如果你 [01:32:09] 想要知道 [01:32:10] 你要告诉他说我现在比较重视什么 [01:32:13] 你就会多放一些东西在你的prong里面 [01:32:16] 但这prong可能是自动生成或是让他学来的东西 [01:32:20] anyway [01:32:21] 但这东西如果是多一点句子里面的特性包含说我的结构 [01:32:26] 或是词性 [01:32:27] 可能LM就会觉得好原来你在意这些 [01:32:30] 那我就 [01:32:32] 我就会 [01:32:32] focus [01:32:33] 更多一点在这个 [01:32:35] 那就看你的应用有些时候 [01:32:37] 这样的效果就会好很多 [01:32:39] 所以变化在个人因为工具就在那里 [01:32:45] 那这比较像是我们会讲到的Transformer跟 [01:32:48] 我会从RN开始 [01:32:50] 应该是 [01:32:52] Transformer应该在这后面 [01:32:53] 从RN跟LSTM开始 [01:32:55] 虽然这个 [01:32:56] 这已经非常老了这个在Deep Learning以前就有的NN的Model这样子 [01:33:00] 但是 [01:33:01] 他其实非常重要 [01:33:03] 尤其是 [01:33:04] 你可以从RN跟LSTM去了解 [01:33:07] 这种Sequential的 [01:33:09] Data进去怎么去Train的过程这样子 [01:33:13] 然后 [01:33:14] Sequence to sequence Model其实 [01:33:16] 非常重要但是 [01:33:18] Google提出这个之后 [01:33:20] 后来因为 [01:33:21] 太多有名的东西出来之后大家就忘了它的重要性但其他 [01:33:25] 我觉得他是比较 [01:33:26] 奠定现在 [01:33:28] 现在这种 [01:33:32] 这种Large Language Model使用的 [01:33:35] 生态的一种 [01:33:36] 的做法的一种 [01:33:38] 创始者 [01:33:39] 就是给你一段序列你要output一段序列 [01:33:43] 而且是 [01:33:44] 任何的配对这样子 [01:33:47] OK [01:33:48] 那当然讲完这些Transformer之后从Bird打完之后我们就会带到它延伸的 [01:33:54] 但是我不会讲到细部的 [01:33:56] 其实 [01:33:57] 有一个网站 [01:33:58] 蛮有趣的 [01:33:59] 他就讲到所有尤其是很新的模型 [01:34:03] 他会给你一个架构图 [01:34:05] 每一个模型的架构图 [01:34:06] 当然是Open Model的 [01:34:08] 他就会更新的模型 [01:34:09] 告诉你这个模型做什么 [01:34:11] 他的 [01:34:13] 他的什么 [01:34:14] Positional Embedding是用什么 [01:34:16] 然后他是有做额外的Filter [01:34:19] 这个我再把连接摆上 [01:34:21] 我觉得这个蛮有趣 [01:34:23] 那当然会讲一下这个如果你想做一些Fintune [01:34:27] 或是想做一些CP就是 [01:34:29] 继续continuous pretraining的时候 [01:34:32] 大概 [01:34:33] 怎么样情况可以适合做或是 [01:34:36] 你做得动这样子 [01:34:37] 当然会提一下Lora [01:34:39] 像这种PFT的方式 [01:34:42] 但是这个其实也都需要资源 [01:34:44] 所以 [01:34:45] 以前本来希望有一些Lora的 [01:34:47] Homework [01:34:49] 但是后来发现 [01:34:52] 需要一点Resource [01:34:53] 就是比较不容易设计 [01:34:55] 那或是Income但是这个可能就会牵扯到 [01:35:02] 不会教你做Prong但是可能会带你说现在大家重视像Reasoning [01:35:07] 或是Test Time Scaling的想法 [01:35:09] 他们怎么去 [01:35:11] 不再 [01:35:12] 调整模型的情况下让模型变厉害 [01:35:15] 的概念这样子 [01:35:18] 好 [01:35:19] 这个就介绍我们 [01:35:20] 上一节课讲的部分 [01:35:23] 好 [01:35:24] 那我们Sleepless大概就带到这边了那这个这个投影片其实都在这两个网站 [01:35:30] 那 [01:35:31] 这个大家可以去assets [01:35:36] 有没有问题 [01:35:39] 好 [01:35:41] 作业可以反复提交优化吗 [01:35:45] 应该是可以只要在截止之前 [01:35:48] 可以在截止之前 [01:35:50] 我们应该 [01:35:51] 没有限制上传次数 [01:35:54] 我们的作业比较没有 [01:35:57] 不像有一些没有 [01:36:00] 没有标准单 [01:36:01] 然后就用Leaderboard去排这样子 [01:36:03] 所以 [01:36:03] 通常是 [01:36:05] 还好但的确也会有一些Performance的数据 [01:36:08] 那我们会有一个 [01:36:10] 可能会有一个 [01:36:11] 标准告诉你一定要做到多少以上这样子 [01:36:16] SLM [01:36:17] 你讲的是small language model吗 [01:36:20] 应该是不会 [01:36:21] 应该是不会 [01:36:22] 不会特别讲啦 [01:36:24] 不会特别讲 [01:36:28] 通常我们讲SLM的情况底下是希望说 [01:36:32] 探讨说怎么做出这个SLM [01:36:35] 或是说 [01:36:36] 怎么用一个比较笨的 [01:36:38] 模型来做 [01:36:40] 比较厉害的事情 [01:36:42] 大概这样但是我们这堂课目前是没有 [01:36:48] 这是同一位学生吗 [01:36:50] 难度要再拉高的话 [01:36:56] 怎么跳掉 [01:36:59] 所以应该是另外一位学生 [01:37:13] 好 [01:37:14] 我只能说这个同学加油 [01:37:19] 持交扣分我们会有一个那个penalty的一个list [01:37:23] 就几天 [01:37:24] 扣百分之多少 [01:37:26] 那 [01:37:28] 不会是直接零分啦但是我也不希望说你说 [01:37:32] 我已经扣到百分之百那我要不要交 [01:37:36] 那 [01:37:37] 其实我是希望 [01:37:38] 你都能够补交但是补交应该 [01:37:41] 最后会有一个基本的分数因为你 [01:37:43] 你不交就是没有分数但是我又不希望学生 [01:37:46] 一次没交后来就放弃这样子我觉得是很可惜 [01:37:50] 很可惜 [01:38:01] 摩克斯喔 [01:38:02] 摩克斯很可惜 [01:38:02] 摩克斯 [01:38:03] 是当初拿 [01:38:05] 这边的课程的前半 [01:38:07] 应该是前半然后 [01:38:09] 好像是比较简单的部分我记得是比较简单因为 [01:38:13] 我们摩克斯上面有做一些 [01:38:16] 课堂练习但是 [01:38:18] 我是觉得那边 [01:38:20] 有啊那个教材 [01:38:22] 是subset的样子我记得是subset [01:38:27] 我可以这个这个比较境界这个老实说我也不是很熟不过我可以去看看 [01:38:34] 的确我们现在有做所谓的watermarking的研究 [01:38:37] 就是说 [01:38:39] 尤其是我们要找 [01:38:41] 授权厂商要让他拿出资料 [01:38:44] 来让我们训练的时候他们说那我们的好处是什么 [01:38:48] 那我们训练完之后对手会不会拿去这个东西他们都很在意这些东西所以 [01:38:53] 会希望把 [01:38:54] training的data加上一些watermark [01:38:57] 影像的东西抓watermark [01:38:59] 反而比较直觉 [01:39:01] 文字的东西以前其实有做watermark [01:39:03] 就是说 [01:39:05] 我会加一些特殊的符号 [01:39:07] 就是这边不太可能会出现这个符号我这边出现这个字 [01:39:12] 其实在今年 [01:39:14] 去年 [01:39:16] ICML还是什么 [01:39:18] 那个会议呢因为他他觉得审稿的人都 [01:39:21] 都没有认真审都把paper [01:39:24] 丢给trekGPT然后叫他提供这个审稿意见然后就上传 [01:39:28] 所以他们就在 [01:39:30] 论文的内容上加上一些特殊的文件 [01:39:33] 但是实际上看不到的 [01:39:36] 但这些文字呢 [01:39:37] 模型的会识别 [01:39:40] 模型读到之后呢他在 [01:39:42] 做de-coding的时候呢他就会 [01:39:44] 对那些文字 [01:39:46] 特别敏感然后就会产生出一些 [01:39:49] 不太可能在一般review [01:39:51] 出现的文字 [01:39:52] 所以那次就抓到一堆就是使用 [01:39:55] AI审稿的 [01:39:57] 的人这样子 [01:39:59] 就是 [01:40:00] 好险没有被抓到这样子 [01:40:02] OK [01:40:04] 所以 [01:40:04] 处罚非常严重喔 [01:40:06] 你被抓到你的submission是被直接deskregent [01:40:12] 但我觉得现在大家还是会多少用AI模型去辅助啦 [01:40:16] 就毕竟 [01:40:18] 这么短时间内那个paper都做了非常多怎么可能去看出重点 [01:40:23] 其实 [01:40:23] 都会用AI辅助但是 [01:40:26] 的确我们都还是得消化一下到底 [01:40:28] AI的summary跟 [01:40:30] 他到底重点是什么 [01:40:31] 而不是直接把 [01:40:32] 这种东西 [01:40:33] 直接教他产生review然后上传这样子 [01:40:36] 所以他会有所谓的这个也 [01:40:37] 某种程度叫watermarking [01:40:40] 但现在的确有很多watermarking研究是说 [01:40:44] 他会让 [01:40:46] 因为如果你们劝过 [01:40:47] 劝过这些人或是 [01:40:49] 劝过language model知道说 [01:40:51] 我不见得每次都要选机率最高的吗 [01:40:54] 他就 [01:40:55] 他就有一个选项 [01:40:56] 是会有一个table [01:40:58] 或是一个机率的算法 [01:41:00] 他会去选择 [01:41:02] 他的分部内的 [01:41:03] 字 [01:41:04] 去让他说你这次就不要选这个字要选那个字 [01:41:08] 让他学完之后呢这个模型 [01:41:11] 做出来东西就 [01:41:12] 比较像A公司的资料会讲的话 [01:41:15] 所以以后如果这个模型被盗用了 [01:41:18] 他就说你这个 [01:41:21] 你这个模型的dispution [01:41:23] 是我用我公司的资料 [01:41:26] 劝出来的模型 [01:41:28] 但这件事情也不是100%在法律上站得住脚 [01:41:32] 因为毕竟 [01:41:33] 很多东西都可以mask [01:41:35] 但是的确 [01:41:36] 现在有很多的判例 [01:41:38] 不过很多的判例是 [01:41:40] 当你这公司赚钱的时候你就会被告 [01:41:42] 没有赚钱他也不再想理你这样子 [01:41:45] 就是他知道说你有拿他们的资料去Chain这样子 [01:41:51] 那 [01:41:52] watermarking [01:41:54] 可能也许可以补充一下因为 [01:41:56] 有一些在做Pretraining会用到这些东西 [01:42:00] 会做到Fintune [01:42:02] 然后后续的RIL设计 [01:42:04] 会提到啦但是不太会叫你们做RIL [01:42:07] 因为要叫你们做RIL [01:42:09] 如果只是讲RIL那也没什么好讲的话 [01:42:12] 画一张图就好了 [01:42:14] 如果要练习 [01:42:15] 那你们 [01:42:16] 没有资源可以Chain RIL这样子 [01:42:24] 研究上使用AI辅助的界限在哪里 [01:42:28] 这看个人的道德吧 [01:42:32] 说实在的 [01:42:34] 说实在的 [01:42:35] AI现在越来越强没错 [01:42:38] 但是 [01:42:39] 实际上你要做出有用的东西 [01:42:42] 不是靠简单的 [01:42:43] 一次性两次性的Prong就可以解决的 [01:42:47] 这个学校老师也没那么笨 [01:42:49] 你把这个结果给老师看老师一定会 [01:42:53] 问题很多这样子 [01:42:55] 但是你如果善用你如果跟他互动非常频繁而且你能够问出 [01:43:00] 问题的重点 [01:43:02] 我觉得他的确给你一些 [01:43:04] 方向或是意见 [01:43:05] 甚至告诉你一个 [01:43:07] 也许不是你Final solution的样子 [01:43:11] 但他的确是有帮助的 [01:43:14] 但这件事情的确有点 [01:43:18] 那个 [01:43:19] 说这到底 [01:43:20] 是AI做的还是你做的这样子 [01:43:23] 这个 [01:43:25] 有点 [01:43:25] 有点难界定 [01:43:27] 说真的有点难界定因为毕竟你是跟他互动 [01:43:30] 你是跟他 [01:43:31] 讨论 [01:43:32] 后的而且如果没有你的这些feedback [01:43:34] 他是做不出来的 [01:43:36] 所以 [01:43:37] 其实 [01:43:38] 其实上理论上你是有contribution的这样子 [01:43:42] 但是现在的确 [01:43:44] 你 [01:43:45] 不太会去标注说我百分之多少是AI协助的 [01:43:51] 对 [01:43:52] 如果以学习上或是 [01:43:54] 基本的研究上 [01:43:55] 我觉得 [01:43:57] 你不要只是把AI给你东西直接交上去就好了 [01:44:01] 我觉得你要消化要调整 [01:44:04] 我觉得 [01:44:04] 那样我觉得是还OK的这样子 [01:44:09] 考试比较偏理论还是计算 [01:44:13] 我觉得都不是吧 [01:44:16] 可能是比较深论啦就是回答一些概念的啦我不太可能叫你们算 [01:44:22] 但也许会有一题叫你们算一下 [01:44:25] TFIDF [01:44:26] 好像 [01:44:27] 不太有意义 [01:44:28] 有点low [01:44:32] 那个NTU酷的问题呢可能我会请办公室那边加速处理啦因为 [01:44:37] 老师说真的很麻烦因为每个学校的修课系统啊名单汇入系统又不一样啊 [01:44:44] 其实他们Tiger真的很辛苦 [01:44:46] 要Sync [01:44:47] 所有的学校 [01:44:48] 就是很麻烦 [01:44:50] 因为每个学校的行政流程都不太一样 [01:44:54] 现在还好现在 [01:44:56] 每个大学开学日期都差不多了 [01:44:59] 我们第1次开课的时候 [01:45:01] 有些学校就晚一周甚至还两周那个我们已经都快要写第1个作业他还没有NTU酷的账号这样子 [01:45:07] 好啦大家怎么很担心考试的奇怪 [01:45:15] 好啦我大概会 [01:45:18] 真的是 [01:45:23] 会跟你们讲一下可能会考什么 [01:45:33] 作业会给多少时间完成 [01:45:35] 助教有回啊通常是一个月前会公布啦 [01:45:40] 但是你们你们通常是前一周才会开始做吗 [01:45:43] 不过 [01:45:44] 我们就是提早公布你要你要前一天做 [01:45:46] 我们也没有意见 [01:45:48] 这门课作业会调分 [01:45:51] 好问题 [01:45:52] 因为 [01:45:53] 因为有学生反应说 [01:45:55] 这个 [01:45:56] 我的学习成绩跟我当初作业老师公布的百分比算出来不太一样这样子 [01:46:01] 但是通常是会往上嘛对不对 [01:46:05] 本来80分我给你85分你不会来抗议嘛对不对 [01:46:08] 那 [01:46:09] 可能会调啦因为就是做一个Normalization这样子 [01:46:14] 但是会不会调低 [01:46:16] 通常不会 [01:46:18] 因为 [01:46:20] 调高你们就 [01:46:21] 比较不会有怨气嘛 [01:46:22] 所以我们都会把作业弄难一点 [01:46:25] 然后把它调高这样你们会觉得 [01:46:27] 老师的恩泽这样子 [01:46:28] 但是如果本来都很高分然后最后把它调低你们 [01:46:32] 大概低卡我就看不完 [01:46:36] 重点都还是在于鉴别度跟 [01:46:39] 这个整个 [01:46:41] 比重 [01:46:43] 好啦应该 [01:46:44] 没有有些我可能就 [01:46:46] 有些我们就是 [01:46:53] offline再回一下好了 [01:46:57] 大概是这样 [01:47:00] S一点 [01:47:14] 我秀一下我们 [01:47:15] 第一张内容前面一点点就好了 [01:47:19] 毕竟 [01:47:21] 毕竟是 [01:47:24] 直播录影的 [01:47:26] 有没有啊 [01:47:28] 嗯? [01:47:34] 关了吗 [01:47:41] 好 [01:47:42] 这个就是另外一份投影片喔就是我标W1的 [01:47:48] 就通常 [01:47:49] 那个投影片的前面那个week [01:47:51] W就是通常会是上课的周数 [01:47:54] 不过后来也不太准 [01:47:55] 所以大概就是照这个这个编号的顺序 [01:47:59] 上下来 [01:48:01] 好 [01:48:02] 那我只秀一下这个 [01:48:06] 好可以吗 [01:48:07] 好 [01:48:16] 这边主要是讲Introduction [01:48:18] 但这Introduction的内容大概也 [01:48:22] 大概也涵盖以前NLP会上的所有东西这样子 [01:48:25] 就是讲 [01:48:27] 这个基本的处理方法这样子 [01:48:29] 但是我把 [01:48:30] 这个Embedding [01:48:32] 或是Vault to Vector摆在 [01:48:33] 下一个部分 [01:48:34] 这边会提到一下这样子 [01:48:37] 所以他重点会 [01:48:39] 先 [01:48:40] 让你看看一些应用 [01:48:42] 然后会告诉你说一般我们在做文字处理的时候 [01:48:45] 会做什么样的事情 [01:48:47] 但是 [01:48:48] 可能你们现在都不觉得 [01:48:50] 该做这些事情 [01:48:51] 因为也不太需要反正喂给LM就好 [01:48:54] 但是有时候 [01:48:55] 这里面的道理 [01:48:56] 还是得懂 [01:48:57] 那会先提一下LSA [01:48:59] 就是 [01:49:01] 以前 [01:49:02] 在做NLP的人 [01:49:04] 没有Vault to Vector [01:49:05] 没有Vault to Vector这些东西的时候 [01:49:07] 我们怎么去了解语义的部分 [01:49:10] 我们怎么知道猫跟狗比较像猫跟卡车比较不像这件事情 [01:49:14] 以前到底用什么方法来做的 [01:49:17] 所以你们可能 [01:49:18] 又要 [01:49:19] 参观一下博物馆看一下说以前这些原始人 [01:49:22] 做的这些 [01:49:23] 工具到底是什么 [01:49:24] 然后我们会秀一下Vault Embedding [01:49:27] 当然你会觉得说 [01:49:29] 这个不是LM [01:49:31] 没错 [01:49:32] 但是 [01:49:33] 他的确是谈到了处理文字的重要的 [01:49:38] 精神 [01:49:39] 所以 [01:49:40] 你懂了这个脉络之后 [01:49:43] 你就可以 [01:49:43] 比较知道 [01:49:45] 痛点是什么 [01:49:46] 这个难的地方在哪里 [01:49:48] 不然老实说你现在有 [01:49:51] 挂个API [01:49:52] 做进去 [01:49:53] 写分析 [01:49:54] 100行Viber Coding [01:49:56] 一个晚上就做完了 [01:49:57] 你觉得那会有价值吗 [01:49:59] 其实 [01:49:59] 很难 [01:50:01] 我就讲这张图就好了这张图其实 [01:50:04] 其实是一个不是很旧的paper 2021年的一篇paper但是他 [01:50:08] 他秀了一个过程我觉得还蛮适合讲NLP的发展过程 [01:50:13] 其实四个阶段你看到这四个时间点 [01:50:16] 从 [01:50:17] 1960到2010 [01:50:18] 这样子 [01:50:19] 那上面两个比较旧 [01:50:21] 上面两个比较旧但是他做出来的东西会 [01:50:24] 比较 [01:50:25] Human friendly就是 [01:50:26] 因为就是都要人进去做 [01:50:28] 所以人 [01:50:30] 对自己做出来的东西比较能够理解说对这样有用这样的确有他的道理 [01:50:34] 但是越来越后发现 [01:50:36] 这好像 [01:50:37] cost太高了所以我们希望靠着一些大量 [01:50:40] 用统计 [01:50:41] 甚至靠训练的方式来做 [01:50:43] 但是做出来的东西的确有一点难解释难表示但是机器看得懂 [01:50:50] 机器看得懂 [01:50:51] 所以这大概是几个阶段 [01:50:55] 我们看一下就是从一开始 [01:50:58] 这个语言学的人 [01:51:01] 这个会希望说从语法上去分析所以你会看到一颗tree [01:51:06] 这是原来的 [01:51:07] 整个句子 [01:51:08] 然后他会有noun phrase [01:51:10] verb phrase [01:51:11] 去做下来的 [01:51:12] 就以前我们 [01:51:13] 做nlp [01:51:16] 起手式 [01:51:17] 就是会建passing tree [01:51:19] 甚至会建所谓的dependency的关系 [01:51:22] 所谓dependency就是说 [01:51:23] 这个形容词是形容这个名词 [01:51:26] 会有一个这样的topple出来这样子 [01:51:28] 所以 [01:51:29] 有一些工具就可以让你pass出一个句子里面 [01:51:33] 这样的关系是什么 [01:51:35] 他的结构是什么 [01:51:36] 你也知道一些词性 [01:51:38] 这个是很久以前 [01:51:40] 这个语言学进来的 [01:51:41] 在做的事情 [01:51:43] 的确那时候也觉得 [01:51:45] 让电脑搞懂这件事情的确应该要这样做 [01:51:49] 他才知道说 [01:51:50] 有些形容词是形容某个名词片语 [01:51:53] 或是这个句子的 [01:51:56] 重点是什么 [01:51:57] 因为我们知道英文重点你要看主词 [01:52:01] 然后看他动作是什么 [01:52:02] 所以就比较知道 [01:52:04] 怎么样这个句子的keyword [01:52:07] 或是 [01:52:08] 想要表达意思是什么 [01:52:10] 后来就觉得 [01:52:12] 那 [01:52:12] 应该要让他聪明一点 [01:52:14] 所以我们就人也进去 [01:52:16] 建立一些explicit [01:52:18] 但是explicit比较像是 [01:52:20] 资料形式用人建 [01:52:23] 所以如果你大概学过知识图谱 [01:52:25] 就知道 [01:52:26] 这看起来就有点 [01:52:28] 有点结构化的句子有点但是他其实是一个比较 [01:52:32] 比较像free text [01:52:33] 不是句子 [01:52:34] 不是句子但是他是结构化的知识 [01:52:37] 所以比如说 [01:52:38] 你会看到这些节点 [01:52:40] 节点的部分 [01:52:43] 节点的部分 [01:52:45] 然后他有所谓的age的关系 [01:52:48] 比如说这个是COVID-19 [01:52:50] 他其实是 [01:52:51] 这个 [01:52:51] 某个这种 [01:52:53] 疾病的这种instance [01:52:55] 然后他会有什么症状就这些 [01:52:58] 那这些东西是靠人建的或者是说你可以从句子里面去 [01:53:02] 截取出来 [01:53:04] 比如说有人说 [01:53:05] 我得了COVID-19然后觉得状况怎么样那你就可以在这样的一个age [01:53:10] 去建立这样的 [01:53:12] 的knowledge出来 [01:53:14] 那这样knowledge出来之后其实很有用啊 [01:53:16] 就是 [01:53:17] 我可以trace啊因为比如说 [01:53:19] 我搞不好还有另外一个这个 [01:53:22] communicable [01:53:24] communicable [01:53:26] disease的 [01:53:27] 疾病 [01:53:28] 然后这个疾病呢 [01:53:29] 他可能跟COVID-19有点关系 [01:53:32] 那我可以 [01:53:32] 从这样的trace里面知道说搞不好 [01:53:35] 他也会有类似的症状 [01:53:37] 就是说我从 [01:53:39] 已知资料建立出来的结构 [01:53:42] 我可以再去涨 [01:53:44] 再去学 [01:53:47] 这些knowledge出来 [01:53:49] 这就是为什么当初 [01:53:52] 在那个AlphaGo出来之前 [01:53:55] 有一些非常聪明的系统 [01:53:57] 也蛮亮眼的 [01:53:58] 那里面他的学法 [01:54:00] 就是像IBM那样子有个系统 [01:54:03] 就是 [01:54:05] 他会去学说 [01:54:07] 水是液体 [01:54:09] 然后液体的特性是什么 [01:54:10] 他会从高处往低处流 [01:54:13] 所以我就可以去推论说 [01:54:15] 水也会从高处往低处流 [01:54:18] 我就可以从这样的知识图谱里面去做这样的推论这样的联想 [01:54:23] 或是让电脑自己去长出那些知识 [01:54:26] 有点像人在学知识的过程 [01:54:28] 所以这个以前 [01:54:30] 就是希望我们可以靠着 [01:54:32] 人给他一点的 [01:54:34] 这种seed [01:54:35] 然后让他去建构这样的东西 [01:54:40] 那后来发现这实在成本太高了啊 [01:54:42] 因为人建出来的量少 [01:54:45] 而且quality也不一 [01:54:47] 有些人 [01:54:48] 随便做做 [01:54:49] 有些人 [01:54:49] 而且 [01:54:50] 你很难去 [01:54:51] 很难去连贯啊 [01:54:52] 因为不同人做的 [01:54:54] 他写的字也不太一样啊 [01:54:56] 不同字的概念又不太一样 [01:54:58] 其实 [01:54:59] 很难去merge [01:55:00] 但是有很多 [01:55:01] 你可以去找一些开放的 [01:55:03] 那种 [01:55:05] 像Freebase这样的比较大的 [01:55:07] 的资料库来 [01:55:09] 去涨 [01:55:10] 但是其实上 [01:55:11] 还是 [01:55:12] 有限还是有限 [01:55:14] 所以后来就希望用大量的统计资料来选 [01:55:18] 所以这个其实点 [01:55:20] 后来 [01:55:21] 其实based on [01:55:22] 为什么有这些东西因为就是网络 [01:55:25] 发达就是 [01:55:26] World Wide Web起来之后有一大堆的文章一大堆文字是可以被accessible [01:55:31] 所以这些东西可以被取得了可以被统计的 [01:55:34] 所以后来就有一些统计的做法 [01:55:36] 像我们提到要提的what vector [01:55:39] 就是基本上我可以用统计的做法知道说 [01:55:41] 其实我不用告诉大家 [01:55:42] COVID-19是什么 [01:55:44] 不用告诉他这些症状是什么 [01:55:45] 他可以靠着文章中的 [01:55:48] 贡献性的关系所谓贡献性是 [01:55:50] 同样在一个句子里面被描述出来的时候 [01:55:53] 我可以拉近这些关系 [01:55:56] 我就可以拉近说这个这个字词其实存在一个关系 [01:56:00] 靠这些关系他就可以去推论 [01:56:03] 一些 [01:56:04] 语义 [01:56:05] 一些概念在里面 [01:56:07] 这个是后来 [01:56:09] 大家觉得这个做法非常厉害甚至 [01:56:11] 他可以拿来 [01:56:12] 翻译 [01:56:14] 就是完全英文的东西对照出法文或是其他语言 [01:56:18] 就可以翻译 [01:56:20] 那后来 [01:56:21] 想说把这个东西再扩大一点我们做 [01:56:25] 用学的方式 [01:56:27] 用一个大模型 [01:56:29] 不过这时候还没有很大 [01:56:32] 就是用model的方式去圈 [01:56:34] 圈完之后这些参数 [01:56:36] 是 [01:56:37] 只有机器看得懂人看不懂 [01:56:39] 所以你可以想象大圆模型那个几个b连的参数 [01:56:42] 里面 [01:56:44] 以前的确有一些人去研究啊 [01:56:46] 就是 [01:56:47] 每一层的transformal参数 [01:56:49] 有没有一些特性有没有一些分布 [01:56:51] 但是都比较像是一厢情愿的做法 [01:56:53] 这个这个 [01:56:54] 这一层好像在做什么 [01:56:55] 那一层在做什么 [01:56:57] 但是 [01:56:58] 的确有一些benchmark可以验证但是 [01:57:01] Who knows [01:57:02] 就是你又不是LM你怎么知道他在想什么 [01:57:04] 就是他怎么靠那堆参数来做出这么厉害的事情 [01:57:09] 就是有各式各样的 [01:57:10] 的做法这样子 [01:57:12] 但是我们希望说 [01:57:13] 他能够把这么大量的东西浓缩在几个b连的参数里面 [01:57:18] 学会 [01:57:19] 所以这一篇 [01:57:21] 当然如果你有兴趣看这篇paper可以看一下因为前面会讲比较多一点 [01:57:25] 他只是说这样的一个history的过程 [01:57:28] 你就可以连贯说这个原来以前 [01:57:32] 这个 [01:57:33] 这些学者 [01:57:34] 都在干这些傻事这样子 [01:57:37] 但是也不得不干这些傻事 [01:57:39] 因为当时的resource [01:57:41] 跟 [01:57:41] 跟资料 [01:57:42] 跟算力也只能做这样的事情 [01:57:46] 好 [01:57:47] 我想 [01:57:48] 就到这边好了 [01:57:49] 就是 [01:57:50] 做个开场 [01:57:51] 然后我们下礼拜就从 [01:57:54] 这边开始讲起 [01:57:56] 那应该是在 [01:57:59] 一周到 [01:58:00] maybe是第3周就可以讲到water vector [01:58:02] 然后我们就会有第1个homework这样子 [01:58:05] 好 [01:58:08] 有没有问题 [01:58:09] 有没有问题 [01:58:14] 没有 [01:58:16] 不会告诉你 [01:58:17] 通常你算出来 [01:58:18] 东西就 [01:58:19] 他的我们会有 [01:58:21] 会有test data [01:58:23] 你就可以去评估 [01:58:25] 是不是 [01:58:25] 每个作业不太一样 [01:58:27] 每个作业不太一样 [01:58:29] 但是比较不像是那种去看Leaderboard或是什么的 [01:58:34] 的data这样 [01:58:36] 不要担心作业没有很难 [01:58:40] 现在看到的是旧的 [01:58:42] 没错 [01:58:43] 我现在看到的是旧的但是有些后面东西 [01:58:46] 我觉得更新的几率也不会高 [01:58:50] 大概就是 [01:58:51] 一两页这样子 [01:58:52] 但是可能会有一些 [01:58:54] 新的章节这样子 [01:58:58] 好吧 [01:58:59] 有没有其他问题 [01:59:03] 那我们今天就到这边 [01:59:05] 我希望下礼拜可以看到各位 [01:59:07] 谢谢