02|从围棋游戏到《宝可梦》,科技公司为什么让 AI 玩游戏?-声动活泼
网盘下载[ti:]
[ar:]
[al:]
[by:AI智能字幕]
[offset:0]
[00:00.00]本字幕由TME AI技术生成
[00:00.33]本节目由生动活泼和十分之一联合出品
[00:04.71]用声音碰撞世界
[00:07.51]声动活泼
[00:10.27]欢迎来到lock nuck 世界
[00:24.12]嗨 你好呀
[00:25.06]我是来自声动活泼的赛德
[00:26.88]欢迎来到nock nock 世界
[00:28.62]今天我们又会敲开哪一个世界的大门呢
[00:33.03]你有没有听过或者玩过任天堂发行的系列游戏宝可梦呢
[00:37.95]上周五
[00:38.87]宝可梦迎来了诞生三十周年纪念日
[00:41.89]为了庆祝
[00:42.79]官方推出了一系列限时限定毛绒周边
[00:46.27]引发了大量抢购
[00:50.57]而有趣的是
[00:51.97]就在人类玩家为宝可梦疯狂的同时
[00:55.13]这款游戏还迎来了另一波不一样的玩家
[00:58.87]那就是ai
[01:01.59]最近有新闻提到
[01:03.07]世界上好几家顶尖科技公司
[01:05.65]比如谷歌和大家熟知的chat gpt 母公司open ai 都让ai 玩宝可梦
[01:12.27]甚至有open ai 的员工一度在办公室的电视上播放gpt 玩这款游戏的直播
[01:19.25]我们编辑部在选题会上讨论这个话题时
[01:22.25]有同事说他试过和ai 下国际象棋
[01:26.01]一点儿也不好玩
[01:27.35]因为机器啊
[01:28.33]总是棋高一招
[01:29.81]所以他很不理解把游戏给ai 玩到底有什么乐趣
[01:34.18]更何况我们平时打游戏充其量就是花时间
[01:38.30]但是啊
[01:38.78]让ai 玩却很花钱
[01:41.24]因为得请一群工资很高的工程师为他编写算法
[01:45.42]那么既然如此
[01:47.20]这些科技公司为什么还要专门让ai 玩游戏呢
[01:53.09]其实啊
[01:53.73]这主要是为了训练ai
[01:55.99]让它变得更厉害
[01:58.07]怎么个厉害法呢
[01:59.69]答案是让它从纸上谈兵变得能为人类在现实生活中做事儿
[02:06.65]我们在去年的节目中提到过
[02:08.97]Ai 之所以看起来无所不知
[02:11.45]是因为在训练过程中
[02:13.23]研究人员会把大量文本资料喂给他学习
[02:17.11]不过就像如果不练车
[02:19.57]就算再会背诵交通规则
[02:21.75]也不能稳稳开车上路一样
[02:24.15]现在的ai 很擅长纸上谈兵
[02:27.07]解题作诗都不在话下
[02:29.57]但是要真让他在现实世界中帮人类做各种决策
[02:34.11]还得靠实际的训练
[02:36.54]去哪里练呢
[02:38.22]科学家认为
[02:39.52]游戏啊
[02:40.36]就是一个又好又安全的训练场
[02:44.46]Ai 呢
[02:45.12]可以在游戏里升级打怪
[02:47.36]为以后进入真实世界做好准备
[02:50.36]那这又是什么意思呢
[02:53.56]我们可以先来看这样一个例子
[02:55.84]美国普林斯顿大学的一位教授和团队正在研究用于汽车自动驾驶的ai
[03:01.98]他们的任务之一是训练ai 学习各种停车标志
[03:06.34]你可能会觉得这不就是看路牌
[03:09.41]有什么难的呢
[03:11.31]但是在实际生活中还真没那么容易
[03:14.69]因为道路环境千差万别
[03:17.53]有时候标志会被卡车挡住一部分
[03:20.71]有时候又被泥浆或者大雪糊了半个
[03:24.01]雨天雾天晚上也看不清楚
[03:27.03]不仅如此
[03:28.23]美国的停车标志还有五花八门
[03:30.75]有的字很多牌子上写着允许停车或者禁止停车的时间段不同
[03:36.61]停车场规则又不一样
[03:38.43]所以老有人搞错ai
[03:41.00]而ai 要想实现自动驾驶
[03:43.62]也必须看到并识别出这些标志
[03:46.80]但是如果去马路上拍摄到这么多不重样的停车标志啊
[03:51.60]比如在夏天找到被雪覆盖的标志
[03:55.04]想想啊
[03:55.74]就很费力费时间
[03:57.32]于是这位教授和团队呢
[03:59.58]想了一个办法
[04:00.80]通过技术手段让ai 去玩有很多赛车场景的动作冒险游戏gta 五
[04:07.86]这款游戏的特点就是高度还原美国城市的场景
[04:12.39]停车标志也又多又逼真
[04:14.89]Ai 呢
[04:15.61]可以在游戏中模拟开车和练习
[04:19.31]不仅如此
[04:20.23]游戏还会模拟真实世界中的物理规律
[04:23.29]能让ai 明白未来在真实世界中如何执行类似的任务
[04:28.47]比如汽车在不同路面上踩刹车往前冲的距离不一样
[04:33.95]手松开一个箱子后
[04:35.75]箱子会因为重力掉在地上等等
[04:39.07]而且既然是模拟
[04:40.83]就意味着出错了也没事
[04:43.63]Ai 可以把游戏当做一个训练场
[04:46.39]在这里随意的练手
[04:48.09]不仅省钱省时间还更安全
[04:50.87]即使犯了错也不用担心带来什么麻烦
[04:54.87]那么说了这么多
[04:56.17]目前为止
[04:57.37]游戏这个综合训练场究竟能让ai 学到哪些技能呢
[05:03.59]和你学习一门知识要先从简单的开始学一样
[05:07.79]在丰富多样的游戏中
[05:09.53]最初ai 玩的游戏也相对容易
[05:12.27]比如围棋
[05:14.80]早在十年前
[05:16.02]谷歌的阿尔法go 就学会了玩围棋游戏
[05:19.10]并且在比赛中击败了当时的人类世界冠军
[05:23.54]你可能会好奇
[05:25.04]为什么围棋对ai 来说比较容易呢
[05:29.23]首先
[05:29.93]围棋的规则明确
[05:31.51]目标单一
[05:32.51]拿到黑白两色棋子的对手在棋盘上轮流落子
[05:36.97]最后看谁占的地方大谁就赢了
[05:40.62]本质上
[05:41.30]如果最终想获胜
[05:42.84]就是走每一步之前都算出把棋子落在哪儿赢的几率最大
[05:48.16]而做计算对ai 来说可太容易了
[05:51.78]以围棋机器人阿尔法go 为例
[05:53.94]当所有棋子的信息都摆在棋盘上的时候
[05:57.58]它能在几秒钟之内迅速计算出在哪个区域下棋胜率最大
[06:02.62]然后再推理出无数种不同的下巴
[06:05.58]找出获胜几率最大的那一步
[06:08.30]算法决定了它会在和人类对弈的过程中不断的强化学习
[06:13.55]从失败中改进
[06:15.01]最终啊赢过人类冠军
[06:18.16]经过这类游戏训练后的ai 拥有良好的推理能力
[06:22.62]能够在现实生活中完成一些特定的任务
[06:25.88]比如几年前
[06:27.08]谷歌就在尝试利用阿尔法go 背后的算法提高英国国家电网的发电效率
[06:33.04]像分析棋盘选择获胜几率最高的下棋方式一样
[06:37.38]实时分析电网的数据
[06:39.52]决定怎么发电最合适
[06:42.21]而现在
[06:43.09]随着ai 不断的进步
[06:44.79]他玩的游戏也逐渐变得越来越复杂
[06:48.53]比如宝可梦
[06:49.99]还有你爸爸妈妈可能听过的在线战斗竞技游戏dota 二
[06:54.63]以及如今很火的王者荣耀和我的世界等等
[06:58.91]那这些游戏都复杂在哪儿
[07:01.57]又能锻炼到ai 的什么能力呢
[07:05.55]拿宝可梦来说
[07:07.07]首先它的设定和规则就更复杂
[07:10.39]根据设定
[07:11.35]宝可梦啊
[07:12.13]是一群神奇生物
[07:13.79]它们有不同的属性
[07:15.35]有的是草系
[07:16.75]有的是火系
[07:17.79]电系
[07:18.83]每种属性的技能特点不一样
[07:20.89]他们还可以通过训练和对战进化
[07:23.83]游戏的基本规则就是抓宝可梦
[07:26.67]训练宝可梦
[07:27.73]然后再用自己的和其他玩家的宝可梦对战
[07:31.49]想玩的厉害
[07:32.49]你需要非常了解每个宝可梦的特点
[07:35.40]比如他们的进化关系
[07:37.08]进化条件
[07:38.10]不同技能之间的对战能力
[07:40.36]这样才能决定抓什么宝可梦
[07:42.80]怎么抓
[07:43.56]怎么训练
[07:44.50]对战时派谁出场
[07:46.24]用什么技能等等
[07:48.54]不仅如此
[07:49.48]宝可梦也不像围棋一样一局一局的
[07:52.56]而是有一个长期的主线任务
[07:55.38]那就是完成一系列挑战后实现通关
[07:59.70]这要求玩家在游戏中不断积累经验和进化
[08:03.50]并且把经验用到之后的关卡中
[08:07.22]实验显示
[08:08.30]Gpt 和谷歌旗下的jimmy i 都花费了好几百个小时才通关了宝可梦的初代版本
[08:15.62]非常不容易
[08:17.32]要知道时间长对ai 来说是个大难题
[08:22.44]为什么呢
[08:23.70]虽然啊
[08:24.28]你可能觉得ai 记性挺好
[08:26.84]只要在同一个聊天窗口里对话
[08:29.24]他就会记得你在昨天甚至几周前说过什么
[08:33.22]但是我们在去年ai 说谎那期节目中提到过
[08:36.92]这是因为他在每次回答之前都会从头读一遍对话
[08:41.62]而这并不代表着ai 像人一样有长期记忆能力
[08:45.98]甚至恰恰相反
[08:47.66]现在的ai 记性都非常差
[08:50.89]有多差呢
[08:51.99]它就像人们口中的只有七秒记忆的鲸鱼一样
[08:56.21]只能记住刚刚发生的事情
[08:59.08]所以啊
[08:59.94]让ai 花几百个小时去通关宝可梦
[09:03.22]就是希望能让他学习通过记笔记等方式有一个好的记性和思维跳跃能力
[09:10.52]同时还要学会做长期规划
[09:13.74]比如有研究员发现ai 在背包空间不足时
[09:18.00]经常会丢弃一些后续用得上的重要道具
[09:22.25]想象一下
[09:23.17]如果你身边有人玩游戏时也这样做
[09:25.93]是不是也有点傻傻的
[09:28.09]只有具备了这些能力
[09:29.99]Ai 才有可能在未来的现实生活中帮人类完成各种需要长期跟进的工作
[09:37.39]其次
[09:38.09]除了对记忆要求高
[09:39.95]宝可梦还是一个相对开放的世界
[09:43.17]鼓励玩家去主动探索
[09:45.07]自由的训练宝可梦
[09:46.79]和其他玩家组队或对战来推进游戏进程
[09:50.71]游戏剧情也会实时变化
[09:53.77]这对目前的ai 来说也是个挑战
[09:57.18]科学家表示
[09:58.30]越是限制少
[09:59.80]越需要ai 在做决策时考虑到方方面面的可能性和风险
[10:05.06]在缺乏明确指引和目标
[10:07.50]Ai 对新环境理解有限的情况下
[10:10.14]他很容易被困在一个地方很久
[10:12.78]不知道如何去推进剧情
[10:15.06]比如有研究人员发现
[10:17.06]Ai 在宝可梦游戏中需要走出一个商店
[10:20.68]正确的做法是走到房间门口的红色地垫那里就能出去了
[10:25.90]但他却没有发现这一点
[10:27.97]一直在盘问一个叫做呆呆兽的宝可梦
[10:32.45]那说到这儿你应该也发现了
[10:35.09]虽然宝可梦是儿童游戏
[10:37.67]你也许花了几十个小时就通关了
[10:40.43]但对ai 来说
[10:41.77]还有很多需要学习的
[10:43.95]更重要的是
[10:45.09]这些恰恰是他未来在真实世界中帮人类做更多事情所必须的能力
[10:51.25]这也是为什么人们要用宝可梦这样的游戏来训练ai
[10:56.33]本质上
[10:57.23]这和像你一样的青少年能用合理的方式从游戏中锻炼将原来用在真实世界的能力是类似的
[11:05.24]比如玩沙盘游戏可以锻炼创造力
[11:08.80]玩协作游戏可以锻炼沟通和团队合作能力
[11:12.58]让ai 玩宝可梦也是为了让他学习在一个相对开放
[11:17.08]环境不断变化的世界里做更好的决定和长期的规划
[11:21.54]将过去积累的经验运用到未来来完成最终目标
[11:27.21]而且啊
[11:28.03]用游戏训练ai 还有一个特点
[11:30.55]那就是人工智能的学习速度会非常快
[11:33.99]因为在游戏世界中
[11:35.43]每一次对战
[11:36.35]每一次尝试都会涉及到大量决策互动
[11:40.11]而计算机的运行速度极快
[11:42.77]所以ai 呢
[11:43.81]可以像海绵一样学习
[11:46.16]另外别忘了
[11:47.30]科学家可不会限制他玩多久就必须关掉
[11:50.96]而是可以日夜不休的训练
[11:53.72]举个例子
[11:54.70]前面提到的在线战斗竞技游戏dota 二
[11:57.90]Open ai 旗下的人工智能每天运行的游戏量就相当于一个人玩了一百八十年
[12:05.10]是一个非常惊人的数字
[12:08.12]而这些都是游戏的特点
[12:10.32]也是人们把它当做ai 综合训练场的重要原因
[12:14.85]那最后让我们再回到现实
[12:17.69]等ai 能轻松通关宝可梦这类游戏之后
[12:21.35]它能帮我们做什么事呢
[12:23.79]有专家认为
[12:24.93]随着ai 通过游戏训练
[12:26.83]逐渐能根据真实世界的变化调整策略
[12:29.91]比如在医疗领域
[12:31.55]现在的ai 手术机器人虽然已经能在手术中缝合血管
[12:36.51]但是关键步骤比如缝合力度多大
[12:40.11]仍然完全依赖医生经验
[12:42.53]未来ai 或许能根据病人的实际身体状况
[12:46.28]在医生的监督下自动优化缝合力度和节奏
[12:50.46]就像ai 在宝可梦游戏中根据情况实时调整出战策略一样
[12:56.20]不过还是那句话
[12:58.10]游戏是ai 的训练场
[13:00.78]既然是训练
[13:01.90]那就意味着ai 能力不够过关之前
[13:04.98]可能不会去解决真实世界的问题
[13:09.80]好了
[13:10.50]今天的knock knock 时间就到这里
[13:12.82]本期节目的作者是编辑千文
[13:15.38]你好呀
[13:15.96]我是千文
[13:16.68]很开心和你度过今天的knock knock 时间
[13:19.82]谢谢千文
[13:21.04]今天我们一起敲开了科技公司让ai 玩游戏的大门
[13:25.40]原来这不是因为ai 贪玩
[13:28.12]而是为了把它训练的更聪明
[13:30.74]能够为将来最终极的游戏世界现实做好准备
[13:35.92]想一想
[13:36.64]等这一天真的到来了
[13:38.44]你有什么事情是想让ai 帮忙做的呢
[13:41.50]欢迎在评论区畅所欲言
[13:48.24]快来给我们报选题吧
[13:50.72]只要你观察到了有趣的现象
[13:52.68]或是忍不住对某些新鲜事儿问出个为什么
[13:55.66]这些都可能成为一个选题
[13:57.86]打开本期节目的单级简介
[13:59.80]就可以看到报选题的具体方式了
[14:02.40]你的选题可能会出现在节目中
[14:04.66]每月提报十个选题
[14:06.22]还能成为了不起的月度全球观察员
[14:09.36]期待你的观察
[14:10.50]我们下期再见
展开