上周 openai 发布了切克 gpt 五点四版本,其中一个能力叫 computer user, 也就是 ai 看屏幕, ai 决定下一步,然后 ai 模拟鼠标键盘操作,说是可以像人一样操作电脑界面。网上很多文章都在说准确率超过百分之七十,甚至高于人类的平均水平。 本来想拿他和 ok 可乐做一下对比,但是找遍了各个平台,几乎没认真的跑起来,所以今天研究了一下,搭了一下环境,结果有点出乎我的意料,网上说他创建 ppt 文档平均得分达到八十七,而人类是百分之六十八。那我们第一步先来测试一下他写 ppt 的 能力,那我写 一个 ppt, 内容为 open class 介绍和应用场景,然后给他发给他,我给了他一个完全访问的权限,如果用默认权限的话,他会在沙盒里面运行,当需要突破沙盒操作你电脑的时候,会一步会让你授权。我想着太麻烦,所以就直接给了一个完全访问权限。 这里他自己生成了三个步骤,一个步骤是整理内容结构已经做完了,现在是编辑并且导出。经过了一个漫长的等待,我发现这个 ppt 已经写已经写出来了,那这里还在确认。 ok, 我 们打开看一下。哎,别说,这个笔记本做的还可以,有点内味了,这一点有点重叠,这一点有点重叠哈,你先管他,进去看一下, 别说做的还行。嗯,我还挺满意的,看一下我电脑 c 盘,就是 c 盘已经满了,因为最近装了很多应用,他就疯狂的为 c 盘进行缓存,我让他帮我整理一下, 哎,已经跑起来,正在运行了,我们等一下,一个缓存文件十二 g 回收站有一点一 g, 通常这个缓存目录下面的文件都可以删掉的,是不会影响正常使用的。 对,前段时间进行了一次系统更新,可能是残留文件,我一百五十 g 过占用的就剩了不到五个 g 哦,他这里已经结束运行了,告诉我这里有十二 g 的 文件,我直接删除的命令做了拦截。 哦,就还是总结一下,就是他能找到这些文件,但是没有帮我删掉,因为他的权限不够。呃,我继续让他继续帮我修改命令, 如果命命运被拦截,你可以修改授权给自己权限。 嗯,说执行完了,我再刷新一下。十六 g, 哦,这是 npm 的 一些缓存哦,我再让他继续执行, 主要还是 npm 的 缓存。好,这里告诉我。又释放了一节空间。好的,经过了漫长的等待,三分钟,将近四分钟,处理了一些缓存,现在是二十七,从一开始的五 g 释放了二十二 g。 嗯,我来刷新一下 啊,确实一开始就有五 g, 现在有二十七 g 了。就是这一步有点像你的工作助手工作助理一样,还挺好用的。这一步体验也是比较满意的。 我们下一个测试,测试一下他能不能通过网页进行一些事情。比如我说使用桌面已经打开了三六零浏览器,新建一个标签,跳到小红书页面,给第一个帖子评论, 内容自己写,因为这个三六零浏览器上面的小红书是我已经登录过的。 ok, 下一步我就完全脱离鼠标和键盘看桌面的地方,他已经 进行了一张截图,他首先运行了一个命令,说要去激活三六零,然后又截了一张图,发现三六零并没有被激活,他是通过截图的方式去比对命令有没有运行成功。 我现在重新尝试了一个,先把三六零输入进去了,但是他没有按回车,又截了一张图,这个时候补充了一个回车,现在已经进来了,他又截了一张图,应该是能识别出来,现在已经进到小红书页面了, 下一步按理说应该要点击第一个帖子,这里还在运行命令,我不知道为什么他不去,通过鼠标去操作好这里识别出来,没有点击成功,他改用鼠标点击帖子, 这里还没有成功。网页这一趴有点拉,他说不再依赖鼠标点击了,而是在当前页面的浏览器跳的第一个帖子,就第一个帖子里面并不是 url, 所以 说他提取的 url 是 错误的,然后他跳,跳转的时候就跳的也是错误的方式, 他抓取链接抓取错误了,所以跳转的时候也就跳错了,他在可以看出他在努力的解决,但是还是不行。 其实如果按照他说的,通过是屏幕识别,然后通过鼠标去点击,这个方式是很容易做到的,但不知道为什么他一直没做到,就要么是识别那部分有问题,要么就是控控制你的鼠标键盘那部分有问题。他点小红书的标签,但是没有点对,语气偏了一点, 这拜托这首页也没有小红书的标签,他一直给他点,不知道在点啥,我还怕干扰他,所以我就尽可能没有动过鼠标,但他现在说标签位置偏了一点,他刚才点了另一个搜索页,他要精准一点点到小红书的标签, 但是现在都没有打开小红书呦,所以他不知道在尝试什么。哎,我看不下去了,要不我帮他打开一个吧。 ok, 我 帮他定位到小红书页面,然后他告诉处理失败了,七分钟十八秒没有,我让他继续吧,再试一下。 ok, 我 点一下把它切换到前台,他现在是非常执着的想要滚动一下,把它滚动到下面, 他要改成键盘滚动。那现在浏览器可以看到他是激活的状态,就是你按鼠标,你按键盘的话是可以滚动,但他现在不知道为什么点开了图片。我没有点,而是他自己点的。那下一步他应该是再点击一下,把图片给缩小,看他能不能识别出来。桌面上刚才看到多了一张截图,就是他有再去看。 他现在已经开始执行下一步了,好像确实有变化。我手动把这个图片给点掉吧,不然看不到他正在做什么操作。哦,可以看到他刚才一直在往下滚动,现在看他能不能定位到输入框里面。 他不知道干嘛,他又跑了。他可能想运行一个脚本,就 gs 脚本,想把浏览器滚动到最底部,但是他这个脚本不知道为什么要放在放在地址栏去执行,就导致直接跳转到这里了。 呃,现在我来停止一下这个任务吧,我已经等的不耐烦了。我来总结一下他这个操作浏览器,因为他不能够通过一些端口或者 mcp 服务 去操作浏览器,他只能通过就是像官网描述的,通过截图的方式去去识别你当前的屏幕,然后通过鼠标键盘去接管去操作。 当然是不知道为什么,就是他识别是能识别到这个屏幕的,也能找到正确的步骤,但就是但就是这个鼠标键盘的接管,不知道为什么总是点不到正确的位置。 然后另一个是他要因为每个网站的功能都不一样,所以让他评论的时候,他去找这个评论框,他认为评论框就是传统的评论框 在最底部,但其实我们知道小红书的这个框其实一直在这里,他就非要划划划划,他认为他划到最底部才能看到这个框,但也可能就是他定位不到这个框,所以导致一直在最接近这个评论框的时候,依然是没办法聚焦到那里进行评论, 所以这个任务就算失败了。而这个任务失败就意味着他们官网宣传的通过啊,通过 computer user, 然后鼠标就是屏幕识别的方式去定位鼠标键盘。这一趴其实是整个都行不通的, 但理论上是可以的,只是他现在做的可能还不够完善,或者是我环境有什么问题。我本来还想让他测试一下去操作微信发消息,回消息,或者是打开你的网页,那我觉得他既然一个小红书都打不开,所以说你让他去发个邮件什么的也估计也够呛。那我先让他把桌面的这些截图文件都给删掉吧。 他这个这个命令应该是不在话下的,主要还是通过命令执行的,不是鼠标键盘。下一步让他帮我写一个 小游戏吧,这应该是他比较擅长的,因为这个扣的,因为这个软件本身啊,写代码的能力就是比较强的。哎,现在可以看到他已经做完了他,我就只是让他上传一个游戏,规则都是他自己定的,都是一些常用的规则。我们打开看一下,这是显示我点开始游 戏可以鼠标点啊。不是,他不是那种通过键盘左右的移动,他是鼠标点的这种, 那这种游戏的话,嗯,还是或者是鼠标按住直接拖这种游戏的话,其实, 哎,他他这个难度就更低一点,就因为他灵活度更高嘛。所以说我让他直接碰一下来试一下,碰一下,看会不会死,哎,真的会死,哎。 不,不,刷新一下,我让他帮我玩,看他能不能帮我。帮我。呃。他说他不能帮我玩,帮我玩更像自动化操作,他说他不能玩,但是可以帮我加一个 啊。我们现在来总结一下吧,他确实可以启动程序,比如打开网页查进城或者是处理脚本,这个都是可以的,或者是写代码什么的他都可以做到的。呃,就是他目前的定位,我感觉还是像你的一个助理或者工具一样帮你去干一些特定的任务, 但不能够就是像一个虚拟员工一样真的帮你思考或者帮你解决一些灵活的问题。就这方面他是不如 open cloud 的, 你看他比如他也说了,他能够通过命令启动游戏,但是并不能够帮你去操作或者去玩这个游戏,就是一点就还是类似于半自动的解决方案, 你看他不能像远程一样去执行或者去玩电脑游戏,所以他目前的工具依然是定位或者是助手,而不是说真正的像一个 ai 员工那样。因为现在是刚上线,我们可以再期待一下接下来的等他更新迭代之后的版本。
粉丝8348获赞2.7万

please wait as your operating system is initiated hello, i'm here。 他能看到你,听到你,你的快乐悲伤他都懂,他还能跟你开玩笑逗你乐。 you wish i could touch you how would you touch me? 这就是 openi 近几天刚发布的最新的 gpt 四 o, 它能够处理文字、语音、图像和视频多种模态的混合输入,并输出文字、语音、图像等各种形式的输出。 今天我就来给大家实测一下,看看 gpt 四 o 的真正表现。首先最让人惊艳的就是 gpt 四 o 的眼睛,也就是他处理视频输入的能力。这项功能还没完全推出,我们来看一下官方的演示视频。 so here's me, so what kind of emotions? do you think i'm feeling hmm it seems like i'm looking at a picture of a wooden surface oh you know what that was the thing i sent you before don't worry i'm not actually a table okay, so take another look ah that makes more sense it looks like you're feeling pretty happy and cheerful with a big smile and maybe even a touch of excitement whatever's going on it seems like you're in a great mood。 从这个视频中我们可以看到 gbt 四 o 就像一个自然人,他能够看到你和你周围的场景,能够给你实时的反馈。 具备了这项能力, g b t 四 o 完全可以胜任学习助手、心理辅导、健身教练、钢琴老师,甚至是医疗护理的角色。第二项 能力,处理图像。我们来看一个实际的测试。这是我特意跑到院子里去拍的,我们将它上传上去,然后使用语音来提问,这是什么植物?我的草坪上长满了这种植物,请问怎么样才能去除它? 这种植物看起来像是田野牵牛花,它是一种多年生草本植物,常被认为是杂草,因为它扩散迅速,并且很难根除。再来看一个电脑版的例子,我们来上传一张图片,然后我们问他,这张图片里有什么?这是什么地方的建筑风格? 他很快的给出了回答。这张图片展示了一处带有典型中式建筑风格的园林,图片中的元素包括水池、桥梁建筑。 这种建筑风格和园林布局典型于中国传统原理。第三项,处理语音这项功能是最适合于语言学习了。我们来看看他是怎么样帮我矫正发音的。 你能帮我练习英文的发音吗?当然可以,你想练习特定的单词、句子,还是某种特定的发音呢?我说一句话,请你纠正我的发音, this is a book。 好的,你说 this is a book。 注意以下几个方面, 一、 this 确保 it 的发音像是在舌尖轻轻的触碰上齿后部,同时发出声音。二、 is 发音清晰,不要混淆成 e, z 或其他音。三、 a 这个词发音要轻,类似于一个短的 o 声。四、 book 注意 o o 的长音, 像呜仔扑里的发音。试着再说一次, this is a book。 注意这些细节,你应该会感觉更自然和流畅。 接下来我们再来看一个官网的例子。 i would like you to function as a translator i have a friend here who only speaks italian and i only speak english and every time you hear english i want you to translate it to italian and if you hear italian i want you to translate it back to english is that good that faith though mike you mikado silly baleni potassiro padlara cause what she did at better mike she wonders if wales could talk what would they tell us they might ask how do we solve the new equations orthrabroquiaderchi coma resul biamole aquatsioni limiari 在这个例子 中, gpt 四 o 可以充当一个实时的翻译,我觉得翻译这个行业快要被取代了。好。第四项,处理文字、数据和图表等等。这部分就不详细赘述了,我们来看官网的介绍。 gpt 四 o 在文本推理、编码、智能方面达到了 gpt 四 turbo 级别的性能。 gpt 四 o 的一个惊人的表现是,它的响应速度几乎已经达到了人类自然交流的速度,它可以在最短二百三十二毫秒内响应音频输入平均为三百二十毫秒。 我们知道 gpd 三点五的平均延迟为二点八秒, gpd 四的平均延迟为五点四秒,所以比较起来, gp 四 o 几乎与自然人的响应速度差不多。而最让用户欢呼雀跃的是, gpd 四 o 是免费的,虽然有每三个小时十六条消息的限制, 而付费用户每三个小时可以发八十条消息。 g p t 四 o 包括 g p t plus 会员版所有的功能,比如视觉联网记忆、执行代码等等。

openai 推出了它的最强模型 g p t 五点四,可以说直接粉碎了 java 三点一 pro 和 cloud open 四点六的神话。这里面最有强力的是 g p t 目前已经可以真正的原声地实现电脑使用了,办公的效率可以说直接拉满。这个我觉得跟 open cloud 推动的方向呢,也是比较一致的。 先快速看一下它的一些基础数字。本次呢, g p t。 推出的是五点四的 thinking 和 pro 开发测呢,推出了 api 和 codex, 并且附带极速版的五点四 fast。 在 一些指标上,比如 g d p l s w e h pro a r c a g i 二这几个指标上都拿到了第一名,超过了 jimmy, 超过了 office。 比较有想象力的呢,是一个所谓叫原生电脑使用能力,什么意思呢?就是 g p 五点四可以通过 playwrite 等酷编辑代码来控制计算机,也能直接通过看屏幕截图,动用鼠标和键盘,比如说发邮件,排日程,填表格,好流程这些以前需要点来点去的活呢,在 g p t 五点四上面都能直接实现了。这份很多工作原来是通过工具的,比如说 browser use g p t 呢,现在是把这份能力内化到模型里面。在 o s word verified 这个指标上, g p g 五点四呢,刷出了百分之七十五的成功率。一个月前登顶的 cloud ops 四点六呢,也不错,是七二点七。而人类呢,在这个指标上的成绩呢,只有百分之七十二。换句话说呢,其实它们都超越了人类控制屏幕上的效果了,比人更会使用电脑。 直接影响呢,就是整个的分析师的这个行业,应该说华尔街的一系列的分析人员呢,都可以被 ai 替代了,这里面呢,包括比如说销售的演示文档,会计的电子表格,急诊排班表,制造图表、短视频等,全部要求 ai 真刀真枪的交付工作产出。 目前呢, g p t。 五点四呢,已经能非常成功的做出 ppt excel, 比绝大部分的专业人士还要更好。有内部的班主榜表示呢,人类在百分之六十八的情况下,更培养 g p t。 五点四胜任 ppt, 而不是人类自己胜任 ppt, 因为它的美观度更强,视觉更丰富,图像使用也更高效。换句话说呢,现在每一次的模型的升级,都把一些 ajax 的 能力,包括一些办公的能力以及功率使用的也都累化了。 g p d。 五点四也是 open ai 迄今为止 token 效率最高的推理模型, 解决同样的问题的情况下,所需 token 大 幅下降。 codex 在 fast 模式下,其 token 的 生成速度最高可以提升一点五倍,同样的智力,同样能力,只是快了百分之五十。 这里重点介绍一个他们很有趣的一个场景,就是 g p d。 五点四呢,发布了一个实验性的 play right interactive 技能,让 codex 一 边构建 web 应用,一边呢,在浏览器上通过 play right 格式化的调试测试,可以理解呢,这是一个双方拉扯的关系, 生成者呢,就是 codex 通过网页来构建,而测试者或者说是评估者呢,是通过他的 play right, 通过屏幕操控电脑来测试效果。所以呢, open 团队也给了一些比较有意思的案例,比如说主题公园的模拟游戏, 凭一个提示词呢, gpt 五点四就能独守的搓出一个完整的经营类的游戏,在游戏的建立过程中呢, gpt 自己呢,又作为一个裁判员 来实现一个全自动运行的检测,从扩建到拆除的整个流程的检测,保证呢,整个的功能呢,是足够丝滑,体验的足够优质,还算达标。所以呢,其实是一个自我进化的,有点像强化学习的一个能力。类似的,比如说战旗 rpg gpt 五点四通过一款回合制的网络战斗游戏, 包含移动行动、站立和遭遇战等完整系统。 playrite 呢,又充当了每一轮携带中的验证界面交互检查并微调 u i 行为的检查员,直到战斗手感、视觉表现和整体的体验全部调优为止。下一个场景叫做金门大桥的飞行体验, g b 五点四呢,可以生成一个超写实的三 d 场景,而 playrite 呢,化身成一个王牌飞行员,作为一个模拟用户的体验,来通过多视角的全自动的巡航的测试,最终呢,保证产品的渲染的效果的稳定性。 通过一小时的高频的迭代呢,最终完成了整个效果的验收。当然还有一系列的 g p t 五点四的性能提升,包括 token 达到了一百万的上下文,包括整个速度和效率的提升,以及幻觉的下降。这些呢,我就不一一来分享了。 有一个比较有意思的产品上的一个功能, g p 五点四编辑呢,是支持随时介入,也不会打断思路。换句话说,你在运行 g p t 输出答案的过程中呢,你可以随时加入新的条件跟注意因素,如果 g p t 还没有输入结果之前,它在编辑的过程中是可以接收更多的信号和信息的。 接下来我觉得 g p t。 五点四的发布呢,是 openai 对 于 jammer 三点一 pro 跟 cloud opera 四点六的一次全面的反击。虽然目前的价格还是很贵,但是可以看出整个的 g p t。 五点四的芯片呢,是没有短板,从推理到编程到视觉的工具使用计算机操作,网络搜索支持工作,每一条线呢,都拉到了顶级的水平。 价格呢,当然短期还不是 g p t 需要优化的点,但是他们回到了真正的铁王座之后呢,对市场也是一个非常有效的回应。当然了,随着 ai 这一波竞争呢,大家能看出来,整个的 ai 颠覆 目前数据来看的话,整个炸子行业呢,已经跌到了二零二四年疫情刚结束这段时间的一个低谷了,按照目前的趋势来看的话,整个的 ai 的 发展速度只会越来越快,无论是 openclaw 还是 cds, 还是这轮的 gbt 的 五点四的提升, 以及一系列的开源模型的升级,我们也希望呢,能看到巨源的速大模型不断的去开启新的领域的升级,让我们看到更多的可能性。这样呢,让整个 ai 发展呢,不至于局限在目前能看到这应用场景。这次呢,我觉得 oppai 的 g p t。 五点四对于电脑屏幕操作的这一个方向呢,又开启了新的里程压力。

再看一下我最新尝鲜的这个 g p d 四五点四的这个版本,大家都网传说它可以直接去操控网网页什么的,实际上是不可以的 啊,它需要有两个前提,一个前提是你要去是美区,然后去下载一个叫 check gbd windows a a p p 的 一个功能,它这个东西它只通过微软商店分发,而且大陆这边目前是无法下载的,包括你用题什么的。 其次啊,这个是它的回答啊 啊,他推荐说,实际上如果你真的要使用 它进行一些电脑网页的操作的话,还是用 oppo core, 至少到目前为止,虽然 oppo core 的 老大加入了 oppo ai, 但是 目前还是 oppo oppo core 的 整个啊操作电脑端的这种能力会远远远远领先。

这波更新直接把 agi 往前推了一大步,朋友们,今天真的太热闹了,被 jamming 和 claudia 了整整一个月的 openai 直接憋出了一个王炸, gpt 五点四 一夜之间所有竞品的神话都被碾碎。这个视频我就用两分钟的时间带你看一下这个模型到底有多颠覆。首先是原声操控电脑, gpt 五点四已经能像人一样通过视觉鼠标和键盘操控你的电脑,包括快速填表、单发邮件、排日程等等。比如这个,他正在把右边的资料填到左边的系统里面,画面我并没有做任何加速。 还有这个,他正在用金妙给团队成员发邮件,并将会议日程分发给其他成员,你觉得这个速度和熟练度怎么样?其次是全能办公, gpt 五点四这次重点提升了创建和编辑文档、电子表格和演示文稿的任务功能。有人认为他的 ppt 已经做的比设计师美, excel 算的比分析师还要准。这里可以看一组对比。 这个是 gpt 五点二做的 ppt, 这个是五点四的。很明显,五点四具有更丰富的视觉效果以及更强的图纹美观性,整体的审美有了不小的进步。 还有这两个表格,可以看到五点四的格式呈现效果更加直观,还区分了文字重点,仿佛一个成熟的文员。值得一提的是, gpt 五点四的幻觉率暴降了百分之三十三,错误率也砍掉了百分之十八。第三是推理编程合体, gpt 五点四在编程测试中已经达到了百分之五十七点七的准确率,超过了 codex, 并且支持一百万 token 的 上下文聊天窗口, 你可以让他来自主开发角色扮演类游戏,在这个过程中,他会自己一边玩一边优化迭代自身代码,优化视觉效果和交互设计,所以小白也能开发属于自己的游戏了。 除了这几个核心升级点, g p t。 五点四这次网络搜索能力也迎来了暴涨, pro 版的准确率冲到了百分之八十九点三,直接反超 cloud, 在 视觉理解能力上也直接突破六千像素的行业极限,再细微的细节都能精准捕捉。还新增了中途可调需求的功能, 你随时能打断调整思路,完全不会打断模型本身的深度思考。所以在我看来,目前几乎没有任何短板的 g p t。 五点四, 这次恐怕并不是简单的升级,而是 ai 生产力的一次里程碑式改革。当他把每一条线都拉到顶尖水平之后,就会用行动来告诉你,谁才是通往 agi 的 路上最可能的终极 boss。

昨晚 openai 重磅发布, gt 五点四正式来了,但这次最狠的呢,不是他更会聊天了,而是他开始更像一个真正能干活的人了。意思就是他可以直接控制你的电脑,他已经能看屏幕、点鼠标、敲键盘、跨软件的去完成任务,比如说打开网页、打开邮件、填表格、跑流程这些原来需要你自己一点点做的事情。 现在 ai 正在从给建议的人变成直接的执行者。更夸张的是,他不只会操作电脑,他还是 open ai 第一代,把强推理能力和 gp 五点三 code x 编程能力整合到一条主线里的模型,他不只是会想,还会写,还会改。官方的演示里有个很经典的案例,你给他一句话,他就能把一个主题公园的游戏做出来, 而且做完不是结束,他还可以自己测试,自己去发现问题,然后再自己优化。这已经不是传统意义上的聊天机器人了,而是在往真正的智能体方向走。 还有细节很关键。 oppai 这次特别强调 gpt 五点四在真实的工作里更靠谱,相当于 gpt 五点二单条事实性错误的概率下降了百分之三十三,诊断回复里出现错误的概率也下降了百分之十八。所以真正值得普通人警惕的是,不是说 ai 会不会聊天比你强, 而是他已经开始会做事了。未来公司可能招的不再只是一个人,而是这个人加他背后的一整套 ai 团队。你不会用 ai, 就 越来越像用手工和开挖掘机的人。比挖矿更现实的问题是,当 ai 已经替你干活的时候,你有没有勇气去当指挥他的那个人?

好的,朋友们大家好,今天 gpt 五点四发布了,融合了操作电脑的能力,它其实操作那电脑的能力本质上就是能够根据截图来输出要操作的坐标和指令。我们的智能体 tino 的 项目也是第一时间 zero day 支持 gpt 五点四的 操作电脑的能力啊。 computer use 的 能力,那就是截图,然后现在我们演示一下,首先就是给他一个名字,操作电脑吧,然后模型这里我们选 gpd, 五点四创建, ok, 嗯,帮我操作电脑,新建一个 ppt, ok, 看一下它怎么操作啊? 它这样子就是先拍张照截图,截图完了之后丢给模型。哎,大家认识 ppt 的 图标啊,这个还是有点牛的哦, 他认识 ppt 的 图标啊,哎,鼠标移过去创建那里完成了,很牛啊,很牛啊,他认识认识 ppt 的 图标,这上面没有任何字,但是他认识 ppt 的 图标太厉害了, 确实不错,确实不错,但是大家也看到这个速度还是有点慢的,因为一张图片大概两三照解析出来其实也还是蛮大的。好,就这样,欢迎朋友们下载来体验啊。

太震撼了,我看到这个消息直接从床上跳了起来,就在昨晚, gpt 五点四正式发布,有多强呢?一句话来说就是 gpt 已经可以直接操作你的电脑了。 openai 说这是针对专业工作最强大、最高效的模型, 它将通用推理、编程能力,还有 ai 智能体工作流完美的结合在了一起。我们来看看案例。首先呢,它具备了原生计算机操作能力, 就是它可以像人类一样看屏幕,然后通过鼠标和键盘跨软件和网站自动执行复杂的工作流。你看啊,这是它正在操控浏览器,自动发送电子邮件,还可以快速填写网页表单。 其次呢,它不仅能编程,还能自己测试和优化,这个真的太夸张了,比如你看这个主题公园的建设游戏就是用一句话生成的,关键是生成后 g p t 正在自己试玩游戏, 再根据体验自行优化游戏内容。最后, gpt 五点四在处理表格、 ppt 和文档方面的表现也大幅提升,生成的内容啊,更具有审美和实用性,并且幻觉显著减少,事实错误率降低了百分之十八到百分之三十三。从 gpt 三点五到 gpt 五点四, ai 已经不再是一个聪明的聊天机器人,而是一个能够直接操作电脑、写代码,并且熟练使用各种工具的超级员工。那随着 ai 越来越强,我们普通人的未来到底在哪里?是不是在不久的将来,大家都要失业了?我相信这是很多人的困惑这个问题啊,我说下我自己的看法, 未来普通人呢,有两种活法,一种叫 ai 工长,另一个叫一人公司。什么是 ai 工长呢?就是公司在招聘的时候啊,招的不是你这个人,而是你和你背后的 ai 团队,公司看中的是你流畅使用各种 ai 解决问题的能力。 那什么是一人公司呢?就是你带着你的 ai 团队开始直接为这个社会创造价值,提供服务,公司不再是购买你的时间,而是直接购买你的服务。我自己啊,就是一人公司的典范,一定要把 ai 当成是你的员工,你是他的领导,你要指挥他去做事,而不是去焦虑 ai 是 不是会替代。