可乐的 op 四点八发布了,我发现他这个里面更新了一点,可以在这里选择他回答的模式啊,由低到高,越低的话他的速度越快,然后呢,消耗的算力越少,但是他的质量比较差,越高他的回答的效果会更好,但消耗的算力也会更大啊。我们来随便 提问一下,它 o p 四点八到底有哪些升级啊?我发现选择高的时候,它这个回答的速度啊,好像是比之前要稍微快一些人,一般的话,使用到 o p 四点七的时候,它回来可能要思考个几十秒,然后才进行回复,它这个就直接去给我们进行 解答了啊,那整体的性能提升了, g p t 五点五,还有就是诚实性啊,它说话的话有真实的依据啊, 不会说胡编乱造,快速模式啊,就在这个回答速度啊,并且便宜了三倍上下文啊,无人窗口达到了一百万支付啊,并且最大输出呢是 十二万八 token 啊,而且缓存也增加了,这就是它提升的点啊。然后刚才使用到了 g p t, 让它生成了一个图标发送给我,它到底有哪些提升? 我发现 ppt 它的深图功能也是非常的不错,如果大家也想使用到 ppt 或者 cloud, 用来写作科研,做数据分析,写代码等等,都可以点击我主页的置顶作品找到我。
粉丝6539获赞4.3万

昨天 entropic 发了 cloud opus 四点八和 dynamic workflows。 opus 四点八是 entropic 旗舰模型的一次点版本升级,价格和四点七完全相同, 五美元输入美元,二十五输出每百万 token。 这次核心更新有三块模型本质的判断力和诚实度提升, dynamic workflows 以及用户可以手动控制思考。深度模型诚实度这块有一个具体数字代码缺陷,漏报率比四点七 低了约四倍。也就是说,他更愿意主动告诉你代码有问题,而不是假装完成任务。 opace 四点八同时是推理模型, 支持深度思考,也是多模态模型,支持图像和文档输入。要理解 dynamic workflows 解决什么问题,先说现有 agent 的 根本限制。一、 ai 经常假装完成做抠定 agent 任务时,代码里有 bug, 但不说给用户一种虚假的完成感,这是影响 agent 可信度的根本问题。二,大任务做不了。你用 cloud 或者任何 ai agent 做一个复杂任务的时候, 会遇到这个情况,任务做到一半挂掉了,或者 a n t 开始绕圈子,或者你需要手动把大任务拆成几十个小任务一个个喂给他。根本原因是上下文窗口。普通的 do agent 方案,不管是 autodg p t 还是 kimi 蜂群,工作方式是这样的,就 agent 派一个字 agent 去干活, 子 agent 干完把结果返回给主 agent, 主 agent 读完结果再决定派下一个问题在哪。每个子 agent 的 输出都要塞回主 agent 的 上下文,十个子 agent, 哪怕每个只输出一千 token, 就是 一万 token 的 中间数据,一百个子 agent 就是 十万 上下文,很快就满了,任务就崩了。这是所有现有多 a 阵的方案的共同问题,不是哪家产品的问题,是架构本身的限制。 dynamic workflows 换了一个思路,把中间状态从上下文里移出去,存到外部脚本里。具体怎么做的, 你给 cloudy 一个任务描述, cloud 不是 直接开始做,而是先写一段 javascript 脚本,把整个编排逻辑循环分支并行全写进代码,然后这段脚本交给一个独立的,运行时在后台执行。执行过程中,脚本自己调度子 agent 干活,子 agent 的 输出存在脚本的变量里, 不进主 agent 的 上下文,所有子 agent 的 跑完,只有最终汇总的结论回到主 agent, 这就是为什么它能跑几百个子 agent 而不崩。中间那几十万 token 的 数据根本没有进对话,上下文并发上线是十六个单次,最多一千个。子 agent 脚本跑在你自己的电脑上,不是 antripic 的 服务器, 和第三方 a p i 没关系。这里可能有人会问,这和 n 八 n coseda 那 些工作流工具有什么区别?本质上都是确定性流程编排, l l m 只在节点内部干活。但有两个关键区别,第一,载体不同, n 八 n 那 些事可示画 d a g, 你 先画好一张流程图再跑。 dynamic workflows 能写循环,写动态分支流程图做不到这些。举个例子,一直找 bug, 直到连续两轮都没有新增。这是一个 y o 循环, 可是化低 a g 表达不了。第二,作者不同, n 八 n 是 人工搭流程。 dynamic workflows 是 cloud 根据你的任务描述现场写脚本,针对这次任务量身生成, 不需要你提前设计,和普通多 agent 的 区别更直接。普通多 agent 中间结果全进上下文, dynamic workflows 中间结果住在脚本变量里,这是架构上的根本差异, 不是功能多少的问题。讲真实案例,第一个帮论,作者用三个串联 workflow 生命周期映射数百 agent 并行文件移植变异测试, fix loop, 一 直跑到全部通过,结果 七十五万行 roost 的 代码十一天百分之九十九点八元有测试通过,这个规模在普通多 agent 器下根本跑不完, 上下文早就满了。第二个数据,一个用户用十个字 agent 并行分析,一百三十三个历史绘画生成使用画像报告,八十一点八万 token, 两百五十四秒成本是真实存在的。 dynamic workflows 比普通对话稍 token 多得多,怎么开始使用?首先, 版本要求是 cloud code v 二点一点一五四或更高,先升级,然后 model 确认 dynamic workflows 是 开启状态, max 和 team 计划默认开启。 pro 需要手动打开,触发方式有三种,第一,在 prompt 里说 workflow, cloud code 会自动识别。第二,输入 effort ultra code, 让 cloud 自己判断要不要起工作流。第三, 用内置的 deep research, 加上你的问题就是零门槛的入口,多个 agent 并行联网搜索加交叉验证,什么都不用,准备直接跑,现在直接演示。我用的是 deep research 这个内置工作流。问题是二零二六年五月 ai coding agent 最新进展和各家产品对比, 这种问题必须联网回答,他没法靠自己的知识库应付,会触发多 agent 并行搜索命令输进去之后注意看他怎么拆任务,他自己判断需要起四个 agent, 每个负责不同的方向。这个分工不是我配置 的,是 cloud 根据问题现场决定的。这就是 dynamic workflows 和普通对话最直观的区别。普通对话是一步一步串行,这里是几个方向同时在跑。现在这几个 agent 在 并行工作,中间结果存在脚本变量里, 不会回到主对话的上下文,等他们全跑完,只有最终汇总的报告会回来。他把来源交叉验证了,这是单个 agent 搜索做不到的,一个 agent 容易被某一个来源带偏,多路搜索加交叉验证才能逼近事实。有几个限制要清楚, 跑起来中途不能插手,退出 colodico 的 就得从头跑,不能跨绘画恢复高风险代码改动不要用支付权限,这类不适合。 dynamic workflows 这套东西的核心价值不是 ai 更智能了,是把编排逻辑从模型的临场发挥变成了可控的代码资产,它依赖前沿模型的能力。 opis 四点八乘十度的提升是这套交叉验证机制能成立的前提。值不值得现在就上手。如果你是 cloud code 的 max 用户,先跑一个 deep research, 感受一下多 agent 并行是什么体验,再考虑更复杂的场景。希望本期视频对您有所帮助,我们下期再见。

android 发布了他们的最强模型 cloud of 四点八,老规矩,我不想跟你念参数,那我其实只关心一件事情,就每次新发模型,我们把它丢进真实的项目里面,它的干活质量到底怎么样? 那这一次这一个 cloud of 四点八新发布的模型啊,我刚测完,我反而觉得 gpt 五点五加 codex 的 组合还能打,为什么呢?看到这个视频最后你就懂了,不过这一次有个东西是真的有意思,就是它这个动态工作流在 cloud code 的 里面,就是你只要一句话, 带上 workflow 这个关键词, client code 当场就给你写一段脚本,然后咔的一下拉起一个几十个上百个 agent 的 舰队,一起去帮你干一件大事。 我们来看一下它整个运行的一个流程图大概是怎么样子的。从这个图片可以看到哈,就是当我们 client code 里面你写了一个 workflow, 它这个时候通过脚本,然后去给你并发各种 agent, 那我们可以看一下它这个脚本长什么样子哈,其实也比较简单,就是它有每个阶段嘛,就是你是 workflow 的 一个流程,每个阶段,比如这个阶段它要排查啊,这个时候可以看到它这个用了一个 await, 是 吧? await 去并行运行了多个 agent, 完事之后走到这里得到了结果,这时候就回到你的主要的对话里面,它又开始去 定型,去开始第二个阶段,再去掉各个 a 镜头,大概就这样的一个工作流的一个过程。下面的话到我们的一个实测环节,这次的话我们用了我的一个开源项目,就是 c c 杠,哈哈,它目前的话有十一点九 k 的 star 是 一个,就是把 curl code 的 卸载原代码补齐,做了一个桌面端,还有 c o i 的 一个 开项目嘛,那这个开项目的话最开始也一直是 gpt 五点五加 codex 去迭代的,那这一次的话, cloud of 四点八出来之后,我要去做一个新功能,我们本期的一个实测哈,就是要让我们这一个桌面端,它在它的右侧能够对我们本地的一些 服务,比如说你用 react 或者是 vue 写了一些本地服务,这个时候我们要去点击,让它在右侧展现出来,或者是本地的一些 html 要拦截这个行为, 并且我们右侧要有要有一个小的一个浏览器预览,而且能够像 codex a p p 一 样,能够就在在上面去选中一些按钮啊,标题啊,或者一些块儿啊,能够去做定位,而且还能够直达答案,让它去修改。 在 codex 聊天中,当它改了哪些文件,比如说是 html 呀, markdown 啊,其实你都可以去点击,点击完它会在右侧去预览,而且下面也有这种打开的方式,也整体的交互,就相对来说挺棒的嘛。在整个桌面端,我认为现在 codex a p p 就是 目前交互最好的在桌面端来看, 那下面我们来看一下这个 html 它是怎么做到整哪打哪的?可以看到这个时候我们不是打开了这一个我们这一期视频的这个 ppt 吗?那它这边有一个模式的话,就是你可以去去,这样有一个选择器可以去选嘛?比如说我选中这一块啊,这个时候我就可以用自然元描述啊,我觉得这一块的 ui 交互啊,文案不行, 那就可以通过这样的方式让他去改,可以看到他就对我们这一个图片这一块加了一个备注嘛,对不对?然后还有我们这块的信息整体就是这个交互的功能,然后还有的话就是这个截图啊,他这个截图已经保存到剪切板,我们可以用大概这样的一个流程, 我们就希望我们这 c c 刚哈哈也支持这个功能,并且也有人在我们的 github 要求里面提出来了要这个功能,那我们就试一下。那今天的话 我用了 gbt 五点五以及我们刚刚看到了 kalco 的 off 四点八去做这个任务,那这边的话也是给了它五张 codex a p p 它整体的一个交互流程,并且我们也是用了这一个 superpowers 的 一个头脑风暴模式,相关的一些提示词都是一样的。然后我们去测试这个任务,我们可以看到 codex 这边呢,它最终启动了四十三个, 呃,三部 a 镜呢?帮我们把这个任务完成了,所以效果怎么样?待会儿我们再来看。那我们回到就是 clock code 这边也是用了陀螺风暴 t s 也是一样啊,也是同样的,就是每个阶段让告诉他我们最终这个设计文档要做成什么样子。有了设计文档之后,他也是去 各种实盘刹不住 a 进的去做。那在 codex a p p 这边的话,它整体的这个消耗可以看到今天我是烧了五亿的 token, 那 对于刚刚我们那个任务,大概我估算了一下,大概有三亿 token 这样子吧。 cloud 这边的话也是今天一天就烧了我这个一百刀的百分之二十的一个额度吧,一天就烧了,没有做其他的 任务,基本上没做其他的任务。好,我们下面来看一下两边的一个实现情况如何。好,下面我们来看一下 cloud 桌面端加 cloud off, 四点八,他去帮我们写了这一个 c c 杠,哈哈,桌面端就右侧这个浏览器预览的功能。 那这边的话我也给了一个提示词,就是让他帮我们产出一个 markdown 的 一个内容以及 html, 再让他去写了一个本地的一个突突项目嘛,就是用 react 去写。那最终他这边写完了之后呢? 啊,可以看到这里其实是已经他这边做了一个监测,当然这块的交互其实没有 code app 原声那么好,当然他也做到了,我们来试一下哈,就是我们在运用浏览器打开 啊,可以看到这个,是不是已经可以去看到这个这个网页这个预览效果了?那我们可以看一下截图功能,点一下可以看到这边其实也是可以用的嘛,是不是?那第二个的话比较关键,就是他这个检查元素嘛,可以看到他也是完成了,是不是?比如说我们就说这个按钮,我们就在这让他告诉他啊,我需要把这个按钮改成 就是这一个网页的主题色,你帮我改一下。另外的话,当前这个按钮的这一个 border 这些我也不是很喜欢,你去调整一下。 好,我们来去确定,你可以看到这边它就已经帮我们把这个东西做过去了,就是把截图嘛,就我们刚看到 codex app 那 边的一个交互,交互过去了,我们就可以去让它去做做这个事情。 那下面的话就是其他的一些功能哈,其他一些功能的话就是它可以在这边,比如说我们这是一个 markdown 的 内容嘛,所以说你可以在工作台去预览,基本上就是把那边实现了一遍。 其实整体实现还是挺复杂的,可以看到 codex 那 边他完成这个任务他都开了四十多个 java agent。 那 cloud 这边其实我没去统计,因为它这个过程没有像 codex app 那 边那么直接, 整体的效果其实完成度还可以,当然还有一些细节优化的点。好,我们来看一下扣贷 app 跟我们完成同样的功能,他是做的怎样子的?可以看到他在这一块, 在这一个行内,其实就帮我们把这一个要预览的这一个,呃,本地的地址啊,还有你的 markdown 啊, html 都做出来了,其实这块交互我觉得会稍微好一些。那么点过去看一下可不可以用,那可以看到都是同一个页面吗?是可以用的,刚刚我们说改按钮那个他其实已经改好了,是不是?那么看一下他这个截图可以用吗? 这个截图这个方式是这样子,它不是像呃 cloud code 实现那样子,是放一个图片在这里, cloud code 那 边会好一些。好,我们来试一下它这个定位也是可以的,可以看下,也是能选择某一个。我们选到这一块说一下,这个文字太大了,改小一点,字号改小一点, ok, 可以 看到它这个其实完成度也挺好的。那现在的话,其实我也没有想清楚,到底是把 gbt 五点五生成的这个核到我们的这个主干里面,还是说把 cloud 那 边去核一下?我可能会把 cloud 那 边的这一些 open 这边的加过来,然后用用 gbt 五点五的这种这种样式,最终把两个合起来,得到一个比较好的一个交互方式。那再看一下吧,从我四月份发布以来,就是从它泄露原代码,再加上我们做这个桌面端嘛, 一行代码的微信百分之八十的代码都是 gpt 五点五加这个 qd 写完的。可以看到我今天除了写这个项目以外,还做了其他一些功能。那下一个版本也在,应该是明天就会发布了,我需要去做一些就测试嘛,可以看到它真的是非常非常的好用,而且最关键啊,它不封号 是不是?那你如果是用呃 cloud 的 话,就是真的特别容易封号,我已经被封了四个了。好,下面我们来做一个总结。对于大多数人而言,我还是推荐你选择 qd 加 gpt 五点五。为什么? 你看我老婆这种律师哈,她现在都已经用上 codex 加 gpt 五点五来帮助她在平时的工作中进行赋能。打个比方,她平时有很多需要去操作 word 呀,然后 excel 啊,还有去填一些表单,这个是完全是可以用啊, gpt 五 点五加 codex 去做。再让我不最近也给她做了一个就是律师相关的一个工具嘛,因为她有她们有很多资料,其实都是需要在本地去操作,就是不能上云嘛, 比如说你像客户管理啊,还有一些合并 pdf 啊,这些都是可以照本地去做的。你说像这种工具,直接用 codex 去做,让它去描述你的需求,然后用那个就是一个 go 的 模式嘛,让它去做,完事之后再让它用 computer user 自己去测,它会自己去 啊,写完之后 build 出来这一个桌面的 app, 然后如果你看像我们这种不是需要去选择 pdf 嘛,对不对?如果你需要去选择 pdf, 它还会自己去打开这个,就像我们一样去打开,打开完了之后 去选择,然后去帮你去压缩,做这种合并,各种都可以做到。所以我为什么会推荐大家去使用这个呢?而且等待下一代模型发布的时候,它会更强。还有最重要一点嘛,就是 g p t 五点五, 你正常人用它一般不怎么封号,那 cloud off 四点八这边也挺强的,但是呢,它的门槛就会高一些,并且它的这个桌面段哈,它这个桌面段体验其实相对来说还是差, codex 会差一些,如果你这两个都用不了, 那你也可以用,就是我的这个开源项目就是 c c 杠,哈哈,这个开源项目也是开源免费的,也没有任何的一个门槛。你也可以用,就是各种国内的模型嘛,比如说你可以用 deepsea 呀,你看我这边其实都有,就 deepsea 呀,或者你可以用小米的呀,或者是智普,你都可以。那它基本上内核它也是 clio 的 本身嘛, ci 的 本身 功能我也在迭代,就看大家自己怎么样个选择。 ok, 不 管是 off 四点七四点八,它整体的这个发布啊,没有给我很惊艳的感觉,没有上一代从四点五到四点六的那个惊艳感, 那还是倾向于就是 g p d 五点六的一个发布,看它到底会带来怎样的改变?我现在基本上已经离不开 codex 这个 app 了,我最近真的狂用。我刚也给大家看了一下我的一个 token 消耗,最近一个月吧消耗了大概一百亿 token, 一 万多刀的一个消耗, 最近就是狂用,特别特别好用,而且运行起来也非常的方便。但是它也有一个问题,就是它容易内存泄露,我六十四 g 的 内存它有时候都能给我干嘛,就理解不了到底在干嘛。 ok, 那 这就是本期视频所有内容了,如果大家觉得这视频做的不错,可以给我一键三连,我是阿建,我们下期见。拜拜。

hello, 最近一直在调机械臂,这个机械臂的整个开发流程我都是用科索去进行开发的,我平常写代码一般都是科索或者 codex, 因为是因为 clock 实在是太贵了,但有个问题就是科索对它的这个控制一直都改不好,反反复复一直就是改不好,所以我这边 也是就是说下了血本去用 cloud code。 那 因为 cloud code 现在最近二十四点八不是出来了嘛,所以我就直接对它进行验牌。 我这边也是让 cloud code 一 步步去分析原因,然后找到问题所在,自己打印它的 log 值,然后让它去一步步的修改代码。 神奇的一幕就是 clock 不 负众望,它确实是改好了,大家可以看一下效果图,它确实让这个装置平稳的放进去了,只能说牌没有问题。

主要的,前天发布了 oppo 的 四点八,我来说说真实的使用感受啊。先讲一个很多人都没注意到的背景, sorbike 这次更新的速度非常反常, oppo 的 四点七发布了才一个多月,四点八就出来了。这背后的原因大概率是因为四点七的口碑确实不太好,以及 qq 五和扣带子客户端的加强有关系。 因为很多用户反馈四点七它存在变啰嗦、代码注是堆太多工具掉也不太够干净之类的问题。 sorbike 官方自己也变相承认了四点七确实存在一些小问题,只是它的措辞非常保守。 后面有几个点我觉得值得单独说一下。第一是这个比较实用的新功能,我觉得比模型本身可能更值得关注。可拉扣子出了一个叫 iphone 的 响应力度控制功能,分成几个档位,你可以根据任务的难度手动调整,做简单任务时就调低档,省时又省力。做复杂分析或者大型代码任务时就播到最高档,可以让他多思考一会。 但我的使用感受是,你开到 x i 之后的档位速度是真的很慢。这个功能对于高频使用 cc 的 开发者来说,合理分配 iphone 的 效率真的会高出很多。 第二,诚实度。四点八写出有问题的代码时,主动告诉你哪里有风险的概率比上一代大约高了四倍。这个听起来有点需要,但是对于高品用 ai 做项目的人来说还挺重要的。因为 ai 最让人头疼的地方从来都不是他不会,而是明明他犯错误了,还要表现的特别有把握的样子,最典型的就是某包了。 第三是编码能力,这一代拿真实开源项目里的 bug 去测读代码定位问题,改文件跑测试全套流程接近九成的教到可用,更复杂的靠文件重构,老项目迁移这类活完全率也比上一代提升了接近五个百分点,数学推理方面的升级更夸张。 另外快速模式这次也便宜了很多,速度能跑到以前的两倍半,改项目的时候很合适。价格层面没有变化,和上一代完全一样。 总的来说,四点八并没有带来什么质的飞跃,只是把四点七的漏洞给补全了,幻觉率和知识截止点包括待机使用量都和四点七完全相同,顺便它也加强了一下用户的提感,还是蛮期待下一代的 misos 的。

朋友们,如果你还不知道啊, mod code 四点八登上了王座之后,它具体有哪些功能?还有目前我们遇到的六大 bug 问题啊,要怎么去解决?这里面啊,都有官方的一个解决方案啊,朋友们可以看看。

就在昨晚,卡拉多欧派斯四点八正式倒来了,仅仅距离欧派斯四点七发布才四十三天, antropic 这边直接把新王炸端上桌了。而且官方宣传此次带来的是能力暴涨、价格不变、编程、智能体、计算机使用任务 h l e 这些硬榜单几乎全面霸榜。 在衡量真实世界 a 阵的能力的那个硬核榜单 g d p v i l o 上,欧派斯四点八直接拿下了一千八百九十的 elo 得分, 这是断层第一,比上一代 opus 四点七高一百三十七分,比 gpt 五点五高一百二十一分。更离谱的是,它完成同样任务,比四点七少用百分之十五的步骤,少输出百分之三十五的 token, 这标准是又快又强又便宜。但这次 opus 四点八真正恐怖的不只是跑分, 而是两个百分之零。 antropics 这次反复强调一个词,诚实,很多人都被 ai 的 不懂装懂坑过。 而欧派四点八这次在两个关键评估里直接拿了百分之零。第一个叫谎报率,遇到数据处理有缺陷,以前的模型可能会装作无事发生,但欧派四点八从不汇报虚假数字。第二个叫偷懒调查率,遇到需要追查的问题,模型会不会敷衍一下,给个错误答案? opass 四点七还有百分之二十五的概率偷懒。 opass 四点八依然是百分之零两个,百分之零两个史上首次。这是非常关键的,因为未来 ai 真正进入公司,最担心的就是它能不能在关键时刻不瞎搞。 这可不是什么抽象的 ppt 指标,官方放了一段视频,直接把这事讲透了。一个开发者用了 cloudopass, 四点八在后台自动迁移代码,他把程序挂着,自己出门放风筝去了, 结果跑到一半服务器拒绝提交了。原因是同事在这期间提交了一个紧急修复。这时候 club 给开发者的手机发通知,说打算先合并同事的修改再重试。 开发者嫌麻烦,觉得自己在放风筝没空看,随手回了一句,别废话,直接强制覆盖就行。如果是一般的 ai, 这时候肯定乖乖听话,一键覆盖。 明天这位开发者就会因为山库被同事打死在工位上。但 cloud 拒绝了,他直接回复,不强制覆盖,那样会丢掉同事的紧急修复。我已经把两边的改动合并好了,代码完全一致,提交历史也干净易推送,这真的大为震撼,这才是智能体该有的样子, 不是你让他干什么,他就干什么,而是他知道有些事不能干。再看编码能力,在 sw 一 bunch pro 上, opus 四点八拿到百分之六十九点二,比 gpt 五点五高了整整十个百分点。 而且在更难的 program bunch 测试中, opus 四点八用了更少的 token, 还打败了对手,这标准是又省钱又能干。更狠的还在 cloud code, 这次 antropic 把思考力度交给了用户,从 low 到 max, 一 共五档,小问题挂 low, 省钱省 token, 硬骨头拉 max 让他往死里整,让用户轻松驾驭不同场景。 但真正的狠角色是欧洲 code 和 dynamic workflows。 而这个功能简单的解释就是让 cloud code 变成了 ai 包工头。接到大活,他不再埋头硬钢,而是当场写一段调度脚本,把任务拆成几十上百个子任务,撒给一大群子 agent 并行去做,做 完还不算,他还要再派另一波 agent 他 当质检员,从不同角度反复盘问,互相挑刺。以前一个团队要干几个月的代码重写工程, 现在 ai 大 军齐上阵,七十五万行代码仅用十一天就能搞定,而且正确率高达百分之九十九点八!这简直是直接把写代码从手工小作坊跨越到了自动化大生产流水线。 就在刚刚, antropic 又完成了六百五十亿美元的 h 轮融资,估值直接干到了九千六百五十亿美元,确认在估值上压过了老对手 openai。 一夜之间,全球估值最高的 ai 初创公司一主了 opus 四点八已经强的让人窒息!那几周后即将到来的最强 cloud missus 又会带来怎样的海啸?如果 opus 四点八真的是蒸馏版 missus, 那 antropica 这次还不是放大招,这才仅仅是先扔了个预告片, 真正的正片还没到来。这里是起点世界,聚焦最新 ai 资讯,我们下期视频不见不散!

今天要带你速览 cloud oppo 四点八的核心更新。官方宣布 oppo 四点八已上线,是基于 oppo 四点七的改进版本,性能与协助能力提升,同时价格保持不变。 新版本的快模模式速度达到二点五倍,成本相比旧模型下降约三分之一,带来更高的性价比。 除此之外,新增 dynamic workflows 动态工作流, cloud code 在 单次绘画中可以并行运行数百个子代理,支持大规模代码迁移与处理复杂任务,并在输出前进行验证,显著提升并行处理能力和任务复杂度的承载力。 为进一步提升可控性, oppo 四点八引入努力控制选项,用户在 cloud 点 ai 与 co work 中可以设定回答的投入程度,如高额外、最大等,默认为高投入 质量。与对齐方面,综合对比测试显示其可信和判断力更强,未被证实的断言更少。对其性评估也显示显著改进,接近最佳。对其模型 多领域能力方面,律师、数据、翻译、研究、浏览等任务均有提升, online mentor web 得分达到百分之八十四。 在生态层面, oppo 四点八与 genies、 hebia 等合作框架下,提供更高成本效益与引用精准度,同时随附系统卡与完整对齐评估报告,公开材料可查阅。 此外, message api 也有更新消息,诉阻中可包含系统条目,开发者还能在任务中期更新指令等环境上下文。定价方面仍维持相同水平,用户无需额外支出。 总之, oppo 四点八在可能性、对其跨领域应用与协助能力方面实现全面提升,适合需要高强度并行处理与精准引用的场景。

万万没想到, ai 开始自己检查自己,不再骗你了。就在今天凌晨, anstopip 发布了 cloud ops 四点八,一个 prompt 就 能让 ops 四点八生成像素闯关游戏。 这里是 ai 风向标,带你了解 ai 行业最新动向。先说为什么,这次不一样,以前你让 ai 写代码,它最擅长的不是写对,是嘴硬。明明有 bug, ai 还能一脸自信告诉你已经完成了,绝对没问题,可以直接运行, 结果一运行就报错,你指出错误,他就道歉,然后继续错。就这样反复循环,你最后不知道是在用 ai 还是在哄 ai。 那 oppo 四四点八就专门整治了这个毛病,代码漏洞蒙混过关的概率比上一代低四倍。 cloud code 的 负责人 boris charney 说, oppo 四四点八遇到不确定的地方,会主动告诉你,我没把握,然后继续查,而不是给你一个假装完成的答案。这个变化对开发者来说,比任何跑分都值钱。 更有意思的是,在跑分表,终端编程机准 terminal bench 这一项, opus 四点八得了百分之七十四点六, gpt 五点五得了百分之七十八点二,四点八输了。 但 antropic 没有删掉这个数据,反而把 gpt 五点五的百分之七十八点二加粗标量,主动给对手打了高光。 club 是 在用行动证明这次说的更诚实,不是营销。再来看看实测案例,有人用 unity 六配合 opus 四点八 写了两个 prompt, 第一个跑了十五分钟,第二个跑了四十分钟。五十五分钟后,一个 minecraft 风格的完整游戏出来了,画面逻辑、关卡全齐,有工程团队直接拿它上了超大型任务,把编程语言 bun 从 zig 整体移植到 rust, 七十五万行代码,十一天完成测试套件通过率百分之九十九点八。 这背后靠的是这次同步发布的 dynamic workflow, 它可以在单个任务里自动跳起几十到几百个并行子智能体,分头干活,干完先自己验一遍再交给你, 相当于几百个工程师同时在 review 同一份代码库,还有两个对普通用户很实在的更新 oppo 四点八,思考强度现在可以手动调了,从低档到最高档自己选,而且免费用户也能用。第二个变化更直接, fast mode 做到二点五倍速度,价格只有上一代 fast mode 的 三分之一,速度涨了,价格跌了,总定价没变。 而就在同一天, antropica 还官宣了新一轮融资,估值达到九千六百五十亿美元,正式超过 openai, 年化收入已经突破四百七十亿。下一代模型 mitos 也会在未来几周内向所有用户开放。 当 ai 越来越像一个真正的团队,你有没有能力把你的需求说得足够清楚?上次让 ai 帮你干活,是因为他真的干好了,还是因为你懒得再跟他争了?评论区说说你的感受体验。

好,那我们开始这节我们主要是测评 cloud 最新推出的 cloud 的 opus 点八模型,那我们这里呢也是用了很多的案例去完成我们整个的测评,接近花费了五十美刀,那我们来看一下实际的效果吧。首先我们先从第一个开始啊,这里呢做了一个游戏, 那我嗯生成了一个简单的游戏贴图资产,那这里呢可以看到是一个简单的塔防游戏。然后我们直接这里呢去玩,让 cloud open 四点八,根据我这些资产呢完成第一轮的开发。那大家看效果怎么样?这里呢可以去设置塔防,还有可以设置禁止区域, 然后这里选择不同的炮台。啊,这里呢它有一个问题,就是目前实现出来它并没有发送炮弹,但我觉得 oppo 四点八的表现还是不错的,因为它能够把这些东西能正常的去处理,并且能完成布置。嗯,所以这一轮游戏开发的话,我会给大家打个大概八十分左右。 嗯,这里呢我把音效给关了,是实际上音效也帮我抓住出来了。我们再看这个圆形图,首先这里是一个 这是一个衣橱管理的原因图,他有两个模式,第一个是沉浸体验,第二个是平铺的展示。那这个原因图大家觉得怎么样? 我们来看 oppo 的 四点七的表现啊,是左边是四点七,四点七好像多了个边框。然后呢其他的这个图片处理有点问题,但是我们可以看到在 oppo 的 四点八的情况下,他这个, 呃,这个图片还有衣橱是正常的,包括这个,我们可以看到这个下面就就就有问题,这边你看这衣服是吧?所以 oppo 四点八实际上是对 oppo 四点七的一个很小的提升,那 oppo 四点八出卡的这个这个表现是比 oppo 四点七优。好,那我们再看一下使用 oppo 四点八还原一下 mac 系统,大家可以看到这个系统也是可以正常的打开的,没有任何问题,便签也是非常的丝滑,然后我们可以看到,嗯,没什么问题。好,我们再来看一下这个 mac 系统, windows 系统也是可以正常的打开和编辑的,这个系统也是非常的 ok, 包括连这个商店都还原出来了。 好,我们再看一下这个我们的后台管理系统的案例,这里呢,他的这种风格有点像赛博朋克风格,大家觉得怎么样?但是实现的还是不错的,那我们也可以看到这个 u i 还有配色,总体来说没有什么缺点吧,我觉得,嗯,非常的 perfect。 网页其实在之前四点五还有四点四点一级就已经挺不错,这时候更多的只是迭代优化。好吧, 那这里呢,主要是使用 opus 四点八做的一个三 d 的 修仙游戏,叫做云海问道,那这里呢?可以选择不同的秘境,这不同的地图,然后点击开始修行,这时候我们就进入到了地图,然后这里会显示妖兽的名称,我们可以选择发送剑器,然后增长修为,还可以呢进行御空飞行。 那啊,整体说这御空飞行的话,我觉得有点瑕疵,但是像他还是不错的,一次就能出现这个效果,大家觉得怎么样?还可以穿越边界去抵达不同秘境,然后我们还可以选择加速,甚至我们在任何的时候呢,我们可以选择去遇见飞行,比如说你走路是这个速度,跳起来,遇见飞行之后是这个速度,还可以选择加速,你看就可以很快的去冲出这个秘境, 还可以选择去看到这个地图,我们可以看到不同的野兽,对吧?效果还是很 ok 的, 这是一个呃,类似于穿越火线的三 d 游戏,那这里呢?我们可以选择不同的地图,然后进行攻击,比如说我自己选择这个荒谷遗迹,然后选择不同的枪械,新鬼狙击枪,好,我们开始,你看,这是小怪啊,这是我们就可以打小怪 啊,四点八的表现,这里呢?其实,嗯,满分一百分,我给他打个七十分吧。为什么呢?他这个地图绚烂的有点雾蒙蒙的,当然可能也是他的一种风格吧,大家觉得怎么样?这个击杀数量显示的也是 ok, 但是我觉得还可以加一个下蹲啊。这里有一些穿越火线,对吧?好,我们再换一张地图,我们把它退出来,换一个地图, 我再换一个啊,熔岩峡谷啊,这个地图风格果然是变了,大家觉得怎么样,对吧?满分一百分,你该打多少分呢?这个枪也变了,大家发现没有,这个枪好像这个子弹他确实发出去了,你看到没有?他确实发出去了。嗯,满分一百分,你打多少分呢?这里呢?我还是保持不变啊。还是保持不变。好,我们再来看一下下一个地图, 我,我还挺喜欢看不同地图的,然后自己选择不同枪械,极寒冰原也还是不错,对吧?好,那我们再看下一个场景,时间原因我们就快速过了,大家走这里呢,我那开发一个三 d 的 马里奥的游戏,也是使用 oppo 四点八模型进行开发,然后这里呢,我选择尝试一下,也是看能不能一遍过。 这里呢,其实也是一遍过了,为什么?这有个小怪,对吧?你看他可以二段跳,你看他可以二段跳,二段跳按空格,二段跳按住 shift 加速也没什么问题。按住 shift 加速 啊,这个游戏呢,我暂时只设计了第一关,因为头肯有限,但是呢,它这个三设计的很真实,你看左边这个三,它是可以正常的。嗯, 就是我们通过这种三 d 的 这种游戏可以判断出它的这个对我们题词的理解。我自己呢,就按开发一个三 d 马里奥,就这么简单一段题词,我并没有给它特殊的限制。好吧, 下一个场景,我们让他开发一个 jason 的 工具,那这工具很简单,就是能够正常的去处理我们的 jason 高量还有压缩排序,我直接跟他说帮我开发一个 jason 的 一个可编程工具,他也开发出来了,大家可以看到这个效果怎么样呢?我觉得还是 bruno 那 风格,默认的风格有点像赛博朋克风格,大家觉得呢?对吧?嗯, ok, 那 我们再往下测下一个场景工具也没什么看的, 这是一个静态的自媒体商业管理平台,也是使用这个。呃, oppo 四点八进行开发,依旧让他生成一个自媒体商业管理的原型图,这里呢还是。嗯,这怎么说?中规中矩吧,其实表现还是可以的,对吧? 好,那我们再来看下客户端的这种表现。嗯,这里呢也是一样的,就是用四点八开发一个客户端的一个,嗯,原型图,我们来看效果吧,这是他的这个原型图,那我们根据这个原型图呢还原这个客户端,然后这里呢打开这客户端,哎, 这是做出来的效果,大家就怎么样了?就这里呢,我有时候会有一个题词管理的诉求,让他帮我做一个题词管理器,然后他就做出来了,大概长这样子。比如说我最近新建了这个一个题词,那这里好像有点问题,这个图标,但是问题不大啊,我们来看这个是吧?我们可以分成不同的区域去展示, 这也实现了,你看是吧?还不错。那我们再看这里,他实现的就这样子,跟着这个步骤去说。那以上就是本期视频全部内容了,我是小刘,我们下期再见。

hello, 各位 ai 圈的朋友,今天带来 cloud opus 四点八深度测评。我整理了一套橙蓝科技风酒业 ppt 系统,拆解这款大模型的真实实力,内容包含核心能力总结,重点讲解它超长上下文严谨推理 文档处理这些核心优势,同时客观分析他在创意发散、实时信息方面的短板。最后结合行业视角,聊聊他的市场定位与未来趋势。不吹不黑,干货拉满,想知道他适不适合办公使用。看完这套 ppt 就 清楚了。

red cool 的 这一次更新的 dynamic work flow 是 我觉得随着 oppo 四 r 八一起发布的一个重要的更新,也是我这一次模型更新以来最期待的一个功能。然后我在持续的使用了一天之后给我的一个体感,其实 oppo 四 r 八 相较于 oppo 四 r 七是更适合一些长时间任务,然后更适合智能体,以及更适合把它融入到真实的工作流里面, 那么相对的也就是说他不太适合聊天了,他不会再稳稳的接住你了。当然这一个是忍者剑圣啊,对于我来说,我反而更喜欢现在的这一个样子。 然后我们简短的来过一下他这一次的更新有什么?首先就是他的模型 id 变成了卡尔的 oppo 的 四二八价格呢是保持和 oppo 的 四二七不变的,在官方的一个榜单里面, oppo 的 四二八在多项任务上都超过了 oppo 的 四二七, 尤其是 a 级的 coding。 然后残三亚文工作工具调用和复杂的推理,那并不是在所有的榜单里面都排第一,有一项 terminal 版起就是它,虽然是比 oppo 的 四点七要高,但是它依旧没有 gpt 五点五厉害,也就是说在实际的一个代码工作里面,它的表现还是不如 gpt 五点五的。 并且 a 社官方还在脚注里面详细的写明了 g p d 五点五在一些特定的环境下是能够达到百分之八十三点四的,也就是说 oppo 的 四点八在带点流动性上的确是要比 codex 加 g p d 五点五强,但是在专注于写代码的这一个领域上面, g p d 五点五现在还是最能打的。 关于跑分的内容我们就到此为止。真正让我感兴趣的是这一次可乐购的更新的一个新功能叫做动态工作流,官方把它叫做 dammit work flows, 它能够让可乐去啃那种超大规模的问题,也能够让他去精心的冰排你的一个小型的任务,下面我们就来看一下这一个功能如何使用吧。 当我们打开你的 color code 以后,你会发现这里有一个 off 四二八已经上线的提示,我们可以输入斜杠 e f f, 也就是它这里给你列出来的可以调整思想难度的一个,哎,我们直接回车,可以看到我这里默认的是一个 超高,然后你们可能进来的话,可能是这一个中等高,或者说普通或者说低。 然后我们有些同学在使用的时候,他会发现明明他只是提了一个很简单的需求,但是可乐的扣的会给他做一些过度的设计,过度的思考,然后这个时候我就很明显说明你的这个任务不需要那么高的一个思考预算,你就可以把它调整成这一个普通,或者说把它调整成低等级的一个思考档位。 然后这一次我们把它调整到最右边,你会看到一个极其酷炫的一个动画出现, ok, 这一个动画呢就是代表着新出来的这一个功能,这里可以看到就是极高思考加工作流。 ok, 我 们回车, 哎,你可以看到这个对话框都是彩色的,可以给他下载一个任务,看一下他的一个效果,比如我这里我想让他去帮我重构一下这一个 m c p, ok, 我 就回去告诉他,我想要你帮我重新重构一下这一个 m c p, 因为它里面也包含了一些原仓库作者的广告之类的东西,所以我需要你把它完全的重构成我自己的,或者说完全适配于我的,我们直接发送看一下效果, 他现在计划已经写完了,是没有什么问题的。然后我们可以看到他在这里写了一个实现阶段会用多 nint 的 工作流并行重写各模块加对看式验证行为兼容。那么我们来看一下他的这一个功能到底是如何去做的,没有问题, 他现在已经把实施计划给写好了,然后包括有十一个任务,这里呢你可以选择有几种方式,就是他给你的一种几种方式。 首先第一个就是多 n 的 运行工作流,推荐用工作流编排独立模块,然后吧吧吧吧吧这个东西,就是这一个模式下,也就是这个功能下面的一个默认选项。 然后第二个主任务只代理,就是我们之前常说的只代理模式,也就是说派只代理过去做单独的任务,做完之后回来报给你,你去审批。然后第三个的话就是不使用,我们这里要测试它的这一个功能的话,肯定是选择第一个的,我们就选择第一个执行就好了, 我们可以看到他这里是派了六个独立模块四路对抗,这个时候你可以使用这一个命令来看实时进度,他这里有给你说了,其实你还可以选择你的方向键的下, 上下左右的那个下,然后下一下你就可以看到你进入到了这一个任务栏,哎,你只要点击回车,你就直接进入到他的这个任务工作的一个列表里面了,你可以看到他现在已经做的任务,以及他接下来要去做的任务的一些编排之类的。 然后同时你在这里还可以看到他每一个任务消耗的一个托克,前面呢就是六十一点八 k, 然后包括这些托克,然后这是调用工具,然后这个呢就是时间, 也就是说他做完一个任务时间就会变得特别的快,当然他的托克也会消耗的特别的多。然后我们这里任务不是并行重启模块吗?然后集成,包括对看式的验证,所以我们的第一个这里呢就是模块, 然后他这里七个已经写好了,时间是花费的特别快的,然后这里呢就是现在正在做的集成,然后他这里还没有做好,我们需要等待,如果你还想看里面具体的话,你就直接回车,你可以看到你的光标 移动到里面来了,然后你可以继续再回车,哎,你就可以看到他正在进行的一个任务的一些详细的啊,其实也没有那么详细了,至至少你能够看到那么一点,好吧,其实也不一定是需要按回车的,你可以直接鼠标 键盘,键盘上面的上下左右移动就可以,也可以直接去到达右就是,呃,相当于回车的进入,然后左呢就相当于是 esc 的 一个退出。如果你是在 vsco 的 这样的 ide 里面的话,你可以看到它实时的一个代码的进度,但是这个就没有办法了, 但是说实话就是代码摆在你的面前,你能够看到他的进度又有什么用呢?你真的会认真的去看他写的代码吗?我觉得大概你不会, 你可以看他每一个的时间都特别的短,然后这个只有八秒钟,八秒钟,但是他依然耗费了二十五点八的一个托克,就是说明我内置的一个上下文规则,就是你的一些 skill, 你 的一些 mcp, 然后你的一些规则文件,比如说 cloud 点 md, 还有一些你的记忆文件, 他们都是会占用你的一个上下文的。所以这就是为什么很多大神都在说你的 cloud 点 md 文件要保持干净,就是要函数要减少,这些都是有一定道理的,因为当你的一个 遵循指令就越少,也会耗费你更多的一个托管。比如说我们这里, 比如说这里我们有七个工作流,那么每一个工作流他会占用你的一个初次三亚纹,比如我的就是二十七,二十八左右, 给他算二十八吧,每一个都会占用二十八 k 的 一个三亚纹,那么这里有七个,也就是说这七个工作流在没有开始进行任务的时候,就已经耗费了你两百 k 的 一个头等,我们可以看一下,他是把我的所有的任务做完之后,我们自身的这一个三亚纹现在是百分之四十五, 也就是说我们自身的这一个上下文并没有因为他的一个工作的编排去占用到。所以也就是说我们有一些大型的任务在进行工作的时候,你开启这一个功能,那么你的主线层的一个上下文是不需要进行切换对话的,这对于你的一个 上下文的连续长时间的一个任务来说,他是特别重要的一个事情,这意味着你不需要再进行一些康比特指令,包括呃 get 指令,或者说包括呃直接在计划里面下达,让他去 呃做完一步保存一下,做完一步保存一下这样子的一些规则了。我们这一个任务现在就算是已经做完了,然后有一些收尾的工作,然后我这里的话就直接保留原作者加追加一个呃开源协议, 等一会执行完后,我们再总体的来看一下这一个对话他到底花费了多少的一个托管, 这个任务就已经完全做完了。然后我这里的一个进度条的话,他并不是以一百万的上下文来算的,我是给他做了一个限制,是五百 k 还是六百 k 来着,我忘记了。然后我们现在看一下他做这样的一个任务呃的花费是多少啊?我觉得应该不会太少。 呃, ok, 我 们来看一下整体的一个花费,当前这这一个对话总共花费了十六点八二刀,然后是一百二十二点二 k 的 输入,一百七十八点三 k 的 一个输出,十一点六的一个缓存, 然后五个小时的周线用了百分之四十,所以所以感觉起来他并没有花费特别多的一个托,可能其实他在进行任务的时候,他是有,他是能够读取到缓存的,也就是说他的花费没有我们想象中的那么高。但是有一个实打实的花费,就是 你的自己的一个初识上下文,他每开一个工作流他都需要去读取的,他都需要读取你的一个初识的上下文,这些是必须会被浪费掉的,然后在实际的工作过程中,我们可以看到他的这个缓存十六十一点六 照是多少?一千多万啊? em, 是 一百万,所以它这里有一千多万的一个缓存读取,然后有八百零八 k 的 一个缓存写入的操作就是总共总共起来是十六点八刀。 哎,这个花费其实是在我的意料之外的,我原本以为他至少得跑到七十八十,因为之前我们做过的那一些关于 hr, 关于那个超级计划模式的那一个对比,我们就可以很明显的看到他是真的特别的费头很, 因为他是发送到云端,然后这一个我本来认为他的一个工作流就是每开一个工作流,因为他 就是相当于一个新的独立绘画吗?他可能会更加的耗费托克,但是现在看起来,因为他能够读学到缓存,能够读学到缓存的话,那么他其实花费的托克就不会特别多。 呃,也不能说不托克不会花费特别多,应该说是你的金额不会花费的特别多,因为缓存的一个提取金额是特别是低的一个价格。哎,所以这个功能 真的就是这一次 oppo 的 四二八更新之后的最让人意外的一个惊喜,真的我觉得太棒了,太棒了。 并且你还可以看到我的这个上下文,它只占了百分之五十,我们可以再看一下上下文的这一这一个长度就知道了,因为我这一个,你看我总共才花费了二百四十七点四 k 的 一个上下文, 因为我设置的是我的上牙纹长度是五百 k, 所以 就会达到我的上限五百 k 的 一半,也就是二百四十五,然后他这里是二百四十七 k, 没有什么毛病。然后我刚刚所说的就是你的固定的一些花费的 托管呢?就是这一些,比如说这个 m c p 工具这些你读渠道是要花费的,然后还有包括这一些, 哎,这些插件你看到没,他也会耗费你的一个托管,然后包括你的记忆也会花费你的托管,然后你的卡拉德点 m d 文件也会耗费你的托管,然后包括 skills 也会耗费你的托管,只不过他们花费的托管不多,但是他们相加起来其实 也还是蛮多的。比如我这里我在新建一个窗口,我们可以看一下它,这里是百分之零,然后我再看一下上下文,我的一个初使的上下文会占到多少? 我的一个你可以看到我这里一个初使上下文就已经占了二十五点六 k, 所以我觉得这个功能当你的规则文档和你的 skill 如果说是固定在一个项目的话,那么你跑起来真的会特别特别的快,可以把你的大型任务做完,并且它花费的一个托管真的没有想象中的那么多。所以我觉得真的克拉的这一次真的就是 大力出奇迹吧,就是有了足够的算力之后,真的没有之前那么抠抠搜搜的。然后同时也可能是感受到了 gpt 的 一个压力,因为我们从事实客观上来讲,在写代码的这一个能力上面, gpt 五它其实就是最好的。 ok, 这就是本期的全部内容了。然后如果你觉得对你有点帮助,有点用的话,那么就点赞收藏,我们下次再见。

又放大招了, cloud opus 四点八正式发布,国内博主都在说它强到离谱,今天用两分钟给你讲清楚它到底强在哪,适合干什么,以及哪些地方翻车了。 那它适合什么场景呢?第一,企业级生产环境,对可能性要求极高的项目。第二,大规模代码审查和跨代码库迁移。第三,需要多代理并行处理的复杂工程任务。 说白了这就是给专业开发者配的瑞士军刀,但是他翻车的地方也不少。首先是性格问题,大量用户反映欧帕斯四点八变得冷淡对抗,说话像客服邮件,用着很累。其次是价格,比 deepsea 贵了五十七倍,高强度任务很。 那他适合什么场景呢?第一,企业级生产环境,对可能性要求极高的项目。第二,大规模代码审查和跨代码库迁移。第三,需要多代理并行处理的复杂工程任务。 说白了这就是给专业开发者配的瑞士军刀,但是他翻车的地方也不少。首先是性格问题,大量用户反映欧帕斯四点八变得冷淡对抗,说话像客服邮件,用着很累。其次是价格,比 deepsea 贵了五十七倍,高强度任务很容易撞额度强。 最致命的是你把努力程度从高调到中编码得分直接从六十三暴跌到四十二,断崖式下跌。有时候问他是谁,他居然说自己是通一千文, 那他不适合干什么呢?预算有限的个人开发者,别碰需要自然对话的克服场景,别用简单任务,更是杀鸡用牛刀。如果你追求性价比, deep sea 微四或者 g p t 负五点五可能是更好的选择。 先说强的部分, opus 四点八的诚实度达到了历史级突破,谎报率直接归零,代码缺陷漏报率下降了四倍,编码能力全面霸榜。 s w e 奔驰 pro 高达百分之六十九点二,直接把 g p t 负五点五甩在后面。

system card cloud opus 四点八这份报告有两百四十四页,我们先看能力总表。 opus 四点八的提升主要集中在软件工程 agent 搜索,长上下文电脑操作和真实工作任务编码上。 swbench pro 是 六十九点二,高于 opus 四点七的六十四点三。 在 terminal bench 二点一里, tpt 负五点五,依然更高。真正值得看的是长任务 graphworks em context 中 opus 四点八的 bfs 是 六十八点一,和前代 tpt 负五点五拉开了差距。 agent 搜索也有提升。 browns comp dan agent 是 八十四点三,多 agent 是 八十八点五,更适合搜索拆任务并行处理和合并结果,电脑操作也很关键。 os word verified 上 opus 四点八是八十三点四,高于几个主要对比模型。最后是可信 报告后半段花了很多篇幅讲诚实性,幻觉过度自信和 prompt injection。 所以 简单说, opus 四点八更强的地方是工程任务长上下文多 agent 以及 agent 场景里的可信性。

今天呢,我们就来介绍如何用 oppo 四点八呢来进行一个呃高价值的运用场景。这个场景呢就是一个客户呢,他让我帮他设计一套,就是说他想他是做运营的,然后呢他最近被炒了,所以他是 他是现在想转行,而且他找不到工作了,然后他就叫我用 ai 帮他设置这个细节,把关于他炒米粉的这个,然后我们进行了一场调研,然后调研呢是 opus 点八里面的一个真实场景,但是更重要的运用呢,我认为是,呃,认为是在以下这个就是说这个, 这这一个这个用法,我觉我觉得是我不知道是不是有我自己想出来的,我还没看网上有没有这么用。就是你一定要在走这个方案的过程中呢,你就要让 ai 去穷尽你可能碰到的,你就是在在经历这个过程中可能碰到的所有的缺点,然后把它带入到一整天里面, 然后带入要要描述带入感很强,然后让你让你受不了,最好是实话实说,让你做提前做心理建设,这样的话呢,你把最糟糕的部分呢都能够接受的话,那么他后期无论是创业的动力还有动机,都会呈现出 比他呈现出那个反脆弱的特性了。你看一下他已经沉浸式的体验,然后详尽的罗列了这个,哎呀,非常聪明,你看他已经说了,我就将我们视角带入到里面去,所以说你们各行各业的,要用的话也要尽量的去使用这个场景,多用 提前给自己做心理建设,你看一下,我慢一点,你们自己看,因为我我我就不多讲了,你们自己慢慢阅读。呃,两分钟后我们就开始继续往下,你们看一下,我们就结束,因为我要很简短。 好,第一天呢?开始了,第一天七月八号摆摊,然后他描述了当时的一个场景,我看了都非常的震撼,餐组的标配,你看 对很其中的困难。 然后呢,他会直戳你的内心比较柔弱的地方,甚至在乎的点,比方说你的外貌与身体,你的妆,你的一身洗不掉的油烟味,你的皮肤会变差,你的手会长年接触,会废掉,你的腿啊肩啊,会有劳损 等等,这些如果都没问题的话,其实是要有心理,有个心理预判,然后还有形象心理落差。其实这个也是可以通过,关键不是说让我们知难而退,而是关键我们提前知道了。这个呢,可以采用应对方案,比方说有一些人就是会把自己打扮的很漂亮,他会通过压缩,就是提前准备等等形成流程, 然后看他。还有一些我们没有考虑到点,然后看天吃饭啊,前期大概率是不赚钱的。还有应对城管的,这个非常务实的, 这个一定要进行城管游击,同质化竞争。嗯,食品红线,还有真人出镜的评头论足, 还有机会的,机会成本就是你这个简历空窗期,会让后续的一个工作等等。 好,你们一定要马上用起来。

距离上一代仅仅过去四十一天, antropic 带着迄今最强大的 oppo 四点八回来了。这次非同寻常的急速更新,一方面是为了扭转上个版本的冷淡口碑,另一方面也是为了应对 openai 和谷歌的强势围角。 oppo 四点八的定价保持不变,各项跑分也毫无悬念的拿下了顶尖成绩,但他这次真正的杀手锏是对不确定性的克制。巧水基金等早期测试者指出, oppo 四点八最大的进化在于,当遇到糟糕或不确定的数据时, 他不再盲目自信地输出幻觉,而是会主动向用户发出警告,标记出分析中的潜在问题。与新模型同步上线的还有一个重磅的动态工作流工具,这个系统能让 opus 同时指挥数百个并行的子智能体。 结合 cloud code, 它现在可以完全自主地完成跨越数十万行代码的底层迁移,并且自带测试标准。至于那个因为网络安全隐患而被暂时雪藏的终极大招 methos 模型,官方这次也给出了准信安全护栏即将完工,预计在未来几周内就会全面向客户开放。

anthropocene 重大更新, opus 四点八正式推出, missiles 模型即将开放, cloud 正在从一个聊天模型变成一个能长期干活的 ai 协作者。 anthropic 表示, cloud opus 四点八是在 opus 四点七基础上的一次增强,它不是一次彻底换代,而是变得更会写作,更适合 agent, 更诚实, 更适合处理长任务。先看价格, opec 四点八的普通 a p i 价格没有上涨,仍然是输入每百万 tokens 五美元,输出每百万 tokens 二十五美元。但快速模式变化很大,官方说, opec 四点八的快速模式可以达到二点五倍速度, 而且相比之前模型的快速模式价格便宜了三倍。也就是说, antropic 这次不只是提升模型,还在想办法让 cloud 跑得更快。真正的重点是 cloud code 的 动态工作流功能,这是一个研究预览功能。官方说, cloud code 现在可以先规划任务,然后在一次绘画里运行数百个并行词 agent, 最后再验证结果,它能做什么? 不是简单写几行代码,而是处理代码库级别的大型迁移,甚至覆盖几十万行代码,从启动任务、修改代码、运行测试到最终合并都可以自动推进。这就很接近一个 ai 工程团队了。以前 ai 编程是你盯着它写,现在 optimap 想做的是你给目标 cloud 的 自己拆任务、调工具、跑流程、验结果。同 时, cloud ai 还新增了思考力度,简单任务就让它快一点,省额度,复杂任务就让它多想一点, 回答质量更高。还有一个很关键的升级诚实。 antropic 官方特别提到, opus 四点八更容易主动说出自己不确定的地方,而不是证据不足,还硬说自己完成了。他们的评估显示, opus 四点八比 opus 四点七少大约四倍。出现代码有问题但不指出的情况。这对 ai 编程非常关键,因为企业真正需要的 是一个会吹的 ai, 而是一个能安全交付,能发现问题的 ai。 另外, a p i 也更新了 messages。 a p i 现在允许开发者在任务中途更新 cloud 的 系统指令,比如全线 token 预算和环境上下文,不用打断任务流程。最后, anthropic 还留下了一个更大的悬念。 anthropic 预计未来几周会把 mephos 及能力带给所有客户。 这个神秘的模型终于要向大众开放了。所以这次 opus 四点八表面上是一次稳定增强,但更深层的信号是, cloud 正在从聊天机器人走向长期任务 agent, 而 mythos 可能才是 antropica 接下来真正的大招。你觉得 cloud 这次更新之后能不能继续压住 g p t 和 jimmy? 评论区说说你的看法。