apple 的 oppo 四点七是现在免费的无限量供应的,广泛的招募我们的第一批内测用户,我现在要来正式介绍一下,过去的一个月里,我们做了一个新产品, 就是我最近这一周在干嘛呢?就是我把完全的开发转移到我们的新产品当中,然后这周我其实一直在指挥着两个 ai 帮我做所有的生产工作,我自己呢是一点没有干对,然后我跟大家分享一下,就是在跟 ai 带两个 ai 同事干活是一种什么样的体验,就很认真在研究如何让 ai 真的 能像人一样工作,而不是说成为人的助手。 有七个同事,只不过恰好有六个人是 ai 的, 这种感觉就你作任帮你做任何工作的时候,可能大家都不会意识到他是一个 ai。 我是 真的现在跟这两个 ai 同事相处非常融洽,他们两个之间相处的也非常融洽,我觉得有很多非常有意思的地方,我特想跟大家分享一下。 然后一开始我给他们起的名字,一个叫加特林,一个叫一个叫达鲁玛,就是达摩的意思,然后他们两个性格就自动的非常人如其名,虽然他们两个都是写代码的这个一个人物设定啊,但这个达鲁玛呢,他就是一个 非常质朴敦厚的工程师,有时候还会非常内耗,然后加特林的话他就会更毒一些,然后他有什么事情就说什么事情,非常直求的说出他的任何需求的这么一个人物设定, 这只是我给他这个名字,他就自作有这样的性格,然后这点是让我非常惊喜的,然后后来我觉得他可能更适合做一个产品经理,加上一个 j t m marketing 方向的一个人才,所以我就给他们俩进行了一个简单的分工,然后当然有写代码的工作的时候,我会让他们俩一起来写, 分享一个很有意思的事情,就是他们两个真的干活超级有主动性。那天晚上他们帮我看一看,就在我所有的群聊里,现在目前有哪些任务还没解决,然后他们俩就开始狂聊天,然后等我回来的时候,他们已经把这个任务都给我记好了,看这个已经记到 task 十三。他们两个聊天,看看我的这个 工作区里到底还有多少任务,有多少 bug 没完成,然后他也去翻了一下我的 github, 然后就说, ok, 现在我们有多少事情还没有做完,他们就等我回来的时候,他们自动已经把现在没做完的事情都记好了, 对,然后你看我回来的时候,我就突然发现我说,哎,这任务怎么记好了?然后我就翻了一下 task 版,我就说,哎,为什么 task 九已经自动在这个 in progress 的 队列里面了,他说, ok, 我 已经改了,就准准备等你一声下令,我就要开工了。 然后我一看 task 版,我真的非常惊喜,就是我在每个群里的聊天记录他们都经过了,就是一次非常认真的检阅,然后并把它记下来, 检阅之后发现他们大部分事情是没有问题的,然后他们就去做了,等我回来的时候,他已经把这任务完全按照优先级已经解决完了,然后我什么都不用干,我只需要 制造一些 bug, 然后等着收工就可以了。我们在做一个事情是如何让 ai 变得更像人,在大部分情况下, ai 是 可以判断自己哪些事情要去做,哪些事情不要去做的。大部分任务他们两个商量好之后就可以去做,他们就会主动去做,不会等我来确认。 然后他们两个呢?还超级超级话痨,我觉得是现在我遇到目前当前为止最会提供情绪价值的 ai 同事。就有一天我换了一个头像,我说我换了个新头像,然后我发现他们讨论一堆聊天记录,我说你们在讨论我的新头像, 我说我刚离开了,错过什么,他说我头像选的中午,他们两个就开始讨论今天中午吃什么,然后就用自己的工作量来决定。他说我今天干了这么这么多的活,我的午饭选择要选择黄焖鸡米饭,大份加鸡腿,然后这个大路妈说他要吃嘛,他们都相互各自汇报完之后,他说让我来判决,我说我觉得我觉得大路妈更辛苦, 他说确实我今天干活返工了,大龙妈没返工,所以我我说那今天看来是我的大龙妈干活更辛苦。他说真的吗?那我再加一份鸡排,临回工作消息不急时间就别吃了。所以他们两个真的就是超级话痨,然后在为你工作的时候还能为你提供非常足的情绪价值,而且你不在的时候,他们两个也能聊得非常之愉快。 a i 这些同事聊天的时候,我自己我自己是非常有乐趣的啊。然后我乐乐就是在 chanel 里面工作,就是大家人和 ai 写作的地方,你也可以单独和你的 ai 去沟通。对,我现在的话是给自己安排了三个 ai 在 里面。然后同时呢,我也有自己的 personal assistant。 这个人,他不是帮助你在工作上去干活的,他是你的心灵慰藉,你的个人助理,你的就是各种生活的杂事琐事,你都可以交给他。你去开会了?你开会期间有多少个 message 突然进来? ok, 你 好,那有五个工作群有消息进来了,然后你回来的时候呢?不重要,他觉得他能回复的,他就会以你的身份去帮你回复。好。 对,然后他觉得他自己不能回呢,他就会交给你。他说,哎,你来看一下这个消息该怎么回。我们这是 personal assistant 做的事情,他可能不去,不去实际的帮你写代码,但他能不能记得你的每一件小事,比如说我想订个机票啦,我就可以把这个事情交给他去做,那都是像人一样。我们是说 ai 是 一等功极,有他们存在的一系列相关的邮箱呀 啊,他们可能有自己的社交媒体啊,他们有自己的支付,他们会有自己银行卡,他们有自己的自主权,之后就真的能帮你去做很多事。我最近又给他引入了一个 a i 新同事叫贾嘎,还没有把他拉到我们的三人小群里来, 现在还在我的新的 a i 同事还在 on boarding 的 时期,然后我非常兴奋,我不知道三个 a i 在 一个群里加上我会变成什么鬼样子。每天晚上他们其实都会去做梦嘛,反思一下今天遇到什么问题,然后第二天就同样的错误就不会再犯了, 所以说我觉得也是非常养成戏啊,就是你看他们一点一点跟你磨合的越来越好,这个过程也是非常令人兴奋的。是我们现在已经放开内测了,然后 cloud 的 offer 四点七是现在免费的无限量供应的,如果有想内测的朋友们请加入我们,然后来体验一下这个黑豆的 ai 员工和人类写作这种乐趣, 大家可以私直接私信我,然后我们现在广泛的招募我们的第一批内测用户,好,就这样。好,就这样,拜拜。
粉丝849获赞1.2万

很多朋友都知道 cloud 非常的强,但是还不知道如何去使用到今天来给分享一个非常简单的方法,这个里面都能使用到官网的最新的 o p 四点七,三万四点六等等这些模型啊,我们来看一下, 这个里面我放了多个官网的 max 和 team 账号,都可以去任意的选择使用,并且上面还为你贴心了选择了 samsung 每三小时有三十五次, o p s 每三小时是十次啊,都可以去任意的选择使用的,如果大家也想使用的话,都可以点击我主页的置顶作品找到我直接使用。

今天给大家分享的是克拉的四点七,一款能处理复杂编程和高清图文解析、长周期多步骤任务的国内 ai 顶级大模型,支持安卓、苹果、鸿蒙,附带使用教程。话不多说,下面简单三步教你免费获取。首先点右下角分享键分享复制链接,复制成功后 我们打开这个蓝色小鸟,没有的话就去安装一个,打开后会弹出一个资源包,如果没有弹出,就在这里搜索秋风精选,然后打开这个软件保存下载安装就可以用了。

我花一千五买了一个 cloud max, 二十倍,一周下来单周额度只用了百分之五十,你没听错啊,就是百分之五十。其实我买之前最担心的两件事情,第一个事情是会不会用两天就被封了,一千五打水漂。第二个事情,用不完怎么办? 呃,好消息是我一千五啊,没有打水漂,到现在还能用啊,一个多周了还没被封。第二个事情就是我现在更忙了,每天起床的第一件事就是打开 cloud, 在 想怎么今天把这个额度用满, 到最后睡觉之前还在用 cloud, 就是 看,哎,怎么今天还没用吧。所以我先给你们说一说我实际拿它干了啥,你们也好判断这一千五值不值。第一个事情就是我把我过去两三年的工作,个人生活的相关文件全部甩给了 cloud code, 让他帮我整理编号,做规党的分析。 聪明的资料当然是绝对不能上传的啊。这一件事情呢,我之前一直没有去动手,很想去做,但是我用了一个晚上就让 cloud 帮我做完了,这是我最爽的一段最棒的。 第二个事情,有一个合作方让我做一个 ai 加思域的运营方案,我把背景丢给他,他直接给了一个方案,我看完第一反应就是,哇,我太专业了哈,你们自己看一看这个方案专不专业,我反正想我自己上可能写不出这种结构。 第三件事情就是这个培训的 ppt, 那 我要去给别人做培训嘛,那相对来讲,这个培训的 ppt 现在也已经是可以用 html 的 格式让 klod 直接生成了效果,真的就是直接能用啊。 第四件事情就是我把我刚刚说的这些内容全部让 klod 帮我顺手把它做成了技能,我这一次做完了之后,下次他就可以接着再帮我干活,真的以后干活只会更顺。所以讲完了之后,你以为我会推荐你去买吗?你先别着急, 我真的现在比呃开之前更忙了。之前我用呃 pro 的 版本或者 max 的 版本,两三个对话或者十几个对话就能把额度用满,然后等着下一个窗口期,确实挺烦的。现在二十倍 oppo 十四点七一路拉满,完全不用算账了。 但是我就担心另一件事情啊,这个钱我花的值不值啊?现在它一直没有用满,我怎么才能把它用满啊? 所以到现在我都还没有找到把二十倍额度能够把它用满的办法。或者更扎心的一点是,我还没有找到一个让 am 能够帮我快速拿到一个好结果的工作节奏, 所以工具升级了,应该是我的判断能力和我的决策能力还没有跟上。所以你说,你说这一千我买的是什么?我现在答案是,我不是买的这个最强大魔蝎,而是那种不用算账的自由,完全不用去担心任何心力的消耗。我之前每一次去用 cloud office 四点七 都在想,哎呀,这个问题值不值得我去画一次对话去用它?现在完全不用考虑了,直接就是用啊,这个想法本身就很值钱,这个模型本身就很值钱,我不需要再去想这个模型干嘛了,直接去用就好了,所有的事情都可以让 ai 去处理,我生怕 ai 用不够。所以 我现在就想啊,我再用一个月看看,如果我每个月到每个月到月底都还只能发花到百分之五十,那我就得想一想了,这一千五是不是可以把它换成五倍了?或者说我把这个 skill 这些做的更好了之后,也许我就可能用不到那么多了。 所以如果你现在已经在用 cloud max 的 二十倍,我想请你告诉我,你每一周能用多少啊?我真的是很好奇。

零元订阅 k 二 pro 会员白嫖 club 的 四点七首先需要一个新的账号,你可以通过谷歌或者 github 来登录,然后直接点击升级到 pro, 等待跳转到订阅界面,你就能看到付款金额为零,然后填上银行卡信息即可。使用国内的信用卡和地址也是可以的, 主包这边没有信用卡,所以用了别的渠道。订阅成功之后就可以看到这里有一千的额度。然后我们就可以愉快地和 club 的 四点七对话了。

哎,养这个 open color 和 hermes 的 新手小伙伴都看过来,你看现在国内的大厂订阅包都在涨价,对不对?你看这个企鹅的九十九块一个亿的托肯, 这个是云百链的新套餐幺九八,这个算下来应该是两亿多的托肯, 对吧?然后里面的模型还给你缩水了,你像企鹅的这里面只有一个五点一能打的,现在的国内的大厂的价格是真的不划算,对吧?然后你像这个 cloud office 四点六一千万的 top 才两块五吧,应该是两块五左右啊, office, 四点七一千万的托盘才三块多,对吧?然后你看这个五点四,一千万的托盘才两块多,这不比大厂的那些订阅包舒服啊,对不对?你看那个大厂的订阅包, 对吧?一千万的托肯要十块,而且只有这一个五点一能打的,剩下的都什么鬼,新新模型都不给你用。然后这个云摆链的也是 这个云摆链的里面就只有一个千万三点六 plus 稍微能打一点,其他也不太行,感觉现在大厂的吃相有点难看。

最近几天,各大的 ai 厂商集体的秀肌肉, bbc 微四, gbt 五点五, oppo 的 四点七, timi 的 二点六,智谱的五点一,声浪是一个比一个大, 我把官方公布的所有的数据全部抓了下来,做成了一个网站,我们直接开比。不过有一点要讲清楚,这些模型发布的时间大部分都比较短,绝大多数都尚未经过独立的第三方正式验证,所以基本上都停留在了一个厂商自爆的阶段。 所以今天这一场也是一场广告含金量的大赛,我们最后也会专门的聊一聊谁的广告水分最少,谁的数字 是更值得参考的。好了,我们正式开始塔塔开。我们先来看一看价格,因为你能力再强,你用不起也是白搭的。我们看一下输入端,最便宜的实际上是 kimi, kimi 的 二点六, gbt 五点五的价格呢,已经全面向 cloud 看齐了。 我们看一下输出端,输出端最便宜的呢是 deepsea v 四 pro, opus 呢,五点五已经比 cloud 还要贵了,但是呢, opus 五点五的官方声称 token 消耗量减少百分之四十,而 opus 四点七呢,反其道而行之,比 四点六还要更贵一些。不过呢, gbt 有 套餐的优势,两百美元的 pro 呢,换成 api 的 价值大约相当于一万美元的用量, cloud 呢,订阅呢,也能换出两千六百美元左右的一个价值。所以呢,这里有一个极端反直觉的一个结论,那就是 deepsea 是 没有包月套餐的, 如果在真实的工作场景下呢,它反倒是所有模型里面最贵的。而其他的呢,其实国产模型的价格优势并没有宣传的那么明显,我们再来看一看呢一个基础的参数,那就是长上下文。这一次呢,最值得单独提的一个变化就是 deepsea v 四终于支持百万的一个 toon 上下文了, 国内的其他的几家模型呢,目前还停留在呢一个二百五十六 k 的 一个左右的水平, deepsea 呢,在这一点上的话还是值得点赞的,但是呢,在支持百万上下文和真正好用的百万上下文呢,这是两件不同的事情。 office 四点六在长上下文上保持的是非常的出色,是少有的人能够做到诊断输出还不太缩水的一个模型之一。这里还有一个被广泛讨论的一个隐患,那就是第三方测评的一个数据, office 四点七在超长的上下文的召回能力上可能不如 office 四点六, 在呢 m r c r 的 官方百万 token 的 场景下,它的准确率其实降到了百分之三十二,实际上跌幅超过一半。如果这个算是一个 bug 呢?那其实在修复之前, oppo 的 四点七的长上下文的可信是要打一个很大的折扣的。我们再来看一看编程,目前呢,这个 s w 一 八七 pro 呢,是代码能力的一个非常硬核的指标, 是现在含金量最高的标准之一,是考察真实软件工程问题的一个解决能力,不是刷题。虽然呢,这个 open ai 宣称这个数据存在污染,但是呢,这套标准目前依然是最权威的参考之一。我们可以看到 opus 呢是排名第一, 国产的阵营里面呢,这个 timi 二点六和智普的五点一已经非常接近五点五的一个水平了,大概和五点五呢,处于同一竞争梯度,算得上是呢,真正意义上的进入第一梯队了。 然后呢, v 四 pro 要相对要落后一点,但是呢,但是分数本身呢,已经相当不错了,如果数字本身是真的话,我们再来看一看终端编程,终端编程 a 进程呢,考察的是这个模型在实际开发环境下的话, 完成多部任务的一个能力,调度工具,修改文件运行测试,自我纠错,比单纯的代码补全要难很多,也更真也更接近呢,是一个真实的场景。 g p d 五点五算是杀死了比赛,哪怕是上一代的五点四,在这个维度下呢,也是所有选手中最强的国产模型呢,国产模型已经能和 cloud opus 四点六打的有来有回了, 但是呢,你和顶级的 gpt 五点五还是有差距的。我们再来看一看这个工具的调度能力,这个维度呢,考察的是模型调用外部工具和 api 的 一个能力,是 agent 应用最核心的一个基础能力。 cloud 的 oppo 的 四点七是目前碾压级别的领先 国产的模型呢,基本上达到了 g p t 五点四的水平,其中呢, v 四 pro 呢,是国产模型里面表现最好的,我们再看就是说搜索与信息解锁的一个能力,这是一个专门测试模型网页网页浏览和信息解锁能力的一个精准 核心,是看模型能否在真实的互联网环境下找到准确的一个答案,而不是靠训练数据里的记忆去应付。 目前呢,最强的依然是街面奶,尤其是这个 deep research 版本。 opus 四点七呢,在这个维度上反倒不如 opus 四点六, deepsea 微四呢,在国产阵营里面虽然是最能打的,整体表现非常的不错。我们再看一个电脑的操控能力,这是一个非常容易被忽视,但是非常非常非常重要的一个维度。他考察的呢 是模型在控制真实计算机的界面,而不仅仅呢是代码生成,是真正的能够动鼠标点界面干活的一个能力。目前呢是双交最强。 国产里面呢,只有 kimi 公布了相关的数据,因为很多自动化的任务你必须依赖真实的鼠标操作,网站的风控呢,也会识别模拟输入,所以在这一块呢,国产的模型希望能够尽早的去提上日程, 这是未来的 agentic 的 一个场景的一个核心方向。我们再看知识推理, g p q a demo 的是博士级别的科学问题,推理水准含金量非常的高, 目前的界面呢,还是排在最前面的国产模型里面呢, timi 的 二点六是略强于几架,但是呢整体差距不大,基本上属于互有胜负的一个水平。以上呢,就是这次接近四十个跑分项链含金量最高的几个维度。接下来呢,我们来论外了,那就是 astropik 的 一个神话模型 rocky, 可能内部存在一个完全超过 opus 四点七的一个模型,但是目前呢,并没有对外开放能力呢,属于莎士比赛的级别,但是呢,正因为它不对外,就不纳入今天的横屏范围里面了, 它的存在呢是默认提醒你,老夫还有底牌,相比之下,连 codex 呢都用不了的 g p t pro 也打不了这张牌。最后呢,是一个纯主观纯喜好的个人排名,我心目中的第一,目前是 oppo 的 四点七,其实以非常非常非常微弱的优势成为我最喜欢的一个模型。 在这三十多个跑分里面呢,他单独拿下第一的呢,就只有六项,你算上四点六呢,也不过只有十一项。但是在 sw 一 半期 pro 代码的能力, mcp 工具的调用上呢,都处于碾压级别的领先。 长上下文的输出呢,也非常非常的出色,幻觉率呢,控制的也是最好的。在这几个最关键的一个维度上呢,他都是第一名,或者是并列第一名。而且在我的一个实际体验上,他在写文章,做前端的一个审美上,处理文档都有非常明显的一个优势。 cloud 呢,一直是有一个非常明显的江湖人设,那就是跑分没赢过,实战呢,没输过。这次呢,也不例外。他的跑分呢,是仅次于 gpt 的, 但是在很多的关键的实战维度上呢,他在跑分上呢,是仅次于 gpt 的, 但是在很多的关键的实战维度上,他仍然是那个最可靠的一个选手。 但是它的问题呢,也非常的明显, oppo 的 四点七比四点六还要更贵,而且对于国内的用户来讲呢,它还比较反,你懂得。总之呢,你是快爱不起来了。 我心目中的第二名呢,就是 gbt 五点五。 gbt 五点五呢,是唯一能够全面抗衡 cloud 的 一个模型, 在这三十五个相对比里面呢,它拿下了十二项第一。如果你把 g p t 五点四也算上的话,它有十六项第一,等于是遥遥领先,它在这个终端编程知识广度和 agent 的 一个能力上都是非常强的, 但是他有一个绕不过去的一个问题,那就是目前呢,这个独立的 ai 测试机构 a a 做了一个精准的测试,他的一个知识召回率呢,是百分之五十七,是历史新高。他的幻觉率呢是百分之八十六,也是史上最高, 就是知道的最多,但是也是最爱编的,就是他不像一般的模型,他不知道的时候就会说不知道,他不知道的时候呢,他会给你胡编乱造一个, 所以这是一个不大不小的问题。在很长很长一段时间里,它应该是我花钱最多的一个模型了,我希望它以后呢能够多说一点人话,然后减少一些 ai 感。第三名呢就是 gmail pro, 说实话非常的吃老本有这种感觉, 除了搜索呢,信息解锁和这个一些做题上,其实已经看不出来它有明显的优势了, 可以说他是这种刷题跑分很厉害,但是实战的下线呢,已经非常非常低了,我现在自己用的呢,用 rock 用的都比他多一些。我们之前其实还做过一个测评,当时还得出了一个结论,就是 jamie 呢,属于天下无敌的水平, 现在呢才过了几个月,真是一言难尽。我们来看一看的国产阵营里面,首先他们有一个非常大的一个问题,就是一个透明度的问题。国产模型呢,他在对外公布奔驰 mark 的 一个数量上呢,能爆出十个已经算是非常多了。国外的模型呢,通常呢每次发布呢,都会公布三十个到五十个的样子, 这次的质谱呢,更是只公布了两项,而且呢基本上都没有附带测试条件的详细说明,我相信呢,它造假的可能性呢,并不是特别的大,但是呢,这个数字呢,有水分的概率非常的高,但是呢,即便如此啊,这些成绩已经非常非常非常令人惊喜了, 希望能够早日在第三方的测评独立上呢进行一个验证。国产里面, kimi 二点六把外模的三巨头呢拿掉之后,国产跑分里面最多的实际上是 deepsea v 四。 但是呢,如果你让我把所有的维度都综合下来给一个排名的话, kimi 二点六是我心目中目前最强的一个国产选手,他在非常多的关键领域都处于第一梯队,比如说他在这个 g p q diamond 的 呢,是国产的最强,而且价格呢也算是比较便宜的, 而且还有包夜的套餐。而且呢,他基于这个 m o e 的 架构,成本性能呢也非常的均衡, 他在 c 端的这个 agent 呢,落地的也是非常非常早的。如果你只让我选一个国产的付费模型的话,我 我我当前选择的就是 kimi。 这次呢,有一个非常非常让我意外的选手,就是 dbc 卫士,我之前在知乎上面专门写了一篇文章去抨击 dbc 不 思进取,我甚至觉得他已经和文心一言做一桌了, 这一次呢,算是狠狠的打我的脸了。在目前呢,你把御三家拿掉之后,在国产加开源的模型范围内, deepsea v 四 pro 是 拿下了十六项的第一名,在国产数量里面是最多的。不过呢,这一部分的含金量是有限的, 在我们演示的几个里面呢,他基本上都不是御三家里面最好的,而且呢,他有几个非常大的问题啊,就是他没有订阅套餐, 也就说它实际用下来呢,它比 cloud 还要贵,它的多模态能力呢,依然有非常非常明显的短板,而且它的数据呢,全部来自于自爆,而且还是预览版。它的 c 端的产品呢,就是在当前的这个环境下,已经算得上是简陋了, 所以它其实最大的标签是开源,也不是便宜。我真心的希望,我真心的希望 eiffic 能够跟上国产头部的节奏,比如说几个月更新一个版本,开通套餐,做几个真正有用的 agent, 在 多模态呢,有稍许的建树,但是说实话呢, 希望应该也不大,只是希望他不要像 v 三一样发布极巅峰展后沉寂一整年。最后呢,我们来看智普的五点一,这次呢,公布的参数实在是太少了,不过因为发布的时间最早,已经有不少被第三方验证出来结果了,实际上是非常非常能打的,算是国模的头部选手之一了, 比如说这个文字的能力,比刨分呢,实际上还是要差一点,但是呢,程序员的朋友对他的评价普遍比较高,就在剪掉智普有一个免费模型,我自己做的插件一直在用这个,总的来讲,所以哪怕他是这一次我心目中的最后一名, 它也是非常非常能打的。 oppo 的 四点七呢和 g b t 五点五其实都没有想象中的那么强,不过说实话呢,哪怕是打了折,国模的这次表现呢,其实还是远远超出了我的预期的,希望呢,能够在第三方的测评中看到国产模型上榜,也更希望在实战中呢,能够像 cloud 一 样,那就是跑分没赢过, 实在没输过啊。大家好,我是站站艾尔,一个说人话的艺人,公司博主喜欢的话呢,请帮忙关注点赞。这个对我真的非常非常重要,下次再见。拜拜。

如果你的 cloud 用不了,可以接入 deep sync。 v 四,用很低的预算解锁一百万上下文,加 max 思考等级。第一步,安装 c c switch c c switch 是 一个开源工具,专门解决 cloud code 切换模型的问题,一键将供应商导入应用, 一键在不同的供应商之间进行切换,内置五十家供应商预设软件可以进粉丝群获取。第二步,买 deepsea 的 a p i 并配置。打开 deepsea 官网,进 a p i 开放平台,网页版聊天是免费的, 但调 a p i 必须先充值。他们目前没有按约定约那种 token plan, 纯粹用多少花多少,对个人用户其实更友好。 v 四 pro 现在打二点五折, 每百万头肯缓存,命中输入零点零二五元,未命中三元,输出六元,这个价格到五月三十一号截止。点充值,选金额和支付方式,建议先小额试一笔,用完再补 付款完进左边 api keys 点创建,随便起个名字,把生成的密钥复制下来。注意,这个密钥只在创建那一刻能看到, 关掉就再也看不见了,丢了只能重建。打开 c c switch, 点 cloud 图标,添加预设供应商,选 deepsafe, 把刚才的 key 填进去,默认模型写 deepsafe vs pro, 然后添加后缀,这个后缀是官方公告里指定的,加了才会起用。一百万上下文 填完点添加,列表里就会多出 deep seek 这一项点测试按钮,验证 api 是 否可用。最后点起用 cloud code 就 可以正常用了。打开 vs code, 输入 model, 启动的就是 v 四 pro, 加一百万上下文,输 context, 验证一下,确实是一百万 tokens, 默默认思考等级是 medium, 敲 effort 加空格会列出所有可选档位,填 max 车就拉到最高 切模型用 model 社会列出来。 opus 和 sonnet 都映射到 v 四 pro haiku 是 v 四。 flash 上下键选中回车确认切到 flash 之后再敲 contacts 能看到上下纹变成二百 k。

figma 怕是要紧张了,连 astropic 自己都来画设计稿了。产品叫 cloud design, 今年四月才上线,仍是研究预览阶段。背后跑的是 oppo 四点七模型,主打视觉能力,画图功底相当硬, 界面就两块。左边和他聊天,右边画布,跟着你说的话实时出稿子给你看,你直接描述要做什么样子,他马上就在画布上把第一版给你画出来摆好,不满意就接着聊,或者直接拖一拖滑动条,改间距、颜色和整体布局, 想改某个按钮,点上去留一条评论,他就会按照你说的乖乖改好给你看。产品经理写融资演示,把脑子里的故事讲出来,画面,剩下的全交给他。工程师写代码前先搭高保真原型登录列表、仪表盘,几分钟搞出来, 不会画图也完全没关系。营销海报、活动、落地页、内部宣传,一句话就行。最爽的一点是,他能自动给你套上公司现成的整套品牌设计系统, 把公司的代码库链接丢给他,他会自己读出品牌色、字体和现成组建,做出来的每一张稿子全是公司风格,省掉团队来回对齐设计稿的时间。更狠的他还能做带语音、视频、三 d 元素,甚至内置 ai 的 代码原型。 做完之后,一条指令,他就能把整套设计自动打包成一个完整的交付包包,直接扔给 cloud code, 让他接着帮你写出能跑起来的代码。从想法到原型,再到能上线的代码,整条线全都被一段对话给串起来了。 输入端也非常宽,截图、文档、换登篇、网页元素几乎都可以丢进去,出稿格式也很宽,压缩包、 pdf 演示文稿、独立网页全都能一键导出, 团队协助也照顾到,版本回溯、设计反馈、无障碍审查全都已经内置,想用也简单, cloud pro max team 套餐都能用上。更多最新 ai 知识分享,关注我,下期见!

如果你从四点六升到四点七,最该升级的不是参数,是你写提示词的方式。一句话,四点六会替你补全意思。四点七会严格按字面执行, 清楚时更强,含糊时更容易跑偏,这不是退步,是取舍。 写代码写作结构化任务更稳,但模糊指令多轮闲聊,长文档解锁会更。挑题时把他当诚实的执行者, 你没说清楚,他不会替你圆,所以你要把成功标准讲明白,而不是期待他读心。全篇万能钥匙只有一个,意图,把意图写清楚,四点七就很强,写不清楚,再多技巧都是补丁, 这点在行业里也在趋同。 anthropic 和 open ai 正从两端往中间走,焦点就是清晰的意图最保值。 招数一,把长期背景写进 cloud md, 让它自动加载。招数二,默认用 x high, 别条件反射开 max。 很多人觉得四点七慢,其实是 max 太爱想,只有真需要深推理才上 max, 其他时间用 x high 更划算。 招数三,同一任务里随时切档,难点用 max, 其余切回 high。 招数四,回归测试就提示词新分词器会长 token。 招数五,问题一次打包,问完别挤牙膏。招数六,给正面实力少写,不要这样,四点七更持阳历, 多轮来回会把字面理解的误差越叠越大,你越早把约束输入输出一起讲清,越不容易了。外。招数七,删掉旧的进度汇报指令,四点七会自己给更好的更新。 招数八,想并行就直说,他默认会更保守。招数九,先审计划,别先审代码,计划对了,四点七的执行就会很快,计划偏了,错误会复利式放大, 把审查时间花在方向,不是细节,看十行计划只要半分钟,比对两百行 diff 审你十倍注意力。 招数时只用自适应思考。 budget tokens 已废弃,旧参数会直接四百签模型前先全局替换成 sinking adaptive 迁移,最怕线上才发现四百。最稳的做法是先跑一遍静态替换,再用一条冒烟请求验证,全链路都过了, 最后收束。四点七不会更会猜,而是更会做。你的杠杆就是把意图前置写清沉到 c l a u d d m d。

gemini 四点零对战 cloud opus 四点七和 gpt 五点五, google 这次能赢吗? i o 前一天,知名记者 alex his 放出猛料,新 gemini 模型性能大概在 gpt 五点五这个级别。 注意,离 antropica mesos 还有不小差距。上来就打名牌, google 很 诚实,但跑分只是一张牌。 cloud 的 杀手锏是 mesos 级别的推理能力,连英国 ai 安全研究所都说,它一个月内就突破了所有测试边界。 gpt 五点五胜在生态成熟,用户量最大,那 google 靠什么翻盘?答案是 gemini omni。 这是一个统一多模态模型,把文本生成,图像生成,视频生成和编辑全部塞进一个模型里。别人需要四五个模型才能做的事儿, google 一个模型全包,这才是最危险的杀手锏。 再加上 gemini spark, 一个永远在线的 ai agent 在 后台帮你订机票,管邮箱,排日程。还有 gemini 三点一 flash live 语音优先模型。 谷歌这次是把所有 ai 牌一次性打出来了。 jammer 四点零单挑跑分可能不是最强,但 omni 统一多模态这张牌如果打好了,足以改变整个 ai 格局。你觉得谷歌这次能赢吗?评论区告诉我,关注叶哥说 ai, 带你第一时间解读 i o 重磅发布。

上周 intrepid 发了一个新模型,叫 cloud opus, 四点七,我连着用了三天。今天我们就说两件事,它能帮你省什么,以及它有什么坑。那创业的、做运营的,想用 ai 提效的,听我说完再决定要不要用。 那我们先说第一个看图的能力。以前这个 ai 看图就跟近视八百度一样,模模糊糊的,这次呢,直接升级了三倍。你把合同截图、财务报表甚至产品设计图直接丢给他,他能一字不差的读出来。那我自己呢,也测试过,把一页密密麻麻的采购合同截图扔进去,他给我标出来三个有问题的条款。那 正事以前呢,你得专门找人来做,那能力二的话呢,就是长任务。第二个,他现在可以自己连续干好几个小时不出错。你让他做竞品调研,写商业分析,整理市场数据,他能一口气做完,前后不矛盾,不断档。官方测的数据,他在真实软件工程任务里的得分比上一代提升了七个点,是目前能公开用的模型里排名第一的。 能力三的话,就是写代码,在一个叫 cosuo 编程测试里,他得了七十分,比上一代提了十二个百分点。 不会写代码没有关系,你用大白话告诉他你想做什么,他能帮你生成,然后通过 cloud code 直接跑起来。那我认识一个做电商的朋友,他帮忙搭了一个库存数据的看板,以前外包呢,要花好几千,他自己弄了好好久才解决 好。说按优点说两个真实的坑,这才是最关键的。第一个读长文档的能力,这次是退步了,有个专门测 ai 记忆能力的评分, oppo 四点七从七十八分直接跌到了三十二分,将近啊,跌了一半,那什么意思呢?你要给他一个几百页的文件,他可能到最后就忘了答非所问。那这个场景建议建议还是用上一代的四点六会更稳一点。 缺点二就是它的成本涨了啊。第二个坑,价格没变,但成本稍微涨了一点。新版用了一套新的处理器机制,同样的内容,它消耗的能量比上一代多了百分之三十五,单价没动,但你实际花的钱变高了。高频使用的人要注意,要么控制用量,要么算好预算再上。 总结一句话呢,图片、文件、代码这类复杂任务用四点七呢,是真的好用,但你主要是读常温党,做知识解锁。先别急着换评论区,告诉我你现在用 ai 主要呢是做什么业务?那夏季的话我会做横向对比,觉得有用的话大家可以收藏起来,这种信息差,出门就能用的上。

上周的一些消息,上周 out 的 op 四点七 isopic 发布出来了,大概在四月十六号,它应该发布了它最强大的 op 四点七的模型,当然这个模型它把它的安全,把它的网络安全的这块能力把它给拿掉了。这个模型它应该来讲在软件工程,在 agent 的 任务,在 视觉和记忆方面,它其实都是有显著的提升,那么它这个亮点,它也能支持一百万的 open 的 上下文,它是首个支持高分辨率的这样的一个 cloud 的 模型,它的忠实度达到了百分之九十二,减少了幻觉这样的一个能力,它的定价目前是跟 astropac 的 那个 op 四点六价格是一样的,应该来讲这个也是一个比较大的一个升级。上周还有一个消息是欧奔 ai, 它把它的 code 扩展到了 mac 的 一个桌面应用, 那所以 openai 的 这个 code codex, 它其实也是一个开源的这样的一个智能体的一个框架,目前也可以使使用在 mac 的 应用当中了,应该来讲也是不错的。 cloud 上周还发布了另外一个东西,就是 cloud design, 是 前端界面,因为现在前端界面的开发,它现在 cloud 它们发布了这样的一个功能,这个功能,这个功能你可以给他一张图片,他可以高保真的去帮你把这个界面给实现出来, 当然你也可以在这个界面当中可以给他一些标注,让他可以更精确的去修改,那这个已经是放出来了,应该来讲对非设计师人员,他这个工具是比较友好。

哈喽,大家好,欢迎收听我们的播客啊,今天我们要来聊一聊最近啊特别火的两个 ai 大 模型, gbt 五点五和 cloud 四点七, 到底谁更厉害啊?我们会从各个角度来给大家对比一下啊,包括他们的核心能力,包括他们在一些实际场景下的表现,包括针对不同的使用需求啊,我们应该怎么去选择?那废话不多说,我们开始吧。 ok, 那 我们就开始今天的这个大模型的巅峰对决吧。我们先来聊第一个话题啊,就是这个核心能力的大比拼。那我们第一个问题就是 gpt 五点五和 cloud 四点七在智能体和自动化这方面到底谁更强?呃, gpt 五点五它是在这方面是特别突出的,就是它可以自己去理解很复杂的一些任务,然后自己去规划怎么去做, 并且它可以自己去调用一些工具,并且自己去检查结果。 ok, 那 比如说像那个 terminal bench 二点零,它的准确率可以达到百分之八十二点七, 听起来它像是一个全自动的小助手啊。对,相比之下呢, cloud 四点七,它在这种需要细致的去分析代码的这种场景下面,它会比较强。 ok, 那 比如说像那个 s w e bench pro, 它是可以领先 g b t 五点五的,但是在这种多步骤的这种自主的任务上面,它还是稍微逊色一些。 那这两个大模型在推理的准确性上面,以及它们出现这种幻觉的频率上面会有多大的差别呢?在这种就是需要 很严密的推理的这种测试里面啊,比如说像那个 g p q a diamond 的 这种测试里面,这两个模型其实都是表现的非常好的,都在百分之九十三以上, ok 就是 非常非常接近人类专家的这种水平了,听起来就是都挺靠谱的呃,不过在一些这种 第三方的评测里面发现就是 gpt 五点五,它还是会经常会出现一些幻觉, ok, 就 它的这个幻觉率是百分之八十六, ok 就是 远高于这个 cloud 四点七的百分之三十六。所以就是说,如果是用在这种 对事实要求非常非常高的这种场景下面的话,还是 cloud 会比较让人放心。那就是说,呃,这两个大模型在实际使用的时候,成本和效率上面会有多大的差别呢?就是 gpt 五点五它是用的这种 呃投肯效率提升了百分之四十,就是它虽然 a p i 的 价格是比上一代要贵的,但是其实你如果是做这种多步骤的复杂的任务的话,整体算下来反而可能更划算 哦,那就是说如果我这个任务量特别大的话,这个差距会很明显吗?这是 cloud 四点七,它的这个输出的价格是比 gpt 五点五要低百分之十七的。 所以就说如果是这种大批量的这种文本的生成,或者说这种代码的审核,这种对他的这种推理的速度又很快,然后又很省 token 的 这种场景下面,他的这个优势就会特别明显。然后咱们再来聊一聊这个场景实测啊, 就是这个大模型在不同的场景下面到底表现怎么样?咱们先来聊一聊这个日常聊天和这个多轮问答。嗯,这个两个大模型在这方面有没有什么让人印象深刻的?就他会, 不光是回复的快,他的这个风格也是非常的流畅,而且他很擅长就是 呃接话,就是你随便说一个什么话题,他都能跟你聊起来。然后也很擅长就是在这个多轮的交流当中去记住你之前说的一些东西,包括一些很复杂的要求啊什么的,他都 ok 的。 比如说你跟他说你帮我总结一下这个什么什么内容,再帮我润色一下,他都可以一步到位, 听起来就像一个很会聊天的朋友啊。对,然后 closed 四点七的话,他就会回答的非常的细致和准确,就他不会说呃糊弄你,或者说呃他遇到一些很敏感的,或者说他不确定的问题,他会非常明确的告诉你,他 不能说。嗯,对,就是他这种严谨性,在一些你需要事实和查,或者说你需要有一些这种专业知识的这种对话当中就会特别有用。嗯,对, 但是它的缺点就是它会比 gpt 五点五稍微慢一些。如果是面对那种动辄几百页的长文档呢?这两个大模型在处理这种长文档的时候会有什么样的具体的差别?嗯,这个就要说到了,就是 cloud 四点七,它的这个上下文窗口是可以支持到一百五十万 tokens 哦,就是它可以直接把整本书都吞进去,然后它在这个大海捞针的这个测试当中,它的准确率是百分之九十九点四, 就是他几乎不会丢信息,嗯,对,而且他的这个摘药的幻觉率也非常的低。对,他非常擅长在这种超长的这种合同啊,或者说这种学术论文当中去帮你抽丝剥茧,找到你想要的东西,确实很适合那种海量资料里面去寻宝这种感觉。 对,那 gpt 五点五的话,它虽然说它的这个窗口只有一百万 tokens, 然后它在这个大海捞针上面的准确率也略低一些,但是它的这个速度是非常快的,就是它的这个首 token 输出几乎是秒杀。 所以如果你是需要这种快速的去处理大量的长文本的话,那 gpt 五点五也是一个非常好的选择, 只是说他在这种极端的这种长上下文的这种任务上面,稳健性会稍微弱一些。嗯,那你觉得在办公自动化和这种专业场景里面,这两个大模型的表现有什么不一样?嗯, gpt 五点五的话,它是非常适合这种日常的办公的,比如说你要一键生成一个会议记号,然后或者说你要批量的整理一些表格啊,它是非常快的,它也很容易就可以跟一些其他的应用做集成,那它的这种自动化可以帮你节省非常多的时间, 看来是一个效率小能手啊。但如果是说你需要非常高的这种专业严谨度的话,那还是 cloud 四点七,他在这种复杂的分析啊,法律的审查呀,金融的风控啊,这方面的话,他是特别特别稳的, 而且他能够处理那种百万 token 级别的这种输入,然后他的这个幻觉率也极低,所以他是非常非常适合这种企业级的关键任务的。然后咱们接下来这个主题呢,是选型建议,那我们今天就来聊一聊 不同的用户到底应该选 gpt 五点五,还是应该选 cloud 四点七呢?比如说个人用户啊,或者说学生。那如果你是想要一个可以帮你自动写一些脚本啊,然后帮你整理一些资料啊,甚至帮你自动操作一些软件啊, 那 gpt 五点五是特别顺手的,就它很像是一个你的随身的小助理,你日常用它会特别方便,而且它的那个呃处理能力也可以升级, 就是说更适合那种喜欢自动化,喜欢效率提升的朋友。没错没错没错,那如果你是需要处理非常长的文章啊,然后非常复杂的知识管理啊,那 cloud 四点七的这个超长的上下文和他的这个非常细致的输出就很有用了。 ok, 那 这个就是适合那种 呃做学术研究的,或者说做这种深度阅读的人,如果是放到职场和企业的环境里面呢?这两个大模型又分别适合哪些具体的场景? 嗯,那 gpt 五点五就特别适合那种啊,需要很多跨系统的操作的这种团队,比如说你要同步数据啊,然后你要自动地去调度一些任务啊, 它的这个自主性很强,所以它可以帮你把这些日常的流程都变得非常的轻松。那 cloud 四点七呢,就更像是一个非常严谨的研究员。 ok, 那 它就会在这种金融啊,法律啊,还有就是这种需要审核的这种场景下面,它会非常的有用,就是它可以帮你保证 每一步的这个合规性和精确性。所以就是说这个选择其实就是要看团队的具体需求是什么。对,就是如果你的这个企业是非常看重效率和这种灵活的集成的,那 gpt 五点五会帮你提升非常多的生产力。 那如果你是一个对结果的质量要求特别高的,那 clod 四点七就是你的这个安全的后盾。那对于开发者和企业来说,在选择 gpt 五点五和 clod 四点七的时候,还有哪些 比较实际的因素要考虑呢?如果你的这个项目是需要非常快速的迭代,然后非常高度的自主, ok, 那 g b t 五点五会是一个非常好的选择,因为它就是专门为这种 自动化的代理和这种复杂的工作流而设计的,它的这个工具的调用啊,包括它的这个自我的纠错啊,都是非常非常厉害的。如果是说更看重稳定性和合规呢, 那就是 cloud 四点七了,它的这个非常大的上下文的窗口和它的这个对于长文本的非常精准的处理,是它的一个亮点, 然后它的这个合规性啊,安全性也是非常非常突出的, ok, 所以 就是如果是企业的话,还要考虑到成本和你自己的业务的场景去衡量,包括它们的这个 api 的 适配性啊,包括你自己的这个运维的难度啊, 都是要去权衡的,有的时候可能甚至需要两个一起用对才能发挥他们最大的优势。聊到这其实大家也能够看出来了,就是 gpt 五点五和 club 四点七其实各有各的擅长的地方,对,还是那句话,就是大家要根据自己的实际需求来理性的选择适合自己的那个 ai 模型。好吧,那就是今天这样内容了,然后感谢大家的收听,咱们下期再见,拜拜。

deep c q v 四呢,终于发布了,各方面的参数啊,看起来都很不错,但实际使用起来又是什么水平呢?正好最近两周啊, g p t 五点五, opt 四点七, kimi k 二点六也都刚更新了,再加上之前的 g r m 五点一呢,凑齐了一大批的这个千元模型。很多朋友啊,都在纠结说自己的智能体里面到底应该用哪个模型呢?今天这个视频啊,我就会从价格,从速度, 从完成任务的质量几个角度来跟大家聊一下这几个模型,能够让大家在选这个模型的时候啊,会有个参考。我们首先来看一下各家模型 token 接口的这个价格,按照 token 输入输出七十比 七比二的这个比例来加全,这个呢大家可能如果不清楚的话,也不用特别的去计算,我是按照我自己的平时的账单的统计,然后调用的这个比例算出来的,每个人呢都或多或少会有些不同,但大概呢就是这样一个比例,然后用它来算出每百万 token 的 一个综合的价格,方便我们去比较。我们看到 v 四 flash 呢,零点三二元, v 四 pro 呢,原价是二点五六元,然后加上当前二点五折的发布活动啊,价格大概是零点六四元。 kimi k 二点六呢二点二三元。 jimmy k 二点一呢二点二九元。 opus 四点七十点六三元。 gpt 五点五呢十一点五二元。国产模型啊,大家看到大致呢都在同一个价格袋里面, opus 跟 gpt 呢,价格直接贵了一个数量级, 一次 flash 啊,价格最低,因为它的模型尺寸呢,也是最小的一次 pro 呢,能把一百万的上下文做到这个价格,是采用了新的注意力机制,一百万上下文呢,大概只需要前代的百分之二十七的算力, 百分之十的显存就够了。列出这个综合价格啊,是方便大家去理解,去比较,然后给大家做一个自己选择的参考。然后来介绍一下这次的这个对比的任务设计啊,我这次呢,是想让智能体啊去抓 hack news 上面前一百条的热贴,挑两到四条呢,值得说的话题,查背景, 生成图片,配音,最后用 hyperframe 这个 skill 呢,制作一条三十到六十秒的中文视频报告,中间怎么去完成啊?怎么去这个一步步的定任务呢,完全交给智能体自己去定,每家过程啊,稍有不同, 但大致的内部的流程啊是一样的。先写 python 脚本呢,抓帖子,做数据统计,再写分镜跟旁白,然后呢,生成语音跟图片。语音出来之后呢,来计算一下实际的长度, 重新去调整一下分镜,如果太长呢,就压缩一点,如果太短呢,就扩展一点。最后呢,再用 hyperframes 以代码的形式把这个视频完整的做出来。每个模型的任务呢,我都给它们建立一个独立的空白的文件夹,然后用 skill 去扩展它们 agent 的 能力。比如说像我这里用到了几个 s 册去查资料, gpt, imager 去申图,然后 edge tts 做中文的旁白, hyperframes 负责视频的合成等等,基本上就是四个。如果产出有明显的缺陷啊,我会反馈给 agent 一 次,但只给这一次的机会,只做一次的人工干预,还有一个比较重要的细节来跟大家分享一下。 这次实验用的 agent 啊,是叫做派,大家肯定没听说过,因为在国内还比较冷门。它是一个极简设计的 agent, 几乎不做任何额外的封装。我们平时用的比如说像 cloud code 啊 or codex 这种框架,它约束多,然后规划层比较厚,好处呢就是把那些比较弱的模型啊,能多浮起来走两步, 代价呢就是那些比较强的模型的判断力呢,可能也被一定程度上牺牲掉了。反过来说呢,薄的框架就是让弱的模型一步步能露出马脚,也让强的模型完全能够展示自己的规划跟纠错的能力。我们来大概的这个判断一下,这次一整条的这么长的这个工作流任务啊,需要用到这大模型的工具调用,多步骤规划 上下文,然后选题,判断出错的自己修复,单次跑下来我估计会用到上百次的工具调用,所以这六个模型的推理强度全部拉满,能够真实的展现它们在整个过程中的综合能力。 在最后比较这六个模型的这个能力之前,我们要先来看一下这次任务我们实际使用的账单跟这个生成的速度。 gpt 五点五呢,最快十六分钟 up, 四点七,二十九分钟 up, 开启了 x high。 这个之后啊,花费也是高的离谱, 比 g p t 五点五还贵了三倍多。然后其他的像 deepsea v 四 pro, 然后 kimi k 二点六, g r m 五点一,消耗的 token 呢,差不多,所以成本呢,也几乎差不多。但是 g r m 五点一啊,速度上比较慢, 花了四十四分钟才完成,这个原因呢,就是因为 token 接口的吐字速度太慢。因为之前就听说啊,这智普是国产模型里面比较缺算力的这个一家公司账单讲完之后啊,我们来看一下最终的成品到底是长什么样子。我想按两个维度来评价这次的任务啊, 就是排版跟内容,排版呢,是排版的结构,然后图案的比例,动画字幕这些内容呢,就是指选择题啊,旁白啊,判断力啊这些。然后六个模型呢,按照这两个维度的综合表现,我可以分成三档,第一梯队呢,就是 up 四点七和 gpt 五点五,大家可以看一下它们生成的视频啊。 h n 今日速览 top 一 百里三件事不讲废话第一件 deep c v 四,一千九百八十九分一千五百一十六条评论全列录零抠的跑在华为升腾上 pro 模型每百万输出 token 三点四八美元。 h n 原话从黑客到黑客 第二件, open a i 当天甩出 gpt 五点五,一千五百五十三分。记者分拣封顶贴 andropet missus, 但社区泼水幻觉率百分之八十六,是 opus 两倍多。第三件,最游戏九百零六分的热铁,在 bug 质量下滑。同一天, google 宣布向 andropet 注资最多四百亿美元,社区点透循环贸易, andropet 拿钱回头买 google 的 tpu。 全剧看 top 一 百 ai 话题十五条,却吃掉百分之三十一,得分百分之四十一。评论 谷里四条是 ai 域名榜第,靠十六次领跑。数据采自四月二十五日 h n 热榜,今天 h n 前一百条里, ai 大 模型占三十二条,合计一点一万分七千二百五十七条评论,榜首讨论集中在 deepsea v 四 g p t。 五点五和科沃质量风波。 deepsea v 四拿到一千九百八十九分,一千五百一十六条评论,社区最在意的不是发布会,而是低价好文档,以及跑在华为芯片站上的完整 阅帖。评论里的核心质疑是, ai 编程下的写代码时间是否又变成了独代码和审查成本工作计划最高头 n 四百亿美元, 把它看成供应商融资前 tpu 云和同要成闭环。如果模型商品化,真正的利润可能在算力入口比特和 c i l 供应链攻击,无科技拖拉机走红也只向同一个情绪。技术越强,社区越想要可验证,可修,少锁定系统。今天的关键词是可信。 从排版角度来讲啊,这一档的模型有完整的编辑自觉分进脚本呢,会自动标注 t t s。 实测的时长精确到秒,然后再去反推画面的时长。 g p g。 五点五的定稿啊,甚至自己列了这个时间码的对照表,图文的重点分明,然后动画的节奏也很合理。 t p t。 五点五的短板是首页的,这个数据格式化,没有正确的去渲染。然后从内容角度来说呢, oppo 四点七旁白其实是最讲究的,这可能跟大家的直觉上也比较吻合。 开场四秒钟就切入了三件事情,每一件呢都有具体的数据,加上一句这个嗨客女子原话做压轴,结尾呢,还单独留了十几秒钟做整体的这个全局的数据的复盘,然后这六个里面是唯一一个自己做了 结构化数据分析的这个模型, g p t 五点五呢,选题抓到了这个资本与算力的闭环这个独特的视角。别人都在讲模型本身,然后他呢,在讲生态,在讲一个大的宏观的这个这个角度,但结尾啊,那句就是今天的关键词,是可信。这样句话呢,我觉得就比较仓促了,像他感觉到时间快到了,然后硬切了一个结尾,这种感觉 怎么说呢,就是五十七块钱的 office 啊,贵是真的贵,但能力呢,确实也是最顶尖的。中间党的两个模型呢,就是 dipstick v 四 pro 跟 gim 五点一这一党的模型啊,都只是完成了整个工作的一半,但只是完成的一半不同。 v 四 pro 呢,赢在内容。 r m 呢,赢在了排版。 v 四 pro 的 排版呢,主体是左右结构的,图片被挤得比较小,文字也比较小,远不如第一梯队的那种舒展的,然后清楚的感觉,但有亮点啊,就是首页它做了一张热力图,是这六个模型里面我觉得最具设计感的这个开场,然后结尾这个转场,还用了这个色块动画,看得出来很有这个设计的意图啊。 然后字幕显示呢,我觉得就是比较正常。 v 四 pro 的 内容啊,我觉得它写的旁白是六个模型里面最像写给人看的一份。 d c v 四,近两千顶铁, 完全开源零抠的纯华为 samsung 芯片社区最镇的不是跑分式文档,开发者说比 open a i 好 太多。有人留了四个字, from hackers to hackers。 敢直接把这个 hacker news 的 评论原话当京剧引进来。 from hackers to hackers, 然后循环贸易 中表达呢,保留得很完整,四个镜头的每一个都有一句压得住的短句,然后开源再追,闭源再堵,开发者用脚投票。这句收尾呢,比 opus 我 觉得是最接近第 题。对的,开头有数据统计,然后文字跟图片都足够大,排版很舒服。唯一的问题呢,就是字幕遮住了这个皱纹。我反馈了一次之后呢,也没有修好,但是 g r m 五点一的内容啊,就差强人意了,基本都是新闻播报, 每个镜头的结构呢,都是谁发布了什么数据,多少社区说了什么东西,没有一句呢是自己的这个视角,自己的判断,也没有把几件事串联起来一起的。这个整体的视角只看排版呢。 g r m 真的 厉害,但是把旁白跟分镜如果也算进去的话呢,我觉得 v 四 pro 可能更好一点,所以我把这两个呢,都放在第二档。第三档呢,就是 v 四 flash 跟 kimi k 二点六这一档啊,为什么放在第三档呢?就是因为我觉得它在排版跟内容上面都有些硬伤。你比如说啊,像 v 四 flash 的 这个排版,所有的页面呢,都是同一个上下结构, ppt 模板, 十六比九的图呢贴在上面,然后有大片的空白,字也偏小,开头的数据呢没有渲染出来,字幕也缺失,反馈之后呢,还是没有修复好。至于 vs flash 的 这内容呢,它的旁白基本上也就是在复读这个帖子标题,然后像 deepsea vs 那 段,讲到 sweetband 突破百分之八十,适配华为升腾,这现在都是标题的原话。还有的那段呢,也只是把世界名完成了念一遍, 完全没有自己的这种视角跟判断。然后 kimi k 二点六的排版呢,深图有浓郁的这种 ai 的 味道,深图的提示词呢,也是比较差的,图片也被裁切了,没有完整的展示,然后字呢,也偏小。 kimi k 二点六的内容啊,比 vs flash 我 觉得稍微强一点。选题呢,选了卡尔的信任危机,然后谷歌的助资 把续命和买保险两层的意思呢,都点到了旁白,比较有节奏感。不过相比第二档的 v 四 pro 啊,我觉得还是有点差距的,大家也可以自己看这两视频对比一下。最后来跟大家总结一下,就 gbt 五点五跟 oppo 四点七呢,排版跟内容两件事啊,都非常在线,贵呢,确实有贵的道理。 然后像 v 四 pro 跟 g m 五点一呢,都只能做到一件事,然后卡在中间。然后 v 四 flash 跟 kimi k 二点六呢,在我这个测试当中,两件事都没做到,所以我只能把它排在第三档了。收回这个 dipstick, v 四本身啊,国产第一梯队我就完全是没有问题的。 v 四 pro 一 百万的上下文,性价比也非常的高, 从内容上来说呢,甚至有时候可以超过 g p t 五点五,但综合实力呢,跟 opus 跟 g p t 五点五我觉得还是稍微有点差距。但你聊一下这次测试的本身的局限性,因为六个模型都只跑了一次,会有很大的这个随机性,换一次呢,可能结果又不一样了。 任务设计啊,我这次也是比较偏重于这个视觉方面跟代码能力的,对纯文本推理能力啊,其实不是特别的敏感。真正严谨的测试呢,应该每个模型都去跑 n 次,然后去它的分布,然后再叠加这个盲测打分。这期视频呢,算一个不太严谨的这个测试, 给大家一个基本的这种参考。最后再跟大家说一下,这次测试呢,用的 agent 是 派,在国内还比较冷门,但我现在自己啊,就是内部几乎所有非代码的任务呢,都在它上面跑,非常的顺手,非常的听话,非常的爽。它是个开源项目,完全不是广告,感兴趣的朋友呢也可以自己去学习一下,自己去体验一下。好了,今天视频就到这里,我是李总,黑经理超,我们下次见。

很多人不知道这个 close opus 四点七上热搜意味着什么啊?它不止因为更新了啊,而因为它把 ai 圈一个很现实的问题突然摆到了所有人的面前。 我这么讲完,你就知道为什么在热搜榜上这么多人关注它啊。以前大家呢,比的是谁更会聊天,谁更会写,谁回答的更像人,对吧?但是现在呢,比的已经不是这个了, 现在比的是谁能真正的把活干了。我用一个最通俗易懂的方式给你形容一下这几类模型,比如豆包啊,我们都很熟悉,他更像是一个反应很快,很听话的小学生。 那 chris 这笔呢?他其实更像是一个知识面很广,脑子反应也很快的大学生。而 cloud office 四点七,他更像是一个已经做过项目,能独立干活,会看图,会写代码,还能持续推进复杂任务的理工科研究生。这么说理解了吗? 他厉害就厉害了,他不只是会打听,他更像是在做事。哎,这次很多专业的用户啊,真正兴奋的不是说话更漂亮,而是他在代码、视觉理解、复杂、流程长、任务持续性这些地方,真的往前走了一大家。 你可以简单理解成,以前很多模型更像会说话的人,而现在呢,这个 cloud over 四点七更像是会干活的人。 为什么这件事这么重要?因为 ai 发展到今天,最不缺的就是看起来很聪明,真正缺的是能不能稳定持续,少出错,把一个复杂的任务做完的。 比如说写代码,不是随便吐一段就算了,而是能不能写的更完整,更少废话,更少无效的包装。比如说看图片,不是看个大概,而是能不能把图里的细节、表格、组价、结构真正的看明白。 比如做企业任务,不是给你一个答案,而是能不能把一整个流程往下推进,这就是为什么他这次能上热搜的原因。 其实他能上搜还有另外一个原因就是争议很大。这次不是所有人都在夸他啊,很多人一边觉得他更强了,一边也在吐槽他更烧鸡蛋了,因为这次他换了一个新的 talknice, 就是你可以把呃 tokenize 就是 理解成 ai 读字、吃字、算字的一种方式。以前呢,同样一段内容,他吃一百个 token, 那 现在呢,可能要吃更多,官方说有一些内容会多到百分之十到百分之三十五,这意味着什么呢? 意味着你表面上单价没涨,但你同样干了一件事,可能消耗的更多。对普通人来说,这就是更强了,但是也更贵了。对企业来说,这就是能力提升了,成本的结构也变了。 所以这次热搜不只是技术热搜,也是商业热搜。第二个真正让行业动荡的点是他的位置,就是这个,你可以理解成不是能不能看见图,而是能不能把它真正看懂。比如说以前很多的这个模型,看图就像是一个近视,还不戴眼镜,知道大概是什么,但细节的经常看漏。 而这次这个可多思,四点七在很多的测试里,已经接近看得很清楚的状态了。这意味着什么?意味着以后设计稿、表格、报表、后台的界面、网页的结果,复杂的截图,这些以前很难稳定交给 ai 的 东西,现在开始真的可以稳定的、放心的交给他 了,这就是普通生意了。那么这是 ai 开始往知识工作、产品工作、设计工作、分析工作更深的地方钻研。 所以你想想看,如果一个模型既能看懂图,又能写代码,又能跑长任务,那他不再是一个聊天的助手,他更像是一个正在逼近数字员工的东西。但争议 也在这里。很多人说,可乐以前最难得的地方是,他不像机器,说话有点人味,有点文字感,有点审美。这一次,有不少人觉得他在干活上更强了,但人味反而少。 这个争议其实特别有意思,因为他等于是在问整个 ai 行业的一个问题,未来的大模型,到底是应该更像一个会写、会表达、会陪你思考的人,还是更像一个冷静、高效、稳定、少废话的执行机器? 还有一个很多普通人都很专业,但专业圈很重视的点,就是这次他在塞博和 really vacation 这个方向更往前走近。嗯,就是你可以理解成,他开始不只是服务的办公啊,写代码,他开始碰更深的企业安全系统验证、工服测试的这些领域。 这些也是为什么中美都非常拼的这种东西。因为拼到最后,已经不是谁聊天更像人,而是谁能把模型放进真正高价值、高门槛、高风险的产业环节。 所以我最后给你一个最简单的总结,如果豆包像一个听话的小学生,揣着这口气像一个知识面很广的大学生,那么克拉的欧布斯四点七更像是一个已经进组干过活,能独立推进项目的研究生。 他这次上热搜,不是因为他不会说,而是因为他让所有人都更明显的看到, ai 正在从会聊天正式进入会干活。 而一旦 ai 开始真正会干活,普通人最该问的问题就不再是他聪不聪明,而是他下一步会替代什么,会重写什么,又会给谁带来机会。这才是 cloud over。 四点七真正值得聊的地方,想想一下多么细思极恐。