你有没有想过,所有人都在吹的多 agent 邪作,大概率只是一场精致的过家家?就在刚刚, mini max 甩出了 mavis, 直接捅破两个最要命的窗户,纸模型既当裁判又当选手的黑箱问题, 超长任务偷看烧到你怀疑人生。先说最要命的黑箱问题,传统的多 agent 工作流,本质上就是靠提示词来让模型玩角色扮演,但演着演着就崩盘,上下文焦虑,任务翻车、后台偷偷串通交付的成果简直不堪入目。 但 mavis 完全不同,每个角色做什么,何时启动,何时交接,不是模型在黑箱里拍脑门决定,而是最底层的运行逻辑说了算。更狠的是, worker 和 welfare 的 关系被改成了对抗,整个过程严格的就像吹毛求疵的甲方,谁也别想蒙混过关。 最让人意外的还是,在验证完之后,他居然说了一句,我学到新东西了,然后顺手更新了记忆。这可不是随便说说,而是真的把这次踩的坑刻进了底层代码里。 再看滔氣消耗,你看以前做超长任务,魔星干到一半突然停下来问一句,下一步怎么办?注意,他不是不会,是不敢。而 mavis 的 解法是,让 t mange 专门接管 agent 之间的状态传递,谁等待谁执行,谁验证,全部有引擎调度,魔星只埋头干活,不再瞎操心流程, 结果就是偷更消耗被直接砸下来。所以说, mavis 的 终极奥义不是让 ai 更聪明,而是让他彻底没法偷懒,用对抗核查记忆的程序铁律掐灭模型拍脑门的韧性。毕竟现实中我们真不需要同事智商爆表,只要别偷懒,别耍小聪明,事儿就能成。
粉丝1300获赞3.7万

就在刚刚,两只马横空出世,一款是腾讯操作系统级的 maus, 支持多端同步,深度嵌入本地操作系统环境,能够在电脑上高效处理本地任务,可以直接操作你的桌面管理文件和进程。卸载不了的小鸟壁纸,它能一键卸载。另一款便是 mini max 的 maus, 直接重构多 agent 逻辑,不再是靠提示词来让模型玩角色扮演,每个角色做什么,何时启动,何时交接,不是罗行在黑箱里拍脑门决定,而是最底层的运行逻辑说了算,交付成果的满意度大大提升。那么,你觉得这两只马哪个更好用呢?

当黄鼬勋紧急登上空军一号,随特朗普来华,没有人在怀疑,算力之争已成为全球 ai 竞争的核心锚点。 大家有没有设想过,当未来的算力不再成为瓶颈, ai 的 终极形态是什么?就在中美会晤的同时, mavs 打造了一个 ai 军团,替我们迈出了算力无限时代的第一步。大家好,我是柳博士。本期视频我将和屏幕前的各位专家一起深度实测全新发布的 mavs, 看算力无限时代的 ai 长什么样?点赞,收藏,我们马上开始。 现在我要找五篇二 零二六年最新的代代码的目标,检测顶会论文,并制作了对应的英文中数和 ppt。 may was 拿到问题后呢,首先对任务啊进行了分析和拆解。我们看右边的 agent 这一栏,它会显示的调动不同的智能 agent 协调工作,把找论文这个任务啊分解成了 scan 和 device, scan 主呢负责搜索论文,而多个大夫呢,负责对应论文的准确性验验,这个有什么好处?想必啊,各位专家都能猜到, 一是多个子任务可以并行提升速度,二来啊,多个 a 准之间呢,能够互相的对抗和较验,尽可能的减少幻觉问题。后面我们也会对单 a 准呢,在同样的任务上进行测试。先接着往后看, 在确认论文无误后,我们进入到了英文的中数写作。 mavs 会再安排一个 agent 团队来负责在这里搜索、检验、写作,分别都是三组的 agent 来完成,我们来看看产出的中数效果,各位专家觉得如何呢?一到五把评分打在公屏上, 然后是输出与英文中注配套的 ppt。 第一眼看过去啊,简洁不花里胡哨,背景、论文、对比代码等多个角度都涉及到了,基本可以拿来就用。 为了让大家更好的对比 agent team, 我 们用相同的任务也进行了单 a 准的测试,和理论不同,实测中啊,单 a 准的速度啊,要比 agent team 快 不少,我想大概率啊,是由于 agent team 的 任务量更大,并行的优势啊,在高峰期也不能完全的发挥出来,自然会慢一些。 在这个测试中啊,我们最关注的是产出成品的效果。单 a 准由于缺乏专门的 a 准教练,存在着不少低级的错误, 最明显的就是收集的五篇论文里面,只有三篇是顶会论文。同时啊,在文献综述和 ppt 中都出现了数据上的描述错误,这个对于科研场景来说是不可接受的。 最后来,整个大活把刚刚的所有过程串起来,让 mavs 做一个人工智能论文网站, 测试产品的分析能力、代码编辑能力和测试运维能力,看看能不能真的做到 a 准团队 ok, a 准 tin 进行了前端后端项目说明,分工并行的推进项目。直接来看效果,页面没有花里胡哨,非常的简洁,能快速地预览推荐论文的大致内容。 同时啊,还能看到其他人的高赞留言。我们点开一篇文章看看,可以发表评论,还可以一键直达相应的 app 以及 pdf 下载。各位专家觉得这个效果可以打几分呢? 聊完实战,我们稍微拆解一下底层原理。当智能体最大的问题就是生产者和验证者是同一个主体,存在既当运动员又当裁判员的致命缺陷。 mavs 的 produce verif 机制啊,理解起来非常简单,但极其有效。 生产者在独立的工作区执行任务,验证者在完全独立的上下文中进行审查。验证者呢,看不到生产者的思考过程,他的唯一目标就是找出问题,如果发现问题自动呢,反馈给生产者,修改,形成一个闭环。 另一个重要的设计是 mavs 的 三层持久记忆系统。传统的记忆系统啊,只是简单的保存聊天记录,不仅勇于,而且啊解锁效率低。 avus 把记忆呢分成了三个层级。局的记忆呢,存储用户的通用偏好。智能体的记忆呢?存储特定的角色、专业经验、绘画的记忆啊,存储当前任务的上下文,在永常的任务中也能够精准的响应用户的要求。 大模型的隐私问题是大家最关心的, avus 的 自托管设计,让所有计算和数据呢,都存储在用户本地,不上传任何云端,这真的非常重要。 最后说两句个人看法,从 ai 助手到 ai 团队,随着算力资源的丰富和 skill level 的 瓶颈,未来的 ai 研究啊,将不再局限单个模型的优化,而是转向如何构建由多个专业智能体组成的可信赖的协助系统。 当 ai 能力啊变得越来越强,我们也应该开始思考,未来我们究竟要提升什么能力,才能让自己继续留在牌桌上?欢迎在评论区说出你的看法。 ok, 以上就是本期视频的全部内容,欢迎关注我们,成为云组会的一员。

千呼万唤始出来啊, mini max 终于是推出了他们自己的桌面端 agent 的 应用 maas。 那 下面呢,是我做的一些测试啊,我先让他分析了一份 excel 数据啊,他不仅呢帮我整理出来了重点,还会自动地去生成这种图标和总结。 然后接着的话呢,我又让他去调研了一下 ai agent 的 一个发展方向,你可以看到他可以去自己搜集资料,然后整理信息,最后直接生成了这样的一个结构化的报告。甚至呢,你还可以让他去生成 ai 慢剧啊,给视频配音生成视觉内容, 玩性还是非常高的。虽然说开局呢,也是这样的一个聊天框,但是他现在能做的其实已经不只是 chat 这么简单了,更像是一个真正能够帮你去工作的 ai 助手。 而且呢,这个 memphis 里面还内置了非常多的 skills, 同时呢,也是可以去支持导入和自己新建的。甚至呢,还可以去记住你的一个偏好,生成新的 skills。 那 这意味着它并不是一个只有固定功能的 ai 工具,而是一个可以不断去被扩展能力的 ai 工作台。但是它真正让我觉得有意思的,还不是说它有这么多的功能,而是它开始让多个 agent 协同工作了。那以前呢,很多 ai 的 工作流本质上面还是 prompt rules, 提示词模板这些,对吧?比如说你保存了一个爆款标题的提示词,那下次你复制进去呢,再让它重新生成一次啊,大概是这样的一个操作。 但是 amazon 呢,它给我的一个感觉就不太一样了啊,就是它更像是在培养一个角色啊,比如说我会去新建这个文档的 agent, 标题的 agent、 封面 agent, 配图 agent, 还有这个审核 agent, 让它们去长期负责不同的事情。而且呢,这些 agent 呢,它不是一次性的使用啊, 他会慢慢地去记住自己的一个职责,包括他做事的一个风格,以及我们使用的一个习惯。如果说你觉得某个 a g 呢,他做的不够好,还可以去单独的跟他对话啊,继续去微调他的一个能力。那这一点呢,我觉得是特别的重要啊,因为以前我们保存的其实是一个 prompt, 现在的话呢,我们更像是在培养一个真实的岗位。那现在的话呢,我们就做一个真实的工作流测试吧,啊,就是帮我做一期这个 agent skills 方向的视频。那这个 agent team 呢,他就已经开始工作了啊,这个视频文案助手呢,就开始去拆解任务,然后做计划。 接下来的话呢,他开始去调用不同的 agent 啊,比如说这个文案助手负责去写这个竹字稿,然后标题助手负责生成标题封面助手负责生成这个横竖 的一个封面,然后配图 agent 开始用这个 html 的 方式去生成对应的口播背景素材。最有意思的是什么呢?就是它不是各干各的,而是真的会相互去协助。那最后的话呢,这个 memphis 是 把各个 agent 呢它生成的一个内容汇聚到了一起, 然后啊调用了本地的这个飞书 c i i, 生成了一篇飞书云文档。那这还没完啊,我们还可以去把这个 memphis 接入到飞书里面啊,就是以后呢, 无论是在电脑端还是在手机端,都可以去指挥 maus 干活啊,就是无处不在,非常丝滑,对吧? ok, 那 现在的话呢,我们就去飞书里面看一下这个云文档的生成效果啊,首先它的这个结构是非常的清晰啊,前面有这个竹字稿, 然后在标题方案这一块呢,它是区分不同平台的,然后这个封面方案这里的话呢,不同平台的设计思路它也是不一样的,下面还给出了相应的一个视力图片啊,大家可以看一下这个图片的效果 啊,包括这个横屏竖屏都是有的啊,而且我觉得是非常的精美。然后呢就是这个配图方案,它这边呢是给人物口播做背景来使用的一个画面啊, 这里面呢它是同步去生成了一个 html 的 文件啊,这个我们稍后会看一下。那最后呢是这个审核报告啊,包括下面的这个格式化图标,这个我一般是会把它截图下来,然后在剪辑的时候去用啊, 就是我们整体的一个视频的画面内容会更加的丰富一些。那我们接下来就去看一下配合口播使用的那个 html 文件吧,它整体的一个配色动效我觉得做的还是非常的不错,对吧?包括说上面的这些文字呢,也不是说胡乱生成的,都是基于我们 上面的那个文案助手写出来的这个文案啊,来生成的,对吧?所以我说他们是相互协助的,之间是有交流和沟通的。 ok, 这个呢,我用到的其实是一个开源的 skills 来做出来的啊,那生成的时候呢,我们可以去指定某个风格,那也可以去让这个 memphis 自己去决定它用什么样的一个风格是最合适的啊,这都可以,那添加这个 skills 呢,也是非常的方便啊,直接在这个技能,然后点击创建,然后从这个 github 导入啊,就可以了。 在以前的时候啊,很多这个 ai 工具,它其实都希望自己是一个全能选手啊,就是你给他一个任务,然后呢,他会从头做到尾啊。但是这个 maas, 它其实更像真实团队里面的那个 职业的分工啊,就是有人负责写,有人负责审核。并且的话呢,这些 ag 呢,它也是长期存在的啊,就是以前的话呢,你可能保存的只是一条提示词,但是现在的话呢,你更像是在培养一只长期写作的 ai 团队。 后面我又测试了一个真实的开发场景啊,就是我想让他去实现一个数据的查询功能。首先呢,这个 code agent 呢,他很快就把这个功能都写完了啊,那如果说是一个普通 agent 的 话呢,到这里其实就已经结束了。但是呢,这个 reviewer agent 呢,很快就发现了一个问题啊,这里面全量查询可能会导致数据量过大,然后存在一个性能方面的风险啊。 最后的话呢,他会把这个东西反馈给 code agent, 让它重新去修改。那这一点的话呢,其实特别像是我们真实的一个开发团队了啊,因为很多真实的工程问题,其实并不是你能不能够运行,而是说我们到了线上啊,它的这个数据量 一旦大了以后,性能是否会下降啊?系统会不会崩?单 agent, 它其实最大的一个问题就是不是说它写不出来,而是说呢它更容易的去只关注这个功能是否可以被完成,因为它本质上面还是自己写,然后自己检查。 webspace 这里呢,它是有一个独立的 reviewer 啊,它呢是专门负责找问题的,那这个机制呢?它们叫做 produce verify。 那 坐到这里的话呢,我就发现这个 webspace 它其实已经不再只是啊 ai 可以 去帮您干活,而是它开始真正进入工程合作这样的一个 level。 我觉得这个 maas 它其实最核心的东西,不是说啊它会做这个 ppt, 会分析这个 excel 啊,因为现在很多的 ai 工具其实都可以做这些,那真正核心的东西,我觉得是它已经开始解决了这个 ai 和 ai 之间如何去协做的这样的一个问题。以前我们看到的那些 ai 工具,它其实更像是一种 呃,一次性的工具,打开使用,然后关闭,对吧?但是现在的话呢,这个 ai 开始越来越像一个数字员工,甚至是数字团队 这样那个方向来迈进了,就是他会去记住你的一个习惯,然后记住你的一个工作流啊,不同的这个 ag 呢,之间呢,还会去形成真正的协助关系。 ok, 那 以上呢,就是本期视频的一个全部内容了,感谢大家的收看,我们下个视频再见, peace。

我刚用一个 ai 团队,直接帮我生成了一个完整的无线化复 ai 全站应用。相比于传统单个智能体,我用更少的 webcoding 次数得到了代码质量更高、效果更符合我预期的产品。 这个 ai 团队智能体产品 mavis 是 mini max 最新发布的,没错,就是那个开源了很多大模型的 mini max。 本期视频我就带大家看看,当智能体组建成一支训练有素的团队,究竟能做多少事情。 其实从这几年智能体的发展就能看出来, ai 已经不是一个人干活了,而是变成一个团队。 mavis 内置了 agent team 的 特性,当你给他一个复杂的需求之后, mavis 会分析需求,然后将任务分配给多个智能体。不同智能体独立运行,又会互相协助, 同时还有 ai 自检查、自循环、自净化的功能,这几个特性对程序员来说就很有用。这期视频我让 ai 来生成一个无线画布的 ai 图片生成工具,并且直接让它生成完整的前后端全站代码。把 mesh team 选上,然后就可以看到 mesh 自己对需求进行了分解,然后生成前端、后端测试等多个智能体, 不同智能体之间独立,但又会互相协作。用单智能体写代码的时候,如果你让同一个智能体再去 review 自己的代码,那它大概率是查不出来问题的。这点其实很真实,程序员自己 review 代码基本等于没 review, 这时候多一个代码 review 的 智能体就很重要了,提前排查出问题,强化智能代码的质量。并且如果单个智能体去完成整个全量项目的开发, 在上下文变长,任务链路变复杂,同一个智能体负责太多模块的情况下,很容易出现降质的情况。到最后就是工具调用变得很随机,甚至效果变差。现在第一遍 web 编辑出来的就是这样一个画布产品了,可以在一个画布中直接完成 ai 图片的制作。我们继续 web 编辑, 增加图像、去除背景、修改物品角度的功能。 maus 目前内置的模型是 mini max m 二点七,再加上工程能力的加持,解出来的代码质量真的不低。 还可以直接接入飞书,比如我在飞书中让他帮我收集当天的 tf 的 热门项目,等他活干完了,你只需要验收就好了。 我最近开始用 ai 做一些技术视频的动画,用来匹配自己的图稿,这些动画内容我个人更倾向于 ppt 这种风格。当我做了好几个这样的动画之后, 会发现当我在做同样的动画时, maus 自己结合我历史的喜好帮我创建出动画。而不用再说一遍动画规则,因为 maus 内置有三层记忆,大局记忆、 agent 记忆以及 chen 记忆。我在不断创建动画过程中, maus 会自己从这些记忆中提取出我的喜好和风格, 还可以把这些固定的流程整理成 skill, 形成专属于我自己的视频生成技能。拥有一支 ai 团队之后,就相当于拥有了一整支产品研发团队、内容创作团队、电商运营团队,甚至是二十四小时在线的数据分析和业务增长团队。以上就是本期视频的全部内容了,我是鱼仔,我们下期再见。

国产 ai 模型又亮出了一张王牌,在 mini max 上周刚刚发布的 max 的 支持下,一个晚上的时间我就把自己抖音号一百多条作品复刻成了影视巨峰同款的飞书数据看板,并且根据具体数据还做出了新一期内容的十个选题,还平 了分。你以为我是熬夜干这个事情的?完全没有,我只是把我的作品列表发给了他,然后再给了他一句话,剩下的部分就是由一只 ai agent team 来帮助我完成的了。 我们直接跳到这个成品展示,大家现在看到的就是我的内容运营分析仪表盘了,那你们可以看到这几个虚荣的数字,有总观看、总点赞、总分享、二万五累计粉丝增量。那下面的还有一些部分就是播放趋势,用户互动趋势,题材播放量对比,题材互动占比,这些全部都是动态实时更新的。那再往下我一百多条作品的 明细表,每一条都给我标记好了发布时间,视频的题材播放量,完播率,五秒二秒的数据等等,还有封面点击率, 那更觉得是他现在还能自动根据我目前的数据给我筛选了十个选择题,并且进行了打分。我跟你说,真的到这步的时候我真的惊到了,因为我让他干的事是分析数据,那他在分析的过程中,他自己又多干了一件我没有让他干的事情, 就是根据我历史一百零一条作品的表现反推出说柱子哥下一期做什么样的内容大概会爆。那直接给了我十条的选题的角度,再到预计的受众差异化的核心优胜率的评级, 九个维度全部都给我打满了。比如说他给我推的第一条五星选择题是 entropic 五个月的估值翻倍,第二条是 entropic 在 企业端首次反超,全部都靠的团队。那确实,现在也是当下 ai 圈的真热点, 而且跟我历史数据表现好的这些题材入驻是完全可以对得上的。这就是多 a 卷协助的一个价值。那一个 a 卷是做不到这个的,因为他眼里只有说用户让我干的事。但是一直 ai 团队不一样,他们之间是会互相启发,互相补位的,所以我就直接服了,这个确实挺厉害,这功能 我跟你说真的,我自己花一周时间在飞书,你的手搓都可能搓不出这个效果,而刚好飞书也开放了 c l a, 所以 真的很好用。那我做的事情是什么?我就拖了一个十一 kb 的 markdown 文档,并且说了一句话,就是请把这份数据整理成飞书多维表格,并利用你多 a 卷特性进行综合研判。 那 marvis 收到以后,没有上来马上就干,而是先把数据扫了一遍,然后告诉我说,你这报告还是很专业的,有多少条作品,多少个主题, 一个月时间的最终颗粒度很细,我想开两路并行,他就启动了 a 卷一是负责把数据写进非书多位表格,然后 a 卷二到四分别是从内容策划、商业价值、粉丝运营三个角度同时做圆盘,最后汇总给到我这边。 那么看到这里,很多老观众就会问,柱子哥,铁柱老师,这个 mars 它到底是个什么东西呢?你这么理解就可以了,它是 mini max 上周刚发布的一个桌面端 ai 工作团队, 不是 gbt 那 种你问一句答一句的聊天软件,而是你桌面上多了一个有项目经理,有执行人,还有专门挑刺儿的质检员的这种小公司小团队,所有事情你只要跟项目经理对话就可以,然后他就操控底下几个 a 卷,同时帮你干活, 那它的优势在哪?我就觉得有四个点是真正的差异化,不是参数,而是机制。第一个就是它的这个 a 卷 team 的 这个特性多, a 卷并行, 每个 agent 还可以扮演不同的角色,比如说我刚才那桌就是 code verify 呀, general 这三个角色一起上。第二个对我来讲也很重要,叫做 produce verify, 这名字听起来很高级,说白了就是一句话,写代码,这个 agent 它不能自己 code review, 就 不能自己审核自己。 所以在全部做完了以后, varify 会用一个全新的独立的上下文窗口重新读,重新查,看看你这个整个项目里面有没有错漏,就是一个非常好的复审和自查的这么一个机制。我在跑第一遍的时候就对这个 varify 非常有感觉,因为 h 一 第一次是把数据写进非书的时候,字断对的不齐, 这个 varify 直接就打回去让他重写了。第三个特性三层的记忆,它可以全职的记住你是谁, a 选记住他干过什么 session, 记住这次到第几步了,这意味着什么呢?意味着你不用从头 再去跟他解释。第四个就是 i m 系统的集成,它现在和飞书整合的非常好,我们现在可以直接在飞书群里面,艾米尔斯让他直接开干,不用切到电脑上,也不用切其他的窗口。 我们现在进入实操环节,来看一下到底是怎么做的。实际上整个流程非常简单,第一步就是把这个 mini max 给它挡下来。第二步到它的窗口里面,把你的数据丢给他,把你的作品列表拖到他的对话框里面,告诉他说请把这份数据整理成非书多页表格,并且利用多 a 卷特性进行综合研判。说完这句话我就去玩手机就睡觉去了。 那第三步实际上是比较重要的,就是我们看 marvis 在 这个时候干什么,他自己是在配置非书的 cla, 这个 cla 是 真的很好用,他在自己用命令行去给我创建非书的多维表格, 那这个是我。如果放在以前,我可能要打开飞书的开放平台,然后申请自荐应用,然后再配 app id, 就 像 open call 刚出来那会,你要跟他进行非常复杂的对接,看很多的教程。我说实话,我那个时候真的没跑通,但是你看现在阿比斯,他直接把这整套开发流程当成自己的工具用,我什么都不用懂,他自己跑就可以了。 那在之后的八分钟,三个 a 卷都在那并行干。 a 卷一来写表, a 卷二在分析哪类小题的点赞比较高, a 卷三呢,在算哪类视频的商业价值最高,而 a 卷四在猜粉丝什么时候最活跃,他们偏好哪种类型的内容,他 们之间是互相不会去抢资源的。那次完成了 verify 就是 最终复审以后,我打开飞书这个看板就已经在那边了。当然了,柱子哥这次拿他干的是看板,但是 mavis 能干的活远远不止于此。在一个窗口里,他可以给你分析 excel, 写 pdf 学术报告,做 ppt 演示文稿,丢什么文件,他都能给你处理。 比如说我就在我的手机上把我的作品数据发给他,他就可以给我生成一个甲方就能看的 ppt, 看这里面有什么关键数据,什么值得亮点提炼一下,它也支持设定定时任务。比如说我就跟他说,你现在每天早上九点把昨天的 ai 日报给我发过来,结果他现在真的每天早上九点就照做。而且我们现在可以在很多的手机软件上面艾特他,直接干活,不需要去切其他的窗口, 越用越懂你,你的 ppt 风格,你的文档结构偏好,他会不断的进步。所以 ai 时代是已经过了谁的模型更聪明的那个阶段。其实大家都挺聪明的, 那下一个阶段是什么?是谁能在你睡觉的时候,有一支团队可以把你的任务完成,而且还互相 review? 那 marvis 给你的答案是什么呢?说白了一句话就是不是又一个更聪明的 ai agent, 而是 ai team 时代的一个工作台。 那这个答案能不能立得住?我用了一个晚上帮你们验证过了,确实还不错,你们自己也可以试一下。好,上就是本期视频的全部内容,希望会对你有所帮助,我们下期视频再见。

这个腾讯刚出的 mars 啊,可以直接控制你的子鸟浏览器进行访问,非常的牛逼,大家可以去用一下。这边是有一个图形界面化的一个 a 俊,他的一个办公的一个场景,那这个是一个文件管理的一个助手, 那这边相当于说是你的一个 ai 主管,这边是你的 app 操作的专员, 这边是电脑的一个专员,然后这边是网页交互的专员,也就是说你的网页抓取就是通过这个工具啊,这个大这个智能体啊,这 box 的 一个智能体,然后这个是刚才那个文件管理, 然后这个呢是擅长网络搜索的专员,也就是说你所有的 ai 这个工具里面的所有的执行任务全部是在这个场景下完成了啊,他现在上厕所,他可能等会这边还会有空闲的员工啊,他会在这里进行一个健身 啊,这是一个场景化的一个展示。我刚才我这边接了个任务啊,我的任务指定是采集竞品,采集竞品数据,采集竞品图片,让我这边选择采集欧众平台竞品。兄弟们,现在 ai 介入了, 打开浏览器,然后你们一套鼠标,一套键盘,要控制多台电脑的话,你们可以买一个像我这样子的工具, 就是一个键盘,一个鼠标可以直接控制多台电脑,你可以看一下啊,就是比如说我这个鼠标, 这个鼠标是不在这里,这个这个鼠标是在我这台电脑,对不对?我这个鼠标直接可以移过来,直接可以到这里啊,可以直接可以穿屏啊,也是个非常方便的工具,也就是说一套键鼠控制两台电脑。

腾讯刚刚推出 mavis, 是 一款操作系统级 ai 助手,不只是聊天,还能帮你操作电脑和手机。它可以理解文件应用和网页内容,协助完成资料查找、文档处理、搜索整理、系统设置等任务。 简单说, mavis 就 像一个能真正帮你干活的智能助手,让设备更主动、更高效,也让 ai 从回答问题走向完成任务。尤其腾讯 mavis 的 my agent, 挺逗的。

腾讯 ai 助手马维斯正式上工, openclaw 还没整明白,这个迭代比手机还快哎,可是越好用的 ai 越藏着没人去说的秘密。 你看 openclaw 是 早年的那个赛班机,要写代码,搭环境,调配置,全是极客圈的专属玩具,普通人哪懂这些啊, 搞了半天装不好还得从头再来,浪费时间。反观马维斯,是智能机,傻瓜式一键安装, windows maker, 安卓三端同步,不懂技术都能用,直接把高端 ai 拉到平面化基础,小白也能轻松的上手。 但我敢说啊,很多人都忽略了中间最关键的安全问题,大肠嘴上说啊,有隐私保护,权限管控,哎,这可你要知道啊,便携和隐私从来都是对立面的, open code 虽然繁琐,但开源可控,安全大权完全掌握到自己手里。可马维斯再好用,数据权限、磁盘扫描全攥在平台手里,就算有隐私模式,谁又能拍着胸脯说,哎,后面没个门啥的呀。要知道马维斯是 ai 底层的操作系统助手, 能让电脑直接给你对话,想做到这一点,难免会读取你电脑里的文件照片,你说谁的电脑里每个什么小作文啦,武打片啥的呀,想用 ai 省心,又怕隐私被窥探,哎,真的太纠结了。 我给你个建议哈,没什么核心隐私的你就放心的用,马维斯每天还白给你一千万的免费磁源,市面上要卖九块九哦, 还自带六个二十四小时待命的 a i n g, 办公效率直接拉满,除了机密文件的,一定要手动关闭磁盘扫描权限, 牢牢守住自己的安全底线呐。高科技产品确实是一代更比一代强啊,好用便捷那是真的,但安全是没有绝对的升级的。便捷交给了产品吧,隐私还是要牢牢转到自己的掌心里面的。

十二期比赛,十七个模型,一百零七万人看过的模型挑战赛的阶段性总结,同时也回答大家一个问题,到底该选用什么模型呢? 谁最强,谁最拉?谁的性价比最高?直接上数据,先看谁赢过 kimi k 二点六三次冠军,视觉还行。 gemini 三点一 pro 两次,视觉类很优秀。 cloud office 四点七两次,代码最强,但也是最贵。 g o m 五点一一次,视觉设计越少,能力会更强一些。 miimo v 二点五 pro 一 次,结合模型参数来讲,价格比较低。 dbc v 四 flash 一 次,绝对的性价比。 gbt 五点五一次, t 管及夺冠。 cloudsonnet 四点六一次,虽然价格偏高,但是质量很好,剩下的没赢过。千问三点六 plus 第一期拿过第二,然后一路下滑,第十期唯一翻车被淘汰了。豆包 c 的 二点零 pro 第七期,手灯八十五分,高光时刻,第十一期换成 code 版本直接垫底。百度文新五点一只上了一期,存在感极低,而且效果一般。 grog 四点三第十二期首秀,一分钟交卷也一分钟翻车。 gemini 三点五 flash 同样第十二期首秀,但价格偏高,综合来讲性价比不高。看稳定性,最稳的是 g o m 五点一,几乎没翻过车,永远在前四。 其次是 kimi k 二点六,整体稳定,没有大毛病,多模态的原因,前端会比其他模型优秀一点。 miimo v 二点五 pro 中规中矩, bug 率不低也不高。最不稳定的就是 deepsea v 四 pro, 思考链离奇的长,复杂问题如此,简单,问题也如此。 再看性价比角度, mini max m 二点七,性价比之王,绝对的量大管保。 deepsea v 四 flash 永久降价之后正在威胁 mini max 的 位置,而且能力不错,但不是多模态。豆包 c 的 二点零,蔻的最快最省,但质量一般。 glod opus 四点七当之无愧的最强,但是非常贵。 gbt 五点五, gemini 三点五, flash 价格相对低,能力没有差很多,但只相对于 glod opus 四点七。视觉物理题 gemini 最好, 代码工程题 cloud 最强,混合题 g o m 最稳,代码质量好,测试写得多,当然如果能用海外预判家肯定不用考虑开源。最终排名如下,仅代表部分题目测试和个人观点,仅供参考。 最后解答一个大家总在问的问题, coding plan 该选择谁呢?现在基本都在转向 token plan 的 形式,单论价格低,量大, deepsea mini max 无脑选,虽然没有绝对的王者,但是能用 gemini cloud gpt 就 不需要选择其他的。

这么多老板想要搭建本地 ai 模型,那到底该选什么硬件?选哪些模型?今天一次性讲清楚。目前本地模型主流方案 n 卡和 max studio。 那 么首先就是 max studio 它的优点肯定就是它的显存足够大,因为它的显存内存是统一的嘛。像这一台是 max studio m 二 ultra 六十四 gb, 也就是说它可以装最大六十四 gb 以下的,但是你像五零九零呢, 它就只能装二十四 g 以内的一些模型,这是很大的区别,也是 max 的 优点,但它的缺点呢,是它的算力不够啊。就是如果说你要跑多人并发的,但 max studio 只能一个人啊,那如果你是多人团队, 想要并发使用,就得考虑 n 卡方案了。但是 n 卡五零九零的,它的价格也会稍微贵一点,贵个几千块钱啊,并且它的算力速度是翻倍的。因为我们实测下来一个数据,那 max studio 它的 t g token 可以 跑到五十到七十,那么五千零九十的 t g token, 它可以跑到一百到两百,然后 max studio 它的 p p token 可以 跑到两百到三百, 那么五千零九十的 p p token 可以 跑到七百左右,这就是它们两个最大的一个算力的区别。所以从算力来讲,那么五千零九十它是全面领先的, 最终怎么选?那么也可以从几个点去考虑,第一点就是你愿不愿意多花几千块钱去获得一个翻倍的算力啊。第二点呢,就是你到底想装多大的模型?如果你一定要装一个六十四 g 才能装下的模型的话,那么可能只有 max studio 可以 满足你这一点。再就是要上 pro 六千了,那么这个价格就不是它翻倍这么简单了。

都说一人公司是二零二六年的主流,可我明明开了一人公司,怎么还是感觉累的发疯?打个比方,我现在要做一条视频,就得用不同的 ai 工具分别完成选择题、脚本以及视频剪辑的工作。本质上依然是我在执行,只是用了更方便的工具。那大家想想,如果是你的老板, 他平时会怎么做?没错,定好大方向,剩下的交给员工就好。那如果你也想完成这样的工作,可能不是这些要亲自手操的 agent, 而这就是 mini max 推出的新 agent maris can manage the leader wirefire 和 product 三个 ai 角色就能轻松实现你的想法。比如我现在要写三篇脚本,就可以直接告诉 marius, 帮我抓取最近一段时间科技圈的新资讯,然后找到这些资讯相对应的热点视频,对热点视频进行拆解, 并把这些热点视频拆解整理成一份 excel 表格,然后分析这篇 excel 表格报,生成三篇有热点潜质的短视频脚本,再根据脚本产出视频,它就会自动拆解我的需求,然后调用适合的大模型完成我下发的任务。并且在这个过程中,它不会来回切换工具,而是在自己的窗口全部搞定。或许你会说, 这有什么,我之前用的 agent 也可以啊,但是我要告诉你的是,之前用其他 agent 的 时, ai 也会经常犯错。但在这里,情况有所不同,依靠 product warehouse cycle, maris 已经成功解决了这个问题。简单来说,在 maris 的 工作流中, ai 会先扮演一个团队中两种角色,即实践者和判断。这两个角色之间不共享对话历史,由判断方以找寻问题作为目的, 零开始理解执行产出内容,然后给出判断结果,并把结果的反馈自动注入 product 的 下一轮工作中。就像传统公司结构中只能不同但默契配合的两个员工,他们跟随你定下的大方向自主完成任务。当然,作为老板,在定完大方向的情况下,你或许还需要一个主管帮你分配任务,而这就是 marvis 内置的 agent team 中定 三个角色 leader, 他 负责把你的大方向拆解成一个一个的小任务,然后根据任务类型把它们分配给不同模型的对应组合,交付出你想要的结果。并且不同于其他 agent, 每次接受指令都要把你所有的注意事项重新说一遍。 mavis 更像一个机灵的助手,我写脚本的习惯,做视频的风格他都能记住。 所以下次我再想让他做一样的工作,就不需要再输入那么长的提示词,只需要一句帮我写脚本,他就能把相同的流程再做一遍。俗话说一个好汉三个帮。而在 ai 时代,即便是做艺人公司,那作为老板,选择一个懂你的 ai 团队,才能真的让你的事业事半功倍。

万万没想到,挑战把两块五的义乌小瓷碗卖给老外,没想到 ai 直接把它变成东方药变天木盏,定价三百都被老外疯狂预定,评论区全是什么东方瓷器艺术典范。一开始我只是询问 ai 助理 mavis 怎么样把流水线小瓷碗卖给老外,没想到 mavis 直接拉出一支电商团队 agent team 分 析。根据我们给到的商品图, 主控 agent 抓住他的文化输出特点,逆定出美国优先英国稳定北欧竞争少的市场方向后,没想到给了我们一套并行策略,一个是薄利多销的快速出单打法,另一个则是以讲故事加文化蓄势的东方七五路 线。在他看来,不能把鸡蛋放在同一个篮子,一定要结合起来安排每个月的执行路线。当然,具体执行也不是一个主控 agent 说了算。接下来他还要把文档打包给数据 agent 去做海外平台的市场调研。结果瓷器多地区并行的运输痛点马 马上被他发现,单晚空运的利润百分之十二,海运百分之三十八,大概率会出现亏损。好在套装组合的方案提 出,及时修正了这份战略内容, agent 这才接手继续去细化产品的平台营销。他拉来制作品牌 dtc 建站的团队,分工合作,确定了三个并行的 truck, 将其整理成一份综合的系统化手册,里面结合了国内外认知差异,把瓷器上的如意翻译成当地人更好理解的 a、 c u v 史。作为产品名, 将文化底蕴细有传世精湛技艺作为营销卖点。直到填满商品的详情页后,视觉 agent 直接补足相应物料的 提示词,用特写图片加精致视频的模式,把右侧反光和器型细节展示的一清二楚。还通过高级沙龙别墅陈设的场景构建,让他进一步贴合白人精英的身份象征。更离谱的是,所有过程我都没有进行任何人为干预。让他进一步贴合白人精英的身份象征,更离谱的是,所有过程我都没有进行。 ai agent 团队支持和优化主控 agent 负责大局战略规划,他从商品图 出发,分析文化价值、市场趋势和潜在消费群体数据。 agent 则实时跟进海外平台数据,发现运输风险和利率差异进行局部调整,直到视觉。 agent 将商品细节用高质特写图片与视频 呈现,各个 agent 之间的分工合作直接形成闭环,原来需要的人力成本不仅被这套全链路协助实时反馈闭环迭代的方式压缩至我一个人就能执行,还能做出像小瓷碗这样兼具个人风格和文化背景的差异性产品。 只能说现在电商拼的不再是投入多少,怎么推出单个优秀产品,更重要的是怎么去实现可复刻、可拓展的电商智能化操作模式。

挑战一个视频,让你学会 ai 大 模型!警告,本视频耗时两百八十分钟,制作时长共一万六千八百秒。我将教你从零基础开始学完大模型,用最通俗的大白话快速学完所有重点。建议先点赞收藏,避免找不到。今天是模型后缀,介绍更多 ai 大 模型资料评论区后六六六,或者直接私信我,我直接安排 nice! 大家平时选大模型是不是只看模型的名字? 那么模型后面跟上的那个英文是什么?我们在选用的时候需不需要注意什么? ultra、 pro turbo、 mini vision? 看着是不是特别像手机发布会?这些名字到底是真的有区别,还是只是厂商起的听起来很厉害的名字?今天这节课,我先给大家打个包票,你只要把这一遍听完以后再看到这些模型名字,基本就不会被带跑偏了。好, 我们先从第一类开始,我给他起了个名字,叫智商门派模型。名字里带 ultra max 是 不是一定比 pro 聪明?答案是大多数情况下是的。 那你得先搞清楚这里说的聪明指的是什么。 ultra max, 你 可以直接理解成顶配版,它不一定更像人,但它通常算力给的更多,能力上限更高,所以更适合干什么事呢?比如数学推理、复杂分析,写比较重的代码。不过我一定要提醒一句,不是所有场景都需要 ultra, 很多时候用它反而是浪费。那再看 pro 或 plus, 这一类模型其实是我最推荐大家用的, 你可以把它理解成综合能力最均衡的主力机型,不算最慢,也不算最贵,但大多数任务它都能稳稳当当的完成。你平时用 ai 写方案,做分析、写文案,说实话,八成情况用 pro 就 已经够了。 那 bass 又是什么?很多人一看 bass 就 觉得这是个弱版本。其实不是, bass 更像是原材料,它通常没有怎么被教过该怎么跟人说话,所以更像一个原始大脑。这种模型主要是给谁用的呢?给开发者、研究人员拿去自己做二次训练,普通用户基本不用纠结 bass 这一类。 接下来我们进入第二类,我管它叫速度门派。我先问你一个很现实的问题,如果一个模型慢五秒,但答案只好百分之五,你等不等? 大多数时候其实是不等的。这就是为什么会有 flash turbo 这种模型。 flash turbo 关键词只有一个,快。它不一定比别的模型更聪明,但它反应更快,延迟更低,而且成本通常也更友好, 特别适合什么场景,比如客服系统、实时对话、自动化流程,你可以把它理解成那种反应特别快的选手。那 mini 通常是把一个大模型压缩之后得到的版本, 就好像把一本很厚的书压缩成一本重点版,体积小了,但核心能力还在,只是没有那么全面。这里我重点说一句, light 和 nano。 很多人会下意识以为这种模型一定能直接在手机上跑,但这个理解是不准确的。更合理的说法是,他们对算力的要求很低,有些版本确实可以做观测部署,有些依然是跑在云上的。 所以看到 light、 nano 不要直接等号本地运行,一定要看具体的使用场景。接下来我们看第三类,我叫它感官门派。我先问你一个问题, 大模型到底是只会聊天,还是能看懂这个世界?这就涉及到多模态能力了。围巾、 v v l 这一类模型代表的是视觉能力,也就是说它不只是看文字,还可以看图片、图表、截图,有些版本还能处理视频内容。但这里我要提醒一句,不是所有围巾模型都有那种电影级的视频理解能力。这个要具体看版本, image 或 rt 就 比较好理解了, 它们主要是用来生成图片的,你给提示词,它给你画图。 audio 这一类也别想复杂,简单说就是能听也能说,支持语音输入和语音输出, 很适合做语音助手或者语音对话场景。最后一类我给他起了个名字,叫技术门派,这一页如果你不看后面,其实很容易踩坑。 structure 是 什么?我用一句人话讲,他是被教过怎么听话的模型, 所以他特别擅长按照步骤执行任务,严格理解并完成指令。 get 和 r l h f 模型更像什么呢?更像是跟人聊过天的模型,他知道什么话该说,什么话不该说,也更懂得怎么顺着你聊下去。 preview 或 x p 一 看到你心里要先有个数。这类模型通常是实验版本,有新功能,但也可能不稳定,尝鲜可以, 真要上正式环境就要谨慎一点。最后我重点讲一下 m o e 这个词,你可以这么理解,它不是一个人,而是一个团队。模型内部有很多专家,每次只把最合适的那几个叫出来干活,所以它看起来规模很大,但实际用起来却比较省, 在效率和性能之间取得了一个不错的平衡。我最后帮大家总结一句话,模型名字后面的这些后缀不是用来装饰的,而是厂商给你的使用说明。以后你在选模型的时候先问自己三个问题,第一,我是不是一定要最强?第二,我是不是更在意速度和成本?第三,我需不需要看图听声音这三个问题想清楚了,你选模型的水平已经超过大多数人了。

家人们谁懂啊?在郊外的一片废土之中,小帅的目光被一个奇怪的土块给吸引了。扒开表面的浮土,一抹刺眼的亮黄色瞬间点燃了他心中的期待。 我的天,这轮廓,这造型,难道是传说中那台称霸东瀛赛道的转子战神马自达 r x 腹肌?只见他浑身裹满了厚重的泥土铠甲,仿佛一位刚刚从远古战场归来的失落大将军,只剩下无尽的沧桑。 看着这台蒙城的梦想之车,小帅的 dna 动了,今天说什么也要让他涅槃重生!话不多说,抢救工作立刻开始。第一步,干尸育雏泥! 小帅抡起祖传的洛阳铲,对车身上的顽固结块进行初步破拆,每一铲下去都必须力道精准,既要剥离污垢,又不能伤及那身经典的黄色战袍。引擎盖、车门、尾翼,每一处都覆盖着厚厚的历史尘埃,这活没点麒麟臂还真拿不下来。 经过一番大刀阔斧的施工,车身大致的轮廓已经显现,但细节之处依旧是重灾区。换上硬毛刷开始对车身进行第二轮的深度清洁,把那些嵌在缝隙里的陈年老垢通通盘它。车顶、侧裙,甚至是底盘,任何一个卫生死角都休想逃过小帅的法眼! 兄弟们,准备好了吗?见证奇迹的时刻即将到来!灵魂之水注入,哗啦啦的水流冲刷而下,泥土瞬间瓦解,内摩属于 r x 负七的柠檬黄终于冲破了黑暗的束缚, 这画面简直不要太解压,我能在这看一天。初步冲洗后,小帅打开了车门和引擎盖,内部的情况同样不容乐观。接下来就是真正考验技术的精细化。作业上,雪崩泡沫, 绵密的泡沫如同大雪般覆盖了整个车身,它们将渗透进每一个角落,瓦解一切污渍。紧接着,牙刷上场,这可不是刷牙,这是在进行一场纳米级的清洁手术。 从前进气隔山到引擎盖上的散热口,再到标志性的冠军涂装,每一寸肌肤都要享受到 vip 待遇。看这手速,没有二十年单身经历,绝对刷不出这种效果。 轮毂是车的灵魂,小帅用牙刷仔细清理着每一根浮条,让这双风火轮重现光彩。战神的座舱岂能容忍半点瑕疵?车门内侧座椅缝隙,甚至是后备箱里的防滚架通通洗刷。刷一番操作猛如虎,现在让我们用清水揭晓答案。 泡沫褪去,污垢消失,车身的光泽度瞬间提升了一个档次。但这还没完,想要重回巅峰,必须来一套 spa 套餐。首先登场的是樱花国特调的焕活精华,这种粉色粘液能够深度滋养车漆,修复细微划痕,让漆面恢复出厂时的水润光泽。 小帅用软毛刷将精华均匀涂抹在车身的每一个角落,这手法堪比米其林大厨在制作顶级甜品。全车涂抹完毕,静置片刻,让车漆充分吸收营养。 时间到,再次冲水,可以看到水流在车身上形成了美丽的荷叶效应,说明漆面已经焕然一新。 别急,还没结束终极护理,深海冰晶镀膜安排上蓝色镀膜液配合增亮泡沫,将为这台战神披上一层坚不可摧的水晶圣衣。这不仅能提升亮度,更能有效抵抗未来的酸雨和划痕。奥利给同样的配方,同样的大师级手法,从外到内进行最后的净化与升华。 引擎舱、驾驶室每一处细节都进行终极镀膜,这才是对一台传奇跑车最大的尊重。最后的冲刺,高压水枪上场,让我们用最硬核的方式迎接王者的归来! 看到这水花四溅的场面了吗?每一滴水珠都在为这台 r x 夫妻的重生而欢呼!清洗工作台收尾,必须干净利落,这是一种态度,请欣赏最后的艺术品擦拭环节,用超细纤维毛巾吸干每一滴多余的水分,现在的他光洁如镜,完美的像一件刚刚出厂的艺术品。 接下来就是激动人心的展示时刻,看这经典的跳灯,一睁一闭之间,仿佛穿越了整个热血沸腾的九十年代。打开发动机盖,那颗传奇的转子心脏虽然只是模型,但依旧散发着令人敬畏的气场。 从一坨废铁到弯道之王,小帅用一双手让这台马自达 r x 四七重回巅峰,这就是男人的浪漫,给小帅一个大大的赞!

siri 终于要升级了,如果你用过,一定知道它有多难用。这次的 w wtc 大 会,苹果介入了 gemini, 不是 用 api。 小 道消息说,苹果找谷歌定制了一个一点二 t 参数的模型给 siri 用。一点二 t 是 什么概念? gemini 三点五, flash 才三百 b 参数 四倍,但大不是重点,快才是 siri 日常问题,必须本地秒回,这是底线。所以真正有意思的是战略,谷歌共引擎,苹果共体验。这不是一次 siri 升级,是一份 ai 时代的结盟宣言。如果这一拳打成了,今年六月就是 siri 翻身的起点。