好家伙哈基米,还得是你为了测试 ai pom, 竟然一个晚上烧了两百万!当咱以为听错了是两百个 w token 的 时候,结果发现咱没听错,就是两百万人民币的 token。 我 睡了一晚上以后,这个发现他十三个小时花了这个两百万人民币的这个 token, 对, 花掉过多的 token, 对 对对,哈哈哈哈! 在这里咱先介绍一下什么是 token。 token 被称作词源,是 ai 处理和理解自然语言时对信息处理的最小单位。因为 ai 其实并不能理解咱们连贯的一整句话的意思,不管是文字、图片还是视频,在经过计算机处理的时候,都需要把它碎片化变成一段段代码才能理解,也就是咱们所说的数字化处理。 而这些碎片也被称为最小的单位 token, 并且也因为它是一个最小单位,所以也是在使用 ai 服务时的一个计算费用的单位。简单说, ai 就 像互联网,而 token 就 像流量,你想让互联网正常运行起来,就需要花钱买流量。一般来说,一个汉字大约对应零点六到一点五个 token。 不 过 ai 模型的计费单位是按模型等级计算的, 轻中高级模型一元所购买的 token 并不相同。而帕姆 ai 属于老米自研轻量级大模型,咱这样带入一下,就可以很好的理解咱们的 ai 帕姆一晚上燃烧两百万人民币的 token 大 概的范围是多少了?哈哈哈哈! 当你点击这个对话框,打开帕姆 ai 对 话,就会发现 ai 帕姆不仅可以给你满满的情绪价值和剧情解答,就连你问他飞鹰的光追是什么时,这个号称崩铁百科全书的 ai 帕姆也可以一秒给出答案。 最重要的是前往游戏内体验帕姆问问,与之对话十次即可获得帕姆时装奖励。每周与帕姆进行不同主题的问答玩法,还有五十星球等你拿!
粉丝1972获赞9.8万

你有没有想过,让 cloud 不 仅会写代码,还能直接帮你打开应用,点击按钮、看屏幕、截图、验证? 这还只是冰山一角,翻译、运行、端到端测试、调试、布局、驱动、模拟器、操控没有 api 的 g u i 软件,十几项能力一口气全给你。这就是 cloud code computer use 功能,它让 cloud 真正能够动手用你的电脑。 简单来说, computer use 让 cloud 接管你的屏幕,它能编辑一个 swift 应用,启动它点击每一个控件,然后截图,把结果告诉你,而所有这些都在你写代码的同一个对话框里完成,不用切换工具,不用离开终端。 那它能帮你做什么呢?有四类典型场景,第一,构建和验证原生应用。让 cloud 写一个 macos 菜单栏应用,它会自动翻译、启动,点击控件验证,你完全不用打开。第二,端到端 ui 测试, 指着一个 electron 应用说测试注册流程,它就会打开应用,点击按钮截图,每一步连 play right 都不用配。第三,调试视觉和布局问题 告诉它,弹窗在小窗口被裁掉了,它会调整窗口大小,重现问题,截图改 css, 然后验证修复。第四,驱动只有图形界面的工具, ios 模拟器、硬件控制面板,没有 api 的 专有软件,它都能直接操作 这四个场景,你可以直观的看到他们是怎么运作的。你看,从写代码、翻译、启动应用,到模拟用户点击截图验证每一步,再到调整窗口大小,重现 bug, 改完再验证。 最后是驱动模拟器,像用鼠标键盘一样操作,整个流程都在同一个对话窗口里完成,你看到的每一个步骤都是克拉的,自己动手完成的, 不过 cloud 不 会一上来就用 computer use, 它有一个明确的优先级,有 mcp 服务器优先用 mcp 命令,行任务用 bash, 浏览器任务用 cloud in chrome。 只有以上都不适用它才会动用 computer use。 控制屏幕是最广泛也最慢的手段,留给其他工具够不到的地方, 要起用它很简单,在 cloud code 里输入斜杠 mcp, 找到 computer use 这个内置 mcp 服务器开启就行, 但起用不等于放开所有权限。 cloud 第一次需要控制某个应用时,终端会弹出审批提示,提示里会显示它想控制哪些应用,需要哪些额外权限。你可以选择允许此绘画或者拒绝, 而且不同应用的控制级别也不同。浏览器和交易平台是仅查看终端和 ide, 是 仅点击其他应用才是完全控制。像 finder 终端、 system settings 这种高风险应用,授权时还会出现额外的哨兵警告,让你知道自己在批准什么。 我们具体来看这三个控制级别,仅查看浏览器交易平台。 cloud 只能看到屏幕内容,不能操作仅点击终端和 ide。 cloud 可以 点击按钮执行命令,但不能随意移动鼠标或截屏, 完全控制其他所有应用,相当于你把自己的键盘鼠标交给了 cloud。 对 于终端 find 系统设置这些高风险应用,系统会弹出哨兵警告,明确告诉你它等同于 shell 访问,能读写任何文件,能更改系统设置,让你清楚地知道风险。 来看三个常用的实战工作流,翻译验证,改完代码后,让 cloud 一 次性翻译启动,打开设置窗口验证控件,最后截图给你看附线布局 bug, 让他把窗口调到最窄,截图损坏状态,然后直接读相关的样式表。驱动 ios 模拟器,不用写 x c test, 直接说。打开模拟器,点击引导页,它就像你用鼠标一样操作。一句话总结, computer use 让 cloud 从只会写代码变成了能自己动手 写代码。翻译、运行、验证一条龙搞定。记住两个安全要点,同一时间只能一个绘画控制电脑,并且按 excel 存存,随时可以中断。关注我们,持续获取实用技巧,让你的开发更高效。

把电脑交给 ai 管理,让他帮我完成百分之八十的重复工作,是怎样一种体验?今天测试一下二零二六年的原生工作台。这是 mini max 最新推出的 agent 桌面端,它和普通 ai 助手最大的不同是,它能直接操作你电脑里的文件、 浏览器,甚至帮你部署网站。今天我测试两个 case, 看看他到底能帮我节省多少时间。第一个 case, 我 让他帮我部署一个个人简历网站。以前大家要做这件事,得先找模板、改代码、配置服务器、上传文件要花半天时间吧。现在我直接告诉 agent 分 析博主李哥 builder, 参考我发的这篇图文笔记, 制作一份李哥的 pdf 个人简历,可以看到他阅读了这个网页的内容,然后为我制作了个人简历。 我再说一句,根据这份简历,做一个李哥个人网站,风格要简洁、专业、现代化,突出独立开发和内容创作经验。你看他开始执行,这就部署成功了。全程只需要说两句话,我们可以看看这个网站的效果。 第二个 case, 我 平常写视频脚本,会存在不同的文件夹分类里,我想整理这些脚本,得一个个打开文件,手动复制数据,再分类整理,光是整理就要浪费不少时间。 但现在我可以让 agent 帮我做这件事,只需要选择对应的文件夹目录,然后告诉 agent, 帮我分析这个文件夹里的所有视频脚本,提取标题、标签、发布时间,整理到 excel 表格里, 然后生成一份数据报告,你看它就自动完成了。 minimax agent 搭载的是 m 二点五模型,在 office 高级处理、深度搜索、调研、长文档摘要等生产历场景中都有提升。传统的 ai 助手,你问他问题,他能给你答案,但你还得自己动手去执行。 而 agent 类的 ai 就 像你雇了一个助理,你只需要告诉他目标,他会自己想办法完成更进一步。他通过分析我的视频脚本,实际上变成了我的工作分身。他知道我的写作风格、常用的表达方式和关注的话题之后,他就能写出更符合我个人风格的内容,做到帮我提效的结果。 这就是二零二六年的工作方式,你专注做更有价值的事,而那些重复性的执行工作交给 ai 就 行。 ok 啊。以上就是我测试 mini max agent 的 桌面端的真实体验,如果你也在探索 ai 提交的方法,欢迎在评论区分享你的经验,我们下期见,拜拜!

给大家分享一个国内手机平板电脑可以直接使用满血版谷歌 gemini 三点一 pro 和 nano banana 香蕉画图模型的 ai 镜像网站, 注册登录好以后,点击 gemini, 点击 auto 可以 看到打开了与官方风格高度一致的聊天界面,我们来测试一下,提问,你是什么模型? 很快输出了三点一 pro 没问题的,然后新建一个对话,教下大家怎么使用 nano banana。 方法一,直接选择下方的制作图片即可。 方法二,可以点击这个加号,接着选择制作图片,想使用 nano banana 二的话,对话框右侧选择 pro 模式。 博主公众号分享过 nano banana 画图案例,直接复制提示词就可以使用。往下翻,我们挑选两个演示一下试试。电商产品制作,直接复制提示词粘贴,点击提交,我们稍微等待一会儿。 制作出来以后可以点击放大查看,可以看到生成的图片质量非常的高,并且可以直接下载。 我们再来试试这个画黑板图解,直接复制提示词 粘贴,点击提交,我们稍微等待一会儿。 这个黑板报的风格个人非常喜欢,感觉适合做教程配图。下面还有更多好玩的案例给大家,快速看看。游戏 ui 设计, 旅游攻略,海报,短故事,剧情数据报表, 个人图片,秒变专业写真大片等等。老实说, nano banana 最大的杀伤力在于中文稳定加知识理解加高清细节,这三件套一次性解决,让 ai 从玩具真正变成了生产力工具。

哈喽各位,今天呢给大家推荐一个很有意思的网站,叫做 can i run 点 ai, 它呢可以去自动检测你的电脑配置,告诉你哪些大模型能够去跑,跑的有多快,哪些呢?你的电脑根本就带不动。 所以呢,你可以再也不用去盲目下载几十 g 的 模型啊,来去碰碰运气了。具体呢就是打开网站以后,它会自动识别出,你看,我用的是 apple m 五的这个芯片,我有十六 g 的 显存,大约呢一百五,十三 g 每秒的内存带宽,以及十六 g 的 ram 的 内存,包含十核的处理器, 不需要你手动去填写任何的参数。接下来我们可以看下面啊,你看像拉玛三点一八 b, 像千万三点五九 b 啊,它都显示我能够去流畅运行,但是 mixture small 二十四 b, 像 jamma 三二十七 b 这一大模型呢,就超出了内存的限制,直接给我去飙红了, ok, 那 这个网站到底能够去做什么呢?第一个就是它能够去做你的电脑的自动硬件检测,你通过浏览器的 web gpu api。 网站呢,不需要安装任何插件就能直接读取你的 gpu 型号, 你的显存大小,你的内存带宽,你的软容量和 cpu 的 核心数,识别精度啊,那是相当的高啊, m 系列芯片,英伟达, amd 都能够去准确识别。第二个呢就是它提供了五级的兼容性的评分, 每一个模型呢对应的是零到一百的综合评分,并且轱辘到五个等级有 runs great, runs well, descent, tight, fit, too heavy, 一 眼就能看清哪些是能够去跑的,哪些呢, 你根本就带不动。第三个就是 token 的 速度预估,不只告诉你能不能跑,还会根据内存贷宽去计算实际的推理速度, 通常呢是大约等于二十多个每秒啊,才有流畅的对话体验,这个指标非常有用。第四个就是多维度筛选,它支持按照评级,按照任务类型,按照发布方式和开源协议进行过滤,快速去找到适合自己场景的模型。 第五个呢就是横向对比以及排行榜,里面呢,内置了 type list 和 compare 功能,可以直观的去比较不同的模型在同一硬件上的表现差异。 ok, 然后呢,我再给大家讲一讲,到底他怎么去用啊,其实就三步搞定,而且是完全零门槛。第一步就是打开网站,你直接浏览器去直接访问 can i run 点 ai。 建议呢,你可以使用直接支持 web gpu 的 chrome 啊,像 h 啊,像 ark 浏览器。 第二个呢就是等待自动检测了,页面加载完以后啊,会自动的去提取硬件信息,几秒就完成了。那如果数字不准呢,可以去点击对应的参数手动去修正, 比如说把共享的选存改成实际的可用量。第三个就是按需去筛选以及去选模型,你可以根据评级,根据任务类型去做过滤,锁定目标模型以后,点击模型名即可跳转到 happy face 或者欧拉玛的下载页,直接去上手。另外有个实用技巧啊,你可以把 sort 改成按照 space 排序, 可以呢,快速找到在你的设备上跑的最快的模型,适合追求实时的对话体验的场景。 ok, 那 最后呢,我从我的技术角度来给大家去剖析这个工具到底能够解决哪些核心痛点?首先,本地大模型的硬件门槛呢,是对普通用户不透明的, 一个模型几乎可以跑和流畅可用之间的差距啊,往往就是内存带宽的瓶颈,而不是内存大小。而 canon 点 ai 用内存带宽来预测 tocs 每秒的这个思路,比单纯去看能不能装进内存更加接近实际体验。当然它有局限性, 它预测的是基于量化精度的理论值,实际速度呢,还会去受到量化方法、推理框架和并发赋值的一个影响,误差可能是在百分之二十到百分之四十之间。那对于 apple 的 silcom 的 用户啊, mlx 框架通常是比那么点 c v p 要快百分之三十以上,但是网站似乎目前还没有去区分这一点。总体而言看来,乱点 ai 是 目前同类工具里面体验最好的一个,不需要注册,不需要安装, 即开即用,信息密度高呢,但是不杂乱,对于想要去入门本地部署大模型的人,这是最好的第一步工具。 ok, 那 对于已经在跑大模型的人啊,也可以用来去快速对比新发布的模型,是不是值得你去尝试?

准备用几个小测试来测试一下,我们这个配置不是很高的普通电脑,能跑地的本地模型都能达到达一个什么样的程度啊?我准备用四个任务,第一个是让他去网上给我下载一个图片,然后呢第二个任务是让他做一个 ppt 啊,第三个是在本地给我整理一下我的资料啊,最后是让他啊做一个小游戏。 那么第一个模型呢?我们是首先我的电脑是 macbook air m 五二十四加 e t b 啊,不是特别高的一个 啊,配置,我们现在使用的模型是千问三点五九 b 啊,蒸馏了一点 class 点六,我们用 hermes。 然后啊第一个任务,我让他啊上网上随便找一张周杰伦的图片给我放在桌面上,然后他就开始运行了 啊,我看到他打开了我的浏览器,然后呢也搜索到了这个周杰伦的图片啊,搜索到了很多,我也都能看的见,然后但是他就是下载不下来,我们可以看到 他通过各种各样的方法,比如说通过这个 html 网页版,然后他就换一个方法,下载不了,他就换另外一种方法,然后他尝试了很多很多种方法,他都没有下载下来,包括他下载下来的有一些这个缩略图,也不是图片的格式, 他会尝试各种方法,比如这个视频网站的封面图,专辑封面图,然后这个获取 vg 百科,或者是这个尝试用啊图片托管的程序。 然后呢他最终啊这里太好了,他下载到了一个图片,但是那个图片不是周杰伦的图片,我看到他在我的桌面上创建了,创建了一个文件夹,里面他搞出来了这么多的啊图文件,但只有这一个是一个图片文件,但就像他说的不是周杰伦的 啊,他最终也没有下载成一个周杰伦的图片给我。他这个任务跑了四十五分钟,还然后跑超过三十分钟的,我就认为他是挑战失败,这个我就给他停掉了,我让他进行下一个任务。

每天一个工具小技巧第四期,今天我们带来的是 jimmy jimmy 小 技巧免费 api 调用。上期视频我们讲了 skill finder 实验技能查找器, 这期视频我们带你免费使用 jimmy, 话不多说,我们开始今天的小技巧。首先我们需要先去创建一个免费 api, 登录官方开发者平台,开启模型权限, 找到这个创建 a p i 的 按钮进行点击,然后就会进入这个页面,找到右上角的一个创建按钮,然后点击创建, 就会弹出一个密钥的创建页面,填入一些说明标记信息后就可以点击创建按钮,点击后你的 a p i 密钥就生成完成了,此时我们就拥有了测试权限。之后我们怎么使用这个密钥呢? 我这边演示的是一个我在用的一个使用方案,配合常用的开源调试工具进行连接我使用的这个,然后下滑找到其安装命令,通过简单的环境配置完成对接,我们打开终端输入安装命令并回车等待配置完成后,我们通过这个命令 输入,加上我们开始的创建的 api 秘钥后,回车之后会出现选择界面,这里我们选择 yes, 然后到了输入界面,再输入界面我们选择 api 选项,然后我们的这么奈可以就安装完成了,这里我们只需要输入启动命令,这么奈就可以打开这个聊天界面了, 在这里可以体验多模型带来的智能响应,赶快去试试吧。好了,本期的视频就到这里了,觉得这个小技巧有用的话可以点赞收藏本期视频,想了解更多小技巧的小伙伴可以关注我,每日更新工具类小技巧,我们下期视频再见喽!