粉丝2.7万获赞17.2万

千问三点八二七币昨天正式开源了,心情非常激动,上一代才发布四个月,我感觉像等了一年。模型权重一放出,开源社区瞬间一片沸腾,惊呼、质疑和兴奋一起刷屏。 一个能在本地运行的二七币,真能正面挑战 opus 四点六 max 吗?这期我上了三台真机,从四千块的丐版整机一路测到十几万的工作站显卡,本地部署。二七币的真实表现,硬件阶梯配置、避坑。一次给你讲完, 官方的跑分实在太吓人了。在多项文本和视觉测试里,二七 b 跟 opice 四点六打的有来有回,那这些数字到底是不是为评测专门优化的结果呢?为了验证它是不是真有本事先预告一下,干货有点多,请耐心看到结尾。 根据官方报告,千问三点八延续了三点五的架构,重点升级是真实环境下的智能体强化学习,面对不同的工程状态模型,能自己判断下一步该做什么。今天社区同步放出了带 m t p 头的 g g u f 仓库,需要的小伙伴可以收藏一下。 这代二七 b 仍然是稠密多模态模型,每生成一个 token, 两百七十亿参数全部参与计算,最高上下文两百五十六 k, 和上一照,略有点遗憾。 先来一个灵魂拷问,在自己家里跑二七 b 到底需要什么硬件?走 mac 路线,六十四 gb 统一内存起步,走显卡路线,低于二十四 gb 根本塞不下。 不管哪条路,价格都非常不美丽,但最头疼的还不是贵,而是你咬咬牙配齐了硬件,速度也未必够用。给大家一个直观印象,我在一台九十六 gb 统一内存的 macbook m 二 max 上跑了二七 b。 你 现在看到的输出只有每秒五个 token, 如果这个输出速度你能接受,这套方案也不是不能用,但作为程序员,我至少需要它再快三倍。为什么二七 b 这么难跑?快拿个对手一比就清楚了。 deepsea v 四 flash 两百八十四 b, 参数比二七 b 大 十倍对吧?但它每次运行只激活一百三十亿, 而二七 b 的 全部参数每次都要激活,实际计算量超过对手的两倍。为了保证推理速度,我推荐你上显卡,接下来按显存大小一档一档,看如何部署。二七 b 家用显卡大部分人顶配也只有二十四 gb 显存,比如四零九零或者五零九零的低配版, 这就是跑二七 b 的 最低配置了。模型只能压到 q 四甚至更低, kv 缓存也得跑四位。量化上下文锁死。在六十四 k 这一档显存能跑,但别指望好用,量化压到这个程度,能力已经掉得很快了,而且六十四 k 上下文远远不够。再往上三十二 gb, 比如五零九零的三十二 gb 满血版,或者上两张十六 gb 显卡,这一档量化能上 q 五,上下文放开到两百五十六 k, 但视觉 mtp、 八位 kv 这三个最多只能选两个,到底怎么选?看完本期你就有答案了。 到了四十八 gb 级别,终于不用做选择题了。模型量化能上 q 六甚至 q 八,两百五十六 k 上下文八位 kv, 视觉 mtp 全都能开一个不落。到了这一档,二七 b 才算真正进入可用的工作区间。 最后,九十六 gb 到了这个级别,你有两条完全不同的路,想要质量拉满就上 bf 十六原版全重二五六 k 上下纹,高精度 kv 全部保留,想要吞吐优先,就上 q 八模型量化显存,省出来给 vl l m 能扛住更多并发症。 本期视频的最后,我选了第一条路,用一台顶配的英伟达九十六 gb 工作站验证千问三点八二七 b 的 满血表现。 屏幕上的表格你一定要收藏好。我把两百五十六 k 上下文的所有量化组合全列出来了。模型的五个量化, kv 的 三种精度,再加上视觉和 m t p 的 开销,显存占用都在这张表里。最可惜的是五零九零三十二 g b 真的 就只差一点点显存不能全开。八位 kv、 m t p 和视觉 本地部署二七 b 最大的障碍是速度。在我手搓的这台四千元双 v 一 百整机上,三点八比前一代二七 b 的 速度降了很多,短上下文每秒只能跑到二十五 token, 长上下文直接掉到十二 token, 跑个长任务真能让你体会什么叫望眼欲穿。 为了看清预算能换来多少速度,这期我加了两档设备,三万多的五零九零三十二 gb 和十一万的 rtx。 六千九十六 gb 用来跑决赛和满血测试准备好了吗?现在正式开始! 这次的评测规则和我置顶的二零二六本地大模型横屏一毛一样,想知道怎么打分怎么排名,关注一下,去看那期视频。本期就只放实测结果。 首先在双 v 一 百上对比千问三点六和三点八的速度,两边都使用 q 四 km 量化,并分别测试四档上下文长度。结论,有两个 千问三点八的预填充和推理速度相比三点六分别下降了四成和两成。而且对于这两个模型,随着上下文变长,预填充和推理速度都会明显降速。 为什么三点八的速度比三点六慢?社区很多人也在纠结这个问题,暂时没有答案,知道的小伙伴可以在评论区给大家解答一下。 而长上下文降速的原因是,上下文越长,每生成一个 token, 要读取的数据就越多,双卡之间还要反复同步,如果换成单卡,三十二 gb 速度会好很多。 双一百还有一个很容易踩坑的限制,二百五十六 k 上下文下无法开启 m t p 草稿模型,申请显存时直接会 auto memory 把上下文降到一百八十 k m t p 才能成功起用。但两张卡的显存分布非常不均匀,一张卡剩余三 g b 显存 挂在 mtp 草稿模型的另一张卡已经贴着十六 gb 上线。这说明双十六 gb 显卡并不等效于单卡三十二 gb, 只要承载草稿模型的单卡先满,另一张卡即使还有空间也很难利用,上下文和量化选择会更受限。 所以在这台设备上,我关掉 m t p, 跑完了预赛的所有项目,每个项目跑两遍,取最好的一次结果。揭晓成绩之前,先回答评论区的一个提问,为什么不放测试过程?因为录屏就有一个多小时,只能在各期视频里穿插放一点。 预赛结果出来了,可能让不少人跌破眼镜。千问三点八和三点六二七 b 三个项目每一项成绩都一模一样,总分同样是二十七分,这个成绩肯定不算差,因为最后两项都是满分 和第一名差距还是我们之前反复说过的仇密。模型写中文代码味太浓了。我把三点八的写作打在屏幕上给你看一下,肯定有人会吐槽,怎么还测中文?可兄弟们 大多数人每天并不是在写代码,在我看来,基础测试不测中文能力就很奇怪。当然,我得承认,这是我的个人观点,给有需要的朋友作为参考。 接下来轮到五零九零三十二 gb 登场,这次打开 mtp 跑完全部决赛项目重点验证两件事,家用天花板显卡速度到底能到多少,以及二十七 b 的 q 五量化是不是能打败上一代三点六二七 b 的 q 六量化。 前面说过, mtp 和视觉在三十二 gb 显卡上只能是二选一。我截了两张图,可以看到开启任何一项显存都已经到了极限。但这里有个前提,我坚持用 q 五量化加 q 八的 kv, 因为量化压得越狠,模型做复杂任务的能力就掉得越厉害。而我用二七 b 唯一的理由就是它更擅长干复杂的活,所以我也建议你一定要用自己能够到的最高量化。 屏幕上是我跑 m t p 的 命令,草稿数量我很保守地设成了二,我看到社区有人设成五,说是综合速度最快,使用拉玛 c p p 的 小伙伴们可以参考一下。 在五零九零上,开 m t p 和不开 m t p 比,输入速度平均降了百分之八,输出速度在短上下文里涨了百分之二十,可一旦上下文超过一百 k, m t p 反而会降速,所以呢, m t p 对 五零九零作用不大,弄不好输入输出还会一起变慢。 决赛正式开始,先说明一下速度,这二十分这次不计入总分,因为之前的模型都没在五零九零上跑过,没有可比的数据 为你揭晓决赛结果。千问三点八二七 b 以碾压之势登顶决赛榜第一。前三项满分不意外,但最后一项长城任务拿下四十二分真的很不容易。要知道他用的是比其他模型低一个级别的量化,总成绩却跟第二名拉开整整十三分, 这直接逼得我下期视频必须增加决赛项目。他以一己之力把本地部署的测试标准抬高到了在线大模型那一档。 这个成绩什么概念?一句话,他从预赛的小孩桌直接坐上了大人桌。就在前几天,我用同一套题给三个前沿大模型做了一模一样的测试,结果千万二七 b 的 q 五量化就已经只跟第一名差了六分。 当然,这只代表我这个场景和这一次测试的结果。所以我马上用官方满血版在工作站九十六 gb 显卡上再验证一遍。 这张 rtx pro 六千显卡有九十六 gb 显存能装下千问官方的 bf 一 六满血权重,再配上全精度的 kv 缓存,可以说是火力全开了。推理框架。这次我用了 vl l m 模型,仓库和启动命令都放在屏幕上了,这次同样打开了原声 mtp 草稿,长度同样设为二。 启动 v l l m 后,显存基本会被吃满,这是这个框架的习惯,我测了一下速度,发现这么贵的卡,预填充虽然很快,但推理速度也没比我的盖板设备快多少,心里瞬间平衡了不少。我不太熟悉 v l l m, 猜测原因是这个框架更在意的是吞吐量,而不是单并发跑得最快。 满学版跑出来的最终成绩是七十六分,全站应用拿到了四十六分,这个分数已经超过 gpt 五点五,只比 gpt 五点六少两分。这一代二十七币,在这种复杂的编程任务上,确确实实是有真本事的。大家点个赞,鼓励一下千万同学。 这也验证了我自己的一个猜想,量化版的能力是被削弱的,判断一个模型到底好不好,有条件的时候还得用官方原版验证一下。 屏幕上就是两个版本的成品,对比时间有限,就不一一讲解了。量化版的主要问题是图片全屏显示的代码有 bug, 还有几处排版上的瑕疵。满血版没有任何 bug, 各种细节也做得很仔细。两个版本的前端风格很接近,比 deepsea 要现代很多,看得出来千万在模型训练的时候很看重前端的表现。 测完了我就一个感觉,想在家里跑满血千万三点八二十七币,硬件的钱真省不下来,十几万的卡跑这种筹密模型也没快到哪去,所以我让 ai 把市面上的显卡翻了一圈,看看哪些我咬咬牙,还能有点念想。 屏幕上是我给自己列的一张单子,不构成任何购买建议,拿出来分享,只是不想浪费,说不定也有人正好用得上。 虽然我有点嫌自己这台双 v 一 百跑的慢,但评论区很多人要他的搭建视频,说下进度,我已经全部拍摄完成了,正在剪辑中,下周就会放出来,感兴趣的同学可以关注一下哦。 这次测试用到的另外两张高端卡都是我从云端临时租的,一共花了二百多搞本地部署,真不能租机器太贵了。心在滴血,给个赞,安慰安慰我吧!如果你也在搭自己的本地模型,关注我,我们一起用好这样强大的前沿模型,后面还有更多实战经验分享给你。


就在几个小时前,阿里正式发布千万三点八 max, 总参数达到二点四万亿,但每次推理只激活九百五十亿参数,支持文本、图像、视频和百万 tokyo 上下文。 在而瑞恩的榜单上,他已经成为排名最高的中国文本模型,视觉理解更冲到全球第二,仅次于克洛的菲薄五。单看跑分,他已经妥妥杀入全球第一梯队。 turmo 扳指二点一,拿到八十六点六分。上一代千万三点七 max 只有七十四点五分, paperbench 从六十四点八分跃升到九十三分, os world vr 也从七十三点三提高到八十六点一。 而千万三点八 max 真正可怕的地方根本不是跑分。阿里展示了三个极端案例,完全体现了模型的连续自主工作能力。 第一个,他从一个空文件夹出发,连续自主工作大约十六天,完成两百六十五次代码提交一百二十七个 p r 和一百五十一个 e 序。 注意,这不是帮程序员补几行代码,而是模型自己接收需求,搭建项目运行测试发现错误重新修复,再继续推进,直到把一个真正能用的软件项目交出来。 第二个,他独立工作了大约一百二十五个小时,写下七千六百行代码,执行一千一百多步操作,完成三十三轮 gpu 训练,最终复现了一篇科研论文的六项主要结论。 第三个案例更夸张,他在没有参考设计、没有人类干预的情况下,自主优化一颗 g c、 d r i c 硬件加速器模型,先把电路跑通,再根据仿真综合和布局布线结果不断修改设计。经过大约五百轮交互,把电路规模从八千两百九十八个门压缩到六百七十八个门, 最终芯片面积缩小百分之八十一,布线长度从三万三千三百六十九微米下降到四千一百八十七微米,还完成了五百兆赫兹频率下的持续闭合。 一个模型能连续干活十六天还不跑偏,这件事的分量就已经比任何一张榜单都重了。这标志着千万三点八 max 模型自己进入工具链观察执行结果发现问题,修改方案再重新验证,他不只是生成一个答案,而是在壁环里把事情整个做完。 这才是 ai 从聊天工具走向生产力基础设施的真正分水岭。第二个重点是价格。按照目前譬如的国内 api 价格,每百万 token 输入十二元,输出三十六元。 cloudos 五目前的官方价格是每百万 token 输入五美元,输出二十五美元。更强的 facebook 更是达到输入十美元,输出五十美元。 这么换算下来,综合成本仅仅是 oppo s 五的二点七折,不到菲薄五的一点三折。所以阿里这次下手最重的不是榜单分数,而是打穿了币源公司的模型利润表。当模型能力逐渐接近,成本却相差数倍,你是企业,你会怎么选? 要知道,阿里背后还有阿里云、钉钉千万办公电商体系以及数量庞大的企业客户。模型便宜一点未必意味着阿里少赚钱。只要千万能够把更多企业拉进阿里云,把更多办公、开发、客服和电商工作流锁进千万生态模型本身就可以成为新的云计算入口。 阿里卖的表面上是 token, 而真正想抢的却是企业未来十年的智能基础设施。为什么千万偏偏在这个时间点突然加速? 因为中国大模型的竞争已经从追赶美国变成了内部互相抬高上限。 deepseek 把推理成本打到了极致, kimi、 k 三把开源模型推到二点八万亿,参数直逼闭源,旗舰智谱 mini max 也在不断争夺开发者和企业客户。 而阿里真正的优势不止在于模型本身,而是他自己就是个互联网巨头,他既能训练模型,也能提供云端算力,还能把模型迅速嵌入办公、开发、电商、客服和企业软件等成熟场景。 至此,模型、算力应用与客户真正连成了一个完整闭环。在字节、阿里、腾讯这三家具备完整生态的大厂中,阿里已经率先亮剑,接下来就看豆包和元宝如何接招了。 至于和 kimi k 三的对比,我相信大家也是比较好奇。综合目前信息来看, kimi、 k 三在前端编程长城 coding agent 和公开第三方成绩上更扎实, 千万三点八 max 则在多模态办公任务、视觉理解以及工具稳定性上可能更占优势。 kimi 目前已经有较完整的公开规格与评测,而千万三点八 max 刚正式发布几小时,仍需要 artificial analysis 等第三方跑完后才能定胜负。 但有一点已经可以确定,长期被少数币源巨头垄断的全球顶级模型能力,已经被中国开源模型打破了。这里是起点世界,聚焦最新 ai 资讯,我们下期视频不见不散!

八月七日,千万功能上新,上线思考研究、定时任务、办公助理等多项新功能,同时支持阿里最新旗舰模型 queen 三点八 max, 所有用户均可免费使用。思考研究在原深度思考基础上升级,面向复杂专业问题 联网检索,逐条标来源输出带出处的研究分析。定时任务可以预设执行时间,让千问按时自动生成简报、汇总邮件追踪动态,常做的事交给他自动跑。 千万还能自主拆解目标,调用工具完成复杂任务,例如操作电脑和浏览器好玩,多个步骤交付文档、表格、应用网站等成品。还支持手机发起,电脑接着办。

不少开发者啊,一直有一个通点,想用上能力强悍的稠密大模型做本地开发,可高性能模型大多闭源,私有化部署的门槛和成本居高不下。好在千万三点八二十七币 正式开源,这款稠密参数模型凭借亮眼实测表现,在不少开发者眼里足以对标高端闭源模型。要知道啊,以往高性能大模型大多以闭源形式对外提供服务, 开发者、小型团队很难本地部署自主二次开发。想要私有化部署做行业定制,往往要承受很 高的调用成本,门槛居高不下。而千万三点八二十七币作为筹密大模型,直接选择开源开放,打破了高性能模型的使用壁垒。从大量的实测结果能看到,千万三点八二十七币综合能力突出,在 在多项生物里展现出步书满写大模型的实力。重笔框架带来稳定的推理表现,不管是代码编辑、逻辑推理,还是文本创作方案梳理,都能交出错的效果。开发者拿到传中之后,可以自主本地化部署,不用依赖外部接口, 数据能够保留在本地适配私有化项目、行业定制开发等场景。对于中小技术团队、独立开发者来说,这无疑是一个利好。 不用投入高昂算力成本去训练基础大模型,直接基于开源的千问三点八二十七币做微调二次开发,就能快速搭建贴合自身业务的专属 ai 应用,有效压缩自研周期, 降低落地成本。往更深一层说呀,国产大模型持续开源,不只是放出一套模型权重,更是在完善本土 ai 生态,把高性能稠密模型开放给行业,让更多开放者能够上手实践、 创新迭代,持续降低高性能 ai 的 落地门槛,助力国产大模型生态持续百花齐放。

苹果 mac 接入阿里签问,结果文档上线不到二十四小时就被撤了。八月八日官网更新,第二天链接就失效了。苹果全球几亿用户,产品手册从来只有上线没有撤回, 这次破例了。所以问题不是合作本身,而是苹果为什么既要做,又不敢让人看见。这笔账得用机会成本来算。苹果得到了中国市场准入,但放弃的是对 ai 体验的完全控制权, 做是必须做,藏是因为代价太大。先说必须做的部分,苹果为什么非得找阿里?你看一个数字,今年第一季度, mac 在 中国大陆出货量约八十万台,份额只有百分之九。百分之九,什么概念?同一份数据,联想百分之三十一,华为百分之十六, 而且 mac 出货量同比下降了百分之九。苹果在全球是高端标杆,但在中国市场正在被国产厂商蚕食。这跟 ai 有 什么关系?关系太大了。联想已经把天玺个人智能体做成 aipc 战略核心,华为把 ai 融入鸿蒙生态, 国产厂商再把 ai 变成操作系统的底层能力。苹果的 siri 呢?在中国,它基本还是个语音开关, 所以苹果级的不是没 ai, 是 没中国版 ai。 对, 海外版 apple 智能早就接入了 chad gpt, siri 能做复杂推理, 但在中国, chad gpt 没法合规使用。苹果在中国空有设备, ai 能力是断层的,那就自己做一个中文 ai 不 就行了?这才是关键。苹果不是不能做,是来不及做,也做不起。你看时间线,二零二六年七月十五日,网信办公布生成式 ai 备案, 苹果智能才刚过审,也就说苹果在中国 ai 赛道上已经落后了,落后至少一年半。而且自研中文大模型,从训练到备案再到系统级集成,至少还要两年。 两年后,联想和华为的 aipc 可能已经把市场吃透了,所以找阿里是唯一的选择,几乎是最快的选择。 阿里谦问已经完成全品类合规备案,阿里云能扛住海量并发, 苹果不需要重新造轮子,直接对接就能用。但我还是没懂,合作是好事,为什么文档要撤回?你想想苹果过去几十年做产品的逻辑是什么?软硬件全封闭,核心体验自己说了算。对,芯片自己设计,操作系统自己开发, siri 也是自家产品。苹果最核心的信仰就是控制, 现在呢?把 siri 的 推理能力外包给第三方,这对苹果来说相当于什么?我给你打个比方,米其林主厨进了中国,发现不能用自家菜谱, 只好把厨房租给本地厨师,菜能上桌了,食客也满意,但你知道最关键的是什么吗?什么?食客吃完只会说这家餐厅真好吃,他们不会问后厨是谁在炒菜, 苹果就是那个主厨,千问是本地厨师, siri 是 端菜的服务员,口碑归苹果,但锅铲在阿里手里。所以苹果撤回文档,是不想让用户注意到后厨换人了,这是在控制交出钥匙这个动作的可见度。 你看苹果的措辞, siri 可利用千问提供更深入的答案。注意,可利用不是由千问驱动,不是千问提供支持,这词很讲究, 但用户真会在意吗?短期不会,千问藏得越深,用户越无感,但长期风险就在这里。如果未来千问出错出争议, 用户骂的是苹果还是阿里,那肯定是骂苹果。我用的苹果设备, ai 不好用,当然是苹果的锅。这就是机会成本的核心。苹果得到了合规和速度,但把品牌风险转嫁不出去。 阿里只提供模型服务,不用承担终端用户的不满。再算一笔账,阿里从这次合作里拿到了什么?两个字入口,而且是系统级入口。 你想想,千问不需要用户下载任何 app, 不 需要用户主动打开,它就藏在 siri 后面,藏在写作工具后面,这对阿里来说值多少钱?没法用钱算 过去,国产大模型靠独立 app 获客,获客成本高得离谱。现在千问直接嵌入了数千万台 mac, 未来数亿台 iphone, 这是任何广告费都买不来的位置。但我看报导说阿里不能用用户数据训练模型,对 苹果明确规定了这一条,但这不影响千问的战略价值,它要的不是数据,是被调用,被调用就是话语权,就是行业背书。 说到背书,苹果还选了百度,对吧?对双轨策略,千问承担约百分之六十五通用多模态任务。百度文新负责 ai 搜索和部分 siri 中文优化。苹果很聪明,不把鸡蛋放一个篮子里,这算是一种对冲,典型的分散风险。 但这也说明,苹果对阿里并不是完全放心,用一个合作伙伴是依赖,用两个是制衡。那回到文档撤回这件事,你觉得是合作要黄了吗?不会。你看今年三月三十一日,苹果也闹过一次类似的事, 国行 iphone 设置页面突然出现 apple 智能与 siri, 几小时后就撤回了,已下载的功能也被收回,所以这不是第一次对。业内普遍认为这是上线前的技术或流程准备,不是合作破裂。 苹果的 ai 入华,就像在走钢丝,每一步都要精准计算。你说到走钢丝,我想问一个假设,如果苹果不选阿里,自己花两年自研中文 ai 通关,会是什么结果?这是反方假设,我认真算过, 两年后 mac 份额可能从百分之九跌到百分之六, iphone 高端市场份额被华为进一步蚕食。更重要的是, ai 体验的代差,会让苹果在中国用户心里从高端变成落后。所以苹果是用控制权换时间,对, 用 ai 体验的控制权换两年市场窗口。这是机会成本的典型应用,不是看得到了什么,是看放弃了什么。那这件事对行业有什么影响啊?它建立了一个范式,海外科技公司入华, ai 合规路径,国内监管备案加本土大模型合作加数据不出境。 这套公式以后微软、谷歌、三星可能都要招潮。对阿里来说,这次合作也有代价吗?有三十六客有篇分析很犀利,标题叫苹果给阿里提了一个醒,千问出尽了力气,但苹果拿走了所有用户信任和品牌溢价,怎么理解?你设想一个场景, 一个 mac 用户对着 siri 说了一句请求,千问在后台处理完,把答案给 siri, siri 输出给用户,用户脑子里形成的印象是什么? siri 越来越聪明了,对用户不关心后台是千问还是别的什么模型, 千问做的越完美,藏的越深,用户就越不需要直接接触千问,这就是入口霸权的威力。所以阿里拿到了一个巨大的机会,但也有一个巨大的引诱模型可以被调用,但入口必须自己掌握。阿里现在站在一个分叉口,是安心做苹果背后的水电煤,还是打造自己的 ai 入口? 两条路都走得通,但商业模式完全不通。如果安心做水电煤呢?那阿里云卖蒜粒,千问卖 api, 各行各业,包括苹果和手机厂商都来调用。 这是一门确定性极高的大生意,完全是阿里云的基因。如果做自己的入口呢?那就得靠千问办公这类产品,在钉钉、淘宝这些阿里自己的阵地上,让用户每天主动打开千问这条路,性感但极难走。阿里没有微信那样的社交入口,照会开头, 苹果把千万接入 mac, 又撤回文档,这笔账到底怎么算?苹果拿到的是合规入华, ai 功能即刻落地,保住了市场窗口。 苹果放弃的是对 ai 体验的完全控制,品牌一致性,以及在 ai 时代什么都自己做的人设。也就是那个米其林主厨的比喻,厨房租出去了,菜能上桌,食客也满意。 但有一天时刻,要是吃出了问题,骂的还是主出,这就是机会成本最残酷的地方。你放弃了什么,往往要等到出问题那天才真正算清楚。最后一个问题,也是给观众的问题, 如果你是库克,在中国市场你会怎么选? a 是 自研中文 ai, 再等两年,但可能丢掉市场份额。 b 是 接入签问,马上能用,但把核心体验交给合作伙伴,你怎么选?评论区聊聊。我的判断是,苹果没得选, 不是千万有多强,是市场不等你机会。成本的本质就是看清什么代价你付得起,什么代价你付不起。

一张 rtx 五十九十,真能在本地跑出接近科沃尔的 opus 四点六的效果吗?还真有可能,至少在部分任务上是这样。最近阿里开源了 qn 三点八二十七 b 参数量只有二百七十亿,却能处理文字、图片和视频,也支持深度思考。他原生支持二十六万头,肯上下文,最高可以扩展到一百万,协议用的是 ipatch 二点零,个人可以折腾,企业也能拿去部署和二次开发。大家更关心的还是他到底有多强。 千问官方给出的数据里, q 问三点八二十七币,在 s w 编程测试中拿到了六十一点七分。 cloud 的 oppo 四点六此前公布的成绩是五十三点四分,单看数字确实很猛,但先别急着说千万超过了 cloud 两边的测试环境和数据版本并不完全相同,六十一点七和五十三点四不能直接划等号, 在复杂的知识推理和长城任务上, cloud 依然更强。不过到了编程、办公、自动化、电脑操作和多模态任务里, 这个二百七十亿参数的模型已经开始接近国际旗舰模型了。更关键的是,它能在消费级显卡上运行,使用斯比特量化后,一张拥有三十二 gb 显存的 rtx 五十九十就具备本地运行它的条件, 当然,原始高精度版本还是装不下,别理解成插上显卡就能满血跑。所以这并不是把 cloud opus 四点六塞进了一张五十九十, 更准确的说是过去只能通过云端 a p i 使用的一部分旗舰能力,现在已经可以扳回自己的电脑。相比排行榜上多出来的那几分,我觉得这个变化更值得关注。我是野菜人,下期视频见,拜了个拜。

六零后老哥,苹果 ai 终于来中国了, siri 接上阿里,千问大模型免费用,你的数据还不出镜?等了两年的国行 ai 这回真落地了。你买苹果手机是不是冲着系统好用?抱歉, 我无法帮你找到结果,看人家国产手机 ai 助手多能干,心里是不是有点酸?八月八号,苹果悄悄更新了官方手册,正式确认国行版接入千问。目前 mac 先上线,系统设置里打开 apple 智能登录千问账号,就能用两大入口,写作工具和 siri。 你 在备忘录写东西,千问帮你创作改写。跟 siri 说话,它能调用千问写诗、总结文章,比以前聪明太多了。 最关键的是数据存国内服务器,千万不能拿你的数据去训练你,随时能关掉隐私规则明明白白国产大模型进苹果系统头一回, 现在 mac 先吃到九月 iphone iphone 丧,跟着上,你的 siri 马上大升级,国行设备加中国区账号就行,免费的橱窗有 ai 入门好书,顺手看看!六零后老哥都能用,你还怕什么? 苹果都接国产大模型了,说明咱国产 ai 真行!关注顾五哥,每天一个 ai 技巧,咱们一起慢慢变强!

阿力刚刚发布了困 u i agent, 重点不是让 ai 看懂屏幕,而是让他真的会操作手机、电脑和网页,完成长城任务。 他把移动端、电脑端、浏览器和 deep search 放进同一个 g u i 智能体底座,找咖啡、查高铁、安排会议,可以跨多个应用连续完成。 官方给出的成绩里,真机机准 mobile word 杠 real 达到百分之九十二点二, o s word 杠 verified 是 百分之七十九点五, web arena 是 百分之七十三点六。更关键的是,他用一百多台真机和一百五十多个应用做训练和评测。 这次阿里特别强调安全边界、违法和高风险请求直接拒绝,遇到支付、删除数据和隐私授权,会在关键步骤停下来。等你确认。 在电脑上,它还能把 g u i 和命令行混合起来,并一次批量执行多个动作,比如跨网站调研、比价、生成 excel、 ppt 和 word, 再回到界面做视觉检查, 它支持超过一百步的长轨迹训练。官方称约一万个病发环境同时运行,再配合跨端 harness, 手机里的收据可以交给电脑整理重命名并生成表格。 所以这次真正值得关注的不只是几个榜单分数,而是模型开始从聊天框走进真实设备。困 u i agent 已公开技术报告和项目主页,后续能不能稳定落地,值得继续观察。

一张游戏显卡跑出 opus 级的 agent, 这是这周最炸的国产开源,但是多项榜单反超 cloud。 这句话我把五项榜单全查了一遍。 先说结论,赢两项输三项,而且赢得其中一项是阿里自己出的榜,标题没撒谎,但它只告诉了你赢的那部分。 逐项看, sw bench pro, 六十一点七对五十三点四,赢,而且赢得漂亮。 quan sw bench, 七十九对六十三点八也赢,但这是自家榜,参考价值要打折。 terminal bench, 七十三对七十八点二输 g p q a diamond, 八十九点二对九十一点三输最难的 h l e, 三十点八对四十,差了九分多,输得很明显。 看到这你可能觉得,那算了,别急,真正的重点不是他赢了几项,而是他用二百七十八亿参数,一张二十四 g 显存的显卡,做到了和碧源旗舰同一个梯队,这个性价比才是这次开源真正的意义。 具体要什么配置?二十四 g 显存起步, rtx, 三千零九十或者四千零九十用激进量化,每秒十到四十个 token, 四千零九十加上多 token, 预测能到六十到一百。 max studio m 四 max, 三十到八十,真的是家用机能跑的量级。 但有个坑必须提前说,它有个推理强度开关,三档低中超高, 如果开在超高,简单任务能跑二十到九十分钟。有人生成一张基础 svg 图,等了一个多小时,而且模型不会自己收敛。这不是 bug, 是 你没调对档位, 所以拿到手第一件事,把推理强度调到中或者低,日常任务用低档确认,复杂的再往上抬。另外,它是筹密模型,不是谋同参数下吞吐会慢一些,别拿它当高并发长警用, 其他关键信息一次给你。 apache 二点零协议商用,没限制原声,支持文字图片视频 上下文,原生二十六万二千可以外推到一百万,相比上一代 swbench pro 从五十三点五涨到六十一点七,提升是实打实的 一句话总结,赢两输三是事实,但二十四 g 显存几近旗舰梯队才是真形。文装之前记得先把推理档位调下来。关注我继续拆 ai 实战。

养宠物最让人揪心的不是小家伙有多调皮捣蛋,而是他们的身体突然出现异常,自己却无法判断问题的轻重。就像猫咪掉毛,皮肤泛红,很容易让人慌乱,盲目上网搜索,很容易被各种夸张的说法误导。 我现在都会用千问 app 的 拍照问答功能非常给力,免费使用,拍下宠物皮肤的异常部位,描述一下具体的情况,让他分析猫咪的皮肤问题。他会自动识别图片信息,梳理出几种可能性, 还会列出需要留意观察的细节,同时提醒哪些状况要及时就医。他并不会擅自给出确诊的结论,只是梳理有效的信息,避免主人慌乱无措。 日常养猫养狗,碰到看不懂的宠物用品、食物成分或者是毛发、皮肤异常,都可以拍照询问,用来做初步参考和知识科普,实用性很高。

二十七 b 的 千万三杀疯了!昨天千万三点八二十七 b 版本的测评结果出来了,综合得分五十二分, agent 能力五十一分。这个 agent 能力直接秒了 deepsix v 四 pro、 gpt、 五点六 turbo 等一众模型,仅次于 kimi k 三。 要知道, kimi k 三是个二点八 t 的 模型,二十七 b 的 千万只用了千分之一的参数,就做到了差不多的性能。很多人没有意识到这个事情的重要性,但在我看来,这又是一个 d p c 个 r e 时刻。二十七 b 的 模型斯比特量化以后,只有十七个 g 可以 在一张五零九零显卡上跑起来, 这意味着企业只要花五万块钱配个工作站,就可以在一张五零九零显卡上跑起来。这意味着企业只要花五万块钱配个工作站,而且不会再有什么数据、安全、隐私之类的问题。 现在 skyline 还没有完全失效,有的公司靠着算力的优势,还在靠堆参数量取胜。 vivo 的 模型参数量据说在十七的级别,但是现在七百倍的 glm 已经紧紧贴上来了,甚至二十七倍的千万都离得这么近了, 我不知道达里奥、山姆、奥特曼他们会不会脊背发凉。在我看来,如果大模型的技术底座没有大的眼镜,模型的能力增长一定会有尽头。哪一天,当大家发现继续提升参数量,模型的性能提升很小了,就会转头一起去把模型往小了做。 这个事情其实十年前在图像识别的领域就已经走过一轮了。当初在人脸识别模型的技术红利期,大家也是疯狂把参数做大,很快从几兆做到了几十兆,最后做到几百兆,但几百兆以后呢? 再提升模型尺寸,性能提升就非常微弱了。当时的商汤、旷世等几家头部模型公司,不断的找更极端的一些场景,要证明自己的模型比其他家好, 甚至到了最后,需要用一些作图技巧来凸显那点微弱的技术优势了。但到最后,大家发现,客户根本不 care 那 一点点性能差别,反而是关心模型能不能本地部署,能不能直接在手机上跑,跑起来了功耗会不会大。 于是人脸识别的模型又开始了参数缩减之旅。到现在,人脸识别模型又回到了几兆的参数量水平, 而旷世、商汤这些曾经风光无限的 ai 四小龙,估值也都基本腰斩了。大家可以想象一下,如果再过半年, open ai、 cloud 这些模型又提升了十分,但是二十七 b 甚至更小的开源模型做到了当前 vivo 五这个性能水平, 那会是怎样的影响?市场会如何变化?模型公司的估值会如何? ai 顺利的大基建又会如何?大家不妨多想一想。

近日,阿里达摩院选铁 c 九五零成功原生运行通一千万三点八二七 b, 这是 risk b 芯片首次在不依赖 gpu、 无需模拟层的情况下,直接运行二七零亿参数级 ai 模型。选铁 c 九五零采用五纳米工艺,拥有六十四个计算核心,并集成矩阵加速和向量加速引擎, 专门针对 ai 推理进行优化。师测运行通一千万三点八二七 b 时,解码速度达到三十 token 每秒,首 token 延迟在一点九秒以内。更重要的是, risk b 本身具有开源优势,阿里同时掌握芯片、模型和云计算能力,可以根据模型需求优化芯片,也能根据芯片能力调整模型。芯片加模型,这套字眼组合拳越打越顺。

一张四零六零真的能跑?千问三点八?在上周,千问官方账号宣布将会在八月的第二周内开放千问三点八 max 的 权重,以及二七币 max 跑分最高票折扣。四点八现在已进入发布窗口期,但真正的主角其实 是千问三点八二七币,因为跑分几率更大的七 gb 模型,又是更容易本地部署,得到不少人关注,甚至网传一张四零六零就能跑。确实能跑,但有前提必须是四 gb 压缩到十七 gb 内存,至少三十二 gb, 因为八 gb 显存根本装 剩余十几 g 由 cpu 的 内存卡速度会很慢,但用一张主流显卡加足内存就能把二十七 d 模型拷起来,不用均匀 gpu 也能摸到准旗舰级的推理能力。

一千四百六十四分,全球第五,中国第一。当这个数字出现在兰博瑞纳的榜单上时呢,很多人的第一反应是,这是正式版还是预览版?答案是预览版 q n 三点五 max preview, 一个带着 pub 后缀的模型,把中国大模型的第一送进了全球前五的俱乐部。如果预览版已经到这个位置了,那正式版会站在哪里呢?为什么这个成绩啊,值得被重新审视, 因为 lemon rena 是 当前国际最硬核的第三方的测评平台,它的排名啊,不是厂商自己报的,是真实用户在双盲对抗中打出来的。一千四百六十四分,意味着 q 三点五 max preview 在 vodao style contract 的 绝对胜率比较中排全球第六,数字能力全球第五,专家级文本处理能力全球第十。这不是某个单项的偶然突破,是综合能力挤进了第一梯队。而做到这一切的,还只是一个预览版, 阿里是怎么做到的呢?答案啊,藏在了千问三点五系列的底层逻辑。除夕发布的 q 问三点五 plus 总参数啊,三千九百七十亿,激活呢,仅一百七十亿,用 m o e 架构证明了以小胜大的可能性。这次预览版旗舰 max 延续了同样的路线, 不追求参数的虚胖,追求效率上的极致。从旗舰 max 到 plus 再到 flash, 阿里啊构建了一条完整的产品梯队,二百六十二 k 到一兆的上下文本度,覆盖不同场景,效果、速度、成本三档分明。用户啊,按需选择,不需要为一个功能买下整个模型。 更值得玩味的是预览版这个身份。在 ai 行业,很多公司把预览版当成了先发个能跑的版本占坑, 正式版呢,在慢慢打磨,而千万 g 萨直接把预览版打到了全球第五的位置,这意味着什么呢?意味着阿里的技术储备比外界想象的要深得多。预览版啊,不是试水,而是亮剑。 这件事的意义啊,远不止一个排名。过去两年,全球大模型的前五被美国公司牢牢占据, open ai、 nsa peak、 google x ai 轮流做装。现在啊,千万挤进去了,而且是带着预览版三个字挤进去的,后续正式版能往上走多少?这是留给行业的悬念,也是留给竞争对手的压力。对普通用户来说,你 用千万 app 会越来越聪明,而成本呢,越来越低。对开发者来说,阿里云上多了一个全球顶级的模型选项,而且是中国公司自己的, 要用方便,合规可控。对行业来说,这意味着大模型的竞争格局正在从美国独大走向中美并跑。千万的一千四百六十四分不是终点,是中国 ai 厂商在国际牌桌上亮出的第一张王牌。当预览版已经占到这个位置的时候,正式版的路只会走的更远。

大家好,我是手机里装了四十个 app, 但每天只用五个的 seven。 今天聊一件刚发生的事,八月十号,阿里千问开放平台正式上线。什么意思呢?你在千问的对话框里打字,就能寄快递、租房子、租车,全程不用打开别的 app, 这听着像个产品更新,对吧?但放到整个行业里看,这是二零二六年最大的一场战争的新信号。 这场战争叫 ai 入口之争。美团、京东、字节、阿里 openai 全部下场了。他们抢的不是卖货,是一个更值钱的东西。谁站在你和所有服务之间? 先说千问这次干了什么?开放平台首批接近来十多个合作方,顺丰、自如、哈罗、租车、闪送非常准,天鹅到家,覆盖快递、租房、出行、家政,十几个日常生活场景。 操作方式很简单,你在对话框里艾特顺丰,告诉他从哪寄到哪,他直接帮你下单。自如说,你要在望京找个宜居室,他给你推房源,帮你约看房, 整个过程不需要切换 app 这个功能,跑在手机、电脑、 ai、 眼镜三类终端上,第三方接入用的是标准化协议,接入门槛不高。千万 app 现在什么量级?公测二十三天月活就破了三千万,目前稳居国民级 ai 应用的第一梯队。 阿里去年专门成立了千问 to c 事业群,把千问 app、 夸客、 ai、 硬件全捏在一起。方向很明确,千问不是聊天工具,是办事入口。 但千问不是唯一想干这件事的。你看看过去半年整个行业在干什么? 美团推了问小团,用自研模型对接外卖,到店、酒店, ai 帮你比价,自动领券。京东上了 ai 购物,你说需求,他直接弹商品卡片,一键付款字节,把豆包大模型接近了抖音商城,对话式匹配商品。 更猛的是豆包手机助手,他拿到了系统级权限,可以跨 app 替你操作。你跟他说帮我定明天去上海的高铁,他自己打开幺二三零六选车次,填信息下单。 结果呢?大厂 app 们集体把豆包拉黑了。为什么?因为豆包是外来户,他要穿过每一家的围墙,在别人的地盘上替用户做事。这动了所有人的命根子。 阿里的打法正好反过来,他不穿墙,他把墙拆了,请别人进来。你想在千问里用顺丰行,顺丰自己接进来。阿里提供平台和流量,合作方提供服务。 同一个梦,两条路线,一个是外面往里打,一个是里面往外请。胜负手在哪?谁的生态里能办成的事更多,谁就更有可能成为那个默认入口。 那这场仗到底在抢什么?往大了说,互联网历史上每一次入口迁移,都重新分配了一次财富。 门户时代,新浪搜狐靠首页广告位赚钱。搜索时代,百度靠竞价排名赚钱,超级 app 时代,微信靠朋友圈广告和小程序抽成赚钱。 现在, ai agent 来了,当 ai 替你比价、选品、下单,商家过去花钱买的搜索排名、直播、坑位、货架、广告位,可能全部失效, 因为你不逛了。你不打开淘宝一页页翻了,你只跟 ai 说一句,帮我买个性价比高的充电宝, ai 给你推三个,你选一个付钱结束。那问题来了, ai 推荐的那三个是怎么选出来的?是真的性价比最高,还是给了平台最多佣金的? 这其实就是新一代的竞价排名。据报道, openai 已经在测试让拆的 gpt 收交易佣金了,还在美国市场测试广告,据说 cpm 六十美元,差不多是 mate 广告价格的三倍。 你看, ai 巨头们已经想好了怎么赚钱,在你和所有服务之间收过路费。 所以我想从消费者的角度多说两句, ai 替你办事越方便,你看见的世界越窄。 过去你逛淘宝,至少还能自己翻翻比比算法推荐,虽然有信息减房的问题,但你好歹还能点换一批。 现在 ai agent 直接帮你决策了,你说帮我租个望京的一居室,他给你推三套,你大概率就在这三套里选了, 剩下几百套,你根本不知道他们存在。这个效率提升是真的,但代价也是真的。你把选择权让渡给了 ai, 而 ai 的 选择标准你并不清楚。 阿里用标准化协议开放接入,看起来很开放,但开放平台这三个字,在互联网历史上从来不是中性词。 谁制定协议,谁审批接入,谁控制排序,平台就是规则的制定者。当然,这不是阿里一家的问题。美团、京东、自洁,谁做成了 a 针的入口,谁都会面对同样的诱惑。既当裁判又当运动员, 这场仗才刚开始,谁赢了我不知道,但有一件事是确定的,当 ai 成为你和世界之间的默认中间人,新的权力格局就形成了。 最后说三句话。第千问,开放平台上线,本质上不是一个产品更新,是一个信号, ai 应用正是从会聊天进入了会办事的阶段, 接下来半年,你会看到所有大厂都在抢这个位置。第二, ai 替你做选择很方便,但方便和自由有时候是反义词,当你不再自己逛,自己比自己选的时候,你省下了时间,也交出了判断权。 第三,不管哪家营,作为消费者,保持一个习惯就够了。 ai 推荐给你的前三个选项,别急着下单,自己再搜一次。 这个动作不花两分钟,但能帮你确认 ai 有 没有把你当冤大头。好了,我是 seven, 觉得有收获的帮我点个关注,咱们下期接着聊。

这是阿里在八月刚刚推出的千万办公,他可以直接在你的电脑上把活干完,还可以外接多种 api 服务,这是小时花了五十亿 tok。 历经八百次迭代,终于稳定的提示词 api 服务。。这两者结合,只需要三分钟,,就能把你在交易中的任何想法变成可模拟、可回测、可优化参数的变化系统。。 这不代表你能用 ai 在金融市场上赚到钱,只能代表千万办公加上小事。。我调教过的习诗词,能够让你免去数据接口 skills 执行规则上巨大的工作成本和时间成本。。 请谨记,工具让专业量化,工作流更简单,但不会替用户创造有效策略。。如果你的想法和策略都十分垃圾,自动化只会让你加速亏损。。再次提醒,对于所有的新手朋友,请你以学习为主,不要! 要介入真实的交易,即使千万办公的能力完全可以达到。。所以今天我要演示的不是让你一夜暴富的魔法,而是你脑子里那个模糊的如果股价突破二十日均线就买入的想法。。 变成一行可执行的代码,一张清晰的回测曲线图,一张可以用每天最新数据模拟的过程,你只需要在千万助手的对话框里花五分钟的时间就可以做到。。下面本大三学姐将手把手的教你,各位请慢慢看,慢慢学。。 你现在看到的画面是一个新打开的桌面端千万办公建筑提示词也非常简单,复制粘贴发送即可。。大家如果想要自己的专属提示词,点个关注,小时粉丝群内领取。。 经过短暂的等待后,,千万办公就拥有了小时打磨两个月的所有功能,你可以让他列出来目前小时提示词的所有功能,然后。 你就会发现,你所需要的一切数据,,包括实时数据和 skills, 千万办公都已完全掌握。,千万办公会给你拉出来一个长长的分类清单,一共高达九百种数据可以拉取。。怎么样,这里值不值得你在评论区为小时在 ai 时代做出来的免费基础设施贡献?? 发展一番,更重要的是,专业之处不只是数据多,,而在于数据源的可靠性、时间线的对齐性。你随便输入一个日期,,在当天发生的所有行业的大事,你都可以看到,这对于你们深入了解之后,防止未来函数起到了关键性作用。。 当然,千万办公能这么快学会,也离不开它自带的聪明模型和开放的生态接口。。两边的分工可以概括成一句话,,小时负责数据和规则,,千万办公负责理解任务、本地计算、检查结果和完成交付。。 接下来,我先用一个最简单的军线规则跑一下历史回测。,这里大家先不要着急研究参数,我只想看一件事,千万办公,能不能把我刚才说过的那句话老老实实的执行出来,我直接告诉他,规矩,,先锁死,时间范围先锁死,数据口径也先锁死。, 不要看完结果再回头改参数,也不要只挑好看的区间,小时把历史数据拉回来之后千万办公,,先检查时间有没有对齐,,数据有没有缺口,,然后才开始在本地计算。。很快啊,起线阶段变化、年度拆分,还有每一次规则触发的记录就全出来了。,这个结果好不好?? 其实不是这一段最重要的,重要的是他会把过程全部都摆出来,,用哪一版规则、哪一段数据,什么时候出发的,为什么出发??后来谁来复合都能看懂。这。 是最简单的局限规则,结果并不好看。。我又让他只做一次说空运话,不让他满世界找参数,只增加一个趋势过滤条件。。局部表现确实有变化,,,但是把完整周期和成本一起算进去,,还是没有达到我们提前写好的标准。。这里我反而觉得很值钱,因为一个研究工具最重要的。 不是每次都哄你开心,而是在数据不支持的时候,,他敢直接把答案放在你面前。。大家也注意,我后面继续琢磨。。你只是为了把流程跑通,,,不代表这套规则就值得采用。。 好历史这一段跑完了小时,,又把录制当下的这段时长请拉进来了,我们自己写的规则也已经清楚了,那到这一步,我们就可以开始模拟了。。这个模拟不会连接任何正式账户,,也不会替我直接真实操作。。他做的事情其实很简单,新的书籍进来,先对齐时间,再更新均线。 量能这些数值,最后把它们放进刚才那套固定规则里,重新判断一次。。左边是实时数据,一条一条进来,中间是规则判断,右边是模拟时间轴,条件没有变化,画面就是灰色显示,保持安静,条件发生变化。。 时间轴上才出现一个小蓝点,点开这个蓝点,可以看到触发时间、当时的数据、使用的规则版本和触发原因。。 这样你看到的就不是一句模糊的可以或不可以,而是能回到每一个步骤,看他到底为什么能得出这个结果。。 说白了,这不是让 ai 猜下一秒会发生什么,而是让他们把我们已经写好的规则持续稳定,可以复合的执行下去。。每来一条新数据就重新算一次,没有变化就别说话,真有变化了再把原因记录下来。。但是千万办公让我觉得真正适合办公交付的地方,是他没有把。 钉盘回测、模拟分别扔给我三个文件夹,他会把前面的钉盘结论、历史回测、当前模拟状态和方法说明全部接到同一个网页里。。我点开首页,先看今天的钉盘结果。。 刚才条件没满足,,他就直接显示保持安静,往下点一下,就能直接打开这条结论背后的历史回测。。这套规则过去怎么跑??什么时候触发??为什么今天没有触发??前后全是连在一起的,今天的结果能回到历史依据。。 历史回测也能接着看现在的模拟状态,而且他给我的不是一张截图,,而是一个能真正打开的网页链接。我的解释词只规定要做图表和报告。, 具体怎么排版我没教,结果千万办公,自己把数据曲线解释,组织成一个代域名的网页,这个审美我一定要夸一下。米白色的底,蓝色做主要对比,橙色。 提示,结论放在前面,,依据放在下面,一打开不会满屏乱跳。。链接生成以后,我可以直接复制给同事,,别人不用翻聊天记录,也不用找本地文件,点开就能看到拼盘回测模拟结果。,后面数据更新了,这个页面还可以继续当看版用。。一个链接打开,前因后果都在里面。, 这才叫办公交付。。还有一个亮点一定要讲,千万办公可以连接常见的主流办公和消息工具,你看这个界面里。 钉钉飞书、 luck 微信、企业微信都可以配置,以后盯盘状态有变化,就可以把一具摘要和网页链接一起送过去。。 全部在电脑旁边,收到之后点一下也能直接打开刚才的结果,这样整条链路就串起来了。。。小时负责把数据送进来,千万办公负责计算检查,做网页和生成链接,钉钉飞书。 这些工具负责把结果送到你手上,数据钉盘、网页通知,不用在好几个地方来回找。。这次手机端和消息提醒,我先不做实际绑定,也不做推送测试,只把场景讲清楚,录制的重点还是让大家看到。。 金盘结果和回色结果怎么在同一个网页里联系起来??以及这个链接怎么打开?? 我刚刚说什么来着??实际数据我们有了,,我们自己的规则也有了,就连模拟过程都跑起来了。过去可能要一个团队先找数据接接口,,对时间写代码、做图表。, 最后还要把结果整理成别人能看懂的报告。。现在我只需要把自己的想法说清楚,再加上一行提示词,,千万办公就能把后面的那些重活给接住。。但是这件事真正厉害的地方,不是量化,变成了一个按钮,,更不是。 点一下就可以得到一套有效规则,恰恰相反,,工具越快,,人越要知道自己到底在验证什么,,也要接受自己的想法,可能根本就不成立。。我觉得 ai 真正慢慢看,,拉蒂以后最有价值的能力,不是让机器替你下结论。, 而是你能不能提出一个可以被验证的问题,,能不能把边界讲清楚,,能不能在结果不好看的时候停下来小时把数据和规则交给千万办公,千万办公把计算、检查、动画、网页交付做完。 他们把复杂的数据做简单,,但最后怎么理解数据要不要继续,,还是得人自己负责。。这才是我理解的千万办公。,他不是替你思考,,而是把你的思考变成一个看得见、跑得动,也经得起检查的过程。。

千万三点八二十七 b 今天直接在一张 rtx 四零九零上现做了一个 gta 克隆,能开枪会抢车,警察还知道追着你跑,可轮到一张 svg 城市图,他反手把船送上了天雾。李老师看完连夜重修牛顿定律, 一个二百七十亿参数的本地模型,前脚把三 d 游戏做成了能玩的样子,后脚又让轮船兼职当飞机。 阿里这次放出的千问强的很具体,翻车也翻的相当有节目效果。这批开放权重里有两个分量完全不同的版本,一个是总参数二点四万亿的大模型,另一个就是跑在消费级显卡上的千问三点八二十七 b, 二百七十亿听起来依然不小,可放进本地模型这一桌,他已经属于能被个人电脑认真考虑的体量。他还把图像理解直接装进了模型,你可以给他截图、图标或者网页,让他一边看画面一边写代码。 原身上下文有二十六万二千 token, 通过扩展还能拉到大约一百万。翻成人话。他处理一份代码项目时,可以同时记住更多文件要求和前面做过的修改,少一点,写到半路突然失忆。 ipad 二点零许可也很实在,模型文件可以下载到自己的机器上,允许部署微调和二次构建,不用每问一句都交一次接口费,代码和资料也能留在自己的环境里。 开放权重到了这里,才从发布页上的四个字变成了你能控制的一套工具。让它挤进 rtx 四零九零的办法是使用四比特量化, 可以把量化理解成给模型行李抽真空,占用空间小了,精度可能有一点折损,但主色版本只占大约十七 gb 显存,一张二十四 gb 显存的四零九零可以完整装下,不必把一部分模型甩给内存慢慢倒腾 速度也得看清。硬件每秒大约两百零六个 token, 来自 rtx 五零九零配合 nvfp 四的运行口径, d g x spark 给出的数字大约是每秒三十八个 token。 这两组成绩都不能贴到四零九零脑门上。 四零九零负责证明二百七十亿参数的模型能在本地跑起来。五零九零和 d g x spark 展示的是另外两套硬件下的速度显存装得下还得看它教出来的东西能不能用 同一组。三 d 亚特兰蒂斯提示词里对照画面中的千问,场景层次更深,视觉焦点更稳,局部效果甚至压过 cloud ops 四点六。 单张漂亮画面容易出彩,连续的游戏状态更难糊弄僵尸模式正好把这部分本事摊开了。一句做使命召唤僵尸模式的提示词下去,画面里先出现武器地图和一波波冲过来的僵尸, 玩家可以打开新的区域捡补给和弹药,花点数抽神秘武器箱,还能拿到一击必杀之类的强化。第一轮打完,游戏会继续进入第二轮,不是走两步就没下文的空壳,这些动作背后全是会变化的状态, 子弹打出去,弹药要减少,僵尸被清掉,波次要推进点数花掉,武器要真的换到手上,模型既要写出画面,还得让射击购买、刷怪和回合推进互相咬合, 任何一项忘了更新,游戏马上就会露馅。千问在这里接住的是一串前后相连的规则。游戏里的连续状态守住以后,网页开始暴露另一类问题。 英伟达产品页有三维效果、滚动动画和不同字体。第一眼确实像个能继续加工的成品框架。鼠标一动,问题也跟着亮出来了。本来只该落在显卡上的高光铺满整张页面,中间还有一块明显空白。他会做视觉气氛细节约束,却没有完全守住。麦克风格桌面更像一座影视城, 天气、时钟、日程、小组件都摆的像模像样。鼠标旋停会动,背景能切换深色模式也能打开,可音乐播放器、电池顶部栏和文件管理器有不少只是布景,远看像系统,点进去才发现门后没有房间。 多模态克隆 airbnb 的 过程更能说明反攻问题。他看着截图,第一版保住了主要结构,顶部栏和标志,要求继续改进以后,第二版反而把标志和顶部栏弄丢了。你让他装修客厅,他先把门牌和屋顶拆走, 这说明他能抓住页面的大致布局,但连续修改时还没有稳稳保护住已经作对的部分。到了 svg 和三维场景,千问的偏科就彻底藏不住了。 一张海边风景画的纹理和层次都很丰富,房子却没有落在该在的岸边,桥也像找不到应该连接的地方。纽约城市图里,汽车有车灯,高楼顶端还有航空警示灯,白天切到夜晚也很顺,偏偏那艘本该待在水里的船直接飘到了半空。 他很会补局部细节,却可能把最基本的空间关系安排错。类似的问题还会换着花样出现,三维鞋子转到某些角度,零件会凭空消失。本具房间的灯光和家具挺漂亮,一块木板却插进了床里。 f 一 漂移,有车有烟,整个三维环境还是散的,只拿到两分。可同一个千万做鱼缸时,鱼又老老实实待在玻璃里面, 没有集体越狱,他能记住鱼不能离开水,却没记住船也不该离开水面。这个能力边界非常直观。最后的 gta 克隆又把分数往回抢了一截。角色可以开枪抢车,犯罪以后会增加通缉心,警察会追上来,车辆挨打还会爆炸。 开枪触发犯罪,犯罪引来警察追逐又牵动车辆和伤害。这套因果链能连续运转,说明他确实开始摸到把一件活做成的门槛。 同一组对照里,千问有几张画面压过 oppos f 一 两分和轮船上天,也说明它还没有全面追平。千问三点八二十七, b 已经能在本地硬件上同时处理代码,视觉和连续交互交出的第一版也能接着改。 千问三点八二十七, b 没把 oppos 原封不动塞进本地硬件,它把能不能接活的门槛压到了一张 rtx 四零九零能碰到的位置。它的能力边界也写在画面上, 游戏状态能接住空间关系和细节仍会突然掉链子。等他哪天既能在 gta 里抢车,又记得把船放回水里, opus 才真的该回头看一眼。

一个一点六万亿参数的旗舰模型正式版上线第一晚,就被开发者吐槽输出不稳定。另外边,阿里却把千万三点八的开源主 力压在了二百七十亿参数上,大模型越做越大,真正争夺开发者的怎么反而变成了二十七币?八月十四日,千万三点八二十七币开放权重采用 pass 二点零协议第三方量化方案把它压到了大约十七 gb, 也就说一张二十四 gb 消费级显卡就有机会运行。 值得注意的是,四个月前发布的千万三点六二十七币还在持续吃流量,它经费时显示,他近一个月下载超过了六百二十万次,社区已经做出了六百多个量化版本。这说明二十七币并非是短期热点,而是已经形成了真实需求。 千万三点八二十七币带来的重要变化,是,把一部分过去只能通过云端获得的能力搬到了开发者自己的显卡上, 且最近变成了一场大厂的集体压注。同一周里,梅塔的 muslim 三十 b, 英伟达的 nemoto 三点五, lightnin 三十 b a 三 b, 再加上千问三点八二十七 b 约三十 b, 这个区间一下子挤进了多个产业的旋风, 开放权重正在从差异化卖点变成了入场券。新的竞争是开源以后谁更好用。商家的路线也很清楚,微塔在抢本地 a 准定位打的三十 b a 三 b, 每次只击活跃三 b 参数主打高校 a 准千万响针的则是单位参数能力更强的通用 a 准。三十 b 级开源模型的竞争,已经从有没有进入 到了用什么方式做到最好用的阶段?比一周出现多个模型更有冲击力的是,二十七 b 开始挑战。过去主要有超大模型 的任务、编程、办公和智能体工作流千万。官方结果显示,千万三点八,二十七 b 整体超过了千万三点七 plus 在 s w 编程、 pro、 coco 编程等任务上,也仅可以与更大模型同台比较。当然,这些表现主要来自官方跑分和 发布日体验,而且奥雅更长时间验证,但至少可以确认模型的参数规模在缩小,能够承担的任务范围却在扩大。二十七币也开始进入到了真实的代码仓库、办公流程和多步骤任务。为什么大家都盯上了二十七币到三十一币?因为这个体量刚好跨过了一条商业分界线。模型再大,普通开发者往往只能租用云端服务, 加进一张显卡,数据可以留在本地,这样成本更可预测,模型版本和工作流也能掌握在自己手里。一汽微四 pro 的 争议正好说明了另外一面,无论问题来自底座还是部署,对用户来说,结果不稳定就是产品问题。 a p i 价格上涨也让云端成本更难预测。所以大模型越做越大,开发者为什么反而回到二 十七 b? 因为参数决定能力的天花板部署条件决定使用的地方参数天花板看的是复杂的任务部署,地板看的是显存 速度和工具调用稳定性。二十七 b 重密模型的原始权重超过了五十 g b, 经过四比特量化,通常可以压到十六至十八 g b, 一 张二十四 g b 的 显卡就有机会完成运行。本地部署带来的还有更低的成本。数据隐私和版本控制。对于需要反复调用工具的 a 准,这些往往比是跑分领先更重要。当然, 二十七 b 无法替代所有的超大模型。面对复杂推理、超长上下文和高要求的智能级任务,大模型仍有优势。 淡化和长上翘纹也会带来额外代价。开发者重新关注二十七 b, 说明市场这一分层,超大模型负责推高能力上限,二十七 b 负责把能力铺到更短的桌面。说到底啊,参数决定模型能飞多高,部署地板决定它能不能真正起飞。关注我,一起关注显眼!