粉丝3788获赞4.3万

a 圈又出大事了,中国移动正式发布国内最大的大模型服务平台 moba 平台,已经接入超过三百款主流的大模型。什么概念啊?就是 国内市面上你能看到的大模型平台,它全部都已经接入了,当大家都在热热闹闹讨论的时候,你才发现真正的王者开始进场了。说一下它的优势以及它对我们的影响。第一, 大模型的平台他已经帮你都选择好了啊,三百多个主流的全部都接入了,想用哪个用哪个。这第一个,第二个,首次实现了磁源的集约化采购。什么是什么意思啊?就是 集中地去采购 talking, 以前还在说普通人可以什么,做什么 talking 的 生意啊?做梦吧,怎么可能。所以呢,这种集中采购结果是什么呢?成本降三十以上?第三,在运行和使用模型的过程当中, 一旦有一个模型报错停止,它会秒急的切换到另外一个模型,会使你的运算和流程变得非常的流畅。当你在调用模型的时候呢,你还可以选择模式,比如说你选择成本优先的模式,还是选择效果优先的模式,还是选择均衡优先的模式, 厉害吗?就是在这个模式下,它帮你去匹配模型,大模型出错之后,它还能瞬间帮你切换到另外的一个模型。前两天刚说中国移动发布了 资源包,现在它就已经帮你把大模型接好,把跑大模型的模式接好,把资源 token 的 成本又帮你集中采购降下来。也就是说, ai 进入寻常百姓家已经来到了,同志们。

今天我们讲一下我们自己的 token 正转,如何快速地去添加一个模型,好嘛,来到目标的这个正转,我们或是我们去对标别人的,我们点击 p 令牌问创建令牌, 我们我删了一下令牌,我们现在添加令牌名称,这里随便写一个吧。 分组 啊,分组,最好也对标目标中的一个分组,这里选一个碰分组 物料们创建十个吧。好模型,模型不用管,差不多就这样 选择分组创建数量,我们这里有个全选 复制所选品牌,吉米雅号们来到我们自己的一个状态控制台渠道管理,添加渠道名称,拍选测试吧。好,蜜要批量创建, 蜜要对魔仙蜜要取中 api 地址。我们回到我们的一个目标的一个目标啊,好,一般都有 api 文档说明。 后面的 max 还 q 啊,那个二点七吧,运行也 deep 一个。有 v 四吗?有 v 四 v 四 pro, 那就 v 四 pro 吧。闻心一言,气魄 没有五。是啊,哦,就五点一。 jammer 好, jammer, 他 没有三点一,说明这个分组里面没有啊。 吓得不要包豆包豆包也不要, 这些都不要。好了,选了九个点,确定我们点提交好渠道创建成功了,我也可以来到模型广场看一下。好,他就已经创建成功了。我们再来到控制台,系统设置 分总蚁管理上游倍率同步选择同步渠道。我们确定 好,这个我之前已经同步了,所以它显显示无差异。然后大家这里选择同步之后呢?它这里会有很多 选项,然后选择之后呢,我们点这个应用同步就可以了。我们来到分组,能创建一个分组,分组名字就跟他一样吧,有个普通分组,然后备一点二,那价格就比他高一点二倍,那么我们的利润是百分之二啊,这个要一, 那特殊倍率是什么意思啊?比如说有的用户啊,他是 s y p 用户,是吧?那可以给他适当的打个折,如果咱们看一下这个吧, 七二十八,我们的目标 你有二十四哇,价格比他高一点,所以快速的添加模型这样子的。

token 是 所有玩 ai 的 人都离不开的名词,模型、价格看 token, 上下文,长度看 token, 很多事情都需要 token。 你 有没有想过 token 到底是什么?是字数?是词语?还是更底层的东西? 两分钟的视频,我们把头更讲明白。举个例子哈,一句话叫,我昨天在 chat gpt 里测试了 tokenization, 结果有点离谱。我们的大脑会拆分成这样的段落结构。我昨天在 chat gpt 里测试了 tokenization, 结果有点离谱。 我们理解段落的方式是先将完整的句子拆分成若干个独立的块,然后把块之间和块之间去联系起来。模型其实也是如此,完整的句子切开,分开为若干个小块,而这些小块就叫头啃, 并非等于一句话,一个词一个字,而是一种最小的切分单位。同场上的切分逻辑也不太一样,也会带来同一个上下文。 token 的 差异依旧以刚刚的段落去举例,这里的拆法可能是这样,倾向于用很多的小块构建起完整的语义, 而可 loft 的 拆法可能是这样。这两个没什么对错,只是两个厂商之间模型的 tokenization 规则不同。现在模型标配的一百万上下文,从理论上去出发,大家已经觉得很能打,他为什么总觉得不够用呢? 这是因为我们在处理工程的时候,不只是当人对话的输入和输出,还有项目规则、历史对话、文档内容代码日制等等的一些内容。 这些东西哈,一层一层的去叠上去,很快就吃满了上下文。那么我们在实际开发的过程中,怎么做才能最节约 token 呢?第一,别重复交代项目的背景,直接写进欠缺的项目文档。 第二,大群段落要学会自己去提炼成结构化的内容,这比模型直接理解全部的文章更加的节约。第三,明确指令,从类似于帮我看看的表达进阶为只检查这块功能的代码,这就是我开发的一些习惯,希望可以帮助到你。理解了 token, 相信你就明白了和大模型沟通的底层交互范式, 这是 token 最大的意义,它不只是一个计量单位。视频的最后,我也想和大家说,我们要尽量养成好的开发习惯,很多无意义的任务不仅消耗我们的时间,还有背后的服务器资源,甚至是能源。每次重复的计算都会变成更高的成本,都会变成对环境承担的负担。 所以少一点重复,多一点整理,不只是省 token, 省成本,也是在保护我们自己的家园。我是逍遥逍遥,本期视频可以帮助到你,下期再见。

普通人能不能自己生产托肯自己卖,这是最近遇到最多的问题啊。今天一条视频给你讲清楚,另外,以后每条视频给你们随机靠二十位粉丝安排托肯,帮助你们学习成长, 前提是要证明你会用啊。先说结论,能生产,但是算完账你就不会干了。原因很简单啊,自己生产这一百万的托肯,至少要花十几万去买 gpu, 再装一台服务器,还有二十四小时不断电,就这样,一台机器 还要花十几个小时才能生产出一百万个托肯。这就是普通人生产托肯面临的问题啊,不是做不了,而是做了一定亏。作为一个普通人,你想做托肯这门生意,正确的姿势不是自己生产托肯,而是用便宜的托肯去创造贵的服务和保障。我 再给你举个例子啊,用海外大魔星花了三块钱买了一百万个托肯,然后让 ai 帮你写十篇小红书文章,通过小红书给你写的这文案带货挣钱,那么成本就是三块钱 赚的其实不是托肯的差价,而是知道怎么用托肯,而别人不知道的是信息差,没听懂是吧?我再给你举个例子,用 ai 帮一个企业去搭建一套 ai 的 agent, 成本可能不到十块钱,但是可以收企业五千块钱的咨询费。 其实企业买的不是你那十块钱的托肯,而是你的认知力和有效产出。所以,不要跟资本抢着去生产托肯,要想着怎么用三块钱的托肯去创造三千块钱的价值。生产托肯的钱就留给资本去赚,普通人就用好托肯就够了。

二零二六年五月十七日,世界电信日,上海移动正式推出魔力算 token 通用服务,把 ai 算力做成像流量一样的套餐。 一元等于四十万磁元,九点九元等于一千万磁元,每月话费直接扣一号通用三百多款主流大模型随便用。 ai 时代真的来了,以后用 ai 聊天写文案做脚本,却一直听不懂。 ai 聊天写文案做脚本,却一直听不懂磁元 token 到底是啥? 今天不讲专业术语,大白话一次性讲明白,看完人人都会用。首先记住词源, token 就是 ai 世界的流量,是大模型处理文字的最小单位,也是现在运营商卖 ai 算力的统一计量单位。 咱们普通人看文字看的是汉字词语整句话,但 ai 看不懂完整句子,它必须把咱们说的话拆成一小块一小块的文字碎片,就叫词源,打几个通所比方,一听就懂。 用电按度算,打电话按分钟算,用 ai 全部按词源算词源就像手机流量,你说的话, ai 回复的话都在消耗词源,也可以理解成 ai 的 饭量,你输入越多, ai 吃的越多,词源消耗越快。重点误区,一个词源不等于一个汉字, 实用换算记这个就行。中文一点五个汉字约等于一个词源,一千万词源约等于七百五十万汉字。上海移动九点九元包月就是这个量。 标点、数字、空格、表情包,全部都算词源。日常用 ai 词源就两大核心作用,老百姓一定要记牢,一、决定 ai 记不记事。 词源等于 ai 的 短期记忆,每款 ai 都有词源上线,上线越大,能记住你前面说的话越多, 一旦对话太长,词源用完, ai 直接断篇失忆。前面聊的全忘光使用技巧,长内容分段发,别一次性堆一大段,防止 ai 失忆。二、决定你花多少钱, 磁源等于 ai 的 计费单位。现在不管是付费 ai 还是上海移动这种运营商,磁源套餐全都是按你输入的磁源,也就你说的话, ai 输出的磁源双向计费 省钱。口诀,话讲短,说重点,少废话,既能省资源,又能让 ai 答得更准。最后总结,资源等于 ai 的 流量,加 ai 的 饭量,加 ai 的 记忆加 ai 的 钱。上海移动已经把它做成九点九元包月的话费套餐,一元四十万,资源三百多款大模型随便用。 看懂词源,你才算真正免费又划算的玩转 ai。 以后再有人说 token 词源,别再一脸懵,这就是 ai 时代的新流量,现在充话费就能买!

妈,我又发现一个好东西,你听过 tok 吗?听过,这是热门词,老刷到的,怎么啦?嘿嘿, tok 就是 ai 处理文字内容最小计量单位,中文呢,叫词源。老厉害了哦,理论看的不错,那我问你词句怎么用,怎么落地?这我还没想好。 这么说吧,普通人日常啊,带豆包上的问答压根接触不到的,只有商用或者大批量的使用,才需要象棋批量调用 ar 接口机构的高频数据整理,这样才会统计消耗。说白了啊,就像流量,日常的上网闲聊就是免费通用流量,随便用 剂量的。 oppo 呢,就像专属的定向流量,大批量的高频使用就会核算消耗额度。爸也发现了,没什么用啊。当然有用, oppo 的 底层支撑靠的就是率理和这电力,这两样啊,才是实打实的核心的关键,你呀,还要好好学学的。

三大运营商集体卖 token, 这门生意啊,要变天了吗?电信日期间,三大运营商呢,齐发 token 服务,中国电信推出面向企业、个人和家庭的 token play, 搭配宽带上行提速包和安全防护包。上海移动宣布一元四十万 tokens 的 通用服务。 中国联通发布全站国产化、国新国模国云安全体作,推出多元化算力及多档 token 产品。三大运营商呢,正从管道商转型为 ai 算力服务商。 运营商杀入投坑市场,最直接的冲击呢,就是价格了,一元四十万投坑司,比市面上大多数大摩星厂商的定价都要低。 运营商的底气来自网络和算理基础设施的先天优势,贷款大、时薪低、覆盖广,能把投坑的边际成本呢压到极致。更重要的是啊,运营商掌握着海量的企业和家庭,用户可以直接把投坑打包进宽带的套餐里。这种捆绑销售呢,会加速 ai 应用的普及。 而对于普通用户来讲呢,以后点开运营商 app 啊,就可能会直接的调用大模型的能力。对于中小开发者,运营商的托管服务呢,提供了新的选择,不一定要绑定某家算力厂商。从产业格局来看啊,运营商入局呢,会打破大模型厂商在托管定价上的话语权。 算力基础设施的国家队啊,正从幕后走向台前。总之呢,这对于整个 ai 生态是好事,竞争越充分啊,成本呢,就越普惠。

兄弟们,今天来聊一个技术话题啊,但是你对 token 生意,但对做 token 生意的人极其重要啊。 token 呢,跟模型是强绑定的,什么意思啊?不同模型有不同的字典呢, gbt 五点五用的是一套词表,那 cloud 呢?用的是另一套, jimmy 用的又是一套同样一个词, hello, 在 不同的模型里面被切分成不同的 token 对 应不同的编号啊。把 gbt 五点五的 token 编号扔给 cloud, 就像拿英文字典的页码去查中文的字典,根本就对不上。那就像你用北京地铁的站点编号去坐上海地铁,结果只能是迷路。哎,那为什么很多人觉得 token 是 通用的呢?两个原因造成的错觉,第一,那同一家 同第一同一家族的模型确实是共享磁表的, gpt 四和 gpt 五点五用的是同一套啊,所以它们之间的 token 是 可以互通的。但啊,这只是特例,不是常态。 gpt 四 o 啊,已经升级成了新的磁表,跟老版本不兼容的。 第二,大厂的 api 做了统一的抽象,那你调用 api 的 时候,输出的也是文字,中间 token 划的过程被封装了,你看不见 token, 自然就不会意识到它的绑定关系。 这个底层事,事实对 token 服务商,它意味着什么?意味着你的价值比你以为的更大。 因为正因为 token 跟模型强绑定不互通,客户在多模型环境下的成本管理才特别的复杂。而这种复杂性呢,就是你的服务空间啊。一个非常经典的例子 叫做 token 叠加陷阱。很多人直觉觉得用便宜的 sonnet 写出稿,再用贵的 ops 用色应该省钱,对吧?那我们算一笔账, 写一篇五千字的文章啊。两段式的操作总成本大概是零点二三三美元,而直接用 ups 一 步到位,总成本只要零点一三美元,那两段式 反而贵了百分之九七十九啊,为什么呀?因为初稿的五千个 token 会作为润色阶段的输入被重新计费一次。这就是 token 叠加陷阱。 普通用户根本不知道这些,他们以为便宜模型加贵模型等于省钱,结果花了更多的钱,还浪费了时间。 top 服务商知道这些, 你帮客户避开这个陷阱,一个任务就能省将近一半的成本,客户会不会信任你呢?哎,当然会。 那文章还讲了几个更深层次的优化策略。第一,缓存机制, cloud api 的 提示词啊,缓存缓存读取成本呢,只有输标准输入价格的百分之十。 agent 系统的 system prompt 往往几千个 token 每次请求都要重复使用, 不用缓存,每次全额计费,用了缓存之后呢,哎,成本降了百分之九十。 第二,投机采样,用小模型快速的生成后选 token, 大 模型啊,并行验证, google 在 搜索栽药中实测加速二到三倍啊,本来需要五次串行计算的过程,变成了一次并行计算,成本和延迟同时降低。第三, 基于意图难读的动态路由,不是简单的便宜模型,先是不行,再上贵模型,哎,而是根据任务复杂度直接选对模型。简单任务走最便宜的中等任务走终端的高复杂任务啊,就直接上顶级的,避免了试错浪费的 top 叠加。 第三个策略,缓存优化,投机采样,智能路由就是 top 聚合平台的核心技术能力, 客户自己做不了这些啊,他们没有能力去计算跨模型的计费差异,没有能力去配置缓存策略,没有能力去搭建动态的路由系统。但你的聚合平台可以有一句话呢,说的特别好, 当你听到 token 不 够用的时候,不妨问一句,是算力不够了,还是配额不够了?是瓶颈在模型呢,还是瓶颈在架构? took, 服务商要帮客户回答的就是这个问题。大多数的时候啊, took 不是 真的不够用,使用的方式不对,调度不优,成本没有管好,你帮客户把这些问题解决了,同样的预算就能多干一倍的活。 took 的 底层逻辑越复杂,服务商的价值就越大,因为复杂就意味着客户搞不定,搞不定那就需要你。

到底什么是 token? 为什么模型不直接读文字,非要把文字转成 token? token 字母、单词之间到底有什么区别? 今天我不讲晦涩理论,用最通俗的逻辑带你彻底搞懂 token 的 底层本质。首先,纠正一个全网最大的认知误区, token 不 等于汉字,也不等于单词。 token 是 大模型专属的经过算法拆分的最小语义单元,它可以是一个字、一个词语、一个字母,甚至是一个标点词缀。 你可以把 token 通俗理解为大模型的认字单位。我们人类读书是以句子词语为单位理解内容,但大模型无法直接读懂人类文字,它只能识别预先定义好的 token。 我们输入的所有文本都会先经过分词器拆分编码转换成一串 token 数字序列模型,才能进行计算和理解。这里讲一个核心底层逻辑,也是为什么必须要有 token 的 关键原因。 如果模型直接输入所有文字,所有词语词表体量会无限庞大,参数量和计算量会彻底失控,训练和推理成本根本无法承受。而 token 分 词的核心设计思想就是高频词诊断保留,低频词拆分成碎片, 常用的词语直接作为独立 token。 生僻内容拆分成熟悉的子单元,用有限的词表覆盖无限的文本内容。这就完美解决了文本无穷无尽、词表爆炸的问题,也是所有大模型通用的基础设计。 再给大家讲一个算法实战中最实用的知识点。很多人疑惑为什么中文内容更好 token? 因为英文大多以单词为 token, 信息密度高,而中文多以单字偏旁拆分,同样字数的文本,中文 token 数量更多,这也是为什么中文大模型推理成本普遍高于英文的核心原因。 同时,我们常说的上下文窗口输入长度限制、计费标准,全部都是以 token 为单位计算,而不是字母,这也是算法落地 工程调优必须掌握的基础常识。最后做一个通俗总结, token 的 本质就是大模型读懂人类语言的通用计算单元, 它平衡了词表大小、计算成本和语义表达,是大模型处理文本、理解上下文深层内容的核心基础。如果这期干货对你有帮助,麻烦点赞收藏!

今天一口气给大家聊清楚 token 工厂到底是什么?这里面普通人有没有机会?先说一个数据,二四年国内日均 token 掉用量大概是一千亿,到了二五年底,这个数字变成了一百万亿,而就在三月份,这个数字已经变成了一百四十万亿, 两年增长超过一千倍。大家把整个 ai 行业过去两年的发展压缩成一个数字,就是这一百四十万亿。这个数字背后催生了现在 ai 最火的新物种 token 工厂。 十五号,红星电子在无锡签了四台华为升腾三八四超节点服务器,组成了万卡级群,专门用来生产 token。 同一天,电信宁夏分公司启动了国内首个百亿级 token 工厂集采,整体规模一百六十四亿,他们要把 token 变成像流量套餐一样的东西。 腾讯把 mark 平台升级成了 token 号,阿里 at 事业群年化收入已经超过了一百二十万亿, 全国第一,全球第三。你发现没有,所有人都在干同一件事,把算力变成头肯。那头肯工厂到底是什么呢?两句话给大家讲清楚。第一句,头肯是 ai 的 产出单位,你可以理解成工厂的成品,算力是才能,头肯是产出的成品。 传统的算力租赁是什么呢?是卖毛坯房,按面积按小时收租,你住的好不好跟我没关系。头肯工厂是精装房,拎包入住,按居住体验收费。 第二句,托肯工厂的本质是从卖资源变成卖结果,客户要的不是你的 gpu, 是 ai 帮我解决问题。这一个结果就像你去代工厂,不是买机器,是买产品。你去炼油厂,不是买炼油设备,是买汽油。 现在 ai 产业正在发生同样的事,从卖善利过度到卖智能产出,这才是 tok 工厂的核心逻辑。那为什么上下游都愿意进这个局呢?有三个关键点,第一, tok 工厂理论毛利率能到百分之六十,对比一下传统 idc, 毛利率大概是百分之十五到百分之二十五, 算率租率好一点,大概百分之二十五到百分之三十五,托管工厂直接翻倍。海外对标公司 fairworks ai, 二六年二月年化收入三点一五亿美元,毛利率百分之五十,估值已经到了四十亿美元,资本市场给他的估值逻辑已经不是硬件公司,而是 ai 服务平台。 第二,收入和调用量挂钩。传统租赁是固定租金,不管用户用不用都得付钱。托管工厂是按量计费,用的多用的少赚的少,和客户业务深度绑定 一起增长,客户爆了你跟着爆,客户凉了,至少还有个底子在。第三,门槛其实不低,不是有 gpu 就 能做头坑工厂,你需要推理优化能力、模型调度能力,稳定的电力和散热,足够的运维团队,缺任何一环毛利率都会往下掉。 所以这个赛道的玩家目前都是有一定积累的算力公司,云厂商、运营商竞争压力比较小,可以排除很多草根创业者,但是也得给他泼个冷水了。首先,托肯工厂的护城河没有大家想象的那么高。原因一,推理优化不是专利,你今天优化了一套方法,能把成本压到行业最低, 但对手三个月后可能就追上了,这不是芯片制成,有摩尔电力护城河,这是软件优化没有永恒的领先 原因。二,大客户的长期外包需求不确定性比较大。现在头肯工厂的客户很大一块是中小企业,他们技术弱,只能外包。但大厂呢?自接腾讯、阿里都有自己的技术团队,等他们自建推理能力足够强,外包比例会下降。 第三可能会被云厂商吸收掉。阿里云、腾讯云、火山引擎,他们本身就在做 token 服务,独立的 token 应用平台,未来很可能变成大厂的富翁,而不是独立生态。说到这里,大家可能会想,这些全是巨头的事,跟我有什么关系? 跟大家说,其实关系大了。调用 token 省时间就是赚钱。一个内容创作者调用大模型消耗 token, 选择题、写作配图能从八个小时压缩到两个小时, 省下的六小时可以多做三条内容,多接一个商单。以前赚钱靠出卖时间,现在靠驾驭 ai 提升效率杠杆。你在一个行业干了五年,踩过的坑,总结的经验,未给 ai 做成 scale, 每次运行几千个 token, 成本低到忽略不计,但能反复升钱, 经验本来就值钱,以前没工具放大它,现在有了。所以对于 token 工厂,我的结论是,它是个真机会,但不是一个适合普通人的机会。 它本质上是 ai 产业分工细化的产品,这是一个趋势,不是一条护城河。最终能活下来的,要么是规模足够大,成本足够低的,要么是由绑定特定场景形成差异化的,那些两头不靠的中间商会很难受。 最后给大家一句话, token 只是一种未来的生产资料,最终产出什么,还是要发挥自己的主观能动性,工具最终还是要看怎么使用,这才是最适合普通人的方向。今天就先聊到这里,觉得有收获的点个关注,我们下期再聊。

面试官问你,大模型是怎么看懂你说话的?如果你只能憋出一句,因为他被训练过,那这场面试基本就凉了。现在满大街都在写提示词叫 api, 但真正拉开差距的往往就是底 层逻辑。比如所有大模型文档里出现频率最高的词 token, 其实百分之八十的初级开发者都理解错了,搞不懂他,你就永远只是个会掉接口的外行。今天我们就来把 token 这个大模型世界里的通用货币彻底盘明白。 视频内容主要分为四个部分,首先第一部分我会带你理清概念,把 context window 和 token 的 本质揪出来,看清它们到底是个啥。懂了概念之后,第二部分我们就直接拆黑盒,去看看这个核心的运行机制,也就是机器是怎么把你的人话吃进去变成数字,又怎么把数字吐出来变成人话的。这里我要重点说一下第三部分啊, 这也是整个视频里最能在面试里拉开差距的地方,也就是深度揭秘环节,那个负责切分 tokenizer, 他 一开始是怎么被训练出来的?说实话,很 很多干了小半年的开发,都不一定能说明白背后的算法逻辑,搞懂这个以后,别人再给你聊大模型调优,你绝对能一针见血。 最后呢,我们把整个流程的闭环给推演一遍。好了,话不多说,我们直接开始大家看各种的大模型发布会,经常会听到一个词叫做 context window, 也就是上下文窗口。比如说有的厂商说我们支持一百二十八 k, 有 的比如 g p 五点二说我们拥有四十万,那 这个四十万到底意味着什么?其实上下文窗口就好比是大模型在回答你这一次问题的时候,他大脑里的一块短期记忆内存,或者说是一张办公桌,桌子有多大,他一次就能处理多少信息。但是这里有个特别容易踩坑的地方,你看右边,我特意画了一把大叉, 很多人一看,四十万,哦,那就是能塞进去四十万个汉字,或者是四十万个英语单词,对吧?不是的,这四十万指的是四十万个 token, token 绝对不等于字,也 不等于死。你看这些蓝色的小方块, token 其实是大模型自己理解世界的一个独特的最小的信息单位。至于它到底有多大,我们后面会细讲,但对于我们平时用模型来说,你只要记住懂了 token, 你 才能真正算清楚,你到底能给模型喂多少页的文档,它, 它才不会断篇。既然 token 是 最小单位,那这个 token 是 怎么来的呢?那就得引出我们今天一个关键角色,叫做 tokenizer, 为什么非得要有它?你看这张图,其实很好理解,左边是我们人类的领域,我们平时说话打字都是小谭喜欢吃苹果吗这样的人类语言。但是右边呢, 你看机器的领域,大模型听起来很高级,但它本质上就是一个巨大无比的数学函数,它根本不懂什么是苹,什么是果, 这就像什么呢?就像一个只懂中文的人,他去跟一个只懂高等数学的外星人交流,这根本就没法直接聊,对吧?所以在人类和大模型之间,我们必须得安排一位翻译官,也就是中间这个 tokenizer, 他的任务就是把两边连接起来,你看 它的核心使命就是一个双向的一个沟通机制。首先蓝色箭头叫做编码 encoding, 就是 我们输入一段文字, coco nina 负责把它转换成机器能看懂的数字为一个模型,然后模型在脑子里一顿狂算,得出一个结果,但是这个结果它还是数字啊。这时候呢,我们就得顺着橙色这一条线进行解码 decoder, 把模型吐出来的数字反向翻译回,我们人类能看懂的文字,其实就这么简单,一进一出。那接下来我们就稍微放大一点,看看这个编码和解码具体是怎么操作的。我们先来看输入的时候,也就是这个编码流程,它其实分为两步, 假设你敲了一句,小谭喜欢吃水果吗?发给大模型。第一步是切分 for, 拿出一把剪刀,把你这句完整的话咔嚓咔嚓剪碎,你看他可能剪成了,小谭喜欢吃水果吗? 切出来这些小片段就是我们刚才说的 token, 但是这还没完,现在切出来的还是汉字,对吧?机器还是不懂,所以到了第二步是映射,诺基亚手里有一本厚厚的密码本,也就是词表,他会去查。嗯 嗯,小谭对应的是一千七百一十七,喜欢对应的是四十一。就这样把每一个小碎片一对一的换成了一串数字,你们管这一串数字叫做 token id, 其实文字和数字就很像是一枚硬币的正反面,内容其实是一模一样的,只是表现形式变了,变成机器能算的东西。好,机器拿到了数字算完了,现在要把答案给回我们了,这就 是解码过程,你会发现解码的这个过程啊,比刚才简单多了,它只有一步,也就是映射方向反过来就行了。大家注意看这个红色这个框啊,我写了一个无需切分,为什么解码不需要拿剪刀切了?是因为大模型它有一个特质,它说话不是一段一段往外蹦的,它是一个 tock, 一个一个 tock 往外吐的。比如模型先算出来一个数字,四 十一扔给 tokenizer, tokenizer 翻开密码本一查,哦,四十一对应的是喜欢啪,屏幕上就出现了喜欢两个字,如果模型还没有说完,他就继续来吐下一个数字, tokenizer 就 继续翻译下一个字。你看,这其实就解释了为什么我们在用各种大模型聊天的时候,那个字啊, 总是一个一个像打字机一样蹦出来的,对吧?这根本就不是为了故意做一个动画效果给你看,而是因为它底层的解码机制就是这样,时时逐个 token 翻译出来的。好,刚才不管怎么转,大家 发现没有 tognine 都死死攥着他手里那一本密码本去查,对吧?那问题来了,这本厚厚的密码本到底是怎么来的呢?总不能是几个程序员坐在那人工一个字一个字的敲进去吧?所以你看这个图,我们稍微往深里挖一点点,看看这个 tognine 到底是怎么被造出来的。其实它的 制造过程就是找一堆的训练材料,比如说海量的文章网页,全都为给中间这个算法引擎去狂扫。注意啊,这里的算法不需要什么复杂高深的数学微积分,它干的其实就是类似于统计学的一个鼓励活。现在业内最常用的算法大概是分为两派, 像 google 通常喜欢用这个叫做 unigram 的 算法,而 openai 和 elastic 这些公司,它们主要用的是 b p。 我们今天就拿 b p 举例,这个引擎它扫完海量文章之后呢,最终会产生右边这两个最核心的资产,一个是词表,另一个是合并规则。好,那接下来我们就来看一下这个 b p 到底是怎么一步步干活的。我们先看第一步,构建出使词表。 b p 这个算法呢,特别实在,它 上来不管三七二十一,把所有的字全都拆碎。你看左边这个表格,不管是小还是弹,他在最初的指标里全都是这种最基础的单字,然后给每个字发一个排队的序号。说到这里啊,我必须要停一下,大家重点看一下这个很常见的误区。很多人在学大模型的时候,总以为这个 token id 就是 大名鼎鼎的 in benny 项链,总 总觉得这个数字里包含了词的意思,但绝对不是啊,这个一二三四五,它仅仅就是一个非常纯粹的,没有任何感情色彩的排队编号。就好比你去一家很火的火锅店,那个等位号本身没有任何实际含义,所以就算两个字意思很近,他们的 token id 编号可能也是天差地别的, 他们毫不相干。这点大家一定要在脑子里区分开来。好,误区澄清了,我们接着往下走。刚才说了,最开始的都是单字,对吧?你想一下,如果模型永远按单 单字去切,那效率得多低啊?我们输入一句八个字的话,他得切成八个头,肯算八次,这太费劲了。所以呢,我们需要把那些老是凑在一起出现的字给他打包。这就到了第二步,高频词的发现与合并算法会在那些海量的文章里去疯狂扫描,扫着扫着,他发现,哎,水和果这两个字怎么老是挨在一起出现啊? 特别高,那琴就会执行一次合并的操作,把水和果强行的焊死在一起,变成一个不可分割的整体 token, 也就是水果。然后你看右边这个循环的箭头,只要你机器不停,他就会继续扫。比如下次可能又发现喜和欢老是在一起,那就合并成喜欢。这是一个不断迭代的过程,那合 并完之后就结束了吗?没有。最后这一步才是真正形成密码本的关键。当水加上果变成水果之后, top and nine 必须要马上做两个动作。第一个动作叫做子表更新,他得赶紧把水果这个刚出炉的新词给登记一下,再 进刚才那个单词表格的最后面,给他发一个全新的独一无二的新编号,新 tokid。 然后第二个动作叫做记录规则,他得在一个专门的文档里写下来。注意啊,规则一,以后你碰上水加上果,就直接合成水果。这其实就是我们刚才说的那个合并规则,以此类推,不停的扫,不停的把小加 大谈合成小谈,不断更新这两个表,直到达到开发者设定的一个数量上限。比如说四十万这个头梗那一子的训练就算大功告成了。对于我们平时做大模型应用开发来说,了解这个过程其实挺重要的,为什么呢?因为你明白了这点,你就会发现,遇到常见的子模型,可能一个头梗就搞定了,不在 地方,再遇到了生僻字或者乱码,它在词表里找不到完整的,就只能切成好几个单字 token。 这直接影响了你那四十万的 context window 到底能装下多少真正有用的信息,对吧?好,密码本现在造出来了,那最 最后我们就把前面讲的所有东西串起来,完整的跑一遍,我们分成左右两半来看。先来看左边的编码阶段,你敲了一句,小谭喜欢吃水果吗?发给大模型,因为 tiktok 已经学过了,他知道水果是个高瓶子,可以打包,所以他切出来的是小谭喜欢吃水果吗?一共五个 tiktok, 接下来呢,他 拿着这五个 tiktok 去刚才那个表里查编号,你看蓝色箭头,小谭查出来的是一千七百一十七,喜欢是四十一,最后 打包成底下这一串数字,一千七百一十七,四十一,一百零二五百四十八,这才是真正味精大魔性嘴里的东西。那右半边呢?就是解码阶段,大魔性在脑子里拿着这串数字噼里啪啦一顿算,算完之后往外吐,结果假设他 第一个吐出来的数字是四十一,那这时候 tiktok 马上顺着这个橙色箭头去反向查表,哦,四十一对应的是喜欢他,你的屏幕上就打出了喜欢这两个字,你看,从文字变成数字进去,再从数字变成文字出来,整个翻译的闭环,这就完成了,这其实就是大家平时用各种 ai 助手的时候, 你的屏幕背后每秒钟都在疯狂运转的流程。好,讲到这里,整个机制其实我们都已经完全通关了。那说了这么多,不知道你们还记不记得,最开始我一直在强调的一个点就是 coin 跟我们平时说的字啊字啊绝对不是一回事,到底是为什么呢?好,我们来看最后这张图长得像个漏斗一样,你一看就明白了,如果我们没有经过刚才那套复杂的预算,横靠单字来算,小谭喜欢吃水果吗?这是八个字,那大模型就得辛辛苦苦的处理八次,但是 tokenizer 会合并高频 词,你看这个漏斗下面,原本八个字的输入被打包成了仅仅五个 token。 这意味着 tokenizer 表面上是个翻译官,但它实质上, 这台数据压缩机对于我们在座的开发者或者是重度使用大模型的人来说,这点太重要了。因为大模型的输入变少了,计算的压力就小了,那你速度自然就大幅提升了。更关键的是,同样是四十万 context window 大 小的那张办公桌,因为你的桌上放的是压缩包, 就是 token, 而不是零散的单字文件,那你实际能塞给模型的信息量其实是远远大于四十万个字的。好,弄懂了这个压缩的本质以后,大家再去看各种大模型的技术文档,心里就绝对有底了。那今天关于 token 的 底层逻辑我们就彻底盘清楚了,我们下期再见!

ai 工具效率倍增,但充值烦恼! 全网低价摆款模型,按量计费,正规渠道闪电充值,千问 open club 一 单全解锁支付秒到账,急速发货,告别等待, 秒速到账,七乘二十四,在线随时待命,扫码进入快乐星球!

之前有期视频介绍了 token 是 什么,为什么要有 token? 这期回答三个和 token 直接相关的问题,每个都跟你花的钱有关系。第一个问题,为什么同一句话,在不同模型里 token 数不一样? 这跟谁在切 token 有 关系?负责把文字切成 token 的 工具叫分词器,而每个模型的分词器不一样。分词器在训练时会统计大量文本,把经常一起出现的字组合打包成一个 token, 给一个编号收进词表。但经常一起出现这个标准完全取决于训练时为了什么语料。 所以每个模型有自己的词表,同一个词切出来的结果可能完全不同。小猫拿几个词在三个模型上试了一下,差异比。想象中大暹罗猫三个模型分别切成两个、三个、四个 toker。 同一个词,三种切法, 铲屎官两个模型切成三个,另一个切成五个,同一个词切法不同。因为每个模型训练十位的语料不同。小猫总结了一句,所以分词器不是在理解意思,纯粹是在按统计 规律签。没错,它不管这个词是什么意思,只看哪些字经常挨在一起,频率够高就打包,不够高就拆开。第二个问题, 为什么输出比输入贵?你发给大模型的文字叫输入 token, 大 模型回复你的叫输出 token。 输入阶段,模型可以把一整段内容并行处理, 像是一次性读完题目。但输出阶段不一样,它必须一个 toker, 一个 toker 的 生成前一个 toker 没确定,后一个 toker 就 不能开始。更关键的是,每生成一个新 toker 模型都要再跑一轮计算,还要持续占用显卡、显存和推理服务的时间。 你让它输出越长,它占着机器工作的时间就越久,消耗的算力也越多。所以输出贵,贵在持续深层。但写作文只能一个字一个字写,对模型来说也是一样, 输出越长,占用算力的时间越久,成本也就越高。第三个问题,为什么缓存名照能省钱?你每次跟大模型聊天,背后会悄悄塞一段系统 提示词,设定角色和行为规范。这段话大部分时候是重复的切出来的。滔看,跟上次一模一样。模型发现前面的内容没变,可以直接附用之前算过的结果,不用重算, 这叫缓存命中价格便宜很多。但为什么能缓存?因为模型在处理上下文时,会计算每个 token 和前面内容的关系,并为每个 token 生成一组 k v 值,也就是键值队。这组值只依赖它前面的 token, 所以 只要前缀完全一致,前面那段的所有 k v 值 都可以原样附用,不需要重新计算。这就是为什么缓存只看前缀。如果你在系统提示词末尾加了一个空格, 哪怕只是多了一个空格,前缀就变了,缓存权断,所有 k v 值都得从头算。还有一件事很多人不知道,不是所有请求都能进缓存,很多 api 有 最低缓存长度门槛, 比如 openai, 要求至少一千零二十四个 token 才能触发缓存。如果你的系统提示词太短,根本进不了缓存机制,每次都是全价。小猫想了一下, 所以 token 不 只是技术概念,且法取决于语料的统计规律,输入输出价格不同,缓存还能省钱,这些加在 一起才是我的真实账单。是的, token 看着是个小概念,但它背后牵着的链条不短,如果觉得视频有用,可以分享给你。还不明白如何省 token 的 朋友,这里是小猫课堂,我们下期见。

我手里这个设备应该是咱们普通人能花最少的钱体验到最聪明的 ai 了,玩过的人自然就懂,没玩过的你听我慢慢给你讲。咱们大部分人觉得豆包很聪明,因为大概率是你只玩过豆包。那豆包有三个模式你都知道有什么区别吗? 还有豆包有几个版本你都用过没有?包括 deepsea、 同一千万、 glm、 天空 ai、 讯飞、星火等等等等。当然我说的这些都是咱们国内的大模型,且都是免费的。 这个设备他把咱们国内的几个主流的大模型全部都内置在里面去了,你可以随意的切换。而且他的 deepsea 已经升级到四点零的版本了,只有老玩家才知道 deepsea 跟豆包到底谁更聪明。我就这样给你比喻吧,如果你觉得 deepsea 像一个老师,豆包更像一个说相声的, 因为咱们大部分人跟豆包聊天,更多的是豆包哄你去开心快乐,其他的模型各有优势,你需要慢慢的去体验。 聊完了模型,咱们再来聊聊设备自定义,也叫角色介绍,你可以理解为你想让他充当一个什么角色。例如有个朋友问我能不能让他教小孩学英语,并且能实时的纠正, 太简单了吗?咱们直接在角色介绍里面给它写上一个英语老师的模板来直接看看效果。 this is super good yes, this is super good! 说得非常棒, can you speak english? 你 是想说 can you speak english 吗?当然可以啊,我刚刚发音哪个地方不准? 其实你刚刚说的很不错啦, can you speak 和 english 都很清楚,就是中间连起来的时候稍微有点快,慢慢说会更标准哦,别担心,多练习就好啦。 如果你想让他成为一个专业的财经分析师,让他帮你分析毛股毛票,那我们可以直接给他一个财经分析师的角色介绍,咱 们在通过 m c p 接口获取到 a 股的实时信息,公司的业绩,主营是什么,公司财务等等,有没有暴雷的情况? 你还在到处查资料时候,他已经帮你整理好了。这就是 ai 的 强大之处。那还有一些小可爱,就喜欢给自己找点乐子,没事喜欢吵吵小架。那行,我给你展示一下 ai 的 暴躁模式。心情不好想找个人吵架,想吵架你算哪根葱啊?老娘我可是毒舌界的扛把子,你说话给我温柔一点! 温柔?你脑子是不是进水了?老娘我生来就是怼人的,想温柔去找你,别在这做梦了,赶紧滚蛋。那我肯定是骂不过他,你要觉得你行,你来试试,就像写作文一样,你给他提示词,让他回应就行了。 你也可以给他写上成千上万种模式,让他变成你的女朋友,律师、导游、医生都可以。 那再来说一下他另外一个聪明的原因,长期记忆这功能属于内测,但是你一不小心跟我一样注册了开放者账号,那就解锁了新大陆。他可以把你跟他的对话全部汇总总结并记住。 你想一想,假如你给他设置一个 ai 女友的模板,你每天跟他对话,他都记着了。你们聊的久了,聊了十天半个月,聊了一个月两个月,他是不是真的快变成你的女朋友了?他都知道你的爱好,你的习惯,他通通给你记住。 再比如你想给他设置一个小孩的模板,那小朋友成长的点点滴滴,小朋友喜欢吃什么?小朋友喜欢穿什么,今天得了奖,说明天爸爸,明天爸爸带他去吃了肯德基,他通通给你记住,你家长没记住的东西,他也给你记下来了。 还有声纹识别,你可以在他后台添加一个自己的声音,爸爸妈妈的或者你对象的小朋友的,在备注这里写上各自的描述,你只要跟他对话,他就能识别出来你是谁。你也可以在模板上写上,当识别到 某某某小朋友的时候,启动儿童模式,当听到爸爸的声音时候,启动财经模式等等。只要你模板写的足够好,他就足够的聪明。所以说他的智商取决于你的上限, 怎么样,厉不厉害?这有点像啥呀?这就像以后未来这些机器人普及之后,一个机器人他可以干很多人的活,可以负责做饭呢,还可以陪你聊聊财经呢。 不过他现在还不能动啊,我相信未来的 ai 机器人,他肯定会走进千家万户的。你不要觉得不可能,那连续好几年,这几年的春晚是不是都是被 ai 机器人给霸屏了?你现在觉得不可能,就像你当年爷爷奶奶那一代,他说你还想上天呢, 是不是?咱们现在是不是都已经上天入地了?一切都是时间的问题。前面我还说到为什么是 花最少的钱,为什么是最少的钱?因为它里面内置的 ai 大 模型都是免费的,它还有三十七个国家语言,五十多种声音,都是免费。你可以理解成买设备送全部的 ai 大 模型, 而且一直升级一直是免费的。好了,本期视频就到这里,不会玩的朋友可以进咱们的粉丝群来交流。