粉丝2602获赞6.3万

hello, 大家好,前两天这个 deepseek v 四 flash 正式版本发布了,然后这个模型呢,它以非常低廉的价格得到了很强的能力,然后呢这个模型它现在完全支持了 response api 格式,这个 这个 api 格式呢,它是适配这个 codex 的, 就是 codex 它的请求格式会略微有点不同,所以说我们这个 deepseek v 四 flash, 它非常适合配到 codex 上面去搭配它一起使用。 因为 deepseek 官方它还没有这个第一方的 agent 工具,所以说我们可以尝试把它跟 codex 结合在一起使用,而且 codex 本身它的产品功能也做得比较好。那今天这期视频就给大家分享一下,我们怎么样在 codex 里面去配置这个 deepseek v 四 flash 模型,并且 这个 deepsea vs flash 它是一个文文本本模型,它不支持多模态,它不支持视觉识别。然后我再给大家讲讲我们怎么样去配置这个视觉识别的能力。好,首先我们访问这个 deepsea 的 官网,然后我们可以看到这里有个开始对话和 api 开放平台,我们点第二个,然后我们点击这个创建 api key, 然后我们这里随便搜一个名字,比方说我就搜个 test, 然后点击创建 好,这时候它有个 api key, 我 们要点这个复制点击,然后关闭这个弹窗,之后我们就没有办法在这里重新复制了,我们要自己把这个 key 保存好。然后下一步呢,我们点击左下角这个接口文档点一下, 然后这里面啊我们点击左侧的接入 a 选工具,然后有一个 codex 点一下,然后这里呢我们可以看到目前仅 tipsick v 四 flash 支持接入 codex。 那 我们本来就是要用这个模型嘛,这里呢,我们可以看到它提供了一个一键配置的脚本。 然后呢,呃,如果是 mac 或者 linux, 我 们就用第一个脚本,如果是 windows, 我 们就用第二个脚本,我们在终端里面去运行,那我现在就复制这个命令,然后我打开终端好,然后我在我的终端粘贴一下 回车。好的,然后它这里会看到修改 codex 配置,使用 deep seek v 四 flash, 那 我们就选一,因为二还不支持呢。然后这时候我们要输入我们刚才复制的这个 deep seek 的 配置,把它给覆盖掉,改成这个 deep seek v 四 flash 的 配置。 然后呢,如果我们想要还原回我们之前 gpt 的 订阅,我们可以直接执行这个命令,我们可以可以把它复制下来,它是把我们原本的配置给拷贝了一份的,是有备份的,所以不用担心。此时呢,我们再打开这个 codex, 那 右下角变成了一个 custom, 其实它就已经是 deepseek 模型了,然后我发送给它,你好 好,现在它已经正常响应了,现在已经是 deepseek 啊,说明我们已经配置成功了,它这里已经没有这个其他的一些 codex 原本的功能展示了。 那我们已经配置成功了这个 deepsea 之后,我们要怎么样让它接入这个多模态识别呢?好,这个 skill 呢,是我自己写的,叫做 c skill。 这个 skill 可以 啊,帮助我们一些纯文本的模型在 a 卷里面使用的时候去提供这种多模态识别的能力。我们想要给它提供多模态识别的能力,其实我们是需要接入另外一个模型的,即使我们不配置任何的第三方模型, 他也会主动地去使用我们电脑上面的原声的 ocr 的 能力。比如说啊, mac 的 自己的这个视觉识别,或者 windows 自己的视觉识别。然后我们要怎么安装呢?我们复制这句话啊,复制这句话,然后到这个 context 里面来,我们粘贴,然后发送给他。 好,这里我们来试一下现在这个 q 的 效果,然后我们斜杠 c, 即使我们不输入斜杠也没关系。然后呢,我们随便截个图给他看一下。 好,这里我已经提前配置了一个 apikey 了,然后这个 apikey 的 话,他默认走的是这个千万三点七 plus 的 这个模型,然后我们发送给他。好了,现在会用这个 c 的 技能来看这张图片了。 好,我们可以看到现在他已经能够看到这张图片里面讲的什么内容了,它中间是一条灰色线,然后云气泡形状,里面带终端提示符。然后这时候呢,我们让他把这个 apikey 去掉,让他用这个 oci 来识别。你把 apikey 去掉,然后你使用原生的视觉识别能力来看看。 好,这里我们可以看到它把 api key 去掉了,然后它调用了这个 macos 原生的 vision ocr, 然后识别到里面的文字了。那如果说使用本地的 vision 的 话, 它就只能够看到里面的文字了,就说我们大多数的这种前端开发的这种 ui 查看它就没办,没有办法看了,所以我们最好呢还是自己去配一个单独的这种视觉识别的 api key。 好, 我今天的分享就到这里,谢谢大家,拜拜。

七月三十一号呢, deepsea 发布了 vs fresh 正式版,这是它史上最强的模型。一周之后的今天呢, deepsea 给全部的 a p i 用户都发了个通知,计划近期整体上调价格,而且预计涨幅较大。我第一反应呢,是看错了,因为 deepsea 在 我印象里面一直只发降价的新闻。我翻了一下,最接近涨价的一次呢,是今年六月的上旬, 峰谷的定价高峰时段呢,双倍的价格,仅此而已。所以很多小伙伴来问啊,说这次凭什么涨?是要收割了吗?所以我来跟大家分析一下。先说它原来有多便宜,真的非常非常便宜, 多人没用过 deepsea 的 这个按量计费啊,所以没有这个感觉。我们先来看单价啊,就是每百万 token 的 输入输出 flash 的 价格呢,是一块和两块, pro 呢是三块和六块,在国产模型里面就是偏低的。然后呢,它还有两个别家没有的东西, 一个呢,就是一个 money 呢,一百万的这个上下文不额外收费。第二个呢,就是缓存,命中只有输入价格的五十分之一,相当于只有两分钱,远低于其他的厂商。而且还有个细节啊,就是 deepsea 的 缓存优化做得非常好,写代码的场景里面啊,命中率基本上百分之九十五以上。这样算下来呢,其实百万 token 的 综合单价只要六分钱, e 头肯只要六块钱。前几天七月三十一号 v 四 flash 这个正式版本一发呢,能力大幅度增强,光看跑分啊,已经超过了参数量比它大好几倍的这个 g i m 五点二,又便宜,然后又强,关键呢,它还快,吐字速度呢,大概在每秒一百个头肯以上,甩开其他大模型一大截,所以跑那些 agent 任务的时候特别丝滑,便宜, 能力又强,速度又快,三样都凑齐了。可以说呢,在某种程度上来说,打破了一个不可能的三角。结果就是啊, a p i 的 钓用量翻了好几倍。官方没公布这个具体的钓用数据,但可以从他最大的客户 open code 身上去推算。 open code 呢,不光是个 a 型的工具,它还提供这种大模型的调用的服 务。里面的 deepsea 呢,就是官方提供的套餐呢,会有一些折扣,所以呢,比 deepsea 的 官方去按量收费要便宜一点。而且它又是开源的项目,所以它不限制去接什么其他的工具。 所以很多人啊,包括我在内,都从 opencode 里面去使用 zipcode。 opencode 里面呢,提供免费的 visa flash 付费套餐, go 里面也有收费版,我自己定了这个套餐,实际用下来,免费版跟收费版其实没有太大差别, 只是免费版呢,它有调用次数的限制。然后接着我们来看具体的数字啊, opencode 的 官方说啊,八月一日 visaflash 发布的第二天呢,免费版烧了五 t 的 token, 收费版呢,烧了三 t 的 token, 第二天呢,就是八 t。 这还只是开始啊, open code 的 有一个实时的这个数据页面,收费 token 的 日消耗量八月五日呢,已经涨到了六点三 t, 是 flash 正式版发布前的四倍。 如果我们再去按照这个免费跟收费版的这个比例来推算一下免费部分呢,一天还要再烧十点五 t 左右的这个 token 加起来呢,一天大概要烧十七 t 左右的 token, 十七 t 是 个什么概念啊?就是 open root 呢,我们知道它是全球最大的这个模型的主软件,这基本上没有之一啊,几百个大模型,八百万的用户, 全平台加起来一天也就三 t 多的。这样的 token, open code 在 deep seek 一个模型上就要烧的量是整个 open router 几百个模型用量的总和的五倍。 所以啊,我们来推测一下,官方没有说这个涨价原因啊,但我认为最有可能的解释就是算力真的不太够了。于是 flash 变强之后呢,吸引来的是 agent 的 重度用户,工具一接上之后呢, token 就是 成吨的烧起来了, 是 opencode 的 这一个客户啊,一天就能干到十七 t, 用量呢,一周直接涨了四倍,但是背后这个卡这个算力不会一周之内就多出四倍,能立刻的这个去见效,所以呢,只能拿价格去来做这个暂时的调节。好了,接下来赶紧跟大家来分享一下这个快讯。然后啊,今天视频到这里,我是迪总,李经理,少,我们下次见。

五十万人看过的 d 老师发语音三十秒带你速通 deepseek 为你服务!今天想让我做什么?

不登录叉 gpt 也能让 codex 真正跑起来吗?这次我用 deepstack 实测,第一步,在 deepstack 后台创建临时 aip, 密钥只显示一次,复制后不要截图也不要发给别人。打开 cc switch 三点一六以上版本顶部切到 codex, 点加号,在完整预设列表里直接选择 deepseek, 这里只需要粘贴 a p i t 官方接口地址已经预设,上游格式是 chat completion, 模型映射也已经带上。接着进入设置里的路由,启动本地路由,再打开 codex 开关, 原因是 codex 发出 responses 请求,而 deep sack 接收 chat completion, 中间需要 c c switch 做格式转换,回到首页启用 deep sack, 然后彻底退出并重新打开 codex, 让新配置生效。 我用新进程做了真实测试,模型是 deep sack 杠 v 四 flash 供应商是 custom, 并成功返回 deep sack root ok, 所以不选叉 ppt 登录入口 codeabs 的 核心模型请求也能通过 deepsafe api 工作,但 api 需要额度,官方插件和远程账号功能仍可能需要官方登录。 记住顺序,选预设填替开路由,启用重启再测试。

兄弟们, deepsea 微四更新了正式版的 vpi 啊,虽然是 flash 版本的,不是 pro 版的。然后我也是迫不及待的体验了一下,发现他真的真的真的非常牛逼,我来不及录屏了,直接拿手机给你们拍一下大概有多屌。 呃,我直接是没有任何提示词,让他帮我生成一个新建的三 d 模型,然后并生成零件图和装配图以及维修手册,然后自己找素材自己设计。我没有给他任何信息,时长和 top 无所谓,要做的完美。当然最后他是二十六分钟生成完了,然后也只花了我一块钱。我们最后看下效果, 下面预览, ok, 这就是它生成出来,它直接做了一个 web 界面出来,这是它的主页,没什么好说的,我们直接来看它的三 d 模型, ok, 这是它的整个三 d 模型,然后通过点击不同的部位,它会跳转到相应的界面,同时 它是甚至这里还有参数哈,大概有多高多长,然后爆炸分解,可以看到完美装备,爆炸分解还有纵向, ok, 然后我们再来看下其他的零件图,这就是它的整个零件图, ok, 可以 看到各种参数 还有装配图,教你怎么来装火箭 啊!还有维修手册,好像是真的维修手册直接从那个芯片上扒的。我觉得目前没有任何提示词的情况下, deepsea v 四已经做到了很强很强,我已经非常期待 pro 正式版来展示一下自己的实力了。

tonight 就是 话费, a p i 就是 插座, skill 是 技能, agent 就是 你的员工, model 是 你的大脑,龙虾接入大脑交话费干活儿。关注我,教你学 ai。

朋友们,我的显卡已经两天没合眼了。事情是这样子的, mini max 发布了一款开源的 sata 级别的视频生成模型, mini max h 三。开源前夜,我拿了一条过去的旧 ai 视频丢给 h 三去重做。原本啊,我只是想跑一条试试, 结果效果一出来,我就坐不住了,然后我把过去全部的都冲跑了一遍,做完天都快亮了。我当时脑子里就只有一个想法,后悔 我之前付给 c 蛋子钱能退吗?那个时候权重还没放出来,于是我就苦等啊,等了好几天,他还跳票了好几次, 最后它终于来了,我第一时间就把这个权重塞进了我的显卡。从那一刻起到现在我的 gpu 就 没有停过。所以先下结论啊, mini max h 三就是开放权重视频模型的 deepsea 时刻。 今天这期视频有点长,建议先点个收藏啊。我讲三件事,它能干什么?它改变了什么?还有最重要的,你应该做什么? 之前看我视频跟风买了 pro 六千的朋友请,现在把笑哭了打在公屏上,那这个模型参数我就不念了。先说一个它和以前所有视频模型不太一样的地方,以前视频模型吧,你得按它的规矩来, 文声视频一个入口,图声视频一个入口,你想搞点复杂,你就得接各种工作流,对吧?每个模型只干一件事,但 h 三不一样,他文字、图片、视频声音,你随便组合,你扔给他,然后用大白话告诉他你要什么官方说法。这叫统一的多模态上下文 说人话。他就是个会看会听会拍的创作者,他还有个名字,叫卖相更通用的多模态智能,他做的片子全部都自带声音、对白、音效, bgm 一 次生成,口型也能对上十一种语言都能说。 你给他一段参考音频,他连音色都能给你换掉。这事能成,是因为画面和声音是在同一个模型里一起长出来的,所以口型、呼吸环境天然就是咬合的。虽然说单条最长是十五秒,你别嫌短,因为广告啊, demo 啊,片头都够用了。 先看一个我自己做的 demo, 讲个故事。我以前是个剧本杀作者,我以前写过一个叫未接来电的本,可惜那个时候没有这种模型啊,物料全部都是手搓的。我把角色卡和主持人手册都丢给了 emage two 先生,成了一套风格图,然后再丢给了 h 三。 等了不到十分钟,一条七六八 p 的 宣传片就出来了。说实话,看到成片的那一刻,我挺感慨的, 当年的遗憾啊,现在十分钟就补上了。随后啊,我就突发奇想,不如让 ai 来发挥一下创意,不断的捕食这个模型的边界。于是我就给他定了一个通宵抽卡任务,看他能做出来什么。 哇,早上起来时候,我被惊到了,三十七条作品,没有一个重复的,也没有废片,各种各样 ai 的 奇思妙想, 如果用官方的七六八 p 的 最低价算两毛三分钱,这一晚上也就消耗了百来块钱。 但这么高的成功率和丰富的艺术表达,在过往的开源模型上都从来没见过。我又看了一下官方的 demo 啊,那个就更惊艳了。如果你做 t v c 广告,或者是电商产品游戏 demo, 或者是产品 demo, 我很想说, h 三已经杀死比赛了,在这样的成本下,你很难再回归手搓了。还有一个我特别喜欢的能力,视频编辑。有一次我录口播录错了,但我录制时穿的衣服刚丢进洗衣机,那我就直接给一段素材,再给一段重录的语音。你们看看这段, 随时都可以换一身衣服,丰富的艺术表达加上这种随意的编辑,可以让每一条素材都可以充分发挥它的价值。 ok, 爽片咱们放完了,咱们说点硬的,大家肯定想知道本地跑的效果如何,以我这台 pro 六千为例吧,我这边测到的极致速度是幺零八八 p 的, 十秒可以二十四分钟搞定。 但是你要知道, h 三刚出来那个早上啊,七六八 p 的 分辨率也要这么长时间。但是没有想到 h 三的社区如此热情,很快的各种优化方案都出来了,什么 stage 啊, attention 啊, easy catch, fbc, 我 就跟着社区一路换方案, 不到四十八小时,生成速度直接翻了一倍,而且这个优化节奏我觉得根本不会停啊,社区太狂热了,但是这件事本身比速度更重要,因为权重放出来,全世界最聪明的一群人就开始帮你免费优化, 这在闭源模型上永远都不可能会发生,对吧?更厉害的是,八月三日开院的当天,各种芯片厂商推力框架都同一天宣布适配 comfui 当天就能跑。于是卖课的、卖体日词的连夜上架,玩 comfui 的 那些朋友疯狂地持续输出, 只有公认的顶级开源才能一夜之间有这样的生态出现,所以我们得给 mini max 点一个大大的赞!现在视频生成这个领域是被闭源模型垄断着对吧?像极了 chat gpt 时刻刚刚发生的那段日子,大家又兴奋又焦虑对不对? 而 mini max, 他 没有选择去成为 onslip。 把智能评权交给每一个人,把机会评权交给每一个人。 所以看到这里的朋友,请把感谢打在公屏上吧!好,接下来我想说的是,这次智能评选会带来多大的机会和变更,这是我们每个人都不能忽视的。大家都想在 ai 时代赚钱对不对?但是咱不能总盯着提效生产力, 因为产品会被海量的生产出来,但传播和获客依旧是最难的,你依然需要获得注意力,而每一次内容形式的升级都会带来注意力的重新分配。 sd 二点零, sd 二点五解决了 ai 视频能不能进生产线的问题, 但他没解决另一个问题,普通人的试错成本太高了。过去几个月啊,少数付得起抽卡费的人先掌握了这个技巧,他们的内容越来越精彩了。 你刷到那些用 ai 参与趋势的博主是真的做得好,但是你们看不到的是他们背后的账单,而更多的人是被那个恐怖的成本吓得站在了门外。而 h 三呢?把试错成本 第一次打到了电费级别。刚才说的社区爆发就是因为这个原因。我自己就是个样本啊,我的 gpu 四十八小时就没停,每做一条我的提示词就准一分,我的经验就增长一分,而且这一次经验的传播速度会比上次快得多,因为一起试错的人多了好几个数量级, 更好的镜头更好的冒出来。我不敢说 h 三的出现会让每个用 ai 做视频的人都会变得更好,但它一定会导致注意力的重新分配。 所以为什么我最近睡眠也少,就是因为在用电力和时间抢跑这波经验差。我的视频制作流程其实一大半已经被 hyperframe 这样的 ai 工作流接管了,如果这套 h 三流程跑通,那剩下的也全都交出去了。 所以我永远都是那句,得赶快行动起来啊朋友们!但是有卡的朋友们,我先泼个冷水啊!本地部署并不是生产级内容的解法,这次 mini max 有 两个重要的模块没有开源, 一个是 contextr, 就是 一个云端的更智能理解素材的中间服务,它可以返回复杂逻辑推理生成的结构化提示词。 它不是简单把提示词写得更长,而是先判断什么该保留,什么该改变。我做了一个雨夜小提琴的编辑测试,如果只用简单提示词加原视频,衣服虽然变成了红色雨衣,但镜头完全变了。 我再用 contextir 服务重新生成提示词,看到没有,人物场景和镜头运动都跟原片保持一致了。 还有一个是 regenerate 二 k 的 超分模型没开源, h 三是一个原声七六八 p 的, 而云端 api 是 通过 regenerate 二 k 的 超分模型提升到二 k 分 辨率的。它的计算快,成本也低, 本地只能说是你能输出幺零八零 p, 但细节提升是非常有限的,完全达不到云端那个效果。而且我试了其他的超分也完全不可用, 而且幺零八八 p 的 时间成本是七六八 p 的 三倍,所以开源部署的版本是完全没法和官方的二 k 比质量的,这是事实。所以本地部署的朋友,咱们把定位搞清楚,本地是用来刷经验试错的,不是用来搞效率的。你早点跑通一条路径,产出高质量的内容才是最有限的。 跑通了这个 token 就是 杠杆,跑不通那就是烧 token 交学费。我现在策略就是一边拼命地找各种 case 验证提炼工作流。 另外,我会本地出七六八 p, 买 api 超分到二 k, 按实际的用量走。等我的业务量大了,稳定了,消耗的多了,我也会考虑要不要直接买 mini max design 的 包月包年。直接出包年版简直是个价格屠夫,它输出二 k 四毛钱一秒。 在影视短剧、慢剧之外的行业,我可以说 sd 二点五的价格是毫无竞争力。如果你是原先就有业务,那你就直接走 api 得了。 用 context 二的 api 可以 对复杂素材做理解,生成复杂的提示词。你甚至可以先用本地抽卡,再调用二 k 超分 api 来提升质量。 而且 api 是 更灵活的,它能接近你的自动化工作流。总之就是赶快动起来。现在 mini max 点赞上有三次的免费生成海螺 ai 也能直接玩儿。 你先得把你第一条片子做出来,对吧?产品 demo 或者是品牌 story, 或者是你就是随便想找个提示词玩玩,随便出都可以。但我的建议就是,你得早点开始建立自己的内容体系,尤其是闷头做产品的程序员朋友们,现在是做内容门槛最低的时代了, 你得早点尝试建立自己的流量,否则以后就得找博主来买流量。那我们交好学费,跑完试错后,应该进一步的质量,因为内容生产的成本大幅的降低, 制作成本也大幅降低,所以市场上的内容数量和质量都会水涨船高,那我们人类是会审美疲劳的, 酷炫的效果几天就看腻了对吧?我们最后还是会回归到更好的镜头表达,更好的蓄势中。所以我认为啊,注意力的重新分配也是有窗口期的,过了这段时间还是得内容为王。 所以我也在探索其他的产出创意的方式,比如说更好的工具啊,能帮你快速提升内容质量的产品啊,能扮演导演和编剧的 agent 啊。 除了 mini max design, 如果大家有经常在用的,也可以在评论区告诉我。结尾我还有一个预判啊,视频生成这条路最终还是会回到 agent 的 指挥视频模型生成一切的。我绝对相信马斯克说的,我们现在已经处于技术发展的起点时刻了,用技术加速技术肯定是趋势。 而 mini max 呢,有视频生成模型,有 mini max 点赞这个数据平台,他们没有理由不把导演、编剧的能力训练到 m 系列语言模型里的,所以我坚定看好 m 系列的后续更新。也许几个月半年后,我就再也不用去搞题时词了, ai 就 搞定一切的内容,在那之前,谁有更多的注意力,那个时刻一到来,就会更多的被技术加速,这就是指数型世界的特点。所以 h 三这波机会你们看懂了吗?好了,以上就是本期的全部内容了,谢谢大家!

你绝对想不到, antropic 为了赶走中国人,不惜在 cloud code 植入间谍识别软件对用户封号。这款软件会直接在后排读取电脑的本地时区,只要是北京或乌鲁木齐,时间就会被标记成中国用户。 哪怕修改了时区, cloud code 也会扫描电脑的环境变量。一旦发现用户使用的是中转站代理,而不是向国外用户直接调取官方 a p i 后,就会自动提取域名,并与内部一份包含国内各大厂和中转站的列表作对比。 对比成功后, cloud code 就 会将日期格式里 todays 的 单眼号替换成三个长得完全一样的 unikig 字母。 更离谱的是,就连数字中间正常的连字母也会被全改成斜杠。这两个微小变动,人类肉眼几乎无法分辨,但从机器解码的角度来说,却完全变成了另一个字母。传回总部后,不出一天就会将中国用户封号。

最近 codex 越来越火了,但是好多新手用户发现呢,他用起来还挺贵的,转头去用中转站的 api 的话呢,又不太靠谱。所以今天这个视频呢,我教大家用 acnes 这个可以国内直联的 api 接入 codex, 他们的模型呢,已经被调用三万多亿个头啃了,而且是不限时免费用的,所有人都可以体验一下让 ai 全自动帮你干活是什么感觉。 首先呢,我们要在 gittub 上找到 codex 加加这个开源软件,它可以自由切换 codex 的模型。打开 codex 加加管理工具之后呢,在左边的供应商配置里点添加供应商,这里名称呢,写 agnes 接入模式,选纯 api 配置模型呢,要填 agnes 二点零 flash base url 呢,写这个 key。 这里呢,我们要去 agnes 在 api 平台创建一个密要之后才能填 这个 apm 要呢是不限时免费用的,不用你充钱,也不用绑定任何的银行卡。戳贴好了之后直接粘贴到这里,上游协议选 chat completions, 再点上面这个保存就可以了。保存好之后呢,我们回到 上列表这里,选中刚刚填好的 ikenes 模型,再点盖栏启动 codex 加加,就可以自由使用免费的 codex。 接下来呢,我试试它的 ajt 能力,也就是让 ai 来调用各种工具来干活。比如这个博主,他做了个很好用的生成文章配图的 skill, 现在在 gap 上已经有五千多收藏了。 这个 skill 可以让 codex 去调用 agnes 模型,来根据文章内容画出像这样手绘风格的黑色小人插图。这样呢,就比单纯看大段大段的文字要更加轻松易懂,但新手呢,可能都不知道怎么用 btop, 也不知道调用 skill 这种情况呢,我们其实只要把 skill 的链接和文章都扔给 codex, ai 呢,就可以帮你自动读取 skill 的工作流来创作这种 手绘插图了。整个创作的过程中呢,艾格尼斯的 agent 模型会帮我们去分析文章内容,再去调用自己的生图能力,思考的过程中呢,也没有出现什么卡顿,而我们只要把 codex 挂在后台让他干活,然后等几分钟,插图就做好了。说明 agent 模型和声图模 配合的很好,这种多轮任务的工具调用也没有出问题,出来的图呢,也符合我们想要的风格。对于不熟悉 get up 的朋友来讲呢,这么用起来确实要简单方便,很多初学者呢,也可以用它来慢慢上手,体验最新的 ai 智能体是怎么干活了。除了这种插图之外,我们测试了一下让他做常用的乐高风格图片,蜘蛛侠、蝙蝠侠都上手呢,还可以。 像这种电商类的产品图,他的出图效果也没什么毛病,最高有四 k 分辨率,拿来做个演示其实挺够用了。另外, agnis 呢,也有视频模型,我们把这几张乐高图喂给 codex, 让图片动起来。 agnis 的模型呢,可以支持最高一零八零 p 的分辨率,拿来做科普视频,或者在我们拍摄短视频的时候提供一些分镜的参考还是挺合适。 是的,最重要的是,这些声图声视频的模型也同样是完全免费不限量的。想用的话,大家把这个整合了 agnes 官方声图声视频 api 的 dt up 项目链接告诉 cosex 就可以自由使用了,体验下来呢?我们觉得 agnes 确实给很多在意烧 token 问题 或者网络访问不太方便的用户提供了一个可靠的尝鲜方式,这其实就消除了很多人想要体验 ai agent 的心理障碍。大家以后有什么新的 ai 工具又担心跑起来太贵的话,可以上手试试。

deepsea 反转来了!刚刚 deepsea 后台弹出重磅通知,官方明确近期要整体大幅上调 a p i 定价。自从 deepsea 上线短短半个月,全网开发者一窝蜂涌进来调用算力服务器,附带直接拉满频繁荡机,这是算力供给跟不上需求最直接的表现。靠低价打市场,确实圈了一大波开发者,但这种长期低价模式根本扛不住海量爆发,每一次调用都在消耗算力流量爆炸之后,算力资源直接被透支。 这次涨价说白了就是自救,之前大家靠着低价省下的成本,接下来大概率全都要吐回去。对于做开发的人来说,现在摆在面前就两条路,要么提前规划好自己的调用用量,要么抓紧去找别的平替模型。当然也不用直接抗衰,低价薅羊毛的好日子快要过去,但不代表产品直接不行了,只是烧钱换规模的阶段才是告一段落。

前四期啊,咱们聊了 agent 的 架构选型、接入和调教,但是呢,有一个问题是绕不过去的,就是 agent 的 安全。过去呢,普通的 ai 安全问题啊,主要还是在关注内容安全,目的呢,就是让 ai 不 说错话,不输出有害的内容。 现在的 a t t 安全问题呢,变成了一个系统安全的问题,因为 a t t 它可以操作你的文件,调用你的系统,访问你的数据库,失控的不再是嘴,而是手。一个被注入控制的 a t t 可以 合法的使用账号,走合法的协议,调用合法的 a p i, 把你的敏感数据啊,全都删掉或者发出去。 今年已经屡见不鲜的山库逃逸这样的事件啊,已经实打实的证明了安全的重要性。而在实际使用当中啊, a t t 最重要的价值就是能够执行命令,读写文件和调用工具。 但为了安全呢,你又不能让他直接去碰你的系统。而沙箱呢,就是在操作系统层给 aginty 画了一个圈, 他呢,让 aginty 能在圈里面呢,自由的活动,但是出不了这个圈。目前主流的那些 aginty 的 厂商啊,基本都提供了沙箱隔离的功能,而沙箱本身呢,也并不局限于某一种底层的隔离技术, 像容器啊,虚拟机啊,用户态的内核隔离啊,都可以作为沙箱底层的能力的一部分,作用呢,都在于把底层隔离的环境啊,封装成一个适合 aint 调用的执行服务, 再去把运行时的能力文件、系统命令接口、网络访问和状态管理啊,组合成一个统一的任务空间。但是呢,沙箱也不是锁的,越死越好, 这里呢,我必须要说一个翻车的案例,我啊,有一个还算常用的 app, 在 多次的升级更新之后啊,我发现他会强制的让沙箱把所有的本地操作定向到虚拟环境。 我呢,让他整理桌面,他呢,就在虚拟环境里面复制了一份,告诉我整理好了,我一看我自己的桌面纹丝不动。更气人的是,这个隔离机制关不掉,每次干活都得手把手的把文件拖进去又拖出来,本来想省事的反而变得更麻烦。 这个呢,就是 a 侦探安全的一个窍窍板,你锁得越死,他能干的事情越少,体验越好呢,漏洞可能就越大。所以啊,沙箱机制虽好,但是呢,也不是万能的,尤其不建议一刀切。 另外啊,在传统的网络安全里啊,有一个十分经典的管控机制,就是 i a m, 也就是身份与访问权限管理。其中的一些方法呢,同样适用于 a 侦探安全管理当中。 像身份管理解决的其实就是你是谁和谁派你来的问题。就比如 agent 用什么凭证来登录系统,他的身份标识是什么?这个身份又是谁授予的?早期的做法呢,就是让 agent 借用使用者的个人身份和凭证。但是问题在于啊,人的权限通常啊会太大, 而凭证的有效期呢,也会比较的长,一旦 aint 被攻破,攻击者就相当于拿到了这个人的万能钥匙。正确的做法呢,应该是给 aint 一个独立的身份,不为任务提供高于必要级别的访问权限,所有的操作都得绑定特定的身份。 假设啊,你的研发团队里有一个 aint, 需要定期获取内部代码仓库做代码审查,但是呢,你不想让他持有永久有效的凭证,那该怎么办呢?第一步就是在每次任务启动的时候,给 aint 签发一个短期的凭证, 就比如说做一个有效期两小时的临时托管,而不是一个长期有效的 api key。 第二步呢,就是当任务结束之后,凭证自动作废,即使 aj 特被攻破啊,攻击者拿到的也只是一张已经过期的作废工牌。 第三步呢,就是 aj 特的凭证,不仅有时效,还跟当前的任务绑定。凭证里啊,要明确的写清楚,本次任务只允许访问代码仓库 a 和 b, 不 包括数据库 c 和 d。 关键的原则就是三句话,第一,不要给 agent 长期有效的凭证。第二,每个新任务都发一张临时工牌,任务结束,工牌回收。第三, agent 的 身份证应该跟着任务走,而不是跟着人走。 再来说权限管理,权限管理解决的呢,是你能干什么的问题,就像 agent 被允许访问哪些资源,执行哪些操作,调用哪些工具。早期的 agent 权限框架设计呢,是非一级零 ident, 要么能调用某个工具,要么就不能没有中间地带。这个呢,就像是给了一个人一张万能的门卡,只要给他,他就能进所有的房间。 结果就是啊,一个 ident 只要能读文件,他就可以把它往外发。目前最佳实践呢,是在赋予 ident 独立身份的同时啊,确保他获得永远是完成任务所需的最小权限,并且强制引入运行式安全机制。 假设你的 adt 需要读取代码仓库,查询内部文档,调用测试环境的 api, 但是呢,你不想让他能删除代码,访问生产环境,导出那些重要的数据?之前呢,已经通过身份管理给他发了临时工牌,那现在要明确这张工牌能干哪些活? 第一步就是创建 adt 角色,明确绑定允许调用的工具有哪些,允许访问的资源有哪些?允许调用的 api 有 哪些。 第二步就是在 agent 想执行写入操作的时候啊,必须经过人工的审批,如果他想在系统目录自动创建文件的时候啊,可以直接拒绝。 第三步就是先在黑名单里面啊,列出那些高风险的工具,然后通过白名单呢,进一步缩小许可范围,然后再把黑名单的检查优先级啊放在白名单的前面。这样呢,即使白名单配错了,把那些危险的工具啊放了进去,那黑名单还可以去兜底, 关键的原则就是默认拒绝所有的操作,只允许明确列出的例外。还有就是 a 进特能够调用的每个工具,每个资源,每个 api, 都必须要先被授权,没有授权的一律不能碰。 而随着 a 进特执行的任务越来越复杂啊,刘恒也成为了必须要做的工作。想象一下,没有审计的 a 进特就像是没有黑匣子的飞机,一旦出了事情,你根本不知道发生了什么。所以 a 进特安全还需要一个基础的治理与可观测性的能力, 就是去定义 agent 被允许做什么,并生成他们实际做了什么的可验证记录。而可观测性工具呢,要能够发现哪些 agent 在 运行,连接了哪些工具,调用了哪些 api? 举个例子,你的监控系统发出了告警, 说某个 agent 在 凌晨三点的时候啊,读取了大量的重要数据,你呢,怀疑他被攻击了,但是你需要证据。 第一步,就是通过 aint 的 审计系统去查看这个 aint 的 完整操作轨迹,像他读了哪些文件,调用了哪些 api, 然后在什么时间点做了什么操作。第二步呢,就是检查是谁发起的,是任务,原始的指令是什么。 aint 呢,又是在哪个环节决定读取那些重要的数据, 去把他的进程文件、网络模型、交互、敏感访问,统一到一条可追溯的行为链条。第三步呢,就是去对比这个 aint 的 历史行为模式, 发现这次任务的时间要用资源输出,目的地,全都跟正常的行为不符。而正是这些审计记录,才能让你快速的定位问题的根源。 而更好的观测性呢,不是事后的追责工具,而是可以实时观察能够事前发生异响的雷达。结合刚才讲的那些内容啊,可以归纳出一个相对完整的 a 级安全体系所需要覆盖的五层级。这五层呢,是递进的关系, 身份跟权限,其实是事前的防范。沙乡呢,是时钟的兜底。审计是事后的追溯。每一层呢,都假设上一层已经被突破了,而在下一层呢,建立新的防线。事前规则防不住的,由时钟的沙乡来兜底,而沙乡兜不住的呢,让审计去追溯。 好了,这一期关于 agent 安全的内容也讲完了,在这个系列的结尾呢,想说一点跟技术无关的话题,从二零二五年到现在,从 minus 到 cloud code 再到现在五花八门的各类 agent 逐渐的普及, 我们的工作模式呢,也因为大模型和 agent 发生了巨大的变化,越来越多的个人啊,通过 agent 放大了自己的能力,而那些小团队呢,也可以通过 agent 来撬动过去大企业的那些潜能。 但同时基础技能和经验积累机会的减少啊,也会倒逼技能向判断力跟统治力转型,而过度依赖 it 的 处理信息和逻辑推演啊,还可能会导致独立深度思考能力的下降。所以啊,大家在通过 it 实现提效和转型的同时啊,希望能够明确 核心的决策、价值、判断和创意的源头啊,必须由人类来主导,仅仅呢,将 agent 作为执行与辅助,共同来守住人类能力价值的护城河。我是老林,关注我评论区聊聊吧。

哥,你们不是用 ai 写代码了吗?对啊,那为什么还要两周? ai 写代码快当我 review 慢 review。 什么? ai 写的代码不直接用吗?你敢用 ai 写的代码不 review? ai 不是 比人聪明吗? ai 聪明,但 ai 也会幻觉。什么叫幻觉?就是 copy 里边一个不存在的 api 经常吗?不经常,但碰到一次就够你喝一壶。那 ai 写代码的意义是什么? 从零到八十,快了,但八十到一百还是人。那能不能跳过八十到一百?你想上热搜什么?那到底升了什么?升了 天。那怎么保证质量?好给我两周 review。
