粉丝47获赞284

别再为做海报、 ppt、 品牌设计花钱求人了!用 check、 gpt、 image 二这六件事,不花钱就能搞定!干运营的做海报,别再求设计师排期了,直接输入活动主题和风格,主海报、活动信息、路线指引,一键全出。 打工人们还在为 ppt 排版崩溃吗?丢给 image 二一份大纲啊!可以生成配色统一、风格统一的 ppt, 再也不用加班了!做电商的产品图拍摄又贵又慢,现在商品没上市呢,就直接做出爆款详情页点击率飙升。 想创业的,以前品牌设计要花大价钱,现在呢?全套物料三十秒配齐, logo、 菜单、名片一口气全出,而且设计风格始终统一! 产品经理们脑子里有个想法,还要吭哧吭哧画原型吗?现在想做个 app 啊,一张图里直接画出三页原型,快速验证想法靠不靠谱。 就连这张信息图也是他生成的,从海报到原型,一个 chat gpt、 image 二搞定这么多视觉创作,他知道真实场景是什么样的,中文多也丝毫不拉!快来想想你的工作有哪些能教给他!我是吃土,带你用产品视角看懂 ai!

今天, openai 发布了 emagine 二点零。如果说到一是洞穴壁画 emagine, 一 是古代艺术,那么 emagine 二点零就是文艺复兴。 emagine 二点零是迄今为止最智能的图像生成模型,能够生成复杂、精美且可直接用于生产的视觉效果,并具有精确的文字和结构化设计。 你看,这个模型不只是在生成图像,他在思考。没错,以媒体,二点零会思考和研究。他甚至可以搜索网络,利用最准确的信息来生成图像。 凭借这些信息,该模型能够生成解释复杂系统的信息、图标,以及通过证明过程来解决数学问题的图像。 借助全新的多语言能力,你可以为全世界创作包含多种语言的视觉内容。 现在,图像生成领域首次实现了一次创建多张截然不同的图像。你可以生成带有结构化排版和写实照片的完整杂志、房屋,每个房间的完整装修方案,或是具有连贯角色和情节发展的漫画。 你现在可以跨多种宽高笔生成具有非凡微观细节的二 k 分 辨率图像。 你看,你不再只是生成让人惊叹的图像。有了 imagine 二点零,你生成的图像可以用来发现导航、发明、建造梦想和探索世界, 并将创意变为现实。灯光亮起,我的逗比智能体也升级到了 gpt 一 位置。二、只需说用 gpt 模型产生图片即可。网址,逗比 dotkn。

自从一 mate 二出来之后,设计师这个群体真是遭老罪了。因为最后一道护城河, ai 图像无法编辑、无法转换矢量文件的问题也被解决了。像 logo 字体设计插图,又或是 u i i cap, 一 拖一拉直接扫描可编辑的 e、 l、 c、 t 原文件就出来了。以这张插图为例,把它丢进 windows 中,扫描可编辑的点 ai 原文件就送到你面前了。 打开文件一看,曲率平滑内容可编辑的点 ai 原文件就送到你面前了。打开文件一看,曲率平滑内容要消耗多少时间呢?再来试试 logo 图形, 把图丢进去右上角点运行。这个扫描的效果和你自己用钢笔工具画也没有太大区别。再来试试字体设计类,方法是一样的,把它丢进去就可以了。 扫描结果不仅保持了文字的还原之外,边缘曲率也非常到位,这个扫描质量比自带描模要好很多。最后再测试下 u i i com, 效果依旧稳定,真正实现了 ai 绘画落地的最后一公里。当图像特别多,还可以批量画全选图像,拖进去计算就可以了。在这过程当中,无需人为干预, 当然工具有所能必有所不能。像这种低分辨率元素,画面占比较小的,扫描出来就很糊了。元素太细或者图形密度大,画面元素就扫描不到。元素颜色带有渐变或灰阶,他就无法识别太细腻的颜色,过度颜色就会出现断层。元素表面带有纹理质感,经过扫描后纹理会被优化,视觉效果也会大打折扣。

做电商的最近都被 gbt 图像二点零刷屏了吧?就是我实测完之后,心情真的是挺复杂的啊。今天啊,正好可以说几点我的感想,其实做电商每一张图都是烧钱的。主图详情,海报封面主图不好点击,转化率极低,版是没有的。以前做图其实有多苦呢,比如说我拍摄贵,慢,周期比较长, 美工呢,沟通类改八遍还不是很满意,但是老板的 ai 呢,字又是乱的,图是假的,根本不能用,呃,还得是自己去修,存耗时间。但这次啊, gbt 二点零我实测完之后真的是不太一样,他真的像一个真的很牛逼的设计师, 他懂指令,会排版,层次很清晰,产品的光线呢,真的是一次性到位,卖点参数直接给你拉满, 做出来的图几乎就直接可以上架。以前每工一天干十张主图,现在运营基本上十分钟就可以全部干完,以前几天的详情页海报,现在几分钟就可以出好几把。说实话,实测完之后,我既既兴奋啊,又感觉非常慌, 为什么呢?兴奋是经验,效率确实很快,但是呢,中小卖家的成本确实能够降低,视觉也是确实能够直接拉满。慌的是什么呢?这次行业真的又要洗牌, 他今天只懂美工的啊,真的可能就被淘汰了。那现在目前的话,就是主图能设计好,详情也能设计好,视频也能做好的话,那现在目前拼啥呢?拼质量啊。所以我觉得这一段是有深度思考的,就当未来一年时间,我相信很多人都会 通过 ai 去做出很高级的这种主图,相亲和很高级的这种视频,但是的话,今天消费者为什么买单为主,图吗?其实最后的还是拼的什么?拼的是产品的质量和供应链,所以我觉得今天 目前来讲的话,还是有很大的信息差,大家根本不知道怎么用以及怎么去如何用。现在很多平台调用这个 gdp 的 这个算力成本依然很高,而且还不太稳定,所以如果说今天你会用的话,这里面就有巨大的信息差 啊,不学就淘汰,做电商一直是这样子,每次技术革明啊,都是重新发牌。 gbt 的 头像二点零淘汰不是人,是真的你不会用的人那,而且你把他当助手,省下的是时间去搞产品,搞流量,搞运营,这才是核心竞争力。如果这条对你有帮助的话,可以点赞、收藏加关注,转发给更多的同学。

为什么新一代图像模型终于能把海报标签和浣灯片里的文字写对?这期我们用两分钟拆解 gpt image 二的文字渲染逻辑。 这份解析以 open ai 官方 cookbook 帮助中心和官方驳刻为主要依据,同时参考技术,分析文章与中文技术,解读用来串起架构和使用层面的关键线索。 do 三这类扩散模型从造声开始逐步去造文字,在这里更像纹理和笔画图案,所以模型容易把字母画变形,或者出现拼写错误和笔画粘连。 g p t image 二的关键变化是把图像离散成 image token, 并和文本 token 放进同一个序列预测过程,它不是单纯画出像文字的形状,而是在生成图像时写出更有结构的字体序列。 更重要的是,图像生成被整合进统一的多模态表征空间。文字和图像不再是两段式流水线,而是在同一套 token 处理层里写作。这样拼写语法和多语言能力自然影响图像输出。 在 thinking 模式下,模型会先用推理 token 规划画面布局、对象、数量、标签、位置以及文字内容的逐字安排。先规划再落到像素,能减少生成到一半忘记结构的问题。 文字渲染还和 quality 参数强相关,低质量适合粗略画面,中等质量覆盖多数文字场景。而小字密集信息图、多字体排版和换灯片更应该选择 high。 实际使用时, prompt 要把需要渲染的文字放进引号,说明字体大小、颜色和位置,品牌名或少见拼写,最好逐字母写出,并明确要求不要增加多余字符。 一句话总结, g p t image 二的进步不只是画得更好,而是把文字、图像和推理放进同一个生成过程,它在 token 层面先理解和书写,再把结果解码成像素。

最近 gpt 一 秘制二很火,那有没有不用科学上网,免费就能用上的呢?有的兄弟有的现在建议网已经接入 gpt 一 秘制二,只要在这里选择 gpt 一 秘制二,上传图片,填好关键词,就可以等它跑图了, 我们可以看下效果,我这里是让它渲染模型的,提示词是这个对比看下是非常写实的效果。 除了渲染, gptemoji 二最大的王牌就是文字精准出图,我们平时的各种分析图以及 ppt 排版都可以用它来做图像,这些都是用 emoji 二生成的,美感和准确度都很不错了。那 gptemoji 二和之前的生图王者 banana 系列相比呢? 如果是单纯的渲染效果图, gptemoji 二是偏写实专业,有点像实景相机直出的照片,而 banana 系列的画面更细腻高级, 有电影艺术氛围。对于建筑室内设计师来说,大家可以根据需求灵活切换真实渲染,加带文字作图,选 g p t image 二,追求高级美学质感,还是得 banana 系列。

这是一个专门为 g p t image two 提供提示词的网站,每天认识一个神奇网站第三十四期,今天讲它里面的提示词非常全面,无论你是想做电商主图、创意海报,还是人像摄影, 在这里都能找到上百种场景。提示词复制就能直接用,关键是里面的内容实时更新,让你彻底告别不会写提示词的烦恼。还有多款主流模型可以随便用,就真的很良心了。

设计好像突然不需要设计师了?这几天 emoji 二正式上线,相信大家早就刷到过实测内容了,但我想说,把设计做的美观并不难,难的是将复杂信息通过图像传递出去。但现在, emoji 二把这事搞定了,不只是好看,而是精准完整, 甚至还多了点深层的理解能力。这本来该是件好事。设计师理想的工作状态,本该专注审美,深耕创意, 可现实是,多数时间我们只能被改稿、被妥协,被一些不专业的声音反复消耗。我们耗费多年沉淀,再做一些本不属于设计的工作。如今这类重复性工作终于被替代,可我们并没有预想中的轻松,反倒新生茫然与失落。 从手绘到电脑再到 ai, 一 路走来,我们慢慢让出创作主导权,现在连过程都不需要我们了。 设计如同我们亲手浇灌长大的孩子,从前需要反复打磨,逐处调整,可转眼之间, 他毅然成熟,蜕变能力甚至远超我们的预期。我们难免陷入沉思,真正放不下的是这份职业,还是当年为热爱全力以赴的自己。设计从未消亡,只是我们长期习惯的创作模式 正在逐步迭代退场,这很难接受,就像人不愿意长大,但还是要长大,你不想放手,但还是要放手。时代发展从不会停下脚步,更不会迁就任何人的情绪。 所以后来我接受了一件事,设计没有结束,只是轮到我们换一种方式参与罢了。屏幕前的设计师们,面对 ai 时代的到来,你又是怎样的心情呢?

我发现了一个 imagine two 和这个地边的一个小妙招啊,是这样的,你看这是我前两天做的一张图,呃,虽然说效果是很一般,算半成品的,半成品因为我摆了, 然后你也能看到,就是比如说这边的石头有点莫名其妙,然后我想试着去优化,但是我当时没有什么头头绪,然后直到就是说我直接让 e m g two, 就是 我随便说了点题,就说你尽可能帮我去优化一下大致这个意思, 然后我觉得这个优化的方向是可以的。虽然说这张图吧看上去确实有点一眼 ai, 而且这个油画感很重,就是 e m g two 的 一个通病, 但是他就是优化完之后这个图给的这个效果就是有参考度。你知道吗?就说我这张图可以按照他给的这个效果啊去进行一个优化,这个我觉得是没有问题的。你看比如说他这个地方,他 这个地方告诉你,哎,你这边可以加个类似于风车的东西,而这个地方你可以加一个类似于烟囱的东西,然后这些地方的一些丰富度的摆件是没问题的。当然这些地方他就有些什么 ai 的 这个不明所然的重复度,然后像这些地方他这个地方就改的很合理,像这个地方石头是怎么堆砌的, 这个就是我觉得有帮助的一个点。对于我就是说再去优化场景是一个有帮助的, 就是 ai 他 缝的尸块多,所以他能缝到一些,就是可能一些大神那些原话给你,然后我觉得就算是一个很不错的思路,然后像比如说,呃, 这个山以及这个雾,这个山的这种延伸,然后这个森林的额外的一些地方,然后这些雾的一些怎么说?他的一些呃,摆放 我觉得都可以的,我觉得都挺不错的。然后特别像这些草地里面可以放一些碎石,我觉得也很合理,是我没有考虑到的事情, 我觉得优化做的相当可以。呃,其他的我也跳不出来,就是张图肯定是 ai, ai, 但是能给到的优化点也很多。然后我再看啊,我再看一下这个还有哪些值得我可以学习到的点哦, 因为我这张图反复扒了几遍,但是他有一个点就是这种反光的东西感觉做的有点 怪,说不上,我感觉我原图这个反光就是很合理的,但他这加上去之后感觉就有点水渍有点多,然后感觉反光有点怪,然后特别是这一块变成小一块,我不知道他是理解成这个地方是坏掉了还是什么,这个是 ai 的 一点问题, 然后这个也是有一点点的资源重复率,说是他看这个场景里的重复率有点高,说实话, 但这个都可以靠提示词修改。就你跟他讲一句,我不希望出现太多重复率比较高的东西,那他也肯定会改。然后这个地方有点不明所以然, 但是这个水的处理做的真的挺牛逼。说实话我这个是扒的一个工程里面的那个水的材质,但他这个水很明显做的比我这个更牛逼,可以考虑往这个地方优化一下。 所以总的来说,他这些给的优化图的一些效果是完全可以就是搬过来然后套进去。只能说 ai 这个确实作为工具辅助确实牛逼, 就是给你相当于灵感参考,知道吗?就是优化思路的一个参考,但是肯定是不能作为直接的这个一个 成品。你像我这边一堆乱石资产又重复,然后他这边,哎,这个 稍微给他扩了一下,然后这边是平立,这旁边几块碎石,我觉得这个可以,好吧?可以,或许可以再把这几个石头去掉,也可以,我觉得都是一个不错的优化思路,然后包括这边 也帮我进行了一个优化。这个草地可以,是否是在摆的更合理一点啊?我觉得都挺好的,牛逼,我觉得应该挺牛逼的,这张图优化的不错好吗?我觉得这个可以作为一个思路,可以作为一个地边的思路。 就是没时间去问大佬,可以找 ai, 而且时间也快,基本上你一天也做不了多少张图,让 ai 给你随便做几张,而且一天有差不多三到四张图的额度,我觉得 我觉得给你做两张图做参考,嗯,或者再给一张图做风格画,我觉得都是不错的。好吧,这个是我一点点的见解哦。

我打算做点狠东西出来,大家先看一下效果啊。 哎,朋友们,我又郁闷了。 这期视频原本要教大家部署一个能一定程度平替 nano banana 的 本地纹身涂抹, 结果你看,不是 gbt emoji 二出了,那强的有点太离谱了。所以呢,我打算做点狠东西出来。这是百度飞讲最新刚刚发布的 ernie emoji 纹身图模型,它是一个八 b 的 尺寸,二十四 g 显存就能跑的很好了, 四零六零 ti 十六 g 也可以跑量化版本。不过你想想,本地模型就算再强,它也很难做到一次出图 one shot 就 能直接达到海外模型的效果。但是如果有一个机制,我们稍微花一点本地的算力和时间, 就能让我们的升图结果无限地逼近海外模型。如果有这个方案呢?你觉得怎么样?通过了几天的尝试啊,我实现了一套升图的 harness, 也就是说用一套 skill, 让 ai agent 把生图当做成一个研究的过程,当做是一个 research, 让它自己去探索提示词, 最终实现让国产模型可以跑出 b g nano banana 模型的效果。所以呢,这期视频我不光会分享我的方法是什么,而且我还会讲我是如何找到这个方法的, 而且本次所有的内容都已经开源在了我的 o p c 仓库里头,大家可以在 github 的 这个地方去找到你,把它交给你的 ai agent, 比如说 cloud code, open curl, 它稍微改一下就能跑起来,但是前提是你必须得部署好 comfui。 我 提前声明啊,本期是一个方法论的教程, 这个方案还在不断的调优中,等我优化到最好,而且大家如果感兴趣的话,我到时候再出一个喂饭级的教程。 好了,咱们从头开始讲这个故事吧。我最近不是一直在探索 ai 生图吗?前几天百度飞讲就发布了这个 early image 这个模型文生图的模型,哎,我看了官方的 demo, 哇,真的是太惊艳了,那个中文文字的渲染,还有那个海报的质量,让人看了超级的兴奋。 于是啊,我就去找了一些提日词去测试,虽然和 nano banana 对 比一下还是有差距的,但质量真的已经超级好了。 我为了真实地感受到它的进步,我在 image jason 这个网站上找了一堆的提示词,并且我做了一个测试集,让它跑了八个小时,同时对比了 z image 和千万 image 二五幺二版本。 可以十分确定的是,这是目前开源纹身图模型的 top。 但是呢,当我开始稍微加大一点测试,比如说我用了一些小某书上 比较流行那种 nano banana 的 文字排版图,同样的提示词它就完全不行了。我就蒙了,为什么 imagine jason 上的都可以呢?直到我发现官方给的这个 工作流上有一个提示词强化的节点,我就去稍微扒了一下官方给的这个代码仓库,哎,我才明白了,它所谓的提示词强化, 实际是把普通你输入的提示词强化成了一种 json 格式。这时我才明白 imagine json 这个网站,它为什么叫 imagine json, 因为它所有的 prompt 都是 json 格式的。我是个文生图的小白,我到今天我才知道, 原来有一个结构化的 json 能对这个生图的流程产生如此巨大的提升了,所以我就明白了一件事, g p t imagine two 或者是 nano banana, 它们首先是一个强大的大语言模型,其次才是在这之上衍生出来的升图的能力。而 early imagine 它只有八 b 的 规模,你想想,八 b 连一个大语言模型它都达不到可用的程度, 更别说升图时候理解你这个文字的之间的逻辑了,这是完全不可能的事情。所以问题不是 early imagine 不 行,而是我们根本就不应该用这种简单的提示词去考验它。 但是如果我给他的不是一句话,而是一份详细的指令,精确到构图、光照、色彩、背景、图像上的逻辑,每个维度我都控制死,那就能把它的图像能力完全的发挥出来。 但有个问题啊,就是如果我手动去调提示词,一个一个的去试,那效率就太低了。于是我就想起了 capacity 不是 分享过一个叫 auto research 的 一个 harness 吗? 它的那个原理大概就是它在做模型研究的时候,它做了一套 harness, 让 ai agent 自己去跑各种参数的组合,通过不断的测试来发现哪个组合是最佳的,那生图这件事是不是也是一个基于提示词的一个探索呢?于是我就做了几件事。第一,我把生图的 ai agent 词给我划了。首先我把 com 的 节点 api 导出,为了 jason 背给 colloud code, 就 把它做成了技能,集成到了我的 opc cli 里头。 这样 ai agent 呢,用 o p c image 这样一个命令就可以调用 copy ui 的 服务器来生成图片。我给 cli 集成了 ernie image, 千万 image、 z image 三个模型的升图。 第二件事,我让 image 命令默认使用了 json 格式。也就是说,如果 ai agent 呢,使用了文本提示词来升图的时候,它就会报错,并且它会在报错的信息里提示 ai agent 呢,你应该用 json, 这样我就可以确保每一个 a i a 阵都会努力去构思一个基于 json 格式的有结构化的体式词。我发现做到这一步的时候已经很有效果了, ai 已经学会了不断地去改变 json 的 结构来改变生图的效果。 你要知道,这不是一个编辑模型,但是 ai 通过更改 jason 的 结构化提示词,它已经能做到很强的编辑效果了。我不得不夸一下这个 ernie, 以麦芝对 jason 对 指令的遵循,真的是超级强大。那第三件事呢? 做到这一步的时候,我发现一个问题啊,就是我还是懒,我自己指挥还是有点太累了。比如说,我说图不够亮,他能给我调亮,我说这个 z r 了,他给我调正了,但是啊,我得一直盯着,我得一直提意见呀,就很烦。你们有没有那种感觉,就是你明明有个助手了,但是这个助手就是 你得手把手的去教他,累的其实还是你自己。所以我又做了两个命令,一个叫 describe, 一个叫 compare。 而且我给 c l i 接了一个本地部署的多模态 模型,千万三点五一百二十二 b, 这个模型是一个可以看图的模型,让它作为裁判。有了它啊, ai 好 像就突然长了两只眼睛,一只是可以逆向的眼睛,就是说我可以给他一张图, 他来反推提示词,另一只是自我批评的眼睛。他可以用这个生成的结果去和原图做对比,找出自己的不足,然后再不断的调整这个 jason 的 提示词。你们能想象这个场景吗?就是 ai 生成了一张图,它 看了一眼,觉得不满意,哎,构图偏了,文字太暗,背景太杂。然后他自己改提示词,再生成,再对比,再改。这三件事做完之后,我已经实现了可以完整的复刻小某书上那种特别流行的文字图文混编排版的那种图了。 当然,如果文字过多的话,可能还是会出现乱吧,但是没关系,你多抽几次卡不就得了。当然了,这还没完,我想明白了一件事,就拿做文案图这件事来说吧,一种流行的格式,大家是不是很快就看腻了?但是如果我有一个机制,能不断地发现更好的艺术效果呢? 更好的风格呢?如果我能把卡帕西的那一套 auto reset 应用在寻找风格上,那岂不是很爽?所以我就做了第四件事。我给 ai 做了一个记忆,严格来说是一个知识图谱。我先找了一些优秀的提示词,我让 ai 把它们分成了知识图谱中的实体。 这样 ai 每次生成的时候,它可以先查一遍图谱,看看都有哪些实体,然后这样它不就有灵感了?然后它再基于这些灵感进行发散, ai 就 有了从不同维度来排列组合的能力。用了这个方法啊,我发现 ai 很 快地学会了抽卡, 而且它的抽卡的风格变化还蛮快的。只不过它的这种尝试都比较天马行空,真的要找到让人类审美满意的,还是需要一些时间的,但我相信随着 ai 学会的模板越多,以及对这个图谱的流程的优化, 它的衍生能力会越来越强。那到这里啊,我说的这些都是针对 ernie mag 这个模型在做优化。我相信很多朋友在创业,尤其是一人公司,都一定需要宣传,需要文案,需要排版, 产品图啊,文案图啊,封面啊什么的。但是不同的模型,到底谁更擅长什么呢?这其实是没有一个直观的认识的。我们不应该新模型一出来,就那些旧模型就都变成牛夫人了,而是应该知道谁更擅长什么。于是啊,我又在这个 o p c c l i 的 dashboard 里增加了一项功能, 你可以把常用的 prompt 加入一个测试集,然后 ai 呢,会运行一个评估测试,分别用不同的模型去跑这些体式词, 最终它会展示在网页上,就可以很直观地看到每个模型的优劣势。比如说,大家看到的这个画面,其实是我从 image json 上找了八十多个提示词,然后分别对 any image、 千万 image z image 做了一个横屏。这样通过这个列表,我就可以一目了然地知道哪个模型更擅长什么, 哪个模型什么事绝对不能碰。未来有了新模型,用这个测试级一跑到底,它强不强,一试就知道,毕竟我们想要无限地逼进 banana。 banana 不是 说要找到一个最强的模型,而应该在所有能用的模型里找出各有所长的点。如果大家看过我之前的视频, 我不是提出过要把多种多模态模型组成能力的 combo 组成基于模型的 harness, 让它们来做裁判,来参与一个生产的循环。 那今天的这一套可以说是一个很好的例子了。如果有了一套生图的 harness, 我 发现使用 comfui 的 场景也发生了一些变化。 以前我们还是要通过工作流不断地抽卡,现在变成了完全自动流程,而且是完全基于 ai 的 智能判断的。更重要的是,它让生图这件原本很繁琐的事, 变成了可记忆、可自我迭代、可精确控制、可长时间运行的事。而且还有件事就是这个 early image, 据称啊,它月底还要出一个编辑模型, 我知道大家都在等 z image 的 编辑模型,一直没等到对不对?然后千万 image 现在不是也慢慢转向闭源了吗?你想这个 early image 本身它指令遵循就这么强,它在支持了编辑, 那这个 harness 能玩的场景就越来越多了,想象空间是不是越来越大了?我到时候肯定还要基于这一套 harness 再扩展出来一些新的玩法, 还要做一些更狠的功能。所以一个自驱动的美学研究生成器,能不断逼进更好的模型,从模仿到创造,从工具到研究者,这是我从一个实际的痛点探索出的一个方向。今天这个故事也是真实,就是我平时解决一个痛点的一个思考的流程。 我希望大家不仅学会了怎么样用这套 harness, 更重要的是我解决这个问题的流程能够启发到大家去解决别的问题。如果大家感兴趣,也可以在评论区里多讨论讨论,后续等我优化好了,我再出一个完整版的喂饭教程。 那最后如果你对这个方向感兴趣,关注我的艺人公司系列的后续更新。好了,以上就是本期的全部内容,谢谢大家。

昨天, openai 发布了 gpt 一 枚指头,这可能是 ai 深途领域今年最重磅的一次更新。先说核心变化,这次不是达利的迭代版本,而是一个全新的架构,从扩散模型转向自回归模型。 听起来有点技术,但效果很直观,生成速度比上一代快了四到六倍,而且首次支持批量生成多张风格完全一致的图像。 但最重要的突破,我认为只有一个文字准确率。之前 ai 画的图,但凡有中文,十有八九十乱码, g p t 一 枚指头把这个问题基本解决了,文字准确率达到百分之九十九,中文、日文、韩文都能精准渲染。店铺招牌、名片、海报这些以前 ai 完全做不了的场景, 现在可以直接用,而且不只是能写字,是写对字。在图像深层领域,最权威的一枚指头以一千五百一十二分登顶,领先第二名两百四十二分, 这是一个碾压级的差距。那价格呢?通过 a p i 调用低质量档位,折合人民币不到五分钱一张,高质量档位大概一点五元,可以说是非常便宜了。最后说说对国内市场的影响,中国有全球最大的移动互联网生态海报配图、电商图, 需求海量,但 ai 深图一直有个硬伤,中文写不好。这次 g p t 一 枚指头算是彻底翻篇了,大量基础设计工作被替代,设计师的门槛会进一步提高,但效率也会大幅提升。 当然,工具越强大,造价的风险也越大,这就需要监管和平台跟上节奏了。总之, g p t 一 枚指头不是一个功能升级,是一个时代的切换。

就在前几天,拆 gbt 刚刚更新了它的隐秘者二点零的图像生成模型,这一次应该也是拆 gbt 第一次模型更新之后,在它的官网当中没有放上太多的文字版的介绍,而更多的还都是这种 向生成的结果案例作为展示了,应该也是直接想让用户直接能够感受到他的这一次模型有多么强大。这一次我通过大量的案例测试下来之后,发现主要有两点还是比较突出的。首先第一点,对于真实性,回头可以看一下这张图片,这张图片是以 v 二点零 生成的一个 mac 电脑的桌面的版本,首先是它的应用图标已经很完整了,其次就是它的不管是缩多小的这种状态栏文字,包括还有它的图标样式,几乎是没有任何的错误,还有就是桌面的这种界面样式几乎是没有任何问题的。 第二点,关于文字的生成的能力真的是提高了太高的一个 level 了,不管是中文、韩语还是日语,以及这种泰泰文,泰国的语言,还有像印度的语言当中的五十三种语言的文字形式,基本上都是可以直接生成的,质量是非常好, 但是我在测试了大量打理之后发现其实还会有稍微的一点点小小的弊端,他在生成的过程当中还是需要我们给到对应的一些准确的描述,不能太过于的自然语言,或者说不能太过于的简单了,还是要描述的相对于准确一些, 它在生成的质量或者说遵循我们用户的指令的过程当中,还可以给到我们更好更高的一些结果,给各位同学展示一个案例,我这里边做了一个 p r d 文档,给到 j b d 之后让它先进行提取,提取完成我会给到对应的一些指向性的这种要生成的界面 以及对应的尺寸。那么他给到我返回的结果,比如说这里边生成的是一个蓄势界面,并且指向了用户是十岁左右的儿童,尺寸是 iphone 十七,他就可以直接帮助我生成这样的一个 样式以及界面,所有同学可以看一下,我稍微放大一点,这里边不管多小的中文的文字图标样式以及排布样式,包括里面的插画样式,合情合理,没有任何太大的一些问题。 但是这里边我明我说的是 iphone 十七的尺寸,他可能也把这个 iphone 十七的手机壳给理解到,其实也给生成了一个手机壳,那这个时候我其实就直接要求他给到我一个界面就 ok 了,他就把手机壳给去掉了, 没有任何的这种差异性。再来往下看,就生成同样的界面,同样的尺寸, ok, 没有任何问题。当我在想让它生成一个 样式的时候,或者说生成一个对应图片对应界面的作品级包装的时候,其实还是出现了一些奇异的,本身应该是这个界面,它是一个 iphone 十七的尺寸,在作品级包装当中应该也是一个 iphone 十七的尺寸的样式,但是还是会有一些被拉宽了,这个还是没有办法理解的,到后来反复的进行修改,在这个过程当中还是他理解到了应该是整个作品集的样式是一个十六比九的样式,但是必须要把所有的尺寸全部都明确的给他提到了 他才可能,比如说作品集应该是十六比九里面的界面, u i 界面,他才能可以理解的很准确,最后反复的跟他推销之后, 基本上就可以得到这样的一个结果了,一个完整的作品级包装样式,一个页面还是反复的进行推敲,但是经过的轮数其实差不多,我们在原本的 ai 模型当中,包括 image, 就 gpt, image 还是现在的极梦图像里边, 其实我们不管是跟他的想拿到一个最终结果,至少要经过在七到八轮或者十轮级以上,我们才能拿到一个结果。而现在我们大部分其实是两到三轮之间,基本上就可以拿到一个最终完美的结果,而且几乎是不用太做任何的修改。各位同学可以看一下这里边不管是多么小的文字是吧? 其实都是可以直接生成的,比如说这种陨石来袭,什么危机出现,稍微会有点小瑕疵,但是其实已经能够达到了百分之,我所认为的是已经可以拿来直接去应用和使用的了,可能需要我们作为修改的过程,修改的体量或者修改的位置其实并没有那么太多了, 而且会把里边的所有的文案也帮助我们直接进行生成了。玩家在冒险旅程当中可以选择一位 ai 伙伴同行,也是合情合理的存在的。 ok, 这个其实就是我给各位同学去感受以及落地的一些案例,相信各位同学应该也在网上看到了大量的一些其他的博主也好,或者说 新闻媒体上去传导传递出来的一些案例和效果了,其实是有一个非常大的明显的提升的,就是文字这一块 已经把图像生成领域的模型能力已经最后一块拼图基本上已经给补齐了,所以也推荐各位同学赶紧去试一试。 ok, 这期视频就到这了,下期视频再见。

真的不用再下载 ps 了,最近 gpt image 二功能大升级,一个视频教会你怎么用一张产品图搞定全套商品图。这个网站已经接入了 image 二大模型,现在连提示词都不用,直接给你生成。选择平台,输入商品名称语言,导入图片,点击一键生成。 这个软件内置了四百九十五万个提示词脚本,再加入 image 二的超级大模型,生成商品图的效果也得到了质的飞跃,而且它还能申诉,要是货不对版,直接退回积分,真是太方便了!