今天说一下 cadence 二搭配 image 二控图林秋卡的一个演示案例,希望可以给你的视频制作提供一个新思路。完整样片请看上一条运镜教学视频。 这里胶带场景的画面因为涉及后续爆炸,所以需要锁一下以保持场景一致。如果场景胶带只会出现一次,也可以选择不做参考图,直接生成。另外,这里使用了 image 二生成,有强大的联网参考能力, 有一些具体的地点或人物可以直接描述,比如纽约街头的一家酒吧。 fbi 为了保持场景一致性,直接从前一个男主喝酒画面截取竞争作为这个镜头的参考图。 agent mr wu your company's actions are a threat to national security you're coming with me for questioning you're on our turf now we have the upper hand in every way i suggest you get very clear about where you stand。 从这个镜头开始的五个正反打镜头都带画面参考,截取之前已经生成正确的人物闭嘴画面作为分镜头参考图。 you have no standing to negotiate with me from a position of strength i know my rights and your boundaries so there's nothing left to discuss chinese people don't buy that all right then。 生成到,这里出现了之前没有的画面。我们选取之前两人的全景画面,高清处理之后导出镜帧,用一米尺二改变人物动作,然后作为画面参考,生成这个镜头。 guess we're done here。 这里再次出现特殊视角,不存在于之前的任何关联画面中。使用一麦之二反退画面生成特殊视角,供狙击镜头参考。 这里要生成一张手枪对着男主的画面,用伊妹杰二参考左上图片,生成类似左下构图的图片,手枪作为焦点外前景出现在新的图片左侧位置。 so they sent an enhanced individual after me i assume they're aware, i'm the same。 这个镜头主要要考虑的是爆炸效果和提示词,在伊妹杰二或 nano 里精准控制爆炸位置和效果。 这里说个题外话,要营造一种氛围,可以不要在一开始就出现主角的全身画面,从局部到整体搭配光影构图和配乐也是一种思路。 no, no, no the tables have turned。 总的来说,截图加改图可以解决百分之九十后续视频一致性问题。你给的每个镜头的参考图本质上就是这个镜头的分镜图。所以只要提示词正确,基本不需要抽卡图片化,不使用 tptno 下课。
粉丝7006获赞4.1万

token 是 如何被计算出来的?之前呢,我们用了五期视频全面讲解了 token 到底是什么,全网呢有一百万播放,感谢大家的催更。这次呢,我们继续出发探讨 token 到底是如何被算出来的,最后的结果一定会让你发出原来如此的惊叹。 在模型推理阶段呢,完整流程一共分为七步。第一步呢,用户输入提示词,比如我们输入用苹果手机拍苹果这句话。第二步呢,模型将这些提示词切分成一个个托管,并得到每个托管的数字 id, 切分的依据呢,就是这个文件中的词表。 第三步,模型根据这节 token id, 从词切入矩阵中取出对应的词切入向量。比如手机的 token id 是 八五四九,对应的切入向量是这样的,苹果也是这样的。一大堆数字,为了方便演示呢,我们只取前四个数字作为演示势例。 到这里,一句话就被转为了多个数字向量。熟悉限限待数的朋友可能已经意识到,我们可以用一个矩阵来表示这句话,模型呢,也可以通过矩阵运算实现并行计算。第四步呢,模行为每个 token 呢添加位置编码,标记它们的先后顺序,否则模型无法区分你爱我还是我爱你。 位置编码的公式呢,不同模型会略有差异,具体公式呢,这次我们就不展开了,实际的效果就是在没有添加位置编码的时候,这两个不同位置的苹果向量都是一样的。添加了位置编码后呢,两个苹果的向量就变得不一样了,这样模型就能区分不同位置的 token。 第五步,模型读取这些添加了位置编码的向量,通过多层 transform 计算,最终得到了一个理想的预期向量。具体的算法细节呢,可以查看我之前发的 transform 模型讲解视频。 第六步模型呢,将这个理想向量与词表中所有的拓客向量进行比对,计算它们之间的相似度。 这就好比相亲亲友智囊团先定义出理想型男友的标准,身高一八零,有房有车、大城市户口等等,但实际情况是,没有人能百分之百符合这个条件。模型呢,就拿这个标准作为打分依据,对每个后选男嘉宾呢进行打分,也就是计算相似度。 第七步模型,根据计算出来的相似度,取出其中一个后选托肯作为模型。本次的输出 分越高,被选中的概率呢就越大,得分越低呢,选中的概率就越低。这也就是之前说的模型输出具有一定的随机性,不同时间问同样的问题,回答可能会不同。比如这个例子中,候选词照片十逗号,得分相对比较高,都有可能被选到。 最后,模型把选中的 token 拼接到已有的输入中,重复第三步到第七步,一个接一个的输出后续内容,直到模型输出结束符,这才停止输出,结束整个回答。所以你看,模型不是凭空生成内容,而是在做选择题,而每一次的落笔都是一次十万分之一的遇见。

好,那么盘点一下,现在市面上一共可以用到 gpt 一 米尺 two 的 五种渠道,那我先把渠道贴出来,有需要的可以截图。 那首先就是这个 gpt 的 官网,一定要点击这个新建的模式,然后再点击这个创建图片,那在 gpt 官网生成图片还有个使用小技巧,就是我们生成完一个比如说竖屏的图片,我们可以点击这个编辑,它在里面还有个根据当前的版式在二次排版的一个功能,可以看一下,这张图片就是根据上面这个竖版 生成而来的。那第二种方法就是 gbt 的 这个 codex, codex 是 gbt 他 们家的推出的 agent 也是集成了这个 image two 的 深图模型。那这个第三种方法就是这个 lm arena 就是 一个大模型的竞技场,那我们在这个 battle model 这里切换为 direct, 然后在这个图片这边选择 gbt, 那 就可以选到这个 image two 的 模型了,也是可以正常的输出到图片,而且这个是免订阅的一个方法,那当然了这个 gbt 的 话也是自带一些免费的额度。 第四种和第五种方法就是国内的一些网站,那这个叫 type nord 的 这个网站的话也是有一些免费的额度,那还有这个 fla 的 网站的话,也是有在图片这里,那体验这个最新的 ai 科技已早不宜迟,赶紧去试试吧。

一条视频带你八遍最强 ai 生图模型, gbt emoji 二的使用方法!最后一个是重点,建议三连,免得要用的时候找不到。第一个官方渠道,亲爱的, gbt 网页端登录就能体验免费,用户每天有三到五张的生图权限。 第二个, arina 人工智能评估平台,内置多种生图大模型,每天可以调用 emoji 二生图五张左右。第三个, create vision ai 聚合平台,内置多种生成模型, emoji 二、 nasa 二 c dream 等等,每日登录的八十积分可以升四张图。第四个, lab 二,这个平台想必大家都很熟悉了,同样每日登录有八十积分,可以使用 emoji 二模型生成两到三张图,可以和第三个平台换着号。第五个, high ipi 注册即得一刀的余额。 emoji 二生图约三分,一张划下来可以升三十多张图,四舍五入就是无限额度,免费用。 最后一个最重磅的来了, mine video, 同样是 ai 声图聚合式平台,接入了多种声图和视频大模型,最 重要的是,它最新接入的 emoji 二可以免费使用,你没听错,登录就能用,并且生活质量和官网几乎一致,不一定什么时候就恢复原价了,趁现在赶快去试试吧!有了工具怎么能没有提示词?我这里有一份超全的提示词文档,包含多种大模型的关键词逻辑,直接复制就能用。想要的评论区留言。

没想到刚出来没多久的 emoji 模型,我就找到完全免费用的地方了,我用它生成了最近很火的马斯克直播,当然它还可以生成, 就连这张图都是 emoji 生成出来的,有图有真相的时代彻底结束。而以上这些图你都会做,因为有人把这个模型研究透了,把全网热门图片的神级提示词直接做成开源项目,人像 海报、角色设计、用户界面等等,成千上万个案例,内容全面到我不敢置信!直接复制提示词粘贴进来,免费做几分钟就可以出土,两个项目无缝链接配合,真的非常强大。

一分钟教你学会套用提示词模板替换产品图场景!跨境电商卖家最大的痛点是什么?同样一款产品在美国站点能够卖爆,原封不动的放到其他国家却不行,那是因为你的产品水土不服。今天我 将整理的万能提示词模板分享出来,让同一产品一分钟内无缝穿越不同目标市场,流程极其硬核,马上点赞、收藏、评论获取模板做本土化的大忌就是每次都重新升图,导致产品长的都不一样。 听好我们的,第一步,进行视觉底图的生成。这一部分有三个核心框架,基础设定、环境营造、摄影与后期。其中我们需要做的是将变量 d、 变量 h、 变量 i 进行修改,场景光用布局以及整体风格是我们需要进行不同国家修改的主要部分。 那么我们以咖啡机作为例子,将我们的其他固定变量确定。接下来针对我们刚刚提到的变量台面变量 h、 光影变量 i 分 为与背景 进行变量内容的替换就可以,这样就保证了不管背景怎么换,产品永远一致。假设打北美市场场景厨房中岛 光影、自然窗户光风格,现代开放式美国家庭美学。假设打日本市场,场景厨房台面光影柔和橙光与商业轮廓光风格极简日式美学。同样我们将这套方法应用到中东国家和巴西国家,我们就可以得到针对不同国家制作的场景图。 那么接下来第二步是进行文案的加入,在模板中细心的话你可以发现右上角留白部分,这一部分就是用来进行文案的填充,同样我整理了关于文案填充的提示词模板,包含主标题、产品核心、辅助说明、排版与字体, 这样就能保证我们的图文咬合,确保卖点直击人心,不破坏画面的美感。这里我们就简单以北美国家为例,将我们的文案在留白处添加,同时确保我们的字体排版颜色,这样我们生成出来的图片会严格按照我们的要求在右侧留白部分进行文案的添加。 这套模板的核心是对框架里面的变量进行修饰,针对我们的不同产品进行填充,而框架里面的变量并没有固定的,我们可以根据不同的情形进行套用。本期视频到这,如果想套用其他的产品,可以在评论区评论。

呦呦呦呦,又是新王陈然,模型的能力肯定是随着时间而不断进步的,但是 g p d emoji 二真的有这么强吗? 作为制作 ai 动漫的博主,我今天来做一下对比测试。在这个视频中,我们会详细的说明这个模型的优点以及缺点,同时呢,增加香蕉以及 midori 的 一些横向对比, 来看看他的出现对我们的制作会有什么影响,同时呢,对其他的一些领域又会有什么帮助呢?在测试之前,我想先说每一个模型呢,他都会有自己擅长以及不擅长的部分,并不是说一个模型在一个场景下不行,我们就要彻底的全盘否定,而是什么呢? 根据你使用场景去找到最适配你的模型,这个才是最好的方式。 ok, 经过我几天的详细测试呢,我们先来说一下一米九二的五个优质特点。第一个,超强的指令遵循能力, 我们看到这张图,他是我用了香蕉 pro 转了二十次,无论如何调整他都无法让我满意。不过呢,一米九二一次他就让我成功了,老头在一米九二的操作下,第一次转过身去,他真的不哭死, 这个就是源自于超强对提示词的遵循能力啊,在这个点上,我认为它是远远的超过了香蕉的。第二个呢,在深图模型中,拥有断档的推理能力, 比如说这个,我们先生成一个咖啡厅,然后做他的反视角,还记得我们以前怎么做反视角的吗?告诉他画面中存在的内容,以及机位跟场景的关系。同时呢,怎么样对参考图进行元素的抓取。但是一米九二呢,我们只要给他这张图,然后我们再告诉他反视角,咖啡店内部场景, 摄像头在参考图门框位置向内打,他一次性的就给我们生成了咖啡厅的反视角。这是我在直播的时候测试的,我记得当时看到这张图片,我音量都不由自主的拉高了,因为这个 ai 真的 会推理 这张图,在原图的参考图位置上,左右前后内容的调度完全正确,经常做反视角的同学就知道这个生成多么有含金量了, 我们看一下在推理能力上是不是像一个小丑呢 啊?当然我后面也做了两次其他的测试,并不能百分百一次就出,最好的建议还是你适当的增加一些描述以及空间关系的介绍, 这样的话准确率就会提高很多了。但是我们从这个案例就能看到,他的推理能力是断崖的领先。第三个优质特质就是细节控, 我们看这张图,是不是感觉整体的画面密度非常高啊?实际上我们再把重心移到画框的左侧,每一株植物都被他细心的描绘了。在二 d 的 动画场景中,其实这种场景是非常少见的, 由于注意力机制的影响,为了保证主体的质量而会牺牲一些画框边缘以及一些背景的细节,但是这个模型恰恰感觉反其道而行之了,他把细节和主体一样,同样认真的去描绘,所以他整体的细节度非常非常的高。 我们来看一下正常的绘画中图片应该会怎么样呢?没错,就会像这张图一样,用色块以及少量的线条去做一些简化,让你知道这里是一些花花草草就行了 啊,但是他没有,他在深图的时候就会非常详细的去描写一些细节,说实话,这个细节控的程度啊,都让我怀疑这个模型的注意力机制是不是有问题了啊,简直夸张到爆啊,我没见过这样的,真的牛逼!克拉斯 第四个优质特质呢,是超高的文字准确率啊,其实这个是最让我下巴惊掉的,我只给他了这样的一个提示词,然后他就帮我非常详细的出了整一张图片。 杭州超详细旅行图啊,左侧有一个行程总览,然后图片中心这边呢,是非常详细的一张地图啊,在画面的右侧,他有季节与穿搭建议,预算 在下方呢,有行程建议,交通指南以及 top 必吃榜。我们看到在 top 必吃榜里,甚至推荐了杭州名菜西湖醋鱼啊啊,推荐大家真的来吃一下。同时呢,我们可以看到交通指南这里啊, 它的每一个内容前呢,都会配一个小小的图标,这些图标并没有错误啊,步行真的是两个脚丫,骑行就是一辆自行车。我想一个设计师如果要做这样的一张图,他可能要花非常非常长的时间,但是我们用这样一个 ai 生成的图片,用这么一个简单的话语, 大概只花了几分钟就跑出来了这样一张详细的图片,而且错误率非常非常低。相比之下呢,我们来看一下香蕉 pro 给我们生成的图片,可以看到整体的文字数量是大大的低的,并且呢,画面的美感远远没有前一个画面来的有冲击力, 文字呢,有非常多的错误,而且信息细节是要少很多的,这个呢,我看没有任何一个模型可以接近啊,甚至望其向背,这个能力呢,真的非常非常的夸张。相比之下呢,这个香蕉仿佛拉了一坨大的, 以前我看这么香的香蕉,现在居然也看不上了,真的应承了那句话,大人,时代变了。除了这样的线路图呢,我又做了一张包彩的一张建筑的,大家可以看一下它的细节密度。当文字非常非常细的时候呢,终于发现了它的文字开始崩坏了, 但是呢,我依然觉得 ok, 他 牛逼,克拉斯多说不易啊,只能说做平面设计的同学有福了呀。第五个优秀特质呢,就是美感了,这里我们给到他这个提示词,我们看到他给我生成了这样一张图片啊,右边的艺术字底非常的好看,天光开辟新世界, 左边按照我的提示词要求写了你没看过的全新版本,是兄弟就来砍我。其他的这些字呢,是他自己配文的,整体的构图画面非常的好,也按照我的要求生成了一个天气之子的画风啊,瞬间完成又好看的海报,真的是没话说了,朋友们, 那么以上五个优秀特质就是我认为其他模型望其项背的地方了,当然,米德珍妮在美感上还是有一战之力的。其他的这些特质啊,像文字生成啊,米德珍妮属于拉中之拉了,我们就不多说了。那么抛开了五个特点呢,我们再来看一下三个我总结出来的细节优点。 第一个呢,是在写实领域,我觉得他还是非常能打的。这里呢,我们看到三张图片,同样是这个提示词生成的, 这一张是香蕉二,这一张是米德娟尼八点一,这一张是一米九二。三张图片呢,我觉得最好的是一米九二,因为这一张图片比较真实,香蕉二呢,感觉人物稍微有一丢丢的油啊。而同时呢,香蕉在做写实题材的时候,特别喜欢给我们画面中加很多的造点,总有这一股味道去不掉。 那么米德修尼呢,说实话,这个女生呢,真的美了我一脸啊,我在别的模型上很少看到能生成出长相这么有辨识度的女生啊,不过她完全没有遵照我的指令要求吧,我需要的是女生怒吼,这个女生也太温柔了吧,我们再看一组啊,这个是跳舞的女生,这张是一米九二生成的, 这一张呢,是香蕉二生成的啊,整个推理上稍微有一点问题啊。然后这一张呢,是米德基生成的,这里我把风格画拉高了一点啊,他的整一张照片的艺术感非常强,我们可以看到一米九二的写实功底还是很不错的。 第二个优点呢,是我认为他非常的适合做漫画,因为呢,做漫剧他的技能包要很多,而且呢,你投入的成本时间周期也会相对要大很多。 如果你有剧本,其实可以用一米九二来先做漫画,这个呢,也是一种低成本的验证啊。同时呢,漫画也可以作为未来你去做剧的一个分镜参考。 那由于做漫画的内容教程他也非常的复杂跟详细,如果呢,有比较多的同学需要这样的内容的话,回头我再出一期,如何用一米九二去做我们的 ai 漫画? 第三个优点呢,是我认为他可以很好的去做我们的分镜故事版。这里呢,我们给到这张参考图以及这样的提示词,这个分镜故事版中呢,有十二张分镜图,并且有角色的三十图,戏的重点,镜头语言,场景的设定以及一些道具啊, 那么这些信息呢,能帮助我们梳理,更好的去做剧。以上呢,就是我目前测试下来感觉一米九二的主要优点了,你是不是也觉得我要疯狂的捧一米九二了, 身徒心亡,天下无敌。 no no no no! 重新重复我之前的观点啊,每个模型他都有侧重的地方,有优点,那么也会有缺点吧,现在我们来看一下他存在的问题,其实呢,如果这些问题他不优化, 这个模型在很多的场景中我觉得是根本没有办法应用的。要做剧的朋友们注意了,我认为这个模型目前并不适合来帮我们做剧啊,尤其是做一些分镜的关键帧啊,你往下看了就知道为什么我这么说了, 有四个非常大的劣质特质。第一个最大的问题啊,我们现在能用到的一米九二呢,基本都是被加了版权限制的降质版本,这其实就衍生了很多的问题。 降质呢,他不是单纯的说把模型的智力从二百八降到了二百五这么简单,而是因为版权的限制导致以前提示词能准确抓到的内容,现在不能生成,他要绕过去给你生成一个另外的东西,尤其在画风上, 一米九二的降质呢,他就导致了很多的画风会自动的偏移,比如说我们刚才看到的这张图,我要的是夏木有人造的画风,结果呢,他给了我这样的画风,有人造的画风是这样的, 对吧?区别大吧? ok, 这就是降至绕版权的问题啊,为了保证测试的严谨性的,我们再拿它去跑一遍内容,可以发现这一次生成出来的内容又不一样,那这样呢?对,我们在做一些场景的二次生成啊,以及溶图的过程中,就会有很大的问题。第二个特质呢,是脏脏包 这个模型呢,它只要图深图,画面就会开始脏,有人说脏的原因是噪点,因为原来的深图模型,你只要大量的图深图,你就会发现它很糊,实际上就是噪点的问题。 但是呢,在一米九二这里,我觉得它是上色的问题啊,而且它这个问题比原有的深图模型要严重的多。原有的深图模型呢,可能跑个三到五次,它才会慢慢开始变糊,但是一米九二呢,它第二张图片,第三张图片就开始给你变得非常的脏了, 这个问题非常的大啊,大到了谁用 g p t 做内容,其实一眼就能看出来了,昨天我刷到了教授的视频,我刚在键盘上敲下了爷青回三个字,下一秒就被屏幕上的脏脏包给逗笑了,真的一眼一米九二。第三个劣质特质就是细节控了, 我刚刚不是说这是优质的特质吗?怎么又变劣质的了?是的,细节控呢,他是一个双刃剑啊,虽然对于细节的精细打磨和详细刻画,能增加画面的美感以及信息的丰富度,不过如果你想拿他做据,也很容易在不知不觉中陷入到被背景抢戏的地步 啊。由于他太细节了吗,导致主体的信息其实会被大量的截断,所以我觉得他很适合做插画,他并不适合拿来做据。 此外呢,还有一个小问题,就是如果你是图生图啊,我们不考虑脏脏包的前提下呢,你会发现他还会主动的给你去加一些细节,比如他会觉得你画面的饱和度不够高,会自动的给你加一些饱和度。同时呢,他会给我这个平图简化的人物自动的加细变复杂啊, 比如说他头上的细线阴影变得更小更密了啊。但是我做这个剧的时候呢,我并不想让他更小更密啊,这个就让他跟我的想法产生了一些相背,并不能准确的控制住这个,反而会增加我们的试错以及时间成本。 第四个大的劣质特质就是上色的问题,我们再回到上面看过的这张图,我们把图片放大一点,能不能看到在平图人物中给我们上了很多不规则的色差,比如说这边的红色, 以及右侧这个人物他又白又红的地方,同时这些阴影的边界也非常的不清晰,上次他就会影响人物的跳出,这个时候对蓄势以及画面逻辑又会产生很大的影响。那么说完了四个劣质特制,我们再来说一下几个细节的问题啊。 如果你想用这个模型做二 d 或三 d 动画的话,也请注意了,他的背景会偏写实,整个写实的权重非常高。左边这张图是香蕉 pro 生成的, 这张图的背景呢,就非常的手绘,但是我们看一米九二生成的整张图片就非常的偏写实,实际上我给他提出的要求呢,要非常详细的手绘感, 但是呢,整体的画面还是非常偏写实,除了二 d 呢,三 d 也有这个问题啊,我们看到这张图片中啊,整一个钢琴,简直跟实拍的一模一样,而让这个三 d 动画感呢,有一点出戏了,那接下来呢,还有一个细节控理解能力又拉满, 应该是细节高手啊,结果呢,他又反手给了我个出乎意料。我们先看看这个提示词下,香蕉 pro 他 是怎么生成的,可以看到香蕉整体的视觉真实度都非常不错,同时没有一个人脸是重复的,这里也能清晰的看到我前面所说的香蕉,非常喜欢在画面中加噪点, 那我们来看一下。一,秘诀二,在这张图片里呢,我们可以发现前面几个人物还是挺不错的,但是我们一旦放大一点往后看,你就会发现端倪了。 在这里呢,这两个人物,这两个人物都共用了一张脸,简直像是黏贴复制上去的。 同时呢,人物的眼睛非常容易笨,他说远距离人像的时候呢,眼睛就很容易变成这样,你感觉眼珠子都要超出眼眶了。 为了保证测试的严谨性呢,我又跑了一张。这一张的人脸呢,开始有大面积的崩坏了啊,有上色的问题,有人物形状的问题啊,但是最让我绷不住的是这个哥们啊,兄弟,你是不是走错片场了呀? ok, 所以 综上所述啊, 他有非常非常多的缺点,我们并不能认为他的某些能力特别强,就把他捧为了一代神图模型的新王了, 还是要结合它的应用场景以及优缺点来看总结一下呢。我认为 gpt emoji 二呢更像是单张精致图像的生产器,它很适合一些设计工作,比如说电商产品图,宣传海报,一些平面的设计稿。 新模型的出现固然是能推动整体行业的发展的,但是呢,大家也要辨真的来看待它的优缺点,掌握它的适用场景,来最大化的提升你的工作效率。那么我是栗子,这一期详细的测评就到这里,感谢你的观看。

gpt image 二的出图能力真的有点夸张,你现在看到的这些画面基本都是一句话生成,而且完成度已经是专业设计水平,很多朋友还不知道怎么用。其实现在很多创作平台已经可以一键调用,基本是无门槛体验。 比如打开这个自由创作画布,在出图时选择下方的智能图片。 v 二高质模型出来的效果就是 image 二电商场景中,只需要给一张产品图,通过简单对话就能直接生成整套详情页,基本等于一个小型设计团队。 办公场景下输入一段内容,它可以直接完成 ppt 的 结构排版和视觉层级,不满意的地方可以通过上方的编辑按钮对画面元素和文字进行修改。 做知识讲解时,复杂信息可以一键转成信息图,让表达更直观,同时还支持高清放大,方便直接商用。再比如知识卡片,给一个主题,可以一次性生成多张风格统一的内容,基本可以直接发布 广告。创意方面,上传产品图,加一句需求,它能直接输出完整的 t v c 分 镜,包括镜头感和光影氛围,可以直接用于生成广告视频。 文旅类应用中,一句话就能生成带标注的旅游地图,甚至还能输出完整的旅游攻略图,自动整理路线、预算和美食信息。 如果有文字不准确,也可以直接修改。你会发现 image 二已经不只是一个绘图工具,而是一个完整的视觉内容生产系统,从理解需求到结构设计再到最终输出,基本实现全流程覆盖。 当然这些也只是它能力的一小部分,更多玩法大家可以自己去探索,快去生成属于你的精彩画面吧!

为什么新一代图像模型终于能把海报标签和浣灯片里的文字写对?这期我们用两分钟拆解 gpt image 二的文字渲染逻辑。 这份解析以 open ai 官方 cookbook 帮助中心和官方驳刻为主要依据,同时参考技术,分析文章与中文技术,解读用来串起架构和使用层面的关键线索。 do 三这类扩散模型从造声开始逐步去造文字,在这里更像纹理和笔画图案,所以模型容易把字母画变形,或者出现拼写错误和笔画粘连。 g p t image 二的关键变化是把图像离散成 image token, 并和文本 token 放进同一个序列预测过程,它不是单纯画出像文字的形状,而是在生成图像时写出更有结构的字体序列。 更重要的是,图像生成被整合进统一的多模态表征空间。文字和图像不再是两段式流水线,而是在同一套 token 处理层里写作。这样拼写语法和多语言能力自然影响图像输出。 在 thinking 模式下,模型会先用推理 token 规划画面布局、对象、数量、标签、位置以及文字内容的逐字安排。先规划再落到像素,能减少生成到一半忘记结构的问题。 文字渲染还和 quality 参数强相关,低质量适合粗略画面,中等质量覆盖多数文字场景。而小字密集信息图、多字体排版和换灯片更应该选择 high。 实际使用时, prompt 要把需要渲染的文字放进引号,说明字体大小、颜色和位置,品牌名或少见拼写,最好逐字母写出,并明确要求不要增加多余字符。 一句话总结, g p t image 二的进步不只是画得更好,而是把文字、图像和推理放进同一个生成过程,它在 token 层面先理解和书写,再把结果解码成像素。

全网都在吹的 emoji 到底有多牛?看这些就知道了。我发现了一个在国内就可以直接使用的方法,看过来,打开这个 ai, 在 这里切换 gpd emoji 模型,输入提示时就可以直接开始了。比如生成商品模特图, 你看这效果你就说 ok 不 ok。 以前做一套商品图,找模特拍摄排版,改尺寸,来来回回几个小时起步, 现在一句话的事,最离谱的是,它不仅仅是只生成一张图片,主图、场景图、详情页,整套的商业视觉直接生成相关的提示词。我已经放评论区了,如果你也想效率,直接拉满,记得点赞收藏,别到时候找不到了。关注我,带你解锁更多 ai 使用玩法!

今天讲一下,嗯,这是我最近使用的两个网站吧,对吧?他们两个都能使用这个 gpt 界面的。二啊,首先第一个网站的话是,呃,这个网站是这个博主的,这个博主的,然后他他他好处什么?好处就是可以自己接入这个 api 啊, 就如果你有更便宜的 api 的 话,你就可以自己去接入到这里面,对吧?然后,嗯,他是无线货部的一个形式,是一个货部的形式 啊,反正我自己接的这个 api 的 话,它是六分钱,是四 k 的, 这可以选择分辨率可以最多。呃,上传可以是可以上传四张参考图, 然后这有尺寸也可以选,一 k 的 话是两分钱,二 k 的 话是四分钱,呃。四 k 的 话是六分钱。反正我接触的 api 是 这个价格,如果你们有更便宜的话,你可以在自己自己去网站里面,然后找到 api, 找到这个接口,然后去输入进去就好了。然后第二个网站的话是 这个网站,呃,这个网站的话是这个博主的,嗯。他他的一个好处是什么?他的好处呢?是,呃,可以上传很多个参考书的嘛。就你看,我上传了三十二张参考书, 刚刚那个只能上传四张团合照,但他缺点什么?他缺点就是价格有点贵啊。一积分一积分是多少?一毛钱?一毛钱一张,然后一 k 也是一毛钱一张,二 k 也是一毛钱一张,三 k 也是一毛,呃。四 k 也是一毛钱,没有三张。但这模型挺多的,可以选很多模型, g p t 啊,什么 g m l 啊,还有什么拉拉布拉蓝啊,什么都有,反正大家都是,就是按按需求去,去选一下吧,去选吧。 呃,但刚刚那网站的话,他是他可能会会失败的吗?会超时,如果人太多的话,他说 api 超时,但他也会算扣分的,也会算扣的,就超时了,他也会算扣的,扣扣六分钱。然后但这个的话,他超时他就不不扣积分的吧。 都各有各的好处吧,你们自己去选择吧。反正今天就推荐这两个网站。都是由这两个网站生成的 啊,谢谢。呃,你们的关注和点赞吧,就是希望你们能够生成出自己喜欢的图片,我们下次再见。

来了兄弟们, emoji 二零深图模型最近可谓是火出圈了,不少人用 emoji 二点零就能瞬间做出输出,光影构图与细节都拉满的高清大作, 就连零基础小白也能彻底告别手残。但是有很多人上手后才发现,随便打字生成的图不是脸崩就是细节糊成一片, 这其实不是模型不行,而是你提示词塞太多或者不够准确导致的,所以神图与废片之间往往只差一段标准提示词, 所以本期视频就手把手教大家使用 promptify 提示词生成插件。首先我先来看看效果,我们在网页端选择自己需要的图片,右键点击选择插件,然后我们就能看到有两种提示词模式,普通版和 json 版,这里我比较推荐 json 版, 因为它可以把光影、视角、镜头风格全解析出来,细节还原度能干到百分之九十九。然后我们点击使用后等待生成完成之后把生成的提示词添加,选择模型 gpt image two 零,即可获得一张超逼真的效果图。最后就是该如果使用这个插件,方法超级简单,首先我们打开浏览器,输入这个插件,方法超级简单,首先我们打开浏览器,输入到外面文件夹, 然后返回浏览器,点击扩展程序,点击管理扩展程序,点击开发者模式,选择加载未打包的扩展程序,将它解压,然后点击即可使用。好了,兄弟们赶紧去试试吧,还有什么问题可以打在评论区,我们下期见。

gbt image 二这一次升级有一个玩法我发现很少有人知道,就是你可以直接让它去生成分层的 psd 文件,就是说你在 ps 里面打开,每一个元素都单独是一层。 然后提示词我已经整理好了,关注我直接就可以拿到,我来带大家看一下是怎么做到的哈。首先呢,我让他正常去出一张海报啊,这里出了一张北京旅行的长城,天坛、故宫都有,元素还挺丰富的。 接下来我让他去把这个海报给拆开,每个元素就是单独的一个图层,位置不变,底色是白色, 他就这样给我拆好了,画布的大小都是一样的,位置跟原图也都对得上。最后呢,我让他把这些合成到一个 psd 文件里面去,去掉白底,每个元素单独保留图层,他会直接给我一个 psd 的 打包文件, 下载下来之后在 ps 里面打开,每一个元素数据都是单独的一层,白底变成了透明底。 不过要说一下,每一个图层出来的它是图片,它不是矢量的,也不是可以编辑的文字。所以如果你想要把天坛换成是其他建筑的话,那就建议直接删掉了这一层啊,换一张就可以, 它更适合的是你想要调整布局啊,替换某个元素,或者是对于单独某个图层加效果的话就会比较好。想想看以前一张海报,呃,你要做的话至少得会个 ps 吧,现在的话,你连这一步都省了。 三条提示词我已经放到首页了,关注我可以直接拿去用,我是张小乐,专门分享能够帮你赚钱的 ai 工具,关注我不会吃亏,拜拜。