我实测了 gpt image 二点零在电商的各种玩法,从电商图再到详情页、产品主图,还有产品创意海报,全场景我都实测了一遍,结果真的让我倒吸一口凉气。 稳坐 ai 深途神坛的 banana, 这次是真要被拉下神坛了。先给大家报个最硬核的成绩,在 ai 深途专业跑分榜上,当其他头部模型还在一千两百分上下贴身厮杀的时候, g p t 一 米九二点零直接甩开第二名 banana, 整整两百多分,不是小幅度迭代,是实打实的降维打击。 做过电商的都懂,之前用 ai 做一张合格的主图,得写几百字的提示词,但这次的英妹姐二点零,你只需要一句大白话。比如一个男生在户外拿着风扇帮我设计一个电影级海报,科技风格,他就能直接出一张九十分以上的成片,审美完全在线, 不用费劲调参数。还有英妹姐二点零的中文生成也稳到离谱。同样还是这个产品,我直接告诉他,帮我根据这个产品生成一张电商详情页,等待他的生成结果。我们来看一下,不仅文字零错误, 他还帮你把排版都设计好了。我还实测了产品投图,甚至产品海报,我感觉他的设计能力可以媲美专业的设计师了。 除此之外,哪怕是旅游规划图、产品设计图、深层产品说明书,我们都可以通过大白话告诉他,大大降低了 ai 深图的门槛。 ai 的 更新速度实在太恐怖了,我把所有提示词都整理成文档了,扣六六六!
粉丝8620获赞2.5万

如果你不知道 gpt html 在 国内怎么用,你直接打开这个网站,他接入了最新 html 大 模型,只需要一张产品图就能生成全套商品图,而且还能随意修改,想怎么改就怎么改,三步教会你只需要选择平台、商品名称、语言,点击一键生成 全套商品图,一分钟就做好了,效果不输大牌设计师。更离谱的是,它还能一键声速,货不对版直接退回积分,内置了最强视频模型 cds, 甚至能生成视频,太牛了!

是谁还没学会 emoji 二出故事版分镜图加 cds 二点零出视频,这个工作流直接来到这个位置,输入分镜本提示词,提示词模板里填写好你剧本情节需要的镜头内容,选择 gpt emad 二模型,生成一张十六比九的二 k 或四 k 画质的分镜图, 简单等待几十秒就可以出图。这个工作流最核心的就是 image 二,强大的文字生成能力可以保证描述精准。我们下载好图片,点击上传,简单写一句提示词,视频生成模型,选择满写的 c 的 sense 二点零图片参考一定要选多参考。 这次生成一个十二秒的横屏视频,看看效果,现在是十四点五十八分,看看生成一个视频要多久。视频生成完了,耗时八分钟,来看看效果。 可以看到 cds 二点零严格遵守了分镜本要求制作视频,但还是有点小瑕疵,比如这个画面的键太短了,这是由于 emoji 二一开始升图就有瑕疵导致的,只要在升图的时候多抽一两次检查,检查就能解决,比抽视频的卡成本低太多了。

呦呦呦呦,又是新王陈然,模型的能力肯定是随着时间而不断进步的,但是 g p d emoji 二真的有这么强吗? 作为制作 ai 动漫的博主,我今天来做一下对比测试。在这个视频中,我们会详细的说明这个模型的优点以及缺点,同时呢,增加香蕉以及 midori 的 一些横向对比, 来看看他的出现对我们的制作会有什么影响,同时呢,对其他的一些领域又会有什么帮助呢?在测试之前,我想先说每一个模型呢,他都会有自己擅长以及不擅长的部分,并不是说一个模型在一个场景下不行,我们就要彻底的全盘否定,而是什么呢? 根据你使用场景去找到最适配你的模型,这个才是最好的方式。 ok, 经过我几天的详细测试呢,我们先来说一下一米九二的五个优质特点。第一个,超强的指令遵循能力, 我们看到这张图,他是我用了香蕉 pro 转了二十次,无论如何调整他都无法让我满意。不过呢,一米九二一次他就让我成功了,老头在一米九二的操作下,第一次转过身去,他真的不哭死, 这个就是源自于超强对提示词的遵循能力啊,在这个点上,我认为它是远远的超过了香蕉的。第二个呢,在深图模型中,拥有断档的推理能力, 比如说这个,我们先生成一个咖啡厅,然后做他的反视角,还记得我们以前怎么做反视角的吗?告诉他画面中存在的内容,以及机位跟场景的关系。同时呢,怎么样对参考图进行元素的抓取。但是一米九二呢,我们只要给他这张图,然后我们再告诉他反视角,咖啡店内部场景, 摄像头在参考图门框位置向内打,他一次性的就给我们生成了咖啡厅的反视角。这是我在直播的时候测试的,我记得当时看到这张图片,我音量都不由自主的拉高了,因为这个 ai 真的 会推理 这张图,在原图的参考图位置上,左右前后内容的调度完全正确,经常做反视角的同学就知道这个生成多么有含金量了, 我们看一下在推理能力上是不是像一个小丑呢 啊?当然我后面也做了两次其他的测试,并不能百分百一次就出,最好的建议还是你适当的增加一些描述以及空间关系的介绍, 这样的话准确率就会提高很多了。但是我们从这个案例就能看到,他的推理能力是断崖的领先。第三个优质特质就是细节控, 我们看这张图,是不是感觉整体的画面密度非常高啊?实际上我们再把重心移到画框的左侧,每一株植物都被他细心的描绘了。在二 d 的 动画场景中,其实这种场景是非常少见的, 由于注意力机制的影响,为了保证主体的质量而会牺牲一些画框边缘以及一些背景的细节,但是这个模型恰恰感觉反其道而行之了,他把细节和主体一样,同样认真的去描绘,所以他整体的细节度非常非常的高。 我们来看一下正常的绘画中图片应该会怎么样呢?没错,就会像这张图一样,用色块以及少量的线条去做一些简化,让你知道这里是一些花花草草就行了 啊,但是他没有,他在深图的时候就会非常详细的去描写一些细节,说实话,这个细节控的程度啊,都让我怀疑这个模型的注意力机制是不是有问题了啊,简直夸张到爆啊,我没见过这样的,真的牛逼!克拉斯 第四个优质特质呢,是超高的文字准确率啊,其实这个是最让我下巴惊掉的,我只给他了这样的一个提示词,然后他就帮我非常详细的出了整一张图片。 杭州超详细旅行图啊,左侧有一个行程总览,然后图片中心这边呢,是非常详细的一张地图啊,在画面的右侧,他有季节与穿搭建议,预算 在下方呢,有行程建议,交通指南以及 top 必吃榜。我们看到在 top 必吃榜里,甚至推荐了杭州名菜西湖醋鱼啊啊,推荐大家真的来吃一下。同时呢,我们可以看到交通指南这里啊, 它的每一个内容前呢,都会配一个小小的图标,这些图标并没有错误啊,步行真的是两个脚丫,骑行就是一辆自行车。我想一个设计师如果要做这样的一张图,他可能要花非常非常长的时间,但是我们用这样一个 ai 生成的图片,用这么一个简单的话语, 大概只花了几分钟就跑出来了这样一张详细的图片,而且错误率非常非常低。相比之下呢,我们来看一下香蕉 pro 给我们生成的图片,可以看到整体的文字数量是大大的低的,并且呢,画面的美感远远没有前一个画面来的有冲击力, 文字呢,有非常多的错误,而且信息细节是要少很多的,这个呢,我看没有任何一个模型可以接近啊,甚至望其向背,这个能力呢,真的非常非常的夸张。相比之下呢,这个香蕉仿佛拉了一坨大的, 以前我看这么香的香蕉,现在居然也看不上了,真的应承了那句话,大人,时代变了。除了这样的线路图呢,我又做了一张包彩的一张建筑的,大家可以看一下它的细节密度。当文字非常非常细的时候呢,终于发现了它的文字开始崩坏了, 但是呢,我依然觉得 ok, 他 牛逼,克拉斯多说不易啊,只能说做平面设计的同学有福了呀。第五个优秀特质呢,就是美感了,这里我们给到他这个提示词,我们看到他给我生成了这样一张图片啊,右边的艺术字底非常的好看,天光开辟新世界, 左边按照我的提示词要求写了你没看过的全新版本,是兄弟就来砍我。其他的这些字呢,是他自己配文的,整体的构图画面非常的好,也按照我的要求生成了一个天气之子的画风啊,瞬间完成又好看的海报,真的是没话说了,朋友们, 那么以上五个优秀特质就是我认为其他模型望其项背的地方了,当然,米德珍妮在美感上还是有一战之力的。其他的这些特质啊,像文字生成啊,米德珍妮属于拉中之拉了,我们就不多说了。那么抛开了五个特点呢,我们再来看一下三个我总结出来的细节优点。 第一个呢,是在写实领域,我觉得他还是非常能打的。这里呢,我们看到三张图片,同样是这个提示词生成的, 这一张是香蕉二,这一张是米德娟尼八点一,这一张是一米九二。三张图片呢,我觉得最好的是一米九二,因为这一张图片比较真实,香蕉二呢,感觉人物稍微有一丢丢的油啊。而同时呢,香蕉在做写实题材的时候,特别喜欢给我们画面中加很多的造点,总有这一股味道去不掉。 那么米德修尼呢,说实话,这个女生呢,真的美了我一脸啊,我在别的模型上很少看到能生成出长相这么有辨识度的女生啊,不过她完全没有遵照我的指令要求吧,我需要的是女生怒吼,这个女生也太温柔了吧,我们再看一组啊,这个是跳舞的女生,这张是一米九二生成的, 这一张呢,是香蕉二生成的啊,整个推理上稍微有一点问题啊。然后这一张呢,是米德基生成的,这里我把风格画拉高了一点啊,他的整一张照片的艺术感非常强,我们可以看到一米九二的写实功底还是很不错的。 第二个优点呢,是我认为他非常的适合做漫画,因为呢,做漫剧他的技能包要很多,而且呢,你投入的成本时间周期也会相对要大很多。 如果你有剧本,其实可以用一米九二来先做漫画,这个呢,也是一种低成本的验证啊。同时呢,漫画也可以作为未来你去做剧的一个分镜参考。 那由于做漫画的内容教程他也非常的复杂跟详细,如果呢,有比较多的同学需要这样的内容的话,回头我再出一期,如何用一米九二去做我们的 ai 漫画? 第三个优点呢,是我认为他可以很好的去做我们的分镜故事版。这里呢,我们给到这张参考图以及这样的提示词,这个分镜故事版中呢,有十二张分镜图,并且有角色的三十图,戏的重点,镜头语言,场景的设定以及一些道具啊, 那么这些信息呢,能帮助我们梳理,更好的去做剧。以上呢,就是我目前测试下来感觉一米九二的主要优点了,你是不是也觉得我要疯狂的捧一米九二了, 身徒心亡,天下无敌。 no no no no! 重新重复我之前的观点啊,每个模型他都有侧重的地方,有优点,那么也会有缺点吧,现在我们来看一下他存在的问题,其实呢,如果这些问题他不优化, 这个模型在很多的场景中我觉得是根本没有办法应用的。要做剧的朋友们注意了,我认为这个模型目前并不适合来帮我们做剧啊,尤其是做一些分镜的关键帧啊,你往下看了就知道为什么我这么说了, 有四个非常大的劣质特质。第一个最大的问题啊,我们现在能用到的一米九二呢,基本都是被加了版权限制的降质版本,这其实就衍生了很多的问题。 降质呢,他不是单纯的说把模型的智力从二百八降到了二百五这么简单,而是因为版权的限制导致以前提示词能准确抓到的内容,现在不能生成,他要绕过去给你生成一个另外的东西,尤其在画风上, 一米九二的降质呢,他就导致了很多的画风会自动的偏移,比如说我们刚才看到的这张图,我要的是夏木有人造的画风,结果呢,他给了我这样的画风,有人造的画风是这样的, 对吧?区别大吧? ok, 这就是降至绕版权的问题啊,为了保证测试的严谨性的,我们再拿它去跑一遍内容,可以发现这一次生成出来的内容又不一样,那这样呢?对,我们在做一些场景的二次生成啊,以及溶图的过程中,就会有很大的问题。第二个特质呢,是脏脏包 这个模型呢,它只要图深图,画面就会开始脏,有人说脏的原因是噪点,因为原来的深图模型,你只要大量的图深图,你就会发现它很糊,实际上就是噪点的问题。 但是呢,在一米九二这里,我觉得它是上色的问题啊,而且它这个问题比原有的深图模型要严重的多。原有的深图模型呢,可能跑个三到五次,它才会慢慢开始变糊,但是一米九二呢,它第二张图片,第三张图片就开始给你变得非常的脏了, 这个问题非常的大啊,大到了谁用 g p t 做内容,其实一眼就能看出来了,昨天我刷到了教授的视频,我刚在键盘上敲下了爷青回三个字,下一秒就被屏幕上的脏脏包给逗笑了,真的一眼一米九二。第三个劣质特质就是细节控了, 我刚刚不是说这是优质的特质吗?怎么又变劣质的了?是的,细节控呢,他是一个双刃剑啊,虽然对于细节的精细打磨和详细刻画,能增加画面的美感以及信息的丰富度,不过如果你想拿他做据,也很容易在不知不觉中陷入到被背景抢戏的地步 啊。由于他太细节了吗,导致主体的信息其实会被大量的截断,所以我觉得他很适合做插画,他并不适合拿来做据。 此外呢,还有一个小问题,就是如果你是图生图啊,我们不考虑脏脏包的前提下呢,你会发现他还会主动的给你去加一些细节,比如他会觉得你画面的饱和度不够高,会自动的给你加一些饱和度。同时呢,他会给我这个平图简化的人物自动的加细变复杂啊, 比如说他头上的细线阴影变得更小更密了啊。但是我做这个剧的时候呢,我并不想让他更小更密啊,这个就让他跟我的想法产生了一些相背,并不能准确的控制住这个,反而会增加我们的试错以及时间成本。 第四个大的劣质特质就是上色的问题,我们再回到上面看过的这张图,我们把图片放大一点,能不能看到在平图人物中给我们上了很多不规则的色差,比如说这边的红色, 以及右侧这个人物他又白又红的地方,同时这些阴影的边界也非常的不清晰,上次他就会影响人物的跳出,这个时候对蓄势以及画面逻辑又会产生很大的影响。那么说完了四个劣质特制,我们再来说一下几个细节的问题啊。 如果你想用这个模型做二 d 或三 d 动画的话,也请注意了,他的背景会偏写实,整个写实的权重非常高。左边这张图是香蕉 pro 生成的, 这张图的背景呢,就非常的手绘,但是我们看一米九二生成的整张图片就非常的偏写实,实际上我给他提出的要求呢,要非常详细的手绘感, 但是呢,整体的画面还是非常偏写实,除了二 d 呢,三 d 也有这个问题啊,我们看到这张图片中啊,整一个钢琴,简直跟实拍的一模一样,而让这个三 d 动画感呢,有一点出戏了,那接下来呢,还有一个细节控理解能力又拉满, 应该是细节高手啊,结果呢,他又反手给了我个出乎意料。我们先看看这个提示词下,香蕉 pro 他 是怎么生成的,可以看到香蕉整体的视觉真实度都非常不错,同时没有一个人脸是重复的,这里也能清晰的看到我前面所说的香蕉,非常喜欢在画面中加噪点, 那我们来看一下。一,秘诀二,在这张图片里呢,我们可以发现前面几个人物还是挺不错的,但是我们一旦放大一点往后看,你就会发现端倪了。 在这里呢,这两个人物,这两个人物都共用了一张脸,简直像是黏贴复制上去的。 同时呢,人物的眼睛非常容易笨,他说远距离人像的时候呢,眼睛就很容易变成这样,你感觉眼珠子都要超出眼眶了。 为了保证测试的严谨性呢,我又跑了一张。这一张的人脸呢,开始有大面积的崩坏了啊,有上色的问题,有人物形状的问题啊,但是最让我绷不住的是这个哥们啊,兄弟,你是不是走错片场了呀? ok, 所以 综上所述啊, 他有非常非常多的缺点,我们并不能认为他的某些能力特别强,就把他捧为了一代神图模型的新王了, 还是要结合它的应用场景以及优缺点来看总结一下呢。我认为 gpt emoji 二呢更像是单张精致图像的生产器,它很适合一些设计工作,比如说电商产品图,宣传海报,一些平面的设计稿。 新模型的出现固然是能推动整体行业的发展的,但是呢,大家也要辨真的来看待它的优缺点,掌握它的适用场景,来最大化的提升你的工作效率。那么我是栗子,这一期详细的测评就到这里,感谢你的观看。


没想到还有人只拿 gpt image 二画图,这十个写秀玩法一个比一个离谱,看完全面解锁 gpt 的 隐藏功能。 你只需要上传一张手部照片,用上这个指令,就能生成一张掌纹解读指南。如果还想要更详细的分析,可以用上这个指令,立马就能得到一份超级清晰的解读报告。你别说,他有个地方还真说到我了, 他说我不是那种马上开干的人,而是会先观察、调研、分析,再开始行动,这个还真挺像我的。还有这里他说我比较重细节,重思考,有自己的秩序感。我确实不太喜欢混乱的东西,这个也挺准的,没想到 gpt 真是有点子东西的 同理。上传一张正脸照,用上这个指令,你就能得到一份超级完整的面相分析报告。你看他虽然看的方式和部位不同,但最后得到的判断却和前面首相的结论惊人的相似,包括其他部位的分析,真就是赛博算命了。感兴趣的可以去玩一下, 给他一段话和自己的照片,他就能直接帮你做个人。发型分析、色彩分析、穿搭分析、妆容分析, 什么发型最合适,什么色彩最容易踩雷,什么样的穿搭最不建议,什么样的妆容最自然,甚至连化妆工具都给你磨练出来。像我这种又懒又不会导致自己的人,真的是一整个挨住了。 我们接着来玩点有意思的,让马斯克和华为汽车同框,让库克和小米手机同框,让川普来推荐老干妈,瞬间老干妈就变成了我吃不起的样子。当然,以上视觉都是练习,不能当正式代言,更不能拿去商用。而回到设计本身,每一张海报的灯 光排版、产品氛围、广告质感,真的完全不输专业设计师做出来的效果。一个字,绝! 给他一瓶威猛先生,出来一个机能复古感赛车套装,再给他一瓶 a d 钙奶,出来一个牛奶般丝滑的校园风晚礼服。再给他一个故宫文物,直接出来一套宫廷高定,细节感拉满,这设计绝对是极致奢华了。 输入你想拼的积木主题,就能得到一整套乐高,见到说明书、零件清单,甚至是细节特写等等全都有,重点是从头到尾一次性都保持的非常好,让普通人不懂设计也能自己 diy 玩具了。 g p t 现在强的真的不是一星半点。 让他重新教我光核作用、细胞呼吸、动作、定位、产生与传导,用一张图就能把一个学科主题讲透,让教材知识可知化。如果我们上学那会有这个好东西,可能记这些知识也就没那么痛苦了。 一张图把产品定位、人群、卖点、竞品等等信息全方位展示,它整个的配色设计和各种细节的处理都做得很好,尤其是中文的渲染,几乎没有任何错别字,非常 nice。 我 给自己设计了一整套周边,不管是 logo、 帆布包、 t 恤、保温杯,还是这个贴纸,我都非常喜欢。 关键是这些都是我一句话指出,你真的很难想象,这是没有经历过任何抽卡生成的。我还给自己设计了一套周边服装,每一件看起来都很酷,属于我自己看了都想买的程度。 g p l 的 设计能力确实很强, 同样还是一句指令,让 iphone 十七开盖,让 pocket 开盖,让大疆无人机展示各个方位的内部结构,完美呈现工业美学。不管你是做数码科技 ppt, 还是做科普产品介绍,用这种图来讲解都很抓眼球。以上所有玩法我都整理成提示词文档了,想自己上手玩的我发你。

呃,以后真的不需要设计师了,这个金某 t 的 引幕机二这个新模型刚出来啊,我们做了一个连夜的测试,这个效果真的有点牛啊。我们来看一下它的这个效果,比如说我们让他去做了一套这样的一个室内的一些空间效果图, 首先他给到我们的这样的一个效果方案,然后把每个的一个理念给它进行了一个拆解。那么还有我们的一个整个的一个彩图,还有我们的一个立面的一个图,整个的一个设计说明以及色块全部帮你做出来了,这相当于什么?相当于直接性的干了一套 ppt 啊。然后呢这个另外的一个风格也是一样的,比如宋氏美学的,这是室内的,那同样的你要做一些什么?你要做一些建筑的,比如说我们做一套民宿的也是一样的,整个的一个理念,包括平面总图、平面分析图,以及我们的一些地形模块、立面图,全部帮你一整套的做出来,包括你做些建筑空间的也是一样的,这个真的是强的离谱, 相当于把你整个的 ppt 全部给你干出来了,当然还没有结束,我再给他看一下,我们可能做一些门头的啊,那么来看一下,这是我们的这个原图啊,这是原图。 好,那么这个啊,是他给到我的结果,结果啊,这是第一个方案啊,这是第一个方案,那么这个我是让他做了一个奶茶店的设计,包括名字名头,包括我们的一个店招啊,然后还有一个什么,还有另外一个方案,这是也是一个奶,这是一个咖啡店的啊,这是一个英文名字的啊,然后这还有一个奶茶店的,看到没有? 整个的按照刚才的这样一个风格全部做出来,你说这东西你说以后设计师还要干吗?这个随便一个普通人就可以做出来,我觉得真的强的可可怕啊,包括他的一个设计理念,你看到没有?整个的一个 logo 全部帮你搞出来,这就很可怕啊。然后呢,我们再看一些其他的啊,比如说我们的一些做产品设计的老板也是一样的啊,做产品设计的也是一样的,来 啊,整个的一个设计理念啊,灵感来源,我们这个是让他根据一个鸟的形态做一个演变的,然后我们的一个三十图啊,整个的一个抛面图、配色方案 全部帮你做出来,柜子设计的也是一样的,整个的材质分析,抛面图、立面图全部帮你做出来啊,相当于整个干了一套 ppt。 我 们再来看另外一个,比如我们用一些白膜做渲染,我们这里也测了一下啊, 这个还原度就比较高啊,他比那个香蕉不拿的还原度要高些,为什么呢? 因为现在补单的话,有的时候我们可能说这个场景它会增加一些新的东西,或者减少一些东西,但是这个不会,它是真的是完全完全跟你这个场景做一个还原的啊,那么这个也是的啊,如果说你的空间好一些,那么你可能出来这个图片啊,可能说,哎,更加有质感一些,好,那么还有另外的,比如说我们出我们的一些平面图做小方案啊,来看一下, 这是我们给到 ai 的 这样的一个彩屏方案,你可以看到啊,这个,其实这个很复杂啊,很复杂,这里呢有标注啊, 有我们的啊,什么洽谈式啊,开放式会议室,对不对?但是你可以看到他可以帮我把每个空间的图片做出来啊,当然这里面可能会有些质感的问题,因为我们这个图片并不是很大啊,可能说你发现有些湖,对不对?但是他已经很好了,基本上是按照我们什么是按照我的这个空间去做出来,做这个墙有点可怕啊, 然后这套也是的啊,这个整个的一个图纸。好,那我让他生成了一个彩屏方案啊,立面的一个图片来看一下啊,他这里写的什么啊?比如说我们的会议室的,然后东立面的入口盖办公室的一个区域,然后呢我们休闲的一个区域啊,整个的一个会议室的区域全部帮你撸了出来啊,整个的干到一张图上面, 而且他做这次更新的话,就是这个文字啊,文字的话这个能力非常强,就算你很小的一个文字啊,他也能帮你很好的写出来啊,基本上可能说不糊吧,我觉得以后不是没有设计师了,而是人人都是设计师,随便一个普通的人就可以完成设计,大家认同吗?所以说做设计的小伙伴更要会 ai 了。

如何借助 chat gpt 和 image 二高效的绘制这种精美的科研视域图呢?给大家分享一个非常实用的方法。好,首先第一步我们需要用顶刊的视域图去训练 gpt, 得到相应的高质量提示词。我们直接找一张细节比较丰富的顶刊视域图发给 gpt, 让他呢去学习这幅图的绘图思路和绘图风格,并且呢给出能够复刻生成这张图的详细提示词,要求这个提示词要详细到在任意的纹身图模型里边都能够生成原图的程度。 最后我们告诉 gpt 这幅图的主要内容,方便他去理解和学习这幅图的绘图过程。对话时一定要选择最新的 gpt 五点五的 cking 模型,不要选 instant, 然后发送 不到一分钟之后呢就给出提示词了。好,我们来一起快速的看一下。如果想要完美的复刻生成这种顶刊的视意图, g p t 认为我们的提示词应该包含哪些内容,应该包含一些整体的风格,要求 每个区域应该去具体的会制哪些内容,还有一些整体的视觉风格,要求文字标签, 构图参考,还有一些负面提示词,也就是一些通用的注意事项。除了这版非常详细版的提示词之外, gpt 还给出了一套经典版的提示词,我们直接把上面这一套详细版的提示词复制, 把它粘贴到一个新的 gpt 窗口,调用一米二,同样也是用 ckey 模型。然后呢让它去出图,目的呢当然就是为了验证我们这套提示词的好坏。好几分钟之后呢,图就生成了,第一感觉呢就是生成的图也是非常的精美, 我们把它下载下来,跟顶开原图放在一块对比一下,大家可以看到生成的图基本上所有元素的立体感比原图都要更强, 尤其最明显的比如这个肿瘤细胞群生成的图比原图更形象,更立体, 再比如这个半透明小鼠的器官生成的图片明显也要更加形象。再比如这些烧瓶、纳米颗粒、血管线立体单个肿瘤细胞的洁面图,这些部分的立体感都加强了, 其实还有一些细节的提升,大家看左侧的这个光电热的示意图,原图里边只是简单的用箭头表示一下,而在一米二生成的图里边, 他把这三部分光电热都形象的画了出来,所以呢,个人感觉一米二生成的这张图比顶刊原图要更上一个档次。 如果大家发现你们的生成的图片一般可以继续呢,用这个指令反复优化我们的顶刊提示词,反复生成图片,直到呢生成的图片满意为止,拿到我们最终的高质量提示词。 好,第二步,第二步我们要做的就是对刚才的这份高质量的非常详细的提示词进行提炼。刚才的提示词我们也看了,其实呢它就是两部分内容的混合体,一部分呢就是适用于任何场景的一些通用提示词,另一部分呢就是作者特定的一些内容需求。 现在呢,我们就让 gbt 把通用提示词那部分详细的提炼出来,将来呢,我们就可以直接套用在我们任意想要会制的内容上。 我们返回第一个对话窗口,接着给 gbt 这样一条指令,让它去从上面的提示词中去提炼提炼这份详细的通用提示词, 要求考虑到从上面这个顶刊制图学到的所有要点,包括排版、布局、信息密度、配色字体等等, 并且呢,要适用于机制图、流程图、架构图、技术路线图等等各种类型的视域图,适用于各种研究领域。将来呢,我们可以直接套用任意的内容需求,就能生成高质量的科研视域图。 好几秒钟之后呢,我们就拿到了这份他提炼好的通用提示词,是非常的详细全面,包括整体风格、排版布局、配色、字体标签、图形元素、信息表达、画质质感, 适合各种场景以及一些质量标准。负面提示词可以说是方方面面,各种科研绘图需要注意的事情都考虑到了。 好最后一步,第三步,结合我们想要的这种内容需求,直接套用刚才这份高质量的通用提示词,我们就可以高效出图了。 我们先试试机制图的这种出图效果,直接复制刚才那一大段详细的通用提示词,再加上我们的内容需求。比如这里我把内容需求简单的描述为光催化、电催化、光电催化的这种机制对比, 然后发送,大约呢过了四分钟左右,一米至二就把图片生成了,大家可以看看效果,出图质量是非常的不错。 好,我们再试一下这个中数图的这个效果,还是直接复制那一大段非常详细的通用提示词,加上一个内容需求。比如我这里输入荧光分子在化学、生物材料等领域的应用概述图 也是这个,大概花了四分钟的时间,一米二就完成出图了,效果也是很棒。好,最后简单总结一下我们的思路呢,就是先用顶刊图去训练 gpt 生成提示词, 再让 gpt 去提炼出一套高质量的通用提示词,这样我们可以保存以后,将来自己结合自己的内容需求,随时去调用它。 这套方法的出图效果呢,目前要比那种简单粗暴的直接参考图片生成图片的效果要更好。所以呢,在这里分享给大家,并且建议呢,大家尽量不要用那种接入一米之二的外部网站 gpt 官网呢,它的这个状态才是最满血的状态。好的,谢谢大家。

俏皮 g p 呢,出一页子二甚至是文字呢,再也不会乱码了,不管是长图还是海报,通通搞定对面的精美效果,这个花呢,我是上传一张那个海报风格,然后呢,让他用这个 ip 参考这个风格生成一张海报, 哎,这呢,是静态生成的效果,狂潮音乐局对吧?然后呢,他这个字体明显就是一个通用字体,对吧?并没有参考我给他海报的自己风格,我们在看什么呢?同样的题词,同样参考给到我们这个俏皮屁, 记不记得,就因为 emg 二的话,你看怎样呢?就完完全全不一样了,你能发现什么东西?他的字体已经经过设计了,而且呢,会把你这所有排版的细节,对吧?层次关系全部拉开了,人物里面的,哎,人物里面什么风格 以及干嘛完完全全不一样了,就跟什么呢?就跟我给他海报声卡是一样的,所以这个真的是拉开了很大距离。 再对比另外一个,这个画是给那个基本里就拿拉布拉的二的模型哈,用它把这个这个石头呢改为 aigc, 好, 它是在上面打个 aig 的 字,对吧?它理解的上不太好啊。然后呢,这个的话呢,我是用超级 p m g r 生成的 同样关键词,哎,他是 aigc, 用石头去改对吧?但是我觉得石头呢,太什么呢?他那个太规整了,太像字体了,我让他稍微参考,像是这个石头效果,哎,他改了一下这个效果是不是就好了非常多啊?同样呢,我们还可以,他用来做什么呢?我们还可以让他做字体设计, 来,我来参考什么?参考我们公司做的奇幻植物哈,这种虚拟字体对吧?哎,他也能做个模仿的。差不多吧,不能说很好哈,你看奇幻森林对吧,这个就真的非常炸裂。 然后呢,我丢个这个 banana 二的话呢,他没识别出来,我让他也是喜欢是零的,发给我是一样的。所以 banana 二的话呢,刚开始出来很惊艳哈,我猜后面那个 chris 的 mazr 二的话呢,到后面也会什么又降质啊,刚出来时候非常惊艳。大人用多之后呢?因为大模型喜欢使用什么平均值 对吧?给大家生成什么效果,他就就概率出成效果会更多,就反而就是你的关键词就很重要了,就提示很重要了。另外最炸裂什么呢?最炸裂的话呢,就是你可以呢让他做详情页,我这丢个产品图,然后参考这个版式排版,哎,他呢一键给我生成什么呢?详情页 这个效果,这个文字完全没有错,错别字没有乱码。然后看这个时候呢,我立马干嘛呢?立马在翘起屁 open i 里面啊,充了他们的 a p i 那 个买他们 a p i 做了一个我们自己的工作流, 这样的话呢,你一天生成几十个详情页不在话下,而且特别快,以后有什么呢?可能都是信息流广告了啊,就是不需要这样的,除非那个除非非常 高端的一些品牌设计,对吧?大部分中小型企业呢,都可以呢,都可以什么东西都可以完完全全自己批量去生产,而且我们看广告的话呢,都是信息流广告不会在什么呢?就是那种你要磨很长时间对吧?然后再投放去测试效果, 大批量一天就个几十张图片去测试,看点击率,看转化率,哪个好哪个不好,立马能测试出来。所以以后看广告都信息就有广告,除了是高端品牌、高端企业,对吧?那这种话呢,还是需要呢我们传统设计师去制作。

大家看这张图啊,这是我让 gbt 生成的二零一零年高中教室摄像头实拍。随后呢,我就把这张图片发给了豆包,并且询问这张图片是否是真的,豆包告诉我呢,这是真的,不是 ai 生成的。到这里,你是不是以为 ai 骗过了 ai? 那 你再看这张图呢? 你看懂了吗?连豆包被他骗的这个场景也是 gbt 生成出来的,而且毫无违和感,真的就像是盗墓空间一样,一层套一层。以前我们都觉得 ai 生成的图片有股子明显的 ai 味,包括手部会畸形、光影很油腻, 被蚊子乱骂等的。但是现在呢,手部的油脂反光、屏幕的摩尔纹,甚至连对焦对不准的这种模糊感,全部可以给它拉满,你甚至啊,可以深层和任何陌生人的亲密合影。所以,当 ai 都能被 ai 骗的时候,眼见为实这四个字将永远成为笑话。最后呢,我想提醒大家,我不是在制造恐慌,而是已经看到了一个 定会发生的未来,那就是诈骗分子一定会最先的绞尽脑汁的用技术来欺骗转发给你的家人朋友,告诉他们,从现在起,你在屏幕上看到的任何媒体内容,任何所谓的实拍证据,都要打上一个巨大的问号,先默认它有可能是 ai 生成的,然后再去仔细验证。

瑞平国内与国外 ai 的 星图习力从夯到拉,第一个,豆包星图纯纯是附赠功能,技术明显没下放,人像生成普遍存在塑料感,艺术风格偏单一,稍微有专业需求就撑不住,唯一的好处就是免费,能凑合着用,当个娱乐入门工具还是可以的, 所以生图实力给倒拉完了。第二个 gemini, 它拥有多模态能力,处理复杂项目,分镜、脚本知识,地图结构设计都是最强的,不过功能太重太专业,门槛比较高,只想快速出一张简单图的话就没必要了, 所以生图实力给到顶级。第三个 midi journey, 目前来说是全球艺术审美天花板,电影级质感拉满,画质无敌,出图即壁纸,无任何工具能对标,但门槛极高,小白很难玩得明白,属于专业创作者的专属工具, 所以生图实力给到吭。第四个吉梦,可以说是豆包生图的高级版,提示词理解精准,做出来的效果更好,但主力产品是生视频,技术完全拉满,是国产里少有的能对标海外商用工具的产品, 主打全能,落地高效,所以升图实力给到顶级。第五个, gpt emoji 二,目前是最新登顶第一的 ai 升图工具,多语言支持优秀,简单几句中文生成的人像图、海报图、数据图表精度拉满,不仔细去查找细节,谁能知道是 ai 做的, 真是强得可怕,所以生徒实力给到憨爆了。第六个,谦问,做出来的效果不算差,但是特别吃,提示词对新手来说有点困难,重规重矩吧, 没有太多的突出亮点,但日常是够用的,所以生图实力给到人上人。第七个, nano banana, 这是谷歌出品的生图王牌,是当前最均衡、最实用、性价比最高的全能生图模型,速度、中文批量,一致性全面领先,但是还没达到还原现实的效果, 精细方面还是需要 pro 版,所以生图实力给道行。第八个,可林主打的是高画治国风、古风武侠,创作能力不算差,但人像崩脸率高,服务器稳定性一般, 需要反复试错,所以生图实力给到 n p c。 第九个,元宝提示,此事精准的情况下还是 ai 感很重,人像和复杂场景都很拉胯,精细创作完全无法实现,核豆包半斤八两,只能算轻量娱乐工具。所以生图实力给到拉完了以上排名,群主观点。

多个榜单全部第一,纹身族能力呢,超过 nasa banana 二百四十二分。官方说啊,这是历史以来第一名和第二名最大差距的时候。那这个 jpg image two 啊,是真的那么强吗?三分钟,我们来看一下,如果你也用 image two 尝试了新的玩法呢,可以分享在评论区,我们讨论一下 每天一杯强壮。由内而外。 先来说呢,他这个提升最大的,并且感官呢,最明显的优点就是他文字的理解以及呈现的能力。像你刚才看的那些电商海报啊,模特图啊,书法,甚至是试卷,其实全部都是由 image 二直接生成的。 在同样的提示词下呢,他对比 nasubao 在 文字的生成准确率上是有明显提升的。我们可以看一下这个对比啊,同样是生成人物简介,那这张 image two 生成的图片在文字上几乎是没有错误。另外呢,我们让他分别生成两个时尚杂志的封面, 可以看到明显的 image 生成的图片呢,这个图片模特的眼神,角度,探头的,这个标题的字体层级, 背景,光影的戏剧化程度,这一切呢,都是经过逻辑推演的。画面里的每个元素呢,都像是被这个强迫症导演安排好了的, 清晰,锐利,准确。那整个构图呢,像是一本被精心编排好的画册。那这种审美啊,其实是高度设计化的,并且充满了严谨。 而 nintendo 有 更多的抽奖结果呢,是偏向于把相关的元素拼在一起,看起来很像。但是这种逻辑的严谨也带来了缺点。不知道有没有朋友发现啊,当你生成的场景比较复杂的时候, 全景或者元素较多的图片意味着兔这个模型呢,会给你非常多没有用的细节,导致你整个画面没有主次, 再一个画面每一处呢,其实都过于清晰了,那光线呢,过于均匀了,构图过于完美,反而呢,会产生一种类似于影楼精修,或者说呢,塑料模型的不真实感。在这方面呢,其实给了你一种生图水平回到了二十四年的感觉。哎,这是为什么呢?这其实涉及到一个问题了, 就之前呢,你生成这种图片里的文字呢,一直是一个大问题,那这几年为啥突然会写字了呢?其实都是因为现在的生图模型,也就是这个 diffusion 这个单一架构了, 他们大多啊是先让字回归的大圆模型作为大脑进行语义理解和逻辑规划,然后呢,再去调用扩散模型作为手来完成最终的像素成 像。那比如 nintendo, 就是 先拿 jimmy 三做语义理解,然后规划再生图。那扩散模型呢,就像电视雪花一样,整体消除无用的噪点,最终呢,呈现出一幅图变 而字回归啊,你就可以理解成 g p d, 就 像写文章一样,一个板块预测下,一个板块一块一块的把图像画出来,就是因为这样呢,他才不容易写错字,逻辑解密。但副作用呢,就是过于遵循指令了,生成了非常多不必要的细节,让整个画面呢,看起来很繁杂,非常的挤。 虽然关于 gpt image 二具体的框架信息啊,官方也是首口入屏,但基本上从它的文字和指令遵循到变态的特点上,也不难推断它的图像生成啊,大概率是由一个具备推理能力的自回归的语言模型所出道的, 所以相信大家看完这期啊,对新模型的优缺点呢就有基本了解了。虽然说看起来意味着兔领先了那么多,但是目前来说,图像生成模型我觉得还没有找到最好的一个苹果那图像模型没有进步空间了,这种画呢,其实还是为时尚早的。