大家好,今天来学习图生图的基本概念。
AI绘画的第一次大规模破圈,源于各大短视频平台推出的AI绘画特效——只需用手机自拍一张照片,系统就能将其转化为二次元风格的画面。这类视频普遍具有较高的传播度和流量表现。当然,过程中也常出现一些“翻车”案例,比如将嘟嘟唇错误识别为M唇,或将小狗画成类人形象。那么,这些效果究竟是如何实现的呢?
这就要提到Stable Diffusion(SD)这项开源AI绘画技术。它于2022年8月正式免费向公众开放。与以往的AI滤镜(如短视频平台内置滤镜、美图秀秀AI功能)或封闭式AI绘图程序不同,Stable Diffusion能在秒级时间内生成高质量图像,并支持以原图为基础进行风格迁移——即“图生图”(Image-to-Image)。
借助图生图技术,我们可以将二次元人物转为写实风格,也能将真人照片转化为二次元、油画、机甲等多元艺术风格。
图生图与文生图一样,同样依赖正向提示词与反向提示词。区别在于:除了文字输入外,图生图还引入了图像作为额外的信息源。
通过上节课的学习,我们已经知道,文字提示对AI生成结果有直接影响,但其随机性难以完全控制。例如,即使使用完全相同的提示词(如“白色裙子”),不同迭代步数下生成的图像仍可能存在显著差异——这种不可控性,本质上是AI对文字信息解读存在偏差所致。
这种信息传递偏差在日常生活中也很常见。比如“你画我猜”游戏中,我们精心绘制一幅草图,但多人却无法准确猜出原意;又如甲方提出设计需求时,仅靠语言描述,设计师往往难以精准还原预期效果。此时,提供参考图便成为最直观、高效的沟通方式。
图生图正是基于这一逻辑:我们向AI提供一张目标风格或构图的参考图,AI便以此为基础,在保留原图结构的前提下,完成风格转换或内容重绘。
举例来说,若想基于名画《亨利·怀特夫人》进行二次创作,可先提取画面关键元素:白色长裙、灰色背景、红色沙发。若仅用文字提示(如“白蓝色长裙、华贵长裙、红色沙发、灰棕色背景”)生成图像,结果往往与原作相去甚远,可能需要反复尝试数十次甚至上百次才能接近目标效果。
而采用图生图方式,只需导入原图并做适度模糊处理,AI便会依据像素级信息(如各区域的颜色数值、明暗分布等)进行重绘与去噪,从而高效实现风格迁移——比如将古典油画风格一键转为二次元风格。
图生图的基本操作可分为三步:
下面我们以“将真人照片转为二次元风格”为例,进行实际操作演示。
打开Stable Diffusion,进入图生图(img2img)界面。与文生图界面相比,最明显的区别是多了一个用于上传图片的方框。
导入图片有两种方式:
第二步是编写提示词。我们以最简示例开始:“a boy”(一个男孩)。
第三步是调整参数。图生图相较文生图,新增了一个关键参数——重绘幅度(Denoising Strength):
其他常用参数设置如下:
点击生成后,可以看到AI已较好还原了人物姿态、服装、背包及背景等主要结构。但仅靠简单提示词(如“a boy”)仍存在细节缺失问题,例如墨镜、棕色帽子等关键元素未被呈现。
图生图虽以图像为输入,但提示词依然至关重要。它不是可有可无的补充,而是对图像信息的强化与校准。
例如,在原提示词基础上补充细节:“a boy wearing sunglasses and a brown hat, black backpack, masterpiece, best quality”,再配合原图输入,生成结果中墨镜、帽子、背包、手部姿势乃至背景枝叶等细节均得到显著增强。