将模糊的请求“漂亮的杯子”变成结构化的提示。仅返回 JSON:{"prompt":"...","style":"...","details":"..."} - 在 prompt 中以一个短语收集主题、环境和光线,在 style 中指示视觉风格,在 details 中添加材质、角度和格式。
图像生成器不像人类那样绘图。它接受了数百万个“图片+标题”对的训练,并记住物体、样式和光线的样子。当您提供文本时,模型从随机噪声开始,然后逐步将其消除,使图像更接近描述的含义。这有两个后果。首先:词语越具体,神经网络就越不为你思考——它会向“普通互联网用户”填写一个模糊的请求。第二:开始总是来自随机噪声,因此相同的提示会给出不同的图片。这不是一个错误,而是一种获取选项的方法。工作杠杆:锚定名词(框架中到底是什么)、材料和光线的形容词、风格和格式的指示。内幕技巧:分层次写提示——主题、环境、光线、风格;模型对第一个单词的反应更强烈,因此将主要内容放在开头。第二招:如果你喜欢这张图片,请修复它的种子并一次更改一个单词。初学者的一个典型错误是加载情感(“漂亮,哇”)而不是属性。模特不知道你的“美”;她懂得“柔和的漫射光”、“陶瓷”、“特写”。