在多數軟體裡,「自拍」並不是相機拍出來的照片。聊天模型寫出場景的描述,另一個圖片模型負責把它畫出來。下面的一切都由此而來,機制在AI 女友的圖片與語音如何運作裡解釋過。
為什麼圖片會跑掉
- 每張圖都從零開始。沒有定錨的話,模型每次都重畫這張臉。
- 描述會被改寫。如果聊天模型把角色的外貌稍微換個說法,臉就會變。
- 太複雜的請求會擠掉辨識度。複雜的場景,留給讓她看起來像她的細節的空間就更少。
有些軟體用固定的參考圖片或針對角色訓練的模型來解決這個問題;在我們的測試中,Candy AI 讓同一張臉維持得最久。軟體沒做到的話,下面的做法就更重要。
先固定外貌
在要任何照片之前,先確定角色的外貌已在創建器或描述裡精確寫好。含糊的特徵(「漂亮、黑髮」)給模型太多自由。具體的特徵給它一個定錨:
| 太含糊 | 具體 |
|---|---|
| 漂亮、黑髮 | 及肩黑色直髮,有瀏海 |
| 好看的眼睛 | 綠色眼睛,濃眉 |
| 苗條 | 纖瘦體型,170 公分,肩膀有運動線條 |
| 有品味 | 常穿寬鬆針織衫,戴銀色圈形耳環 |
這一段永遠保持不變。當圖片看起來不對,拿它和這一段比對,而不是改寫這一段去配合圖片。
好的請求包含什麼

五個簡短的部分,勝過一整段形容詞。
- 取景。手臂伸直的自拍、鏡子自拍、腰部以上的肖像、全身。
- 場景。咖啡館的窗邊座位、夜晚的廚房、黃昏的海灘。
- 光線。柔和的窗光、暖色檯燈光、強烈閃光燈、黃金時刻。
- 表情。大笑、睡意惺忪、專注、淡淡的微笑。
- 一個細節。拿著咖啡、頭髮綁起來、穿著雨衣。
「手臂伸直的自拍,坐在咖啡館窗邊座位,柔和日光,淡淡的微笑,手裡拿著咖啡」,通常會勝過一長串形容美貌的形容詞。
省點數的習慣
- 一次只改一個地方。如果光線不對,就只改光線。全部都改,就沒辦法學到什麼有效。
- 先在聊天裡問,再生成。請角色描述她會傳的照片,用文字調整描述,再要求生成圖片。文字免費或很便宜;圖片不是,請見AI 圖片生成的真實成本。
- 重複使用有效的做法。記下產出好圖的請求,沿用它們的結構。
- 知道上限。許多方案限制每日或每月的圖片數量。長時間使用前先確認。
讓它幾週下來都保持一致
- 外貌那一段保持不變。
- 在大多數請求裡提到一個標誌性的細節,同樣的耳環、同樣的髮型。
- 避免極端角度和濃重特效,它們最容易讓臉變形。
- 如果軟體提供「參考圖片」或「基底圖片」,慎重挑選並保留。
隱私與同意
生成的圖片存放在公司的伺服器上,位址往往比你想像的更公開,請見你的圖片實際存在哪裡。由此得出兩條規則:
- 絕不要上傳真人的照片來當作創建角色的基礎。換臉功能曾被用來製作真實女性的未經同意性影像,2025 年儲存空間未設防,更讓其中數千張被公開。
- 對自己的臉要三思。這會在一個你無法掌控的資料庫裡,建立一張你的影像。
一張好的 AI 自拍,大半在於一開始具體,之後保持一致。畫圖的是模型;有多少畫面留給運氣,由你決定。