「訓練」AI 伴侶,聽起來像是軟體像寵物一樣逐漸學會你的偏好。實際情況包含更多部分:少數槓桿會立刻改變行為,有些會慢慢地為所有人改變行為,有些則主要是讓你覺得自己有參與。
真正塑造一則回覆的是什麼
每則回覆,都是依模型當下看得到的內容生成的,機制在AI 伴侶實際上是怎麼寫出回覆的:
- 角色的描述與設定。
- 為這場對話取回的已儲存記憶與摘要。
- 近期的對話本身。
- 底層模型,也就是公司上次更新的版本。
你的回饋有多重要,取決於它是否改變了這四項之一。
槓桿,由強到弱

改變模型讀到的東西,而不是它對你的感覺。
| 槓桿 | 改變什麼 | 多快 | 多強 |
|---|---|---|---|
| 編輯角色描述 | 每則回覆前都會讀的指令 | 立刻 | 強,且持久 |
| 編輯一則回覆 | 模型所複製的對話 | 之後的回覆 | 在它還留在視野內時很強 |
| 記憶筆記 | 未來聊天中被取回的事實 | 從下次取回起 | 對事實強,對風格弱 |
| 角色外的註記 | 目前的場景 | 立刻 | 隨聊天變長而淡去 |
| 重新生成 | 只有這一則回覆 | 立刻 | 除了這則回覆之外沒有 |
| 評分(按讚、星等) | 通常是未來模型更新的資料 | 數週或數月,甚至永遠不會 | 對你的角色很弱 |
要編輯,不要爭論
在角色裡爭論,例如「你表現得不像你自己」,很少有用,因為爭論本身會變成模型所複製的對話的一部分。把一則回覆編輯成角色本來該說的話,則給了模型一個正確的範例去跟隨。如果你的軟體允許編輯,這是你能養成的最有用的習慣。
風格放描述,事實放記憶
- 風格:語氣、句子長度、幽默、她有多深情,屬於角色描述,因為它必須適用於每一則回覆。我們的角色創建器指南說明了哪些欄位重要。
- 事實:你的工作、你的狗叫什麼名字、上週發生了什麼,屬於記憶,在相關時才會被取回。
把它們混在一起會出問題:放在記憶裡的風格筆記,取回時時有時無;描述裡一長串的事實,則會擠掉個性。
評分真正的用途
在多數軟體裡,評分會進入公司用來改進模型的資料,通常涵蓋所有使用者。這可能值得做,你是在幫助未來的版本,但它不是通往你角色的直接管道。有些軟體說評分會影響你的伴侶;即使如此,效果也是漸進的,而且比編輯過的描述弱得多。
如果你在意,請查看隱私權政策:替一則回覆評分,可能會把那場對話標記為供審查或訓練,這是隱私上的取捨。請見誰會讀你的 AI 伴侶聊天。
每週一次的微調
- 記下這週你喜歡的兩件事,和讓你煩的一件事。
- 把煩的事轉成描述裡的正面指令(用「她用簡短、冷淡的句子回答」,而不是「不要囉嗦」)。
- 把任何新的重要事實加進記憶。
- 如果舊的聊天已經走樣,就開一個新的聊天。長對話會累積習慣,如個性漂移所說明的。
伴侶不會像人那樣學會你。但它每一次都會讀你:透過它的描述、它的記憶和你最近的話。改變它讀到的東西,你就改變了它是誰。