如何按題材與風格測試創意寫作模型
如果您想了解某個寫作模型是否適合特定的題材或風格,可以在受控的提示詞下給予它相同的微型寫作任務,然後對照預先選定的標準來比較生成的段落。在結合兩者之前,先分別測試題材與風格。這樣更容易看出模型是遺漏了故事的要求、誤解了語調,還是僅僅產生了需要大量修改的段落。以下的工作流程適用於為特定短篇小說任務挑選模型的作家;這是一種實用的比較方法,而非品質的保證。
您應該先測試什麼:題材還是風格?
題材和風格塑造了段落的不同部分。題材決定了讀者對情節走向、氛圍、設定以及關鍵細節類型的預期。風格則涉及句長、用詞、視角、節奏以及段落使用多少描寫等選擇。這些範疇有所重疊,但分開步驟進行測試能為您提供更清晰的評估。
從題材開始。詢問模型是否能完成該場景的基本任務:例如,在鬼故事中建立不可思議的前提、在懸疑故事中維持線索脈絡,或創造一個連貫的推想世界觀。接著,在固定的場景設定下測試風格,指定可觀察的特徵,而不是依賴如「文學性」或「電影感」這類籠統的標籤。提出「第三人稱內限視角、克制的描寫、緊繃情境下的短句,且不直接解釋角色的感受」這樣的要求,比「讓它更有氛圍」能提供更多可評估的具體依據。
這種區分是一種工作方法,並非主張題材或風格可以被客觀衡量。[Google Cloud 提示詞設計指南](https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/prompts/introduction-prompt-design)建議使用清晰具體的指示、上下文資訊、範例以及提示詞對比。[OpenAI 提示詞指南](https://developers.openai.com/api/docs/guides/prompting)同樣建議多做實驗,並保持範例與特定任務細節的清晰度。這些原則支持受控的測試;但它們並未認定某一種提示詞格式對所有創意任務而言都是最好的。
建立小規模且公平的比較
選擇一項能代表您實際需要協助之寫作內容的任務。篇幅要短到足以仔細檢視:250 字的場景、一段環境描寫或對一個段落的修改,都能展現出有價值的差異,而不會讓測試演變成看誰產出草稿最長的競賽。
撰寫一份包含固定故事設定、段落長度、視角和任何內容界限的通用提示詞。然後僅改變受測的特徵來建立幾個測試提示詞。如果要比較題材處理能力,請保留相同的前提並要求不同的題材處理方式。如果要比較風格,請保留相同的題材和場景設定,然後更改所要求的語調特徵。切勿同時更改前提、長度、視角和風格;否則一旦輸出有差異,您將無法得知是哪項改變導致了不同。
盡可能使用相同的模型設定,並記錄模型名稱、日期、提示詞文本以及您更改的任何設定。如果您無法控制設定,請記錄該限制,並避免將單次輸出視為評估該模型的穩定指標。進行第二次生成有助於確認某個令人驚豔或令人失望的結果是否具備可重複性,但這並不會將個人的小型測試轉化為具廣泛代表性的基準。
在下達提示詞之前,選出對您的任務至關重要的三到五個標準。對於懸疑場景,這些標準可能包括:線索存在但未被直接說明;敘事者的知情範圍保持一致;文字能維持張力;以及場景以一個耐人尋味的問題結尾。對於風格測試,標準可能包括視角一致性、句式變化、具體意象和克制感。至少要包含一項「必須保留」的要求和一項「絕不能出現」的標準。否則,流暢的文筆可能會分散您的注意力,讓您忽略了遺漏的限制條件。
實例演練:測試安靜的懸疑場景
假設您正在撰寫一部當代懸疑小說,內容講述一位管理員在一間上鎖的檔案室內發現了一個潮濕的腳印。該段落應採用第三人稱內限視角且風格含蓄。以下是作為示範的提示詞輸入,並非模型測試的實際產出結果。
首先,使用如下提示詞進行題材檢查:
測試提示詞範例:以第三人稱內限視角撰寫一段 250 字的當代懸疑場景。一名管理員在黎明時分進入一間上鎖的檔案室,在乾燥的窗戶旁發現了一個潮濕的腳印。原因保持未解。包含一個可能成為線索的具體細節,但不要指出嫌疑人或解釋腳印。使用克制的文筆,並以未解決的抉擇作結。
對照您的核對清單檢視輸出。檔案室是否維持上鎖狀態,窗戶是否保持乾燥?它是否保留了懸念,還是編造了解釋?是否存在一個可作為線索但未被直接標註為線索的細節?結尾是否營造出抉擇而不僅僅是戛然而止?將每一項標記為「符合」、「部分符合」或「未達成」,並抄錄導致您做出該評判的確切句子。引文是用於您的筆記;它能防止像「張力很好」這種籠統的印象取代具體的觀察。
接下來,保持場景設定和懸疑要求不變,但更改風格指示。一種變體可以要求短促簡練的句子和極少的心情反思;另一種可以要求更長、更具觀察力的句子,同時保持視角緊貼角色。比較這些具體指示如何影響行文風格。您不是在問哪種風格絕對更優秀,而是在問哪種輸出能為該場景以及您預期的語調提供更多可用的素材。
最後,針對表現最佳的段落提出一項具體的修改要求。例如:「保持腳印和密室設定不變。刪除解釋管理員懷疑的句子;改透過動作傳達不安。」檢查修改後的版本是否存在對故事設定的意外更動,以及是否確實刪除了那些解釋。一次有價值的模型測試既包含初稿的流暢度,也包含修改時的表現,因為您真實的工作流程可能會涉及數輪局部調整。
使用評分表,然後做出編輯抉擇
一份簡單的評分表可以讓比較保持務實:
將最後一行視為關於您寫作流程的決定,而非文學價值的客觀衡量。相較於過早解開謎團的精緻段落,您可能更偏好保留了設定並帶給您強烈意象的粗略草稿。您也可能會認為這兩個模型對該任務都沒有幫助。如果您使用數值評分,請在開始前定義每個分數代表的意義,並且不要將微小的分數差距呈現為具有統計意義的差異。
這種方法也符合將創意工作視為反覆迭代的更廣泛視角。在一項針對新銳作家的實證研究中,Chakrabarty 及其同事檢視了作家與協同寫作系統的互動,並將寫作描述為一種反覆迭代的活動;該研究描述的是一個互動過程,而非單一提示詞就能產生完整的故事。該研究的參與者、系統及寫作任務限制了其觀察結果的推論範圍。這是測試您自身修改循環時有用的背景參考,而非證明某個特定模型或工作流程對所有作家都適用的依據。請參閱 [《大型語言模型時代的創意支援:一項涉及新銳作家的實證研究》](https://arxiv.org/abs/2309.12570)。
在更換工具之前先診斷表現不佳的輸出
當某個段落令人失望時,請精確找出失敗的原因。如果它與固定的設定相矛盾,請突顯該設定,並從提示詞中移除衝突的細節。如果文字遵循了前提但遺漏了預期的語調,請用具體特徵替換模糊的形容詞,或加入一段您自己撰寫的簡短範例。如果模型不斷解開預留的謎團,請明確要求它維持不確定性並避免說明原因。一次只更改一項指示,然後重新執行比較。
如果段落符合您的核對清單但感覺依然不對,問題可能出在品味或契合度,而非未能遵循指示。用具體的字眼記錄哪裡感覺不對勁:過多的解釋、平庸陳腐的意象、可預測的對話,或是與您期望不符的節奏。然後決定是值得嘗試進行針對性的修改要求,還是這個場景由您親自起草會更好。模型生成看似合理之文字的能力,並不能證明它理解了您的意圖,也不代表這些文字應當被保留。
模型測試的局限性
少數幾次生成無法證明某個模型在整個題材領域都始終表現出色,一位作家的評分標準也無法代表所有讀者。輸出可能存在差異,提示詞可能對某個模型更有利,而且對題材的熟悉度也會影響審閱者所注意到的細節。請讓您的結論保持克制與具體:「在這兩次測試中,這個版本更好地保留了場景設定」比「這是最好的懸疑寫作模型」更站得住腳。
此外,對模仿特定知名作家的做法請保持謹慎。如果您需要的是某種特定的技藝效果,請直接描述該效果——例如精煉簡省的句法、細緻入微的觀察或冷面幽默——並評估這些特質。這樣能針對您實際想要的寫作抉擇進行更清晰的測試,而不會將作家名字當作可靠的風格規範。
一次測試最有價值的成果就是對整個過程的客觀記錄:任務、提示詞、模型與設定、核對清單、輸出佐證,以及您嘗試過的修改。有了這些記錄,您就能選擇最能支援特定任務的模型——或者決定將時間花在親自修改段落上會更有價值。
