如果把 LLM 比喻成一個「說故事的演講者」,那麼提示詞就是題目,而模型配置參數(Output Configuration)就是你給這位演講者的「講話的規則按鈕」:
- Output Length(輸出長度限制):就像規定演講者的最大字數限制。超過字數它就會立刻閉嘴,但這不會自動讓它講得更精簡,除非你寫提示詞要求它「簡短總結」。
- Temperature(隨機度/溫度):控制演講者要嚴肅遵守常理還是發揮天馬行空的創意。溫度低(趨近 0)時,它每次只選最安全、機率最高的詞;溫度高時,各種罕見或意想不到的字詞都有機會出現。
- Top-K 與 Top-P(候選詞過濾網):在決定下一個字前,先把可能性太低或不相關的字詞過濾掉。
- Top-K:只留機率最高的「前 K 個字」(例如前 30 個字)。
- Top-P:只留累積機率達到 「P 百分比」 的字群(例如累積機率達 90% 的所有字)。
🎯 核心重點
- Output Length(Token 限制):限制生成 Token 的上限。生成更多 Token 代表更多運算、更高成本與較慢的響應。注意:縮短限制只會讓模型達到上限時「直接中斷生成」,不會自動讓模型寫作風格變簡練。
- Temperature(溫度參數):
- 控制 Token 選擇的隨機程度。
- Temperature = 0(Greedy Decoding 貪婪解碼):確定性最高,每次都固定挑選機率最高的 Token。適合數學解題、程式碼生成或有唯一標準答案的任務。
- Temperature 越高:輸出越隨機、多樣化且具創意;極高時所有 Token 的出現機率會趨近相同。
- Top-K 與 Top-P Sampling(抽樣過濾):
- Top-K:限定從機率最高的 前 K 個 Token 中進行抽樣。Top-K = 1 等同於貪婪解碼(Greedy Decoding)。
- Top-P(Nucleus Sampling):限定從累積機率和達到 P(範圍 0 到 1)的最小 Token 集合中抽樣。
- 參數之間的相互作用與極端覆蓋現象:
- 在同時提供多個參數時(如 Vertex AI),系統會先用 Top-K 與 Top-P 的篩選條件交集出候選 Token,再根據 Temperature 進行抽樣。
- 極端覆蓋規則:
- 若 Temperature = 0、Top-K = 1 或 Top-P = 0(或極小值),模型只會選機率最高的單一 Token,此時其他兩個參數將會失效或變得無關緊要。
- 推薦設定起手式:
- 確定性/唯一答案(如數學):Temperature = 0。
- 兼具條理與少許創意:Temperature = 0.2, Top-P = 0.95, Top-K = 30。
- 高創意生成:Temperature = 0.9, Top-P = 0.99, Top-K = 40。
💡 實際例子
想像模型在預測「今天天氣真__」後面的字:
- 機率排名:1. 好 (50%)、2. 棒 (30%)、3. 差 (10%)、4. 怪 (8%)、5. 狂 (2%)。
- Top-K = 2:模型只會從「好」和「棒」這 2 個候選字中選。
- Top-P = 0.8 (80%):1. 好(50%) + 2. 棒(30%) = 80%,所以候選庫同樣只留下「好」與「棒」。
- Temperature = 0:不管 Top-K 或 Top-P 設多少,永遠只選 100% 確定性最高的「好」。
❌ 常見錯誤
- 以為降低 Output Length 會讓 AI 的回答變得簡明扼要:只降低 Token 長度上限,模型會在講到一半時直接被切斷(Sentence truncation),出現斷句不完整的情況,必須在 Prompt 中要求「請用 50 字以內總結」才能改變寫作風格。
- 重複循環 Bug (Repetition Loop Bug):AI 陷入不斷重複同一句廢話或字詞的死循環。這在極低溫度(過度確定,死扣最高機率路徑)與極高溫度(過度隨機,隨機字詞機率性觸發回舊狀態)都有可能發生。
- 在需要邏輯推導(CoT)或精準回答時設定高 Temperature:這會導致邏輯推導失控或產生幻覺。
📖 來源依據
本單元內容依據《Prompt Engineering》教材:
- LLM 輸出配置與 Output Length:第 8、9、10 頁
- Sampling Controls (Temperature, Top-K, Top-P):第 9、10、11 頁
- 參數相互作用與極端覆蓋現象:第 11、12 頁
- 推薦起手參數值:第 12 頁
- Repetition Loop Bug 機制與原因:第 12、13 頁
📝 理解測驗
第 1 題(單選題) 如果你在系統管理後台將模型的 Output Length(輸出長度限制) 從 1024 降低到 50,但沒有修改提示詞,會發生什麼事? (A) 模型會自動將回答壓縮成精簡的摘要短句。 (B) 模型會提升回答的邏輯嚴謹度與精準度。 (C) 模型會照常生成回答,但在達到 50 個 Token 時被直接硬性截斷。 (D) 模型會自動降低 Temperature 來縮短文字。
第 2 題(單選題) 關於 Sampling Controls(抽樣控制參數)的「極端覆蓋現象」,下列哪一項敘述是正確的? (A) 當 Temperature 設為 0 時,Top-K 與 Top-P 的設定仍然會強烈影響輸出結果。 (B) 當 Top-K 設為 1 時,不論 Temperature 或 Top-P 如何設定,模型都只會選擇機率最高的下一個 Token。 (C) Top-P 設為 1 代表完全關閉隨機性,只允許輸出機率最高的 1 個字。 (D) 只有在高 Temperature 下才會發生「重複循環 Bug(Repetition Loop Bug)」。
第 3 題(應用情境題) 你正在開發一套「自動解答國中數學應用題」的 AI 系統,需要模型給出絕對精確、重複測試結果一致的解答步驟。 請問你會如何設定 Temperature 參數?為什麼?
測驗答案:(參考)
第1題:C
第2題:B
第3題:Temperature = 0(Greedy Decoding):確定性最高,每次都固定挑選機率最高的 Token。適合數學解題、程式碼生成或有唯一標準答案的任務。
註:這「學習系列」的文章,是記錄自己與AI一起探索知識的過程,也是我將AI做為私人家教的一項試驗。對於如何藉由Ai輔助自我學習,請參考這篇:
https://blog.udn.com/tku_89056/192561353
學習教材:《Prompt Engineering》
本書探討了提示工程的核心概念、多種進階技巧、以及最佳實務(use cases)。內容涵蓋如何設定大型語言模型的輸出長度與取樣參數,並且介紹零樣本、少樣本、角色扮演、思維鏈、以及如何結合外部工具的推理與行動等實用策略。此外,本書也示範了如何利用人工智慧來編寫、解釋、翻譯和除錯程式碼。最後,本書提供了多項專業的建議,例如簡化提示設計、優先使用正面指令、利用如JSON的結構化格式、以及落實詳盡的版本記錄與迭代。
本書作者Lee Boonstra是一名人工智慧軟體工程師、技術主管和系統架構師,在谷歌全球首席技術官辦公室(OCTO)、應用創新工廠等擁有10年以上的資歷。
免費下載:https://www.kaggle.com/whitepaper-prompt-engineering