SillyTavern教學(四)
SillyTavern的相關教學。本篇主要說明聊天補全預設設定檔的參數。
第一章:工欲善其事,必先利其器(三)
本篇介紹SillyTavern聊天補全預設設定檔的常見參數。
聊天補全預設設定檔是什麼?
用來儲存聊天補全請求中的參數、提示詞與功能設定的檔案。

右邊的插頭圖示可以打開「連線設定檔」。
左邊的圖示可以打開「預設設定檔」。

連線設定檔用來設定要使用的模型、API Key等內容,如何設定可以在其他網路教學查看。
在連線設定檔中,「API」這個欄位有許多選項,其中聊天補全與文字補全是最常使用的。
聊天補全與文字補全指的是傳送給API的請求格式,能使用哪種格式要看各平台與AI模型的設定。
目前,使用雲端模型時,一般會選擇使用「聊天補全」。

而在聊天補全預設設定檔中,可以設定傳送給AI端的各種參數、功能,以及提示詞。
以下僅解釋常見的參數。
上下文長度
控制最多要傳送多少內容給AI。
上下文指的是送給AI的提示詞,包含角色設定、世界書、聊天訊息、寫作提示詞等等。
送多少上下文給AI會影響每則回覆的價格。
以各家API的價格來說,輸入給AI的Tokens價格會比AI輸出的Tokens便宜許多。但是,即使你的錢包撐得住,過長的上下文也可能降低AI的回覆品質,需要玩家自行取捨。
ℹ️上下文長度需要包含最大回應長度。也就是說,上下文長度扣掉最大回應長度,才是留給提示詞與角色設定等內容的額度。
最大回應長度
控制AI最多可以回覆多少Tokens,只要一到達最大回應長度,AI會立刻截斷訊息。
使用推理模型時,應該將思維鏈的長度考慮在內。如果最大回應長度設定為300 Tokens,模型的思考內容只要超過300 Tokens,就會立刻截斷回覆,也就是說你只能拿到一個空回覆。
即時串流
設定AI的回覆是要一個字一個字回傳,還是整篇回覆生成完畢後再一次回傳。
逐字顯示時,受到審查的機率似乎比較高,但等待回覆的時間在體感上較短,而且發現文字沙拉就能立即按中止回覆。
整篇回覆再一次顯示時,則無法立刻中止出現文字沙拉的回覆,文字沙拉會重複到被最大回應長度截斷,並且等待回覆的時間在體感上較長。
ℹ️文字沙拉:通篇意義不明的文字,最常見的就是通篇都在跳針同一句話。
ℹ️我個人在開啟即時串流時,比較容易遇到Gemini截斷回覆的問題,因此偏好不開啟。
Temperature/溫度
簡單調整AI的創造力與一致性。
數值範圍通常是0.0到2.0。
數值調低,相當於降低AI的隨機性,你會獲得更保守、更一致的回應。
數值調高,相當於提升AI的隨機性,你會獲得更有創意、更多元的回應。
通常預設為1,建議一次調整一點就好,以免調得太高,得到AI發瘋般的回應。
Top-K
從機率最高的N個詞彙選擇下一個字。
設為50時,會從機率最高的50個詞彙選擇下一個字。
要注意的是,不是每個模型都有這個參數能調整,還有一些模型或平台會限制數值上限。
Top-P
從機率最高的候選項目開始,選取累積機率達到指定比例的範圍。
設為0.9時,AI會從機率由高到低排列候選項目,直到累積機率達到90%,再從這些項目中選擇下一個字。
數值調低,候選範圍會縮小,回應通常較保守、穩定。
數值調高,候選範圍會擴大,回應通常更多元,但也可能更容易出現不自然的內容。
Frequency Penalty/頻率懲罰
降低AI反覆使用相同Token的機率。
同一個Token出現越多次,受到的懲罰就越高。
通常保持為0即可。只有AI明顯反覆使用相同詞句時,才建議小幅提高。
Presence Penalty/存在懲罰
降低AI再次使用已經出現過的Token的機率。
只要某個Token曾經出現過,就會受到懲罰,不會因為出現次數增加而加重。
通常保持為0即可。調高後可能增加用詞與內容的變化,但也可能讓AI刻意避開人名、稱呼或其他需要重複出現的關鍵詞。
推理相關

請求思維鏈
勾選後,支援此功能的模型會輸出思考過程到聊天室裡。
沒有勾選時,模型不會輸出思考過程,但這不代表模型沒有思考。即使沒有勾選,模型仍然會思考,其思考過程也仍然會占用最大回應長度。
推理耗費
可以選擇要讓模型使用多少額度來思考,額度的部分如截圖內的說明。
模型支援的推理耗費額度可能不同,實際選擇時請參考SillyTavern當前版本的說明或各模型的API文件。
給模型更高的額度思考,回覆就會越聰明……Gemini的高推理可能還是有點笨就是了。
簡單的QA
一定要調整參數嗎?
上下文長度與最大回應長度應該按照你的需求調整,其他參數如果沒有需求,也可以不要調整。
只要出現文字沙拉就是參數有問題嗎?
不是。部分模型(尤其是Gemini)本身就有較高機率發瘋,如果不是每次回覆都出現不知所云或重複跳針的情況,應該跟參數無關。
上下文長度推薦設多少?
沒有推薦,根據個人需求調整。
我個人會設為4萬Tokens,但因為搭配記憶擴充,每次請求實際送出的上下文長度為1萬6。
調整上下文長度的考量:價格與模型的注意力。
上下文過長時,模型的注意力會分散,可能答非所問。這部分需要玩家自行取捨。
最大回應長度推薦設多少?
沒有推薦,根據個人需求調整。
我個人會設4千Tokens,推理耗費會選擇高或自動。
其他參數推薦設多少?
沒有推薦……但硬要說的話,我個人會推薦一般聊天就直接用預設值就好,省事。
這裡說的預設值是指別人分享的聊天補全預設檔內的預設值。
如果是要自己寫預設檔,就一樣用系統預設,真的覺得模型的回覆太單調,再慢慢調整參數。
SillyTavern系列文章
- 第零章:踏入AI角色扮演的世界:談論AI與AI RP。
- 第一章:工欲善其事,必先利其器(一):介紹ST、網路的ST教學,以及簡易QA。
- 第一章:工欲善其事,必先利其器(二):說明API、雲端模型與本地模型。
- 第一章:工欲善其事,必先利其器(三):說明聊天補全預設設定檔的常見參數。