DeepSeek 酒馆配置:三分钟接入 SillyTavern
最后更新:
酒馆接 DeepSeek 的最短路径:API 类型选 Chat Completion,Base URL 填 https://api.kkaiapi.com/v1,模型填 deepseek-v4-flash,充值拿 Key 即连即用。日常对话用 Flash,长剧情和复杂人设换 deepseek-v4-pro,参数预设照抄本文即可。
先给结论:这样填,立刻能聊
第一步,在充值页用支付宝或微信充上一笔,后台生成 sk 开头的 API Key。第二步,打开 SillyTavern,点顶部插头图标进入 API 连接页,API 类型选 Chat Completion,来源选 Custom (OpenAI-compatible)。第三步,按下面的信息填写,点 Connect,状态灯变绿即接入成功。 注意 Base URL 结尾带 /v1,但不要带 /chat/completions,酒馆会自动拼接剩余路径。JanitorAI 这类网页端工具才需要填完整端点 https://api.kkaiapi.com/v1/chat/completions,两者不要搞混。
API 类型: Chat Completion
来源 (Source): Custom (OpenAI-compatible)
Base URL: https://api.kkaiapi.com/v1
API Key: sk-xxxxxxxxxxxxxxxx
模型 (Model ID): deepseek-v4-flashV4 Flash 还是 V4 Pro:按场景选
结论先行:九成酒馆场景用 deepseek-v4-flash 就够,响应快,重度夜聊也几乎没有成本压力。写长篇剧情、跑复杂世界观或多角色群像时切 deepseek-v4-pro,它在角色一致性和细节铺陈上明显更稳。两个模型共用同一个 Key 和同一套预设,在酒馆的模型输入框里改个名字就完成切换,可以随时来回对比。
| 维度 | DeepSeek V4 Flash | DeepSeek V4 Pro |
|---|---|---|
| 响应速度 | 快,首字延迟低 | 稍慢,推理更充分 |
| 文风表现 | 日常对话自然,偶有套路化 | 剧情张力和细节描写更强 |
| 角色一致性 | 中短剧情稳定 | 长线人设、多角色群像更稳 |
| 成本水平 | 极低,重度玩家无压力 | 更高,见价格页 |
| 适合场景 | 日常陪聊、高频快节奏对话 | 长篇剧情、复杂世界观、精品卡 |
参数预设:这份配置直接抄
DeepSeek 系在创作场景建议把 temperature 放在 1.1 到 1.3 之间,数值太低容易复读和套路化开场;frequency_penalty 拉到 0.4 左右能明显压住口癖和重复句式。换用 Pro 时把 temperature 降回 1.0 上下,它本身的发挥已经足够放得开。 回复长度按阅读习惯给 400 到 800 token,同时把流式传输打开,首字出得快,体感完全不同。
{
"temperature": 1.2,
"top_p": 0.95,
"frequency_penalty": 0.4,
"presence_penalty": 0.3,
"max_tokens": 600,
"stream": true
}上下文管理:token 花在刀刃上
酒馆每发一条消息,都会把整段上下文重新发给模型,账单大头永远在输入侧。管好上下文,既省钱,又直接决定角色会不会中途忘掉设定。
- 上下文长度 (Context Size) 建议 32K 起步,酒馆默认值偏小,长剧情容易忘设定。
- 角色卡瘦身:人设描述控制在 1500 token 以内,冗长背景移入世界书按关键词触发。
- 世界书 (World Info) 扫描深度设 2,关闭递归扫描,避免每条消息都塞满触发条目。
- 开启 Summarize 摘要扩展,超出窗口的旧剧情自动折叠成摘要,长线不断档。
- 示例对话只留一两段最能代表语气的,不要把整段小说塞进角色卡。
成本实测:一晚重度对话的真实账单
按一条消息平均携带 6K token 上下文、回复 400 token 计算,连续聊 150 条,总量约 0.9M 输入加 0.06M 输出。用 deepseek-v4-flash 跑完这一晚,合计五毛钱上下;充 20 元够这个强度玩上一两个月。同样强度换 glm-5 大约几块钱,kimi-k2.6 略高;Claude 系文笔公认最好,但只适合普通创作向剧情。全站按量计费,没有订阅,不聊不扣钱。
| 模型 | kkaiapi (¥/1M,输入/输出) | 官方 (¥/1M,输入/输出) | 模型 ID |
|---|---|---|---|
| DeepSeek V4 Flash | ¥0.5 / ¥1 | ¥1 / ¥2 | deepseek-v4-flash |
| GLM-5 | ¥3 / ¥13.5 | ¥4 / ¥18 | glm-5 |
| Kimi K2.6 | ¥5 / ¥20 | ¥6.5 / ¥27 | kimi-k2.6 |
| Claude Sonnet 4.6 (仅普通创作) | ¥3 / ¥15 | 无人民币官方价 | claude-sonnet-4-6 |
常见问题
酒馆连接 DeepSeek 提示 404 或模型列表为空怎么办?
九成是 Base URL 填错:结尾必须是 /v1,不要多写 /chat/completions,也不要漏掉 /v1。来源要选 Custom (OpenAI-compatible) 而不是 OpenAI 官方源。改完点 Connect 重连,仍报错就对照代理报错排查文章逐项检查。
DeepSeek 官方 API 和 kkaiapi 有什么区别?
模型同款,接口同为 OpenAI 兼容格式。区别在于 kkaiapi 支持支付宝和微信充值,按量计费无订阅,价格低于官方,且同一个 Key 还能直接切 glm-5、kimi-k2.6、Claude 等其他模型,不用维护多个平台的账号。
上下文开到 32K 甚至 64K 会不会很贵?
不会。Context Size 是上限而不是每条消息的实际用量,费用只按真实发送的 token 结算。配合摘要扩展和世界书按需触发,长剧情的单条消息通常只带几千 token,64K 窗口也完全可控。
DeepSeek 角色扮演容易 OOC 吗,怎么保持角色一致性?
把角色卡写精简、temperature 不超过 1.3、用作者注释固定人设要点,Flash 在中短剧情里已经很稳。长线剧情或多角色群像更容易漂,这时切 deepseek-v4-pro,一致性会有肉眼可见的提升。
Claude 适合拿来跑酒馆吗?
Claude 的文笔在所有模型里公认最好,适合正剧向、文学向的普通创作。但 Anthropic 内容政策严格,禁止露骨内容,拒答场景比 DeepSeek 多。追求创作自由度和性价比,优先 DeepSeek V4 系,其次 GLM-5 和 Kimi。
为什么有时候会被拒绝回复?
每家模型都有自己的内容政策,触发拒答属于正常机制。把场景和人设写清楚、避开敏感题材,拒答会明显减少。不建议使用所谓破限手段,既不稳定,也容易让对话质量劣化。