AskUserQuestion Lab
v2 — Batch Training Matrix + A/B Compare
v1.0 Not Set
— samples · — calibrations
存在浏览器 localStorage
Quick Fill: Anthropic 官方 f2api 中转 OpenAI DeepSeek 通义千问 本地 Ollama
请先填入 API Key 并点 Save & Test
Storage: persistent
STEP A — 生成测试场景 A
Single Mode 是早期版本的单条精测模式。日常推荐用 Batch Train,需要精雕某条时再来这里。
Single Case Test
Training Records 0
0Total
0Calibrated
—Avg AI
—Avg Human
—Δ
∅
No records yet.
Meta-Prompt Optimization 0
基于校准样本生成新 System Prompt。
0Calibrated
v1.0Active
○
No optimization yet.
Prompt Version Manager 1
v1.0


Version History
v2 Workflow

① Batch Train (核心)

1. Step A 输入 Scope + 可选指令 → 一键生成 10 个场景
2. 勾选要训练的场景 → Run
3. 10 个 case 并行跑 + 评分,显示在结果矩阵
4. Prompt Workbench 在顶部:可输入"快速指令"让 LLM 帮改 Prompt,或直接编辑 Prompt 全文
5. 点 Re-run 用新 Prompt 重跑所有 case,看分数变化
6. A/B 模式:点 Enable A/B,把另一版 Prompt 填入 B 框,左右对比
7. 满意后 Save as New Version
8. 逐 case 反馈 (👍/👎/✏️),最后 Submit All

⊙ Single Mode

精雕某个具体 case 时用。日常推荐用 Batch。

② History

所有沉淀的训练样本,可导出 JSON。

③ Optimize

基于 History 里的校准样本,自动生成 Prompt 优化建议。

④ Prompts

版本管理。支持 .md/.txt 上传、文本粘贴导入、下载导出。


常见报错

• 404: Endpoint URL 不对(忘了 /v1/chat/completions)
• 401: Key 无效
• 429: 速率/余额问题
• JSON parse failed: 模型能力不够生成结构化 JSON,换更强的模型或重试
• Empty response: 通常是中转返回了非标准格式