分析
分析页深入呈现你的大模型使用模式、性能特征,以及回复质量随时间的变化。
侧边栏位置: 分析 路由: /analytics
各个分区
回复质量
质量随轮次变化展示回复质量在多轮对话中的演变。每条助手回复按 0–5 分打分,依据是:
- 字数(权重 40%)—— 越长得分越高,上限为 50 词
- 词汇多样性(权重 30%)—— 不重复词数与总词数之比
- 低重复度(权重 30%)—— 4-gram 重复越少得分越高
数据点按颜色区分:绿色(3.5 以上)、黄色(2–3.5)、红色(低于 2)。
延迟分析
三张分析请求性能的图表:
- 请求延迟 P50/P95/P99 —— 会话中
totalDurationMs的滑动窗口百分位 - TTFT P50/P95/P99 —— 对首 token 时间做同样的处理
- token 间延迟分布 —— token 与 token 之间耗时的直方图,采用 OpenTelemetry 推荐的分桶边界
可靠性
- 各模型错误率 —— 堆叠柱状图,按模型显示各类错误
- 错误时间线 —— 每日错误数量随时间的变化
- 加载耗时趋势 —— 模型加载时间,并标出冷启动(超过 500ms 时显示橙色点)
错误类别包括:连接、超时、模型未找到、超出上下文、内存不足、工具错误、已取消。
使用模式
- 请求量 —— 每日请求数量的柱状图
- 模型分布 —— 环形图,显示各模型请求量的占比
- 活跃时段热力图 —— 7 天 × 24 小时的网格,按请求密度着色
设置的影响
一张散点图,显示温度与 token/秒之间的相关性。每个点代表一次会话。需要至少 2 次明确设置了温度的会话。
模型内存
近期模型加载事件的时间线,显示加载耗时以及冷启动 / 热启动状态。冷启动(超过 500ms)以橙色高亮。
数据来源
所有分析都在客户端计算,数据来自已经存储在 IndexedDB 中的 SessionMetrics。不需要额外采集任何数据。有新会话记录时,图表会响应式地自动更新。