Skip to content

分析

分析页深入呈现你的大模型使用模式、性能特征,以及回复质量随时间的变化。

侧边栏位置: 分析 路由: /analytics

各个分区

回复质量

质量随轮次变化展示回复质量在多轮对话中的演变。每条助手回复按 0–5 分打分,依据是:

  • 字数(权重 40%)—— 越长得分越高,上限为 50 词
  • 词汇多样性(权重 30%)—— 不重复词数与总词数之比
  • 低重复度(权重 30%)—— 4-gram 重复越少得分越高

数据点按颜色区分:绿色(3.5 以上)、黄色(2–3.5)、红色(低于 2)。

延迟分析

三张分析请求性能的图表:

  • 请求延迟 P50/P95/P99 —— 会话中 totalDurationMs 的滑动窗口百分位
  • TTFT P50/P95/P99 —— 对首 token 时间做同样的处理
  • token 间延迟分布 —— token 与 token 之间耗时的直方图,采用 OpenTelemetry 推荐的分桶边界

可靠性

  • 各模型错误率 —— 堆叠柱状图,按模型显示各类错误
  • 错误时间线 —— 每日错误数量随时间的变化
  • 加载耗时趋势 —— 模型加载时间,并标出冷启动(超过 500ms 时显示橙色点)

错误类别包括:连接、超时、模型未找到、超出上下文、内存不足、工具错误、已取消。

使用模式

  • 请求量 —— 每日请求数量的柱状图
  • 模型分布 —— 环形图,显示各模型请求量的占比
  • 活跃时段热力图 —— 7 天 × 24 小时的网格,按请求密度着色

设置的影响

一张散点图,显示温度与 token/秒之间的相关性。每个点代表一次会话。需要至少 2 次明确设置了温度的会话。

模型内存

近期模型加载事件的时间线,显示加载耗时以及冷启动 / 热启动状态。冷启动(超过 500ms)以橙色高亮。

数据来源

所有分析都在客户端计算,数据来自已经存储在 IndexedDB 中的 SessionMetrics。不需要额外采集任何数据。有新会话记录时,图表会响应式地自动更新。

Released under the Apache 2.0 License.