Skip to content

本地 AI 历史

LLMxRay 会自动记录你运行的每一次实验 —— 基准测试、对比、对话、训练。这是你自己的研究档案,可检索、可导出。

会记录什么

与模型的每一次交互都会产生一条历史记录。下表列出各类记录所捕获的数据。

记录类型捕获的数据
基准测试测试集名称、模型、题目、答案、准确率分数、分类别细分、耗时
对比提示词、参与对比的模型、输出、Token 税、延迟、置信度分数
语言对比提示词、测试的语言、模型、各语言的输出、质量指标
对话会话完整对话(全部轮次)、模型、时间戳、token 数、逐 token 延迟
训练数据集名称、模型、训练参数、损失曲线、epoch 数、耗时
嵌入输入文本、模型、向量维度、相似度分数
工具工坊工具定义、测试输入、模型回复、执行结果

记录会自动带上时间戳和模型名称标签。

查找你的数据

历史页提供多种筛选条件,帮助你缩小档案范围。

  • 类型 —— 只显示基准测试、对话、对比或其他任意类型。
  • 模型 —— 按使用的模型筛选(例如 llama3deepseek-r1phi4)。
  • 语言 —— 对语言对比,可按测试的语言筛选。
  • 日期范围 —— 选择起止日期,聚焦某个特定时期。
  • 标签 —— 你自己为记录添加的自定义标签。

多个筛选条件之间是「与」的关系 —— 同时选择模型和类型,只会显示两个条件都满足的记录。

趋势分析

历史页包含一张活动图表,把你的实验过程随时间可视化。

  • 活动随时间变化 —— 一条时间线,显示你每天或每周运行了多少次实验。可以看出研究中的空档或高峰。
  • 使用过的模型 —— 你测试最多的模型的分布。有助于判断自己是不是过度依赖某一个模型,还是探索得足够广。
  • 值得留意的模式:
    • 同一模型在连续几次基准测试中准确率的提升。
    • 模型更新或参数调整后延迟的变化。
    • 在你的使用场景中,哪个模型总是在对比中胜出。
    • 训练损失曲线趋于平坦 —— 说明再增加 epoch 也没有帮助。

导出

历史记录支持两种导出格式。

  • JSON —— 导出全部记录的完整结构化数据。包含每一个字段:时间戳、模型名称、提示词、输出、分数、参数和标签。适合脚本处理、备份或重新导入。
  • CSV —— 把当前筛选后的视图导出为扁平表格数据。列包括记录类型、模型、日期、汇总指标(准确率、延迟、token 数)和标签。可用 Excel、Google Sheets 或 pandas 打开。

导出步骤:

  1. 如果只需要一部分,先应用筛选(不筛选则导出全部)。
  2. 点击导出按钮。
  3. 选择 JSON 或 CSV —— 文件会立即下载。

管理存储

历史记录存储在浏览器的 IndexedDB 中。不花钱,也不需要服务器。

  • 保留设置 —— 配置记录保留多久。可选范围从 30 天到永久。超出保留期的旧记录会被自动清理。
  • 清空历史 —— 使用清空历史操作删除全部记录,也可以从列表中单独删除某条。该操作不可撤销。
  • 体积估算 —— 一条典型的基准测试记录约 2–5 KB;一次完整的对话会话根据长度约 5–50 KB。数千条记录完全可以放进浏览器的存储限额(通常 50 MB 以上)。

隐私

所有历史数据都存储在你浏览器本地的 IndexedDB 中,不会发送到任何云服务。历史记录保存在独立的数据存储中,与原始的基准测试结果、对话会话和训练数据分开。清空历史不会影响你的其他数据。

Released under the Apache 2.0 License.