本地 AI 历史
LLMxRay 会自动记录你运行的每一次实验 —— 基准测试、对比、对话、训练。这是你自己的研究档案,可检索、可导出。
会记录什么
与模型的每一次交互都会产生一条历史记录。下表列出各类记录所捕获的数据。
| 记录类型 | 捕获的数据 |
|---|---|
| 基准测试 | 测试集名称、模型、题目、答案、准确率分数、分类别细分、耗时 |
| 对比 | 提示词、参与对比的模型、输出、Token 税、延迟、置信度分数 |
| 语言对比 | 提示词、测试的语言、模型、各语言的输出、质量指标 |
| 对话会话 | 完整对话(全部轮次)、模型、时间戳、token 数、逐 token 延迟 |
| 训练 | 数据集名称、模型、训练参数、损失曲线、epoch 数、耗时 |
| 嵌入 | 输入文本、模型、向量维度、相似度分数 |
| 工具工坊 | 工具定义、测试输入、模型回复、执行结果 |
记录会自动带上时间戳和模型名称标签。
查找你的数据
历史页提供多种筛选条件,帮助你缩小档案范围。
- 类型 —— 只显示基准测试、对话、对比或其他任意类型。
- 模型 —— 按使用的模型筛选(例如
llama3、deepseek-r1、phi4)。 - 语言 —— 对语言对比,可按测试的语言筛选。
- 日期范围 —— 选择起止日期,聚焦某个特定时期。
- 标签 —— 你自己为记录添加的自定义标签。
多个筛选条件之间是「与」的关系 —— 同时选择模型和类型,只会显示两个条件都满足的记录。
趋势分析
历史页包含一张活动图表,把你的实验过程随时间可视化。
- 活动随时间变化 —— 一条时间线,显示你每天或每周运行了多少次实验。可以看出研究中的空档或高峰。
- 使用过的模型 —— 你测试最多的模型的分布。有助于判断自己是不是过度依赖某一个模型,还是探索得足够广。
- 值得留意的模式:
- 同一模型在连续几次基准测试中准确率的提升。
- 模型更新或参数调整后延迟的变化。
- 在你的使用场景中,哪个模型总是在对比中胜出。
- 训练损失曲线趋于平坦 —— 说明再增加 epoch 也没有帮助。
导出
历史记录支持两种导出格式。
- JSON —— 导出全部记录的完整结构化数据。包含每一个字段:时间戳、模型名称、提示词、输出、分数、参数和标签。适合脚本处理、备份或重新导入。
- CSV —— 把当前筛选后的视图导出为扁平表格数据。列包括记录类型、模型、日期、汇总指标(准确率、延迟、token 数)和标签。可用 Excel、Google Sheets 或 pandas 打开。
导出步骤:
- 如果只需要一部分,先应用筛选(不筛选则导出全部)。
- 点击导出按钮。
- 选择 JSON 或 CSV —— 文件会立即下载。
管理存储
历史记录存储在浏览器的 IndexedDB 中。不花钱,也不需要服务器。
- 保留设置 —— 配置记录保留多久。可选范围从 30 天到永久。超出保留期的旧记录会被自动清理。
- 清空历史 —— 使用清空历史操作删除全部记录,也可以从列表中单独删除某条。该操作不可撤销。
- 体积估算 —— 一条典型的基准测试记录约 2–5 KB;一次完整的对话会话根据长度约 5–50 KB。数千条记录完全可以放进浏览器的存储限额(通常 50 MB 以上)。
隐私
所有历史数据都存储在你浏览器本地的 IndexedDB 中,不会发送到任何云服务。历史记录保存在独立的数据存储中,与原始的基准测试结果、对话会话和训练数据分开。清空历史不会影响你的其他数据。