模型
模型页是一个浏览器,用于查看本地 Ollama 实例中安装的所有模型,并提供详细的元数据与能力检测。
侧边栏位置: 模型 路由: /settings?tab=models
界面概览
模型页(通过 设置 > 模型 标签页进入)为每个已安装的模型显示一张卡片或一行条目,关键信息一目了然。
模型详情
每张模型卡片显示:
| 字段 | 说明 |
|---|---|
| 名称 | 模型标识(例如 llama3.2:latest) |
| 参数量 | 参数数量(例如 3B、7B、70B) |
| 量化等级 | 压缩程度(例如 Q4_0、Q8_0、F16) |
| 系列 | 模型系列(例如 llama、mistral、gemma) |
| 格式 | 模型格式(例如 gguf) |
结构示意图
点击某个模型,可以看到一张结构示意图,展示模型的内部构造 —— 层数、注意力头数、嵌入维度等。这些信息解析自 Ollama 的模型元数据。
能力检测
LLMxRay 会自动检测每个模型能做什么。能力信息是实时从 Ollama 读取的,因此新发布的模型无需 LLMxRay 更新即可正常工作。当模型自己没有报告时,LLMxRay 会退回到基于名称的模式匹配。
从 Ollama 0.32 起,模型列表接口(/api/tags)会直接报告每个模型的能力、上下文长度和嵌入宽度。LLMxRay 以此为主要来源,因此能力图标和模型筛选在列表加载的那一刻就是正确的,而不必等待逐个模型的 /api/show 往返。/api/show 仍会在后台运行,用参数、模板和架构元数据丰富缓存。
| 能力 | 如何检测 | 界面上的效果 |
|---|---|---|
| 推理 | Ollama capabilities,否则用名称模式(deepseek-r1、qwq、gpt-oss、magistral、nemotron、qwen3.x、muse-glimmer、glm-*、kimi-k* 等) | 启用对话诊断中的推理标签页 |
| 视觉 | Ollama capabilities,否则用名称模式(llava、*-vl、moondream、gemma3、Llama-vision 等) | 启用对话中的图片附件 |
| 嵌入 | Ollama capabilities,否则用模型系列或名称 | 出现在嵌入页和知识库的模型选择器中 |
| 工具调用 | Ollama capabilities | 启用对话中的工具调用 |
由于能力信息直接来自 Ollama,LLMxRay 会自动跟上新的模型系列。被报告出来的能力集合被视为权威 —— 如果守护进程列出了某个模型的能力但其中没有 thinking,LLMxRay 会相信它,而不是根据名称去猜。名称模式只在模型完全没有报告任何能力时才生效。
只支持嵌入的模型会被自动从对话模型选择器中过滤掉。
推理强度
对于具备推理能力的模型,对话诊断页会暴露 Ollama 的 think 参数:
| 设置 | 发送为 | 含义 |
|---|---|---|
| 关闭 | (不发送) | 不进行内部推理 |
| 开启 | true | 启用推理;由模型自行决定投入多少 |
| 低 / 中 / 高 | "low" / "medium" / "high" | 明确指定推理预算 |
| 最大 | "max" | 最大推理预算 |
不支持分级强度的模型,会把任何级别都当作「开启推理」处理。
嵌入维度
嵌入页可以通过 Ollama 的 dimensions 参数请求更窄的输出向量(Matryoshka 截断)。留空则使用模型的原生宽度 —— 该宽度会作为输入框的占位提示,读取自模型列表。未针对 Matryoshka 截断训练的模型,无论如何都会返回原生宽度。
模型目录
目录提供一份经过整理的可用模型视图,附带对比表格,帮助你为自己的使用场景挑选合适的模型。
小贴士
- 量化的取舍 —— 更低的量化等级(Q4)占用更少内存,但质量略有下降。Q8 和 F16 质量更高,但需要更多内存。
- 拉取更多模型可在终端中进行:
ollama pull <模型名> - 能力检测会自动调整整个界面 —— 你不需要手动配置任何东西。