你当前正在访问 Microsoft Azure Global Edition 技术文档网站。 如果需要访问由世纪互联运营的 Microsoft Azure 中国技术文档网站,请访问 https://docs.azure.cn。
Important
- Foundry Local CLI 以预览版提供。 公共预览版为正在部署的功能提供早期访问。
- 正式发布 (GA) 之前,功能、方法和流程可能会发生更改或功能受限。
本文提供了 Foundry Local 命令行接口(CLI)的综合参考。 CLI 将命令组织成逻辑类别,以帮助管理模型、控制本地服务器和维护本地缓存。
先决条件
- 安装 Foundry Local。
- CLI 可用的本地终端
foundry。 - 确保您在首次下载(执行提供程序和模型)时拥有互联网连接。
- Azure RBAC:不适用(在本地运行)。
- 如果Windows上有 Intel NPU,请安装 Intel NPU 驱动程序以获得最佳 NPU 加速。
安装 Foundry Local
使用操作系统的包管理器安装 Foundry Local。
-
Windows:打开终端并运行:
winget install Microsoft.FoundryLocal -
macOS:打开终端并运行:
或者,从 foundry-samples GitHub 存储库下载安装程序。brew tap microsoft/foundrylocal brew install foundrylocal
验证安装:
foundry --version
请确保你具有安装软件的管理员权限。
Tip
如果在安装后看到服务连接错误(例如), Request to local service failed请运行 foundry server restart。
快速验证
运行这些命令以确认 CLI 已安装且可访问该服务。
显示 CLI 帮助信息:
foundry --help此命令输出使用情况信息和可用命令组的列表。
参考: 概述
检查服务器状态:
foundry 服务器状态“'”
此命令打印 Foundry Local 守护程序是否正在运行并包括其本地终结点。
参考: 服务器命令
概述
使用内置帮助浏览命令和选项。
CLI 将命令组织成以下组:
-
模型:
modelcache -
运行:
run、、chat、completetranscribe -
服务器:
server -
设置:
config -
帮助:
statusreport
下表汇总了顶级命令:
| Command | Description |
|---|---|
foundry model |
发现、检查、下载、加载和卸载本地模型。 |
foundry chat <model> |
启动交互式本地聊天会话。 |
foundry complete <model> <prompt> |
生成一个无状态文本完成。 |
foundry run <model> |
运行自动路由到聊天或听录的模型。 |
foundry server |
启动、停止、重启、检查和排查本地 Foundry 守护程序的问题。 |
foundry cache |
检查和管理下载的模型缓存条目。 |
foundry config |
查看和编辑持久 Foundry CLI 设置。 |
foundry status |
显示系统、服务、模型和连接诊断。 |
foundry report |
打开诊断的预填充GitHub问题。 |
foundry transcribe |
启动交互式本地语音听录会话或转录文件。 |
模型命令
下表总结了与管理和运行模型相关的命令:
注释
可以通过参数model或模型 ID 来指定参数。 使用别名:
- 自动为可用硬件选择最佳模型。 例如,如果有可用的 Nvidia GPU,Foundry Local 会选择最佳 GPU 模型。 如果有受支持的 NPU 可用,Foundry Local 会选择 NPU 模型。
- 允许使用较短的名称,而无需记住模型 ID。
如果要运行特定模型,请使用模型 ID。 例如,若要在 qwen2.5-0.5b CPU 上运行,而不考虑可用硬件,请使用 foundry run qwen2.5-0.5b-instruct-generic-cpu。
| Command | Description |
|---|---|
foundry model --help |
显示所有可用的模型相关命令及其用法。 |
foundry model list |
列出所有可用的模型供本地使用。 首次运行时,它会为硬件下载执行提供程序 (EP)。 |
foundry model info <model> |
显示有关特定模型的详细信息。 |
foundry model download <model> |
在不运行模型的情况下将模型下载到本地缓存。 |
foundry model load <model> |
将模型加载到服务中。 |
foundry model unload <model> |
从服务中卸载模型。 |
模型列表排序
当多个模型 ID 变体可用于别名时,模型列表按优先级顺序显示模型。 在指定模型 alias 时运行的模型是列表中的第一个模型。
模型列表筛选
使用显式选项缩小 foundry model list 或展开结果。
注释
安装完成后首次运行foundry model list时,Foundry Local会根据您计算机的硬件配置自动下载相关的执行提供程序(EP)。 此时会看到一个进度栏,指示模型列表出现之前下载完成。
| 选项 | Description |
|---|---|
--device <device> |
按设备筛选模型。 |
--type <type> |
按类型筛选模型。 |
--search <query> |
按搜索查询筛选模型。 |
--cached |
将列表筛选为缓存的模型。 |
--loaded |
将列表筛选为已加载的模型。 |
--variants |
在列表中包括模型变体。 |
示例
foundry model list --device gpu
foundry model list --type chat
foundry model list --search qwen
foundry model list --cached
foundry model list --loaded
foundry model list --variants
这些示例使用支持的选项筛选或展开模型列表。
参考: 模型列表筛选
以交互方式运行模型
运行模型,并在终端中直接与它交互:
foundry chat qwen2.5-0.5b
Foundry Local 在首次运行时下载模型,然后启动交互式会话。 输入获取响应的提示:
Why is the sky blue?
Tip
替换为 qwen2.5-0.5b 目录中的任何模型别名。 运行 foundry model list 以查看可用的模型。 Foundry Local 下载最符合硬件的变体,例如 NVIDIA GPU 的 CUDA 变体或 Qualcomm NPU 的 NPU 变体。
服务器命令
下表总结了与管理和运行 Foundry Local 服务相关的命令:
| Command | Description |
|---|---|
foundry server --help |
显示所有可用的与服务器相关的命令及其用法。 |
foundry server start |
启动 Foundry Local 守护程序和 OpenAI 兼容的本地服务。 |
foundry server start --port <port> |
在指定的 TCP 端口上启动本地服务。 用于 0 OS 分配的端口。 |
foundry server start --idle-timeout <minutes> |
在指定的非活动分钟数后停止守护程序。 用于 0 使守护程序保持运行。 |
foundry server stop |
停止 Foundry Local 守护程序。 |
foundry server restart |
重启 Foundry 本地守护程序和本地服务。 |
foundry server restart --port <port> --idle-timeout 0 |
在指定的 TCP 端口上重启本地服务,并使守护程序保持运行。 |
foundry server status |
显示守护程序状态、本地服务 URL、进程 ID、运行时间和日志位置。 |
foundry server logs |
显示 Foundry 本地守护程序和 SDK 日志。 |
固定端口本地服务器
若要在固定端口上启动本地服务并保持守护程序运行,请使用--port--idle-timeout 0:
foundry server start --port 39839 --idle-timeout 0
如果守护程序正在运行并且需要应用新端口,请使用相同的选项重启它:
foundry server restart --port 39839 --idle-timeout 0
若要验证本地终结点 URL,请运行:
foundry server status
缓存命令
下表汇总了用于管理存储模型的本地缓存的命令:
| Command | Description |
|---|---|
foundry cache --help |
显示所有可用的缓存相关命令及其用法。 |
foundry cache location |
显示当前缓存目录。 |
foundry cache list |
列出存储在本地缓存中的所有模型。 |
foundry cache cd <path> |
将缓存目录更改为指定的路径。 |
foundry cache remove <model> |
从本地缓存中删除模型。 |
执行提供程序
执行提供程序是硬件特定的加速库,可在设备上高效运行模型。
内置执行提供程序
Foundry Local 包括 CPU 执行提供程序、WebGPU 执行提供程序和 CUDA 执行提供程序。
CPU 执行提供程序使用 Microsoft 线性代数子例程 (MLAS) 在任何 CPU 上运行,并且是 Foundry Local 的 CPU 回退。
WebGPU 执行提供程序使用 Dawn,这是一个基于 Web 的 API 的本地实现,能够在任何 GPU 上进行加速,是 Foundry Local 的 GPU 回退选项。
CUDA 执行提供程序使用 NVIDIA CUDA 在 NVIDIA GPU 上加速。 它需要 NVIDIA GeForce RTX 30 系列及更高版本,并且建议的最低驱动程序版本 32.0.15.5585 和 CUDA 版本 12.5。 它受以下许可条款的约束: NVIDIA 软件开发工具包的许可协议 - EULA。
插件执行提供程序
下表中列出的执行提供程序可用于Windows上的动态下载和注册,具体取决于设备和驱动程序兼容性。 它们受指定许可条款的约束。
Foundry Local 会在首次运行时自动下载这些执行提供程序。 当新版本可用时,插件执行提供程序会自动更新。
| 名称(供应商) | 要求 | 许可条款 |
|---|---|---|
NvTensorRTRTXExecutionProvider (NVIDIA) |
NVIDIA GeForce RTX 30XX 及更高版本,最低建议的驱动程序版本 32.0.15.5585 和 CUDA 版本 12.5 | NVIDIA 软件开发工具包的许可协议 - EULA |
OpenVINOExecutionProvider (Intel) |
CPU:Intel TigerLake(第 11 代)及更高版本,最低推荐驱动程序 32.0.100.9565 GPU:Intel AlderLake(第 12 代)及更高版本,最低推荐驱动程序版本 32.0.101.1029 NPU:Intel ArrowLake(第15代)及更高版本,具有最低推荐驱动 32.0.100.4239 |
Intel OBL 分发商业使用许可协议 v2025.02.12 |
QNNExecutionProvider (高通) |
Snapdragon(R) X Elite - X1Exxxxx - Qualcomm(R) Hexagon(TM) NPU,最低驱动程序版本 30.0.140.0 及更高版本 Snapdragon(R) X Plus - X1Pxxxxx - Qualcomm(R) Hexagon(TM) NPU,最低驱动程序版本 30.0.140.0 及更高版本 |
若要查看 QNN 许可证,请下载 Qualcomm® 神经处理 SDK,提取 ZIP,然后打开 LICENSE.pdf 文件。 |
VitisAIExecutionProvider (AMD) |
最低配置:Adrenalin Edition 25.6.3 与 NPU 驱动 32.00.0203.280 最高版本:Adrenalin Edition 25.9.1,使用的 NPU 驱动程序版本为 32.00.0203.297 |
无需其他许可证 |
将 Open WebUI 与本地服务器配合使用
将 Open WebUI 连接到 Foundry Local,以获取完全在设备上运行的基于浏览器的聊天界面。
启动模型并将终端保持打开状态:
foundry run qwen2.5-0.5b
1. Get your local endpoint URL:
```bash
foundry server status
复制终结点 URL。 Foundry Local 每次启动服务时都会分配动态端口。
安装并启动 Open WebUI,然后在浏览器中打开
http://localhost:8080。将 Open WebUI 连接到 Foundry 本地:
- 转到“设置>管理员设置连接”>并启用直接连接。
- 转到 “设置>连接>管理直接连接 ” +并选择。
- 将 URL
http://localhost:PORT/v1设置为(替换为PORT步骤 2 中的端口),将 身份验证 设置为 “无”。 - 选择“保存”。
从下拉列表中选择一个模型并开始聊天。
Tip
如果未显示模型,请在终端中运行 foundry run <model> 并重新加载 Open WebUI。 如果连接失败,请使用 .. 确认端口 foundry server status。
升级 Foundry Local
运行操作系统的命令以升级 Foundry Local。
-
Windows:
winget upgrade --id Microsoft.FoundryLocal -
macOS:
brew upgrade foundrylocal
卸载 Foundry 本地
运行操作系统的命令以卸载 Foundry Local。
-
Windows:
winget uninstall Microsoft.FoundryLocal -
macOS:
brew rm foundrylocal brew untap microsoft/foundrylocal brew cleanup --scrub
故障排除
服务连接问题
如果在运行如下 foundry model list命令时看到此错误:
Exception: Request to local service failed.
Uri: http://127.0.0.1:0/foundry/list
The requested address is not valid in its context. (127.0.0.1:0)
Please check service status with 'foundry server status'.
重启服务 :
foundry server restart
此命令修复了服务器因端口绑定问题而无法访问的情况。
有关更多故障排除指南,请参阅 最佳做法和故障排除。