你当前正在访问 Microsoft Azure Global Edition 技术文档网站。 如果需要访问由世纪互联运营的 Microsoft Azure 中国技术文档网站,请访问 https://docs.azure.cn

Foundry Local CLI 参考

Important

  • Foundry Local CLI 以预览版提供。 公共预览版为正在部署的功能提供早期访问。
  • 正式发布 (GA) 之前,功能、方法和流程可能会发生更改或功能受限。

本文提供了 Foundry Local 命令行接口(CLI)的综合参考。 CLI 将命令组织成逻辑类别,以帮助管理模型、控制本地服务器和维护本地缓存。

先决条件

  • 安装 Foundry Local
  • CLI 可用的本地终端 foundry
  • 确保您在首次下载(执行提供程序和模型)时拥有互联网连接。
  • Azure RBAC:不适用(在本地运行)。
  • 如果Windows上有 Intel NPU,请安装 Intel NPU 驱动程序以获得最佳 NPU 加速。

安装 Foundry Local

使用操作系统的包管理器安装 Foundry Local。

  • Windows:打开终端并运行:
    winget install Microsoft.FoundryLocal
    
  • macOS:打开终端并运行:
    brew tap microsoft/foundrylocal
    brew install foundrylocal
    
    或者,从 foundry-samples GitHub 存储库下载安装程序。

验证安装:

foundry --version

请确保你具有安装软件的管理员权限。

Tip

如果在安装后看到服务连接错误(例如), Request to local service failed请运行 foundry server restart

快速验证

运行这些命令以确认 CLI 已安装且可访问该服务。

  1. 显示 CLI 帮助信息:

     foundry --help
    

    此命令输出使用情况信息和可用命令组的列表。

    参考: 概述

  2. 检查服务器状态:

foundry 服务器状态“'”

此命令打印 Foundry Local 守护程序是否正在运行并包括其本地终结点。

参考: 服务器命令

概述

使用内置帮助浏览命令和选项。

CLI 将命令组织成以下组:

  • 模型modelcache
  • 运行run、、chatcompletetranscribe
  • 服务器server
  • 设置config
  • 帮助statusreport

下表汇总了顶级命令:

Command Description
foundry model 发现、检查、下载、加载和卸载本地模型。
foundry chat <model> 启动交互式本地聊天会话。
foundry complete <model> <prompt> 生成一个无状态文本完成。
foundry run <model> 运行自动路由到聊天或听录的模型。
foundry server 启动、停止、重启、检查和排查本地 Foundry 守护程序的问题。
foundry cache 检查和管理下载的模型缓存条目。
foundry config 查看和编辑持久 Foundry CLI 设置。
foundry status 显示系统、服务、模型和连接诊断。
foundry report 打开诊断的预填充GitHub问题。
foundry transcribe 启动交互式本地语音听录会话或转录文件。

模型命令

下表总结了与管理和运行模型相关的命令:

注释

可以通过参数model模型 ID 来指定参数。 使用别名:

  • 自动为可用硬件选择最佳模型。 例如,如果有可用的 Nvidia GPU,Foundry Local 会选择最佳 GPU 模型。 如果有受支持的 NPU 可用,Foundry Local 会选择 NPU 模型。
  • 允许使用较短的名称,而无需记住模型 ID。

如果要运行特定模型,请使用模型 ID。 例如,若要在 qwen2.5-0.5b CPU 上运行,而不考虑可用硬件,请使用 foundry run qwen2.5-0.5b-instruct-generic-cpu

Command Description
foundry model --help 显示所有可用的模型相关命令及其用法。
foundry model list 列出所有可用的模型供本地使用。 首次运行时,它会为硬件下载执行提供程序 (EP)。
foundry model info <model> 显示有关特定模型的详细信息。
foundry model download <model> 在不运行模型的情况下将模型下载到本地缓存。
foundry model load <model> 将模型加载到服务中。
foundry model unload <model> 从服务中卸载模型。

模型列表排序

当多个模型 ID 变体可用于别名时,模型列表按优先级顺序显示模型。 在指定模型 alias 时运行的模型是列表中的第一个模型。

模型列表筛选

使用显式选项缩小 foundry model list 或展开结果。

注释

安装完成后首次运行foundry model list时,Foundry Local会根据您计算机的硬件配置自动下载相关的执行提供程序(EP)。 此时会看到一个进度栏,指示模型列表出现之前下载完成。

选项 Description
--device <device> 按设备筛选模型。
--type <type> 按类型筛选模型。
--search <query> 按搜索查询筛选模型。
--cached 将列表筛选为缓存的模型。
--loaded 将列表筛选为已加载的模型。
--variants 在列表中包括模型变体。

示例

foundry model list --device gpu
foundry model list --type chat
foundry model list --search qwen
foundry model list --cached
foundry model list --loaded
foundry model list --variants

这些示例使用支持的选项筛选或展开模型列表。

参考: 模型列表筛选

以交互方式运行模型

运行模型,并在终端中直接与它交互:

foundry chat qwen2.5-0.5b

Foundry Local 在首次运行时下载模型,然后启动交互式会话。 输入获取响应的提示:

Why is the sky blue?

Tip

替换为 qwen2.5-0.5b 目录中的任何模型别名。 运行 foundry model list 以查看可用的模型。 Foundry Local 下载最符合硬件的变体,例如 NVIDIA GPU 的 CUDA 变体或 Qualcomm NPU 的 NPU 变体。

服务器命令

下表总结了与管理和运行 Foundry Local 服务相关的命令:

Command Description
foundry server --help 显示所有可用的与服务器相关的命令及其用法。
foundry server start 启动 Foundry Local 守护程序和 OpenAI 兼容的本地服务。
foundry server start --port <port> 在指定的 TCP 端口上启动本地服务。 用于 0 OS 分配的端口。
foundry server start --idle-timeout <minutes> 在指定的非活动分钟数后停止守护程序。 用于 0 使守护程序保持运行。
foundry server stop 停止 Foundry Local 守护程序。
foundry server restart 重启 Foundry 本地守护程序和本地服务。
foundry server restart --port <port> --idle-timeout 0 在指定的 TCP 端口上重启本地服务,并使守护程序保持运行。
foundry server status 显示守护程序状态、本地服务 URL、进程 ID、运行时间和日志位置。
foundry server logs 显示 Foundry 本地守护程序和 SDK 日志。

固定端口本地服务器

若要在固定端口上启动本地服务并保持守护程序运行,请使用--port--idle-timeout 0

foundry server start --port 39839 --idle-timeout 0

如果守护程序正在运行并且需要应用新端口,请使用相同的选项重启它:

foundry server restart --port 39839 --idle-timeout 0

若要验证本地终结点 URL,请运行:

foundry server status

缓存命令

下表汇总了用于管理存储模型的本地缓存的命令:

Command Description
foundry cache --help 显示所有可用的缓存相关命令及其用法。
foundry cache location 显示当前缓存目录。
foundry cache list 列出存储在本地缓存中的所有模型。
foundry cache cd <path> 将缓存目录更改为指定的路径。
foundry cache remove <model> 从本地缓存中删除模型。

执行提供程序

执行提供程序是硬件特定的加速库,可在设备上高效运行模型。

内置执行提供程序

Foundry Local 包括 CPU 执行提供程序、WebGPU 执行提供程序和 CUDA 执行提供程序。

CPU 执行提供程序使用 Microsoft 线性代数子例程 (MLAS) 在任何 CPU 上运行,并且是 Foundry Local 的 CPU 回退。

WebGPU 执行提供程序使用 Dawn,这是一个基于 Web 的 API 的本地实现,能够在任何 GPU 上进行加速,是 Foundry Local 的 GPU 回退选项。

CUDA 执行提供程序使用 NVIDIA CUDA 在 NVIDIA GPU 上加速。 它需要 NVIDIA GeForce RTX 30 系列及更高版本,并且建议的最低驱动程序版本 32.0.15.5585 和 CUDA 版本 12.5。 它受以下许可条款的约束: NVIDIA 软件开发工具包的许可协议 - EULA

插件执行提供程序

下表中列出的执行提供程序可用于Windows上的动态下载和注册,具体取决于设备和驱动程序兼容性。 它们受指定许可条款的约束。

Foundry Local 会在首次运行时自动下载这些执行提供程序。 当新版本可用时,插件执行提供程序会自动更新。

名称(供应商) 要求 许可条款
NvTensorRTRTXExecutionProvider (NVIDIA) NVIDIA GeForce RTX 30XX 及更高版本,最低建议的驱动程序版本 32.0.15.5585 和 CUDA 版本 12.5 NVIDIA 软件开发工具包的许可协议 - EULA
OpenVINOExecutionProvider (Intel) CPU:Intel TigerLake(第 11 代)及更高版本,最低推荐驱动程序 32.0.100.9565
GPU:Intel AlderLake(第 12 代)及更高版本,最低推荐驱动程序版本 32.0.101.1029
NPU:Intel ArrowLake(第15代)及更高版本,具有最低推荐驱动 32.0.100.4239
Intel OBL 分发商业使用许可协议 v2025.02.12
QNNExecutionProvider (高通) Snapdragon(R) X Elite - X1Exxxxx - Qualcomm(R) Hexagon(TM) NPU,最低驱动程序版本 30.0.140.0 及更高版本
Snapdragon(R) X Plus - X1Pxxxxx - Qualcomm(R) Hexagon(TM) NPU,最低驱动程序版本 30.0.140.0 及更高版本
若要查看 QNN 许可证,请下载 Qualcomm® 神经处理 SDK,提取 ZIP,然后打开 LICENSE.pdf 文件。
VitisAIExecutionProvider (AMD) 最低配置:Adrenalin Edition 25.6.3 与 NPU 驱动 32.00.0203.280
最高版本:Adrenalin Edition 25.9.1,使用的 NPU 驱动程序版本为 32.00.0203.297
无需其他许可证

将 Open WebUI 与本地服务器配合使用

Open WebUI 连接到 Foundry Local,以获取完全在设备上运行的基于浏览器的聊天界面。

  1. 启动模型并将终端保持打开状态:

foundry run qwen2.5-0.5b


1. Get your local endpoint URL:

```bash
foundry server status

复制终结点 URL。 Foundry Local 每次启动服务时都会分配动态端口。

  1. 安装并启动 Open WebUI,然后在浏览器中打开 http://localhost:8080

  2. 将 Open WebUI 连接到 Foundry 本地:

    1. 转到“设置>管理员设置连接”>并启用直接连接
    2. 转到 “设置>连接>管理直接连接+并选择。
    3. URLhttp://localhost:PORT/v1 设置为(替换为 PORT 步骤 2 中的端口),将 身份验证 设置为 “无”。
    4. 选择“保存”
  3. 从下拉列表中选择一个模型并开始聊天。

Tip

如果未显示模型,请在终端中运行 foundry run <model> 并重新加载 Open WebUI。 如果连接失败,请使用 .. 确认端口 foundry server status

升级 Foundry Local

运行操作系统的命令以升级 Foundry Local。

  • Windows:
    winget upgrade --id Microsoft.FoundryLocal
    
  • macOS
    brew upgrade foundrylocal
    

卸载 Foundry 本地

运行操作系统的命令以卸载 Foundry Local。

  • Windows:
    winget uninstall Microsoft.FoundryLocal
    
  • macOS
    brew rm foundrylocal
    brew untap microsoft/foundrylocal
    brew cleanup --scrub
    

故障排除

服务连接问题

如果在运行如下 foundry model list命令时看到此错误:

Exception: Request to local service failed.
Uri: http://127.0.0.1:0/foundry/list

The requested address is not valid in its context. (127.0.0.1:0)

Please check service status with 'foundry server status'.

重启服务 :

foundry server restart

此命令修复了服务器因端口绑定问题而无法访问的情况。

有关更多故障排除指南,请参阅 最佳做法和故障排除