Local AI Guide

FgoGotran Local 使用指南

在 Windows 电脑运行自己的 GGUF 模型,让手机上的 FgoGotran 通过可信局域网调用本地翻译服务。

Windowsllama.cppGGUF简体中文指南

用途与边界

FgoGotran Local 是本地运行控制工具,可在首次确认后自动准备 Python 和 llama.cpp;GGUF 始终由用户管理。

本地完成翻译推理

模型准备完成后,FGO 对白由电脑上的 llama-server 和 GGUF 处理,不需要云端翻译 API Key。

大型运行文件不进入 Git

Python 和 llama.cpp 的可选下载只写入已忽略的 user_data;也可完全手动配置。工具不会自动修改驱动、防火墙、路由器,或下载 GGUF/TTS 资源。

首次自动准备需要联网并会先显示确认;Python 发布者签名以及 llama.cpp 的大小和 SHA-256 必须验证通过。GGUF 请自行从可信发布者取得,本地接口仍使用独立 API Key。

连接方式

管理页面和手机使用的翻译接口是两个不同入口。

Android 手机FgoGotran
翻译接口电脑 IP:18080
llama-serverGGUF 模型
电脑管理页面:http://127.0.0.1:18081

它固定只监听本机。手机不能使用或打开这个地址。

快速开始

第一次使用按顺序完成,不要跳过“已就绪”和连接测试。

1

启动并检查 Python

双击 Start-FgoGotranLocal.cmd。程序会复用 64 位 Python 3.11–3.13;没有兼容版本时,可确认下载经签名和 SHA-256 校验的私有 Python 3.13.15。

私有 Python 位于 user_data,不修改系统 PATH 或文件关联。

2

准备完整的 llama.cpp

没有已有配置时,可确认自动下载经过大小和 SHA-256 校验的官方 Windows x64 构建;NVIDIA 会按驱动选择 CUDA 包,否则使用 CPU 构建。

也可按 n 跳过并手动选择;已有非空路径不会被覆盖。

3

准备 GGUF 翻译模型

从可信发布者自行下载能够理解日文、稳定输出中文的 Instruction 或 Chat GGUF,再在管理页面选择模型目录和文件。

启动器不会下载、更新、替换或删除 GGUF 模型。

4

启动管理页面

环境准备完成后,管理页面会在浏览器打开;使用期间保留命令窗口。完整的当前 Profile 会自动启动模型。

管理页面默认地址是 http://127.0.0.1:18081,只能由当前电脑访问。

5

填写模型设置

自动设置成功时会写入 llama-server.exe 路径;GGUF 始终由用户设置模型文件夹,再扫描并选择模型。

6

保存并启动服务

确认“可信局域网 + 本机”和 Model ID。自动启动失败或被关闭时,在总览手动启动服务并等待状态变成“已就绪”。

运行参数保存后不会热更新;模型已经运行时,需要重新启动服务才能应用新设置。

7

确认连接测试

启动时会自动检查 OpenAI Chat Completions 兼容性。也可以在“连接测试”中点击“开始测试”复测。

通过只代表连接、认证、格式和非空输出正常,不代表所有 FGO 对白的翻译质量。

8

连接 Android 应用

在总览分别点击“显示 Endpoint”和“显示 API Key”,把两项完整值及可见的 Model ID 填入 FgoGotran 的“自定义 / 本地 AI”,再点击“测试 API”和“应用API设置”。

选择 llama.cpp 与 GGUF

运行时、显卡驱动、模型架构和 Chat Template 必须彼此兼容。

llama.cpp 运行包

  • 自动设置按 nvidia-smi 的兼容版本选择官方 Windows x64 CUDA build。
  • 没有匹配 NVIDIA/CUDA 组合时,自动使用官方 CPU x64 build。
  • 同一 Release 的主包与 CUDA DLL 包会一起校验并解压。
  • 更新时解压到新目录,测试通过前保留旧版本。

GGUF 模型

  • 选择 Instruction 或 Chat 模型,不使用未经对齐的 Base 模型。
  • 确认能够理解日文,并稳定输出所选中文。
  • 确认 llama.cpp 支持模型架构和 Chat Template。
  • 从可信发布者下载,并在提供校验值时完成核对。
显存导向的初始选择,不代表翻译质量排名
可用显存建议起点说明
6–8 GB 显存7B/8B Q4适合作为首次加载与速度测试
10–12 GB 显存8B–14B Q4实际占用仍受架构和上下文影响
16 GB 显存约 14B Q4也可尝试较小模型的更高量化

模型架构、Context Size、Batch Size 和其他 GPU 程序都会影响真实显存占用。

控制面板

页面默认在 127.0.0.1:18081 打开,并分成四个标签页。

总览

启动、重新启动或停止 llama-server;查看运行状态和当前 Profile 摘要。Endpoint 与 API Key 默认隐藏,需要时可分别临时显示。

模型设置

管理最多 12 个 Profile,选择 llama.cpp 与 GGUF,并设置端口、网络范围和推理参数。

连接测试

复测 API Key、Model ID、请求格式和非空中文输出。启动服务时也会自动执行一次兼容性测试。

系统

查看 Python、端口、GPU、内存诊断和运行日志;局域网地址与本机路径默认隐藏,可按需临时显示。

首次测试保留这些默认值

参数默认值使用建议
Context Size8192显存不足时优先减小;过小可能限制较长提示词。
GPU Layers999请求尽可能多地卸载到 GPU;无可用 GPU 时可设为 0。
Batch Size512内存或显存压力仍然过高时再逐步减小。
UBatch Size256必须小于或等于 Batch Size。
CPU Threads0(自动)首次使用让 llama.cpp 自动选择。
Flash Attention开启通常更节省资源;遇到不兼容或启动错误时尝试 Auto 或关闭。
强制关闭模型思考关闭默认跟随模型。只有模型文档明确支持且测试需要时才启用。
Prompt Cache / Metrics / Slots开启首次测试保持默认值,便于缓存、性能观察和请求状态检查。

连接 Android 手机

请点击总览的“显示 Endpoint”并复制当前地址,不要凭记忆手动组合 IP 和端口。

手机不能填写 localhost127.0.0.10.0.0.0、电脑主机名或路由器地址。

  1. 让手机和电脑连接同一个可信 Wi-Fi 或局域网。
  2. 把 Windows 当前网络配置为“专用网络”。
  3. 在当前 Profile 选择“可信局域网 + 本机”,保存并重新启动服务。
  4. 等待状态变成“已就绪”,点击总览的“显示 Endpoint”,再用其中相同的电脑 IP 与端口打开 /health 地址。
  5. 在 FgoGotran 的 API 设置中选择“自定义 / 本地 AI”。
  6. 分别点击总览的“显示 Endpoint”和“显示 API Key”,填写两项完整值及模型名称,然后测试并应用设置。
API 地址http://<电脑局域网IP>:18080/v1/chat/completions
手机浏览器测试http://<电脑局域网IP>:18080/health
电脑总览显示 Endpoint手机“API 地址”
电脑总览Model ID手机“模型”
电脑总览显示 API Key手机“API Key”

运行状态说明

只有“已就绪”表示手机现在可以稳定发起翻译请求。

STOPPED已停止

服务尚未启动,或者已经正常停止。

STARTING正在启动

正在检查配置并建立 llama-server 进程。

LOADING正在加载模型

llama-server 已运行,正在把 GGUF 和运行缓冲区载入内存或显存。

VERIFYING正在检查兼容性

健康检查已通过,正在验证 Chat Completions 能否返回可用文本。

RECOVERING正在应用兼容回退

强制关闭思考与当前模型不兼容,正在改用模型默认行为重新启动一次。

READY已就绪

模型已经通过健康与兼容性检查,可以让手机连接。

BUSY正在翻译

llama-server 正在处理请求,短时间排队属于正常情况。

ERROR错误

服务启动、模型加载或兼容性检查失败;请查看状态详情和运行日志。

性能调节顺序

每次只调整一类设置,保存并重新启动后再判断效果。

1

先关闭其他 GPU 程序

浏览器、游戏录制和其他 AI 工具可能占用显存。释放资源后重新启动模型。

2

先减小 Context Size

这是显存不足或加载失败时的第一项调整。每次只改一项,并重新启动后观察。

3

改用更小的模型或量化

如果仍无法加载,选择参数更小或量化更低的 GGUF,通常比盲目修改多个底层参数更可靠。

4

再减小 Batch 与 UBatch

逐步减小 Batch Size 和 UBatch Size,同时确保 UBatch 不大于 Batch。

5

最后检查运行时兼容性

检查 llama.cpp 构建、显卡驱动、DLL、模型架构、Chat Template 和 Flash Attention 是否兼容。

判断翻译质量时要连续测试多段 FGO 对白,包括人名、术语、省略主语和较长句子;不要只看内置兼容性测试。

故障排查

先按问题现象检查,再查看“系统 → 运行日志”中的最后几行。

找不到 Python

安装 64 位 Python 3.11–3.13。存在多个 Python 时,可用 FGO_LOCAL_PYTHON 指向需要的 python.exe。

管理页面打不开

确认启动命令窗口仍在运行,并打开 http://127.0.0.1:18081。端口冲突时再使用 FGO_LOCAL_CONTROL_PORT 更换管理端口。

llama-server 路径无效

选择名为 llama-server.exe 的实际文件,使用绝对路径,并保留同一发行包中的全部 DLL。

扫描不到 GGUF

确认文件扩展名为 .gguf、模型目录是绝对路径,并且模型位于该目录或它的子目录内,然后重新扫描。

加载时退出或一直加载

查看“系统 → 运行日志”。常见原因是显存或内存不足、DLL 缺失、运行时与驱动不匹配,或模型架构不受支持。

兼容性测试失败

确认 Model ID 与 llama-server 别名一致,并查看认证、Chat Template、只有思考内容或空输出等错误。测试超时为 45 秒。

手机无法连接

确认手机和电脑位于同一可信网络、Profile 使用“可信局域网 + 本机”、服务已经就绪,并检查 Windows 专用网络防火墙与 VPN。

设置保存后没有变化

模型、Model ID、端口、网络和推理参数属于运行时设置。保存后需要重新启动 llama-server。

安全、备份与更新

局域网 HTTP 没有传输加密,只适合可信家庭网络或可信专用网络。

网络安全

防火墙只允许专用网络。不要使用公共 Wi-Fi,不要关闭整个防火墙,也不要把 18080 或 18081 映射到公网。

API Key

不要分享完整 Key。怀疑泄露时先停止服务,再更换 Key,并更新所有手机;旧 Key 会立即失效。

配置备份

更新或重置前备份 user_data。这个目录含 API Key,不能上传、公开或随故障截图一起发送。

安全更新

先停止服务,再把新版 llama.cpp 解压到新目录。更新路径并通过加载与翻译测试后,才移除旧版本。

最终检查清单

全部确认后,再开始长时间运行 FGO 翻译。

  • 使用 64 位 Python 3.11、3.12 或 3.13
  • llama.cpp 来自可信来源并已完整解压;自动下载已通过大小和 SHA-256 校验
  • llama-server.exe 同目录保留所需 DLL
  • GGUF 是从可信发布者自行取得、支持日文输入和中文输出的 Instruction 或 Chat 模型
  • 手机连接时选择“可信局域网 + 本机”
  • Windows 防火墙只允许专用网络
  • 运行状态已经变为“已就绪”
  • 启动兼容性测试或手动连接测试已经通过
  • 手机 API 地址来自总览,并包含 /v1/chat/completions
  • 手机中的模型名称与电脑 Model ID 完全一致
  • 手机使用完整的新 API Key
  • 没有把 18080 或 18081 转发到公网