跳至内容
给 Kopia 装上 AI 大脑

给 Kopia 装上 AI 大脑

Kopia 是一个成熟的开源备份引擎,目前 GitHub 约 14.1k Stars,采用 Apache License 2.0。它支持内容寻址、增量快照、去重、端到端加密,以及 S3、NAS、本地文件系统等多种存储后端。简单说,如何安全、高效地把文件备份下来,Kopia 已经解决得很好。

但 Kopia 更像 backup engine,而不是完整的备份管理产品:它没有"多台主机"的概念,每台机器各跑各的 CLI 或 KopiaUI,互相看不到彼此;就算在一台机器上,想在一个界面里管理多个 Repository,这个需求从 2023 年提出至今也仍未解决(kopia/kopia#2976)。

HyperFileLens 没有重新发明备份引擎,而是在 Kopia 之上补了一层产品化能力。 Kopia 继续负责备份、去重、加密、Snapshot 和 Restore;HyperFileLens 把多台主机、多个存储、任务和快照收进同一个 Web 控制台,配置流程收敛成"注册主机 → 配置备份与恢复 → 开始备份"三步,10 分钟左右就能上手,不用碰 Repository、Policy 和命令行参数。

在这之上,HyperFileLens 还接了一层 Kopia 本身没有的能力——AI。把链路从 File → Snapshot 延伸到 File → Snapshot → Search / Read / Reason → Answer:不用手动定位快照和目录,直接用自然语言提问,AI 就能在快照里检索、阅读、推理原始文件(文档、表格、PPT、图片、代码都行),给出答案并标注来源,读取的始终是备份副本,不碰生产环境里的实时文件。

所以 HyperFileLens 做的事情可以概括成两层:用 Kopia 解决可靠备份,用 AI 让备份数据重新产生价值。 这篇文章就从零把这条链路跑一遍:注册主机、完成备份与恢复配置、生成 Snapshot,再接入 AI,最后直接对备份中的数据提问。

需要准备什么

  • 一台能跑 Docker 的 Linux 主机(x86,小规模使用 4 核 8GB 即可,企业人数较多推荐 8 核 16GB;磁盘 100GB),能连公网访问模型,不需要公网 IP;
  • 对象存储账号,S3 兼容的都行(阿里云 OSS、华为云 OBS、AWS S3 等);
  • 要备份的主机,支持 Linux、Windows、macOS;
  • 大语言模型鉴权信息,推荐 DeepSeek-V4-Flash;需要识别图像的话,直接用 DeepSeek 最新的多模态模型 DeepSeek-V4-Flash-Vision-Exp(Model ID:deepseek-v4-flash-vision-exp)。

整个流程:部署 HyperFileLens → 备份数据 → 洞察数据

第一步:准备主机并装好 HyperFileLens

项目要求
操作系统Ubuntu 24.04(x86_64)
CPU / 内存小规模使用 4 核 / 8GB 即可;企业人数较多推荐 8 核 / 16GB
磁盘100GB(AI 洞察时的文件转换空间,数据量更大就相应扩容)
网络能访问公网(用于访问模型 API),不需要公网 IP
端口11442–11445/TCP(11443 主控制台,11444 模型管理后台),对内网开放即可
依赖Docker Engine 24.0.0+、Docker Compose V2 2.20.0+

SSH 上去装好 Docker,跑安装脚本。国内网络访问 GitHub 本身就不稳定,curl 这一步就得换成 Gitee,不是靠后面的 --mirror 参数能解决的:

国内网络(推荐):

curl -fsSL \
  https://gitee.com/oneprolabs/hyperfilelens/raw/main/deploy/online/install.sh \
  | sudo bash -s -- --mirror cn --yes

海外网络:

curl -fsSL \
  https://raw.githubusercontent.com/oneprolabs/hyperfilelens/main/deploy/online/install.sh \
  | sudo bash -s -- --mirror global --yes

安装脚本跑完会打印两个访问地址和一个初始邮箱密码,地址用的是这台主机的内网 IP。比如内网 IP 是 172.30.164.250,打印出来就是:

  • HyperFileLens · http://172.30.164.250:11443
  • Platform Ops · http://172.30.164.250:11444
安装脚本执行完成的终端输出,展示 HyperFileLens 和 Platform Ops 两个访问地址以及初始邮箱密码

安装脚本跑完打印的访问地址和初始密码

浏览器打开 11443 这个地址,用邮箱密码登录,第一件事改掉初始密码,顺手确认时区和系统时间一致。

登录后的 HyperFileLens 控制台首页,展示生产源端、目标存储、恢复演练三个环节的数据保护链路概览

登录后的控制台首页

第二步:配置 NAT 访问地址和 AI 模型

后面注册主机、加存储、生成 Agent 安装命令,都要用到这台主机对外的访问地址;AI 助手也得先有模型才能用。这两件事跟具体的备份流程没关系,但都得在动手加数据源之前配好,不然中途改了还得回头重新注册。

外部访问地址:如果这台主机买在公有云上,安装脚本打印的是内网 IP,但实际对外能访问到的是云厂商的 NAT 或公网地址,这里要先改一下。打开 Platform Ops,进 外部访问,把外部访问地址改成真正能连到的那个公网地址。如果只在内网用,这一步可以直接跳过。

外部访问配置页面,展示访问配置输入框、当前生效地址和建议的公网访问地址

主机在公有云上,要把外部访问地址改成公网 IP

AI 模型:还在 Platform Ops,进 AI 引擎 → AI 模型,点 添加 AI 模型。供应商里直接能选到 DeepSeek,不用绕道其他网关。

添加 AI 模型页面的供应商选择列表,OpenAI、DeepSeek、DashScope (Qwen)、Anthropic 等主流供应商都在其中

供应商列表里直接有 DeepSeek

DeepSeek-V4-Flash(Model ID:deepseek-v4-flash)处理文本问答;需要识别图片就再加一个 DeepSeek-V4-Flash-Vision-Exp(Model ID:deepseek-v4-flash-vision-exp)。Base URL 填 https://api.deepseek.com,配好 API Key,测试连接 通过后保存。

第三步:备份数据,添加需要备份的主机目录

进入 数据保护 → 备份向导,点 添加源,选 源端主机,操作系统选 Linux(Windows、macOS 同样支持)。

添加备份源页面,选择源端主机,目标操作系统选中 Linux

选主机操作系统,复制安装命令

界面会给出一段安装命令,复制到目标主机终端里执行,等它提示安装完成。回到备份向导刷新数据源列表,确认新加的这台机器状态是 已注册在线

备份向导数据源列表,新注册的 Linux 主机状态显示在线、已注册

主机注册成功,状态在线

第四步:备份设置

  1. 创建备份配置,五步向导:备份源 → 备份策略 → 目标端 → 恢复计划 → 确认信息。
创建备份配置向导,左侧是备份源、备份策略、目标端、恢复计划、确认信息五个步骤,右侧展示主机目录树和路径选择

创建备份配置:备份源 → 备份策略 → 目标端 → 恢复计划 → 确认信息

  1. 目标端需要一个对象存储仓库:存储控制台建 Bucket、建子账号(只给这个 Bucket 读写列举权限),拿 Access Key / Secret Key。回 HyperFileLens 点 添加对象存储仓库,选平台(Huawei Cloud / Alibaba Cloud / AWS 有预设,其他选 S3 兼容存储),填鉴权地址、Region、AK/SK、Bucket、Object Prefix,保存验证。Secret Key 只显示一次,别截图留底。
添加对象存储仓库表单,展示 Huawei Cloud、Alibaba Cloud、AWS、S3 兼容存储四个预设平台,以及鉴权地址、Region、Access Key、Secret Key 等连接字段

对象存储平台随便选,字段都差不多

  1. 目标端选这个仓库,备份策略、恢复计划先用默认值,确认信息保存。

  2. 立即备份,等状态变成 成功

备份向导第三步开始备份,两台主机的备份任务状态均为成功

备份任务跑完,状态成功

存储费可以忽略(阿里云 OSS 标准存储约 0.12 元/GB/月)。下行流量只发生在恢复数据的时候:第一次全量,之后都是增量,本来就不大;AI 提问读的是恢复后的内容,不会再触发一次下行流量。

第五步:用 AI 提问,看效果

备份任务显示 成功,不用再单独跑一遍验证——AI 能从快照里读出正确答案,本身就是最直接的验证。真要恢复数据的话,点 恢复,跟着流程操作就行,这里不展开。

洞察 → AI 助手,左侧能看到历史对话列表,点 新建对话

先选数据源、快照,把要分析的文件加进来——支持 PDF、DOCX、PPTX、XLSX,文件里的图片和单独的图片也能识别,处理的是备份快照里的副本,不动生产环境的实时数据。第二步配模型时带上多模态模型,识别更准。

AI 助手新建对话,选择备份源、快照、要分析的文件和文件夹

新建对话:选数据源、快照、要分析的文件

再选分析类型和数据隐私:分析类型选 知识问答(推荐),数据隐私选 公共数据网关(用平台提供的网关,不用额外部署)。

AI 助手新建对话,分析类型选择知识问答(推荐),数据隐私选择公共数据网关

分析类型选知识问答,数据隐私选公共数据网关

开始对话,等数据准备完就能直接提问。比如备份里有一份《西游记》文本,可以问:“有的妖怪想吃唐僧肉,有的妖怪想和唐僧结婚,这两类妖怪的目的有什么区别?” AI 会基于备份里的原始文件直接回答,带引用来源,能追溯到具体文件和段落。

AI 助手对话界面,针对备份文件中的一份文档提问,AI 给出结构化的中文回答,并标注来源文件和创建时间

直接对着备份文件提问,答案带来源

Kopia 的大脑,装好了

Kopia 本身没有被改造,去重、加密、增量备份这些硬功夫照旧。变的是上面这层:多台主机不用再一个个连命令行看状态,配置收成几步点一点就行;备份数据也不是搁着等出事才用——AI 能直接读、能问、能推理,想要答案直接问就有。

这套流程从部署到能用 AI 提问,一次跑下来大概花一到两个小时,之后的备份可以设成定时任务,自己不用再管。

开源地址

HyperFileLens 采用 Apache 2.0 协议开源:

如果不想自己部署,也可以直接用 https://hyperfilelens.com 的免费 SaaS 版本,跳过部署这一步,直接从加数据源开始。

加入 OneProLabs 开源交流群

如果你在体验过程中遇到问题,或者想参与共建、交流开源经验,欢迎扫码加入微信群。

OneProLabs 开源交流群微信二维码,扫码加入技术交流、开源共建、资源共享、项目协作社区

扫码加入 OneProLabs 开源交流群

最后更新于