
通过 REST API 集成
零云端依赖的完整集成
立即将强大的转录功能无缝集成到您的内部工具中。
Terminal
curl -X POST http://localhost:8000/api/upload \
-H "Authorization: Bearer YOUR_TOKEN" \
-F "[email protected]"
// Response (JSON)
{
"job_id": "job_9f8b2c1",
"status": "processing",
"estimated_time": 45
}
物理隔离架构验证
无外部网络请求
容器在进行转录推理时完全不需要连接互联网。
模型完全内置
运行所需的所有 AI 模型 (21GB) 均已打包在镜像中,无需在运行时动态下载。
离线激活机制
许可证的激活验证无需将生产服务器连接至互联网即可完成。
YOUR COMPANY NETWORK ┌──────────────────────────────┐ │ │ │ Employee / Internal App │ │ │ │ │ ▼ │ │ FreeAudioToText Docker │ │ │ │ │ ├── AI Models │ │ ├── Speaker Diarization │ │ └── Local Processing │ │ │ │ NO INTERNET REQUIRED │ │ ✕ │ └──────────────────────────────┘
您的团队所需的一切功能
全自动声纹识别 (Speaker Diarization)
自动检测并分离同一段录音中的多个发言人。经过验证,最高可支持包含 10 个发言人的录音。
100% 支持物理隔离
所有推理计算都在您的基础设施上进行。没有外部 API 依赖,也不会上传任何数据到云端。
为生产环境而生
支持任何可运行 Docker 的环境。推荐在生产环境中使用 Linux。自动调用 NVIDIA CUDA 或 Apple Silicon 加速推理。
开发者友好的 REST API
提供完整的 REST API 和 OpenAPI (Swagger) 文档。轻松将转录和声纹数据集成到您现有的内部工作流中。
技术规格
部署方式Docker 容器 (Linux/macOS/Windows)
网络要求100% 物理隔离。推理阶段无需任何外部网络。
AI 模型内置 Whisper large-v3-turbo (ASR) + CAM++ (声纹识别)
GPU 加速NVIDIA CUDA (推荐) / Apple Silicon MPS
运行内存最低 16 GB,推荐 32 GB
存储空间最低 40 GB (强烈推荐使用 SSD)
商业自托管版
一次性买断授权。无按月订阅或按分钟计费。
$999/ one-time
- 1 台生产环境服务器
- 不限制内部用户数和转录时长
- 完整的声纹识别与 REST API
- 包含 12 个月更新和优先技术支持
购买商业授权
🔒 即时获取授权 · Stripe 安全结账 · 支持电汇或开具发票
企业定制版
专为合规要求复杂的的大型组织而设计。
联系销售
- 多台生产服务器与高可用 (HA)
- 服务等级协议 (SLA) 与单点登录 (SSO) 集成
- 自定义数据保留策略与审计日志
- 全套安全审查文档与采购对接
常见问题 (FAQ)
我的音频会被发送到云端吗?
绝对不会。所有推理和处理都完全在您的本地硬件上进行。Docker 容器不会向第三方转录服务发出任何外部网络请求。
有多少用户可以访问服务器?
商业授权允许贵公司内无限的内部用户通过 Web 界面或您的内部应用访问转录服务器。
第一年到期后会怎样?
您的永久授权永远不会过期,您可以终身使用该软件。如果您希望在 12 个月后继续获得更新和支持,可以选择每年支付 $249 进行续期。
离线激活是如何运作的?
我们使用硬件指纹系统。您在服务器上生成指纹,从连接互联网的设备上传该指纹,并收到签名的 license.key 文件,然后将其放入您的物理隔离服务器中即可。
安装后服务器还需要互联网访问吗?
不需要。在安装好 Docker 镜像和许可证后,转录和推理可完全离线运行,无需任何网络连接。