# audio2text **Repository Path**: M_Fisher/audio2text ## Basic Information - **Project Name**: audio2text - **Description**: No description available - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2025-12-15 - **Last Updated**: 2025-12-16 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 语音转文字服务 基于 Vue3 + Fastify + whisper.cpp (CUDA 加速) 的实时语音转文字服务 ## ⚡ 快速开始 ### 一键启动 ```bash cd backend npm install npm start ``` 访问: `http://localhost:3000` 就这么简单!前端已内置在后端服务中。 --- ## 📖 文档导航 - **[API 接口文档](./API.md)** - 如何在其他项目中调用本服务 - **[部署文档](./DEPLOYMENT.md)** - 新服务器部署、GPU 配置、故障排查 - **[本文档](#)** - 快速开始指南 --- ## 📁 项目结构 ``` QoderCli/ ├── backend/ # 🚀 后端服务(前后端一体) │ ├── public/ # 前端静态文件(自动生成) │ ├── asr/ # ASR 核心模块 │ ├── ws/ # WebSocket 处理 │ └── server.js # 服务入口 │ ├── frontend/ # 💻 前端源代码(仅开发时需要) │ └── src/ │ └── whisper/ # 🎯 Whisper 运行时(自包含) ├── bin/ # 可执行文件 └── models/ # AI 模型 ``` --- ## 🎯 技术栈 - **前端**: Vue 3, Vite, WebSocket, Web Audio API - **后端**: Fastify, Node.js, WebSocket, Static Server - **ASR**: whisper.cpp (CUDA 加速) - **模型**: ggml-small.bin (中文,465MB) --- ## 🚀 性能指标 - **GPU 模式**: 2-4 秒(推荐)⚡ - **CPU 模式**: 7 秒 - **准确率**: 高精度中文识别 ✅ - **输出**: 简体中文(自动繁简转换) --- ## 📦 部署优势 ### 一键部署 - ✅ **前后端一体**: 无需单独部署前端 - ✅ **自包含 Whisper**: 所有依赖都在项目中 - ✅ **零配置**: 开箱即用 - ✅ **便携迁移**: 复制整个目录即可 ### 传统方式 vs 当前方式 | 步骤 | 传统方式 | 当前方式 | |------|---------|---------| | 安装依赖 | 前端 + 后端 + Whisper | 仅后端 | | 启动服务 | 3 个命令 | 1 个命令 | | 端口管理 | 2 个端口 | 1 个端口 | | 部署复杂度 | ⭐⭐⭐ | ⭐ | --- ## 💻 使用说明 1. 访问 `http://localhost:3000` 2. 点击"开始录音" 3. 对着麦克风说话 4. 点击"停止录音" 5. 查看识别结果 --- ## 🔧 开发者指南 ### 修改前端 ```bash # 1. 开发 cd frontend npm install npm run dev # http://localhost:5173 # 2. 构建并部署 cd ../backend npm run build # 3. 重启服务 npm start ``` ### 切换模型 ```bash # 下载其他模型到 whisper/models/ # 编辑 backend/.env MODEL_PATH=../../whisper/models/ggml-base.bin ``` --- ## 🌐 生产环境 ```bash # 使用 PM2 npm install -g pm2 cd backend pm2 start server.js --name speech-to-text pm2 save ``` --- ## 📋 系统要求 ### 必需 - Node.js >= 16.x ### 可选(GPU 加速) - NVIDIA GPU (计算能力 >= 6.0) - CUDA Toolkit 12.8 - NVIDIA 驱动 --- ## 📄 许可证 MIT