# asrpython **Repository Path**: gxwang/asrpython ## Basic Information - **Project Name**: asrpython - **Description**: 高中生语音识别科普工作站 - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-07-10 - **Last Updated**: 2026-07-10 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README ## 语音识别API调用 ### 原理 开发者通过调用云厂商提供的API,上传需要识别的语音文件,由API返回识别后的文字。通过编程语言发送HTTP请求,将语音文件提交至厂商API,API服务完成语音识别后,将文字内容返回给调用者。 * 优点:快速便捷,将语音识别嵌入自己开发的系统;开发者无需深入掌握语音识别技术 * 缺点:语音识别服务对开发者为“黑盒”,无法探知语音识别底层技术,提升语音识别精度 ### 一般步骤 一般调用云厂商API需要以下几个步骤: 1. 相应的云厂商注册开发者账号,需要实名认证,选择免费试用(部分厂商需要提供信用卡注册) 2. 找到语音识别服务,创建应用,获得APP_Id, Secret等信息(用于API认证鉴权) 3. 根据厂商提供的文档,选择自己熟悉的开发语言编写的demo,替换其中使用的APP_Id, Secret信息 4. 运行demo程序,提交语音文件(或通过麦克风直接输入),获取识别后的文字结果 下面,通过举例百度语音、微软语音、科大讯飞语音API调用过程。本项目中三个.py文件分别对应三家厂商API使用python编程语言调用示例代码。 ### 一、百度语音识别Api 官方文档: https://ai.baidu.com/ai-doc/SPEECH/Vk38lxily 原理及思路: 使用python中的request将音频提交至接口,识别出文字后返回结果并保存入文件(result.txt) 1. 创建百度开发者账号并实名认证 访问百度AI网站,找到语音识别服务 ![](python教程/imgs/baidu_01.png) 点官方文档,可查看技术文档说明;点立即使用,进入管理控制台(需要注册登录) ![](python教程/imgs/baidu_02.png) 官方文档查看参数说明、调用说明、返回数据说明等 ![](python教程/imgs/baidu_03.png) 登录百度开发者控制台。如果你使用百度APP、百度云APP并且实名认证过,则可以使用APP扫描登录。通过一键引入实名认证即可。 ![](python教程/imgs/baidu_04.png) 进入控制台,点击左侧菜单,打开语音识别服务 ![](python教程/imgs/baidu_05.png) 在语音识别服务中,创建应用。首次进入服务列表,会提示领取免费额度,按需求领取即可。创建应用后,列表中显示的AppID和Secret Key就是我们后面编程中需要用到的配置参数。 ![](python教程/imgs/baidu_06.png) 2. 官方文档中下载示例代码进行修改 以官方python代码为例,两个关键函数 * 认证鉴权:`fetch_token` 函数,根据AppID、Secret Key,识别用户身份 * 提交语音文件并接收返回结果: `main`函数中实现 具体配置见baiduai.py文件。 ### 二、微软语音识别Api 官方文档地址: https://docs.microsoft.com/en-us/azure/cognitive-services/speech-service/get-started-speech-to-text?pivots=programming-language-python&tabs=terminal 1. 注册微软开发者账号,并创建应用 访问微软Aure云平台,https://azure.microsoft.com/zh-cn/ ![](python教程/imgs/ms_01.png) 注册账号。如果您使用live.com的邮箱,或windows系统中使用微软账户。可以直接登录,并认证成为开发者,使用此账号登录进入Aure控制台。 ![](python教程/imgs/ms_02.png) 资源列表中显示了所有已创建的资源。可继续创建,也可以对已有资源管理。 ![](python教程/imgs/ms_03.png) 进入控制台后,点左上角菜单,选择AI+机器学习,找到语音服务。点创建 ![](python教程/imgs/ms_04.png) 创建语音识别资源,将必填项填写完成即可。 ![](python教程/imgs/ms_05.png) 进入已经创建好的语音识别资源中,找到开发选项。在这里可以查看示例代码,同时代码中需要的配置项:subscription(对应两个密钥,可任选一个使用)和region(地区,创建资源的时候可选) ![](python教程/imgs/ms_06.png) 2. 示例代码修改 步骤1中的资源部分也会给出几种编程语言对应的示例程序。官方文档中有更详细的配置说明及依赖项安装说明。请查看:(https://docs.microsoft.com/en-us/azure/cognitive-services/speech-service/get-started-speech-to-text?pivots=programming-language-python&tabs=terminal) 微软语音API过程: * 安装对应语言的sdk包,python版可以使用pip命令进行安装 ```python pip install azure-cognitiveservices-speech ``` * 修改示例代码中的配置项 subscription: 对应密钥1或2 region: 对应位置/区域,也可以看终结点域名的前缀 如果是识别中文的话,demo代码中需要增加语言配置 ```python speech_config.speech_recognition_language="zh-CN" ``` 具体代码见msai.py文件。 ### 三、科大讯飞语音识别Api 待完善 ## 连接 * python基础教程:https://www.runoob.com/python3/python3-tutorial.html * VsCode: https://code.visualstudio.com/ * VsCode搭建python环境:https://blog.csdn.net/qq_46092061/article/details/122438823 ### 四、腾讯语音识别 微信语音转文字,尝试将你手机的wifi和数据流量都断开,再尝试使用语音转文字是否能成功? 因此,微信的语音转文字也是需要联网,调用云厂商的语音识别服务。 sdk url : https://github.com/TencentCloud/tencentcloud-speech-sdk-python/blob/master/examples/asr/asrexample.py tencent app id: https://console.cloud.tencent.com/cam/capi tencent sdk url: https://cloud.tencent.com/document/product/1093/48982 ## 语音识别本地部署模型 原始仓库 :https://github.com/modelscope/FunASR 国内gitee镜像仓库:https://gitee.com/mirrors/funasr 服务部署及客户端测试: https://gitee.com/mirrors/funasr/blob/dev_bj_2pass_grpc/funasr/runtime/docs/SDK_advanced_guide_offline_zh.md * python简介 * 安装/编辑器/第一行hello world * 变量/数据类型 * 条件/循环控制 * 函数/类 * 模块/包 * 文件 * json * http协议/api