docext 是用于从文档提取非结构化信息的本地化开源工具,无需 OCR,利用视觉语言模型(VLM)来识别和提取文档中的字段数据和表格信息,既准确又能保证数据安全隐私
最近更新: 5天前Lama Cleaner 是基于 SOTA 深度学习模型的图像修复工具,完全支持本地部署,支持 CPU & GPU
最近更新: 5天前WiseFlow是一个开源的敏捷信息提取工具,能够从网站、微信公众号、社交媒体等来源精炼信息,并自动分类标签上传到数据库。
最近更新: 5天前由密码学专家团队打造的开源隐私计算平台,支持安全多方计算、联邦学习、隐私求交、隐私查询等。
最近更新: 5天前一个带web界面的声音克隆工具,使用你的音色或任意声音来录制音频
最近更新: 5天前一款功能强大的AI语音识别工具 github地址:https://github.com/openai/whisper.git 导入日期:20251009 更新日期:20260828
最近更新: 5天前EasyPR是一个中文的开源车牌识别系统,其目标是成为一个简单、高效、准确的车牌识别引擎。相比于其他的车牌识别系统,EasyPR有如下特点:* 它基于openCV这个开源库。这意味着你可以获取全部源代码,并且移植到java等平台。* 它能够识别中文。例如车牌为苏EUK722的图片,它可以准确地输出std:string类型的"苏EUK722"的结果。* 它的识别率较高。图片清晰情况下,车牌检测与字符识别可以达到80%以上的精度。
最近更新: 5天前Mirror of https://github.com/dirkvdb/ffmpegthumbnailer.git
最近更新: 5天前fork from https://github.com/FunAudioLLM/SenseVoice SenseVoice是由阿里云通义实验室开发的一款多语言音频基础模型,专注于高精度多语言语音识别、情感辨识和音频事件检测。SenseVoice 是具有音频理解能力的音频基础模型,包括语音识别(ASR)、语种识别(LID)、语音情感识别(SER)和声学事件分类(AEC)或声学事件检测(AED)。
最近更新: 5天前