数据集成专业软件,包含ETL数据处理、数据看板; ETL数据处理模块基于Kettle二次开发,重写50余种常用组件,支持关系型数据库、NoSQL数据库、网络服务、文件操作等,可视化设计实现数据或流的提取、转换、加载全流程化处理。 数据看板模块支持模型元数据定义、报表在线设计及在线排版布局,可为不同业务提供丰富的数据统计分析。
docext 是用于从文档提取非结构化信息的本地化开源工具,无需 OCR,利用视觉语言模型(VLM)来识别和提取文档中的字段数据和表格信息,既准确又能保证数据安全隐私
MTranServer 是低占用、速度快、可私有部署的的离线翻译服务器,仅需 CPU + 1G 内存即可运行(提供了 Docker 快速部署方式),无需 GPU,支持全世界主要语言
Lama Cleaner 是基于 SOTA 深度学习模型的图像修复工具,完全支持本地部署,支持 CPU & GPU
WiseFlow是一个开源的敏捷信息提取工具,能够从网站、微信公众号、社交媒体等来源精炼信息,并自动分类标签上传到数据库。
由密码学专家团队打造的开源隐私计算平台,支持安全多方计算、联邦学习、隐私求交、隐私查询等。
一款功能强大的AI语音识别工具 github地址:https://github.com/openai/whisper.git 导入日期:20251009 更新日期:20260828
Surya一款开源的OCR工具,它不仅能识别表格的行、列、单元格,还能识别旋转的表格和复杂的布局,而且支持90多种语言。Surya 还有一个亮点是它能够在本地运行,方便开发者离线处理敏感信息,或者大规模处理文档。同时,Surya 还提供了API接口,开发者可以很轻松地将其集成到自己的应用中,进行批量自动化处理。完全开源且允许商业用途的。
EasyPR是一个中文的开源车牌识别系统,其目标是成为一个简单、高效、准确的车牌识别引擎。相比于其他的车牌识别系统,EasyPR有如下特点:* 它基于openCV这个开源库。这意味着你可以获取全部源代码,并且移植到java等平台。* 它能够识别中文。例如车牌为苏EUK722的图片,它可以准确地输出std:string类型的"苏EUK722"的结果。* 它的识别率较高。图片清晰情况下,车牌检测与字符识别可以达到80%以上的精度。
Mirror of https://github.com/dirkvdb/ffmpegthumbnailer.git
fork from https://github.com/FunAudioLLM/SenseVoice SenseVoice是由阿里云通义实验室开发的一款多语言音频基础模型,专注于高精度多语言语音识别、情感辨识和音频事件检测。SenseVoice 是具有音频理解能力的音频基础模型,包括语音识别(ASR)、语种识别(LID)、语音情感识别(SER)和声学事件分类(AEC)或声学事件检测(AED)。
Stirling-PDF 是使用 Docker 的强大的、本地托管的、基于 Web 的 PDF 操作工具。它能够对PDF文件进行各种操作,包括分割、合并、转换、重组、添加图像、旋转、压缩等。这个本地托管的 Web 应用程序已发展为包含一组全面的功能,基本可以满足的所有 PDF 要求。
良心级开源人脸标定算法,人脸美颜,美妆,配合式活体检测,人脸校准的预处理步骤. Android代码基于深度学习,我们设计了高效的网络模型,该模型鲁棒性较好,支持多人脸跟踪.目前深度学习算法在人脸标定方向取得了良好的效果,该项目旨在提供一种较为简单易用的实现方式.