AI Repo Radar › Audio-Speech

Audio-Speech 음성·오디오

GitHub Audio-Speech 오픈소스 210개 — 실전투입 점수 순

기준일 2026-09-01 · 매일 갱신
📡 Audio-Speech 지금 흐름

오픈소스 생태계는 고품질의 음성 인식 및 합성을 위해 모델 경량화와 오프라인 구동 환경을 강조하고 있으며, 특히 적은 데이터로도 높은 성능을 내는 개인화된 음성 변환 기술이 주목받고 있다. 또한, 단순히 텍스트를 음성으로 바꾸거나 음성을 텍스트로 변환하는 것을 넘어, 다국어 번역, 영상 콘텐츠 처리 등 멀티모달리티와 실시간 활용성에 초점을 맞추는 방향으로 발전하고 있다.

text-to-speechspeech-recognitionspeech-to-textttsasrspeech-synthesis
🚀harry0703/MoneyPrinterTurbo
100
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 119085
★ 119,0852026-08-31이슈 14
RVC-Boss/GPT-SoVITS
99
적은 양의 음성 데이터로도 효과적인 텍스트 음성 변환 모델을 학습합니다.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 61361
★ 61,3612026-08-18이슈 890
ggml-org/whisper.cpp
99
오픈AI의 위스퍼 모델을 C/C++로 구현하여 음성 인식을 가능하게 합니다.
Audio-SpeechC++MIT
최근 30일 내 활발 · 라이선스 MIT · stars 53338
★ 53,3382026-08-31이슈 1,237
🚀OpenBMB/VoxCPM
98
VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 36380
★ 36,3802026-08-26이슈 112
Zackriya-Solutions/meetily
97
Privacy first, AI meeting assistant with 4x faster Parakeet/Whisper live transcription, speaker diarization, and Ollama summarization built on Rust. 100% local processing. no cloud required. Meetily (Meetly Ai - https://meetily.ai) is the #1 Self-hosted, Open-source Ai meeting note taker for macOS & Windows. Understand How to write meeting minutes
Audio-SpeechRustMIT
최근 30일 내 활발 · 라이선스 MIT · stars 30169
★ 30,1692026-08-31이슈 361
m-bain/whisperX
97
WhisperX: Automatic Speech Recognition with Word-level Timestamps (& Diarization)
Audio-SpeechPythonBSD-2-Clause
최근 30일 내 활발 · 라이선스 BSD-2-Clause · stars 23829
★ 23,8292026-08-30이슈 217
jianchang512/pyvideotrans
96
영상 언어를 다른 언어로 번역하고 더빙 및 자막을 삽입합니다.
Audio-SpeechPythonGPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 18851
★ 18,8512026-08-26이슈 16
NVIDIA-NeMo/Speech
96
대규모 언어 모델과 음성 AI 연구를 위한 확장 가능한 생성형 프레임워크입니다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 18370
★ 18,3702026-08-31이슈 298
alphacep/vosk-api
96
Offline speech recognition API for Android, iOS, Raspberry Pi and servers with Python, Java, C# and Node
Audio-SpeechJupyter NotebookApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 15094
★ 15,0942026-08-09이슈 604
k2-fsa/sherpa-onnx
96
오프라인 환경에서 다양한 플랫폼을 지원하는 음성 처리 기능을 제공합니다.
Audio-SpeechC++Apache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 14509
★ 14,5092026-08-31이슈 620
huggingface/speech-to-speech
96
오픈소스 모델로 로컬 음성 에이전트를 구축하는 데 사용됩니다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 12981
★ 12,9812026-08-28이슈 100
debpalash/VoiceStudio
96
VoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.
Audio-SpeechPythonAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 12707
★ 12,7072026-08-30이슈 28
PaddlePaddle/PaddleSpeech
96
음성 인식, 합성, 번역 등 다양한 기능을 제공하는 간편한 음성 처리 도구 모음입니다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 12675
★ 12,6752026-08-12이슈 276
speechbrain/speechbrain
95
A PyTorch-based Speech Toolkit
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 11798
★ 11,7982026-08-27이슈 181
QuentinFuxa/WhisperLiveKit
95
Real-time, local speech-to-text with streaming ASR, speaker diarization, translation, and OpenAI/Deepgram-compatible APIs.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 10981
★ 10,9812026-08-31이슈 7
niedev/RTranslator
95
안드로이드에서 오프라인으로 작동하는 실시간 번역 애플리케이션입니다.
Audio-SpeechJavaApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 10372
★ 10,3722026-08-26이슈 25
espnet/espnet
95
음성 인식부터 합성까지 전 과정의 음성 처리 딥러닝 도구 모음입니다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 9947
★ 9,9472026-09-01이슈 52
xorbitsai/inference
95
하나의 API로 다양한 오픈소스 LLM을 구동할 수 있게 해주는 추론 도구입니다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 9533
★ 9,5332026-08-31이슈 44
QwenAudio/SenseVoice
95
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
Audio-SpeechCMIT
최근 30일 내 활발 · 라이선스 MIT · stars 9192
★ 9,1922026-08-31이슈 8
Uberi/speech_recognition
95
Speech recognition module for Python, supporting several engines and APIs, online and offline.
Audio-SpeechPythonBSD-3-Clause
최근 30일 내 활발 · 라이선스 BSD-3-Clause · stars 8987
★ 8,9872026-08-31이슈 312
fishaudio/Bert-VITS2
95
다국어 BERT를 활용한 VITS2 기반의 음성 합성 모델이다.
Audio-SpeechPythonAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 8797
★ 8,7972026-08-31이슈 2
TalAter/annyang
94
웹사이트에서 음성을 텍스트로 변환하는 기능을 제공합니다.
Audio-SpeechTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 6816
★ 6,8162026-08-05이슈 10
espeak-ng/espeak-ng
94
다양한 언어와 억양을 지원하는 오픈소스 음성 합성기입니다.
Audio-SpeechCGPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 6794
★ 6,7942026-08-31이슈 603
argmaxinc/argmax-oss-swift
94
애플 실리콘 기반의 온디바이스 음성 인공지능 기능을 제공합니다.
Audio-SpeechSwiftMIT
최근 30일 내 활발 · 라이선스 MIT · stars 6349
★ 6,3492026-08-13이슈 136
spotify/pedalboard
94
🎛 🔊 A Python library for audio.
Audio-SpeechC++GPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 6286
★ 6,2862026-08-31이슈 146
modelscope/FunClip
94
영상 음성 인식 및 클리핑을 지원하는 오픈소스 도구입니다.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 6202
★ 6,2022026-08-31이슈 5
denizsafak/abogen
94
EPUB, PDF, 텍스트를 자막 동기화 오디오북으로 생성합니다.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 5793
★ 5,7932026-08-29이슈 45
MahmoudAshraf97/whisper-diarization
94
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper
Audio-SpeechJupyter NotebookBSD-2-Clause
최근 30일 내 활발 · 라이선스 BSD-2-Clause · stars 5634
★ 5,6342026-08-15이슈 42
dograh-hq/dograh
94
자체 구축 가능한 음성 AI 플랫폼으로 다양한 통신 기능을 제공합니다.
Audio-SpeechPythonBSD-2-Clause
최근 30일 내 활발 · 라이선스 BSD-2-Clause · stars 5541
★ 5,5412026-08-31이슈 48
liuzhao1225/YouDub-webui
94
유튜브 및 빌리빌이 영상 다운로드부터 번역, 음성 합성까지 자동화하는 AI 도구입니다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 5396
★ 5,3962026-08-31이슈 6
remsky/Kokoro-FastAPI
94
도커로 패키징된 코코로 음성 모델을 지원하는 FastAPI 래퍼입니다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 5390
★ 5,3902026-08-31이슈 31
Picovoice/porcupine
93
딥러닝 기반으로 기기에서 음성 활성화 단어를 감지합니다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 4926
★ 4,9262026-08-12이슈 0
collabora/WhisperLive
93
오픈AI의 위스퍼를 거의 실시간으로 구현한 음성 인식 모델이다.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 4244
★ 4,2442026-08-31이슈 35
KoljaB/RealtimeTTS
93
Converts text to speech in realtime
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 4020
★ 4,0202026-08-31이슈 126
IAHispano/Applio
93
사용하기 쉽고 성능 좋은 음성 변환 도구입니다.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 3670
★ 3,6702026-08-31이슈 31
Open-Less/openless
93
키를 누르고 말하면 앱 어디서든 다듬어진 텍스트로 변환되는 음성 입력기입니다.
Audio-SpeechRustMIT
최근 30일 내 활발 · 라이선스 MIT · stars 3381
★ 3,3812026-08-27이슈 29
ahmetoner/whisper-asr-webservice
93
OpenAI Whisper ASR Webservice API
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 3326
★ 3,3262026-08-09이슈 122
rsxdalv/TTS-WebUI
93
A single Gradio + React WebUI with extensions for ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, and Bark!
Audio-SpeechTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 3249
★ 3,2492026-08-31이슈 108
HeyWillow/willow
92
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
Audio-SpeechCApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 3100
★ 3,1002026-09-01이슈 25
elevenlabs/elevenlabs-python
92
엘레븐랩스 API를 사용하기 위한 공식 파이썬 개발 도구입니다.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 3082
★ 3,0822026-08-31이슈 36
pytorch/audio
92
PyTorch 기반의 오디오 신호 처리를 위한 데이터 조작 및 변환 기능을 제공한다.
Audio-SpeechPythonBSD-2-Clause
최근 30일 내 활발 · 라이선스 BSD-2-Clause · stars 2933
★ 2,9332026-08-31이슈 338
linto-ai/whisper-timestamped
92
Multilingual Automatic Speech Recognition with word-level timestamps and confidence
Audio-SpeechPythonAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 2841
★ 2,8412026-08-17이슈 49
pnnbao97/VieNeu-TTS
92
장치에서 실시간으로 작동하는 베트남어 음성 합성 기능을 제공합니다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 2458
★ 2,4582026-08-25이슈 13
wq2012/awesome-diarization
91
A curated list of awesome Speaker Diarization papers, libraries, datasets, and other resources.
Audio-SpeechApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 1893
★ 1,8932026-08-27이슈 4
RHVoice/RHVoice
91
러시아어를 포함한 여러 언어를 지원하는 무료 오픈소스 음성 합성기입니다.
Audio-SpeechC++GPL-2.0
최근 30일 내 활발 · 라이선스 GPL-2.0 · stars 1835
★ 1,8352026-08-27이슈 172
High-Logic/Genie-TTS
91
GPT-SoVITS ONNX Inference Engine & Model Converter
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 1760
★ 1,7602026-08-30이슈 35
mkiol/dsnote
91
오프라인 음성 인식, 합성 및 번역 기능을 갖춘 리눅스 메모 앱입니다.
Audio-SpeechC++MPL-2.0
최근 30일 내 활발 · 라이선스 MPL-2.0 · stars 1618
★ 1,6182026-08-27이슈 146
AlekPet/ComfyUI_Custom_Nodes_AlekPet
91
Custom nodes that extend the capabilities of Comfyui
Audio-SpeechJavaScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 1525
★ 1,5252026-08-27이슈 72
QwenAudio/Fun-ASR
91
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
Audio-SpeechCApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 1506
★ 1,5062026-08-31이슈 7
R3gm/SoniTranslate
91
Synchronized Translation for Videos. Video dubbing
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 1412
★ 1,4122026-08-29이슈 119
peteonrails/voxtype
91
Wayland 환경에서 푸시 투 토크 기능을 지원하는 음성 인식 도구입니다.
Audio-SpeechRustMIT
최근 30일 내 활발 · 라이선스 MIT · stars 1325
★ 1,3252026-09-01이슈 127
roatienza/Deep-Learning-Experiments
90
Videos, notes and experiments to understand deep learning
Audio-SpeechJupyter NotebookMIT
최근 30일 내 활발 · 라이선스 MIT · stars 1198
★ 1,1982026-08-15이슈 9
soniqo/speech-swift
90
애플 실리콘 기반의 음성 인식 및 합성 기능을 제공하는 AI 도구 모음입니다.
Audio-SpeechSwiftApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 1159
★ 1,1592026-08-31이슈 7
lhotse-speech/lhotse
90
Tools for handling multimodal data in machine learning projects.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 1149
★ 1,1492026-08-26이슈 169
k2-fsa/sherpa
90
차세대 칼디 기반의 음성 인식 서버 프레임워크입니다.
Audio-SpeechC++Apache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 981
★ 9812026-08-31이슈 110
alesaccoia/VoiceStreamAI
90
Near-Realtime audio transcription using self-hosted Whisper and WebSocket in Python/JS
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 959
★ 9592026-08-13이슈 20
sandrohanea/whisper.net
90
Whisper 모델을 사용하여 간단하게 음성을 텍스트로 변환하는 도구입니다.
Audio-SpeechC#MIT
최근 30일 내 활발 · 라이선스 MIT · stars 941
★ 9412026-08-31이슈 32
mosecorg/mosec
90
고성능 머신러닝 모델 서빙을 위한 프레임워크를 제공합니다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 902
★ 9022026-08-09이슈 16
EDDiscovery/EDDiscovery
90
엘리트 데인저러스의 항해 기록과 삼차원 별 지도를 제공하는 저장소입니다.
Audio-SpeechC#Apache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 896
★ 8962026-08-31이슈 4
Natooz/MidiTok
90
MIDI / symbolic music tokenizers for Deep Learning models 🎶
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 888
★ 8882026-08-05이슈 3
mybigday/whisper.rn
90
Whisper.cpp를 리액트 네이티브에서 사용할 수 있도록 바인딩한 라이브러리입니다.
Audio-SpeechC++MIT
최근 30일 내 활발 · 라이선스 MIT · stars 800
★ 8002026-08-31이슈 8
VRCWizard/TTS-Voice-Wizard
90
Speech to Text to Speech. Song now playing. Sends text as OSC messages to VRChat to display on avatar. (STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)
Audio-SpeechC#MIT
최근 30일 내 활발 · 라이선스 MIT · stars 799
★ 7992026-08-19이슈 9
VocaHQ/vocalinux
89
Free, open-source, 100% offline voice dictation for Linux. Speak and type anywhere via whisper.cpp, Whisper & VOSK engines, GPU-accelerated, works on X11 + Wayland!
Audio-SpeechPythonAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 789
★ 7892026-08-31이슈 57
Notely-Voice/NotelyVoice
89
A 100% private AI voice transcription app that converts speech to text in 100+ languages. Built with Compose Multiplatform for Android & iOS using Whisper AI - no cloud uploads, all processing happens on-device for complete privacy.
Audio-SpeechC++GPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 776
★ 7762026-08-21이슈 42
salute-developers/GigaAM
89
Foundational Model for Speech Recognition Tasks
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 774
★ 7742026-08-17이슈 15
Blaizzy/mlx-audio-swift
89
애플 실리콘에서 MLX를 이용한 모듈형 오디오 처리 스위프트 SDK입니다.
Audio-SpeechSwiftMIT
최근 30일 내 활발 · 라이선스 MIT · stars 768
★ 7682026-08-31이슈 20
cboard-org/cboard
89
브라우저 기반의 텍스트 음성 변환 기능을 갖춘 의사소통 보조 시스템입니다.
Audio-SpeechJavaScriptGPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 746
★ 7462026-08-31이슈 251
Picovoice/rhino
89
딥러닝 기반의 온디바이스 음성 인식 및 의도 추론 엔진입니다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 709
★ 7092026-08-12이슈 0
jamsch/expo-speech-recognition
89
리액트 네이티브 엑스포 프로젝트를 위한 음성 인식 기능을 제공합니다.
Audio-SpeechTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 672
★ 6722026-08-30이슈 57
Picovoice/cheetah
89
딥러닝 기반의 기기 내 스트리밍 음성 인식 엔진을 제공한다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 671
★ 6712026-08-17이슈 0
pnlpal/dictionariez
89
다국어 사전 검색, 텍스트 음성 변환 및 번역 기능을 제공하는 확장 프로그램이다.
Audio-SpeechJavaScriptGPL-2.0
최근 30일 내 활발 · 라이선스 GPL-2.0 · stars 670
★ 6702026-08-26이슈 14
sveinbjornt/hear
89
Command line interface for the built-in speech recognition and transcription capabilities in macOS.
Audio-SpeechObjective-CBSD-3-Clause
최근 30일 내 활발 · 라이선스 BSD-3-Clause · stars 669
★ 6692026-08-30이슈 8
🆕MartinDelophy/ai-video-editor
89
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
Audio-SpeechJavaScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 666
★ 6662026-08-31이슈 7
judahpaul16/gpt-home
89
라즈베리 파이 기반으로 상용 스마트 홈 비서의 대안을 구현합니다.
Audio-SpeechPythonGPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 647
★ 6472026-08-14이슈 0
woheller69/whisperIME
89
Android Input Method Editor (IME) based on Whisper
Audio-SpeechJavaMIT
최근 30일 내 활발 · 라이선스 MIT · stars 627
★ 6272026-08-30이슈 21
lukaszliniewicz/Pandrator
89
PDF나 EPUB을 오디오북으로 변환하고 영상 더빙까지 가능한 도구입니다.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 617
★ 6172026-09-01이슈 17
CrispStrobe/CrispASR
89
다국어 ASR 및 TTS 모델을 위한 C++ ggml 런타임 허브입니다.
Audio-SpeechC++MIT
최근 30일 내 활발 · 라이선스 MIT · stars 598
★ 5982026-08-31이슈 15
TheDeathDragon/LiveTranslate
89
실시간 음성 녹음 및 시스템 오디오를 텍스트로 변환하고 번역하여 보여줍니다.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 597
★ 5972026-08-17이슈 2
VolcanicArts/VRCOSC
89
VRChat용 모듈형 노드 프로그래밍 언어 및 애니메이션 시스템을 제공한다.
Audio-SpeechC#GPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 563
★ 5632026-08-30이슈 0
🆕tornikegomareli/Talkify
89
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
Audio-SpeechSwiftMIT
최근 30일 내 활발 · 라이선스 MIT · stars 532
★ 5322026-08-27이슈 8
wildminder/ComfyUI-VoxCPM
89
ComfyUI node for highly expressive speech and realistic zero-shot voice cloning
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 509
★ 5092026-08-06이슈 4
richardr1126/openreader
88
다양한 형식의 문서를 읽고 음성으로 변환하며 하이라이팅하는 서버입니다.
Audio-SpeechTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 500
★ 5002026-08-23이슈 5
🆕AudarAI/Audar-ASR-V1
88
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 498
★ 4982026-08-22이슈 0
Picovoice/leopard
88
딥러닝 기반의 온디바이스 음성 인식 엔진을 제공한다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 483
★ 4832026-08-17이슈 0
deepgram/deepgram-python-sdk
88
딥그램의 기능을 파이썬으로 사용할 수 있게 해주는 공식 개발 도구입니다.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 458
★ 4582026-08-31이슈 41
jim60105/docker-whisperX
88
WhisperX를 이용한 자동 음성 인식 및 화자 분리 기능을 제공하는 도커 이미지입니다.
Audio-SpeechDockerfileMIT
최근 30일 내 활발 · 라이선스 MIT · stars 455
★ 4552026-08-15이슈 0
elevenlabs/elevenlabs-js
88
엘레븐랩스 API를 위한 공식 자바스크립트 라이브러리입니다.
Audio-SpeechTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 440
★ 4402026-08-31이슈 16
misyaguziya/VRCT
88
VRCT(VRChat Chatbox Translator & Transcription)
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 429
★ 4292026-08-31이슈 19
SWHL/AI-Competition-Collections
88
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
Audio-SpeechHTMLApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 428
★ 4282026-08-10이슈 0
Agions/splicr
88
Vynaro (叙影 AI) - 下一代 7 步全自动 AI 影视解说与第一人称视频创作工具 (Tauri 2 + Rust + React 19)
Audio-SpeechTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 421
★ 4212026-08-28이슈 0
dictation-toolbox/dragonfly
88
Speech recognition framework allowing powerful Python-based scripting and extension of Dragon NaturallySpeaking (DNS), Windows Speech Recognition (WSR), Kaldi and CMU Pocket Sphinx
Audio-SpeechPythonLGPL-3.0
최근 30일 내 활발 · 라이선스 LGPL-3.0 · stars 418
★ 4182026-08-07이슈 31
xifan2333/fcitx5-vinput
88
Fcitx5를 위한 음성 입력 기능으로 로컬 및 클라우드 STT와 LLM 재작성을 지원합니다.
Audio-SpeechC++GPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 405
★ 4052026-08-31이슈 0
Vonage/vonage-node-sdk
88
Node.js 환경에서 SMS, 음성 등 다양한 기능을 제공하는 Vonage API 클라이언트입니다.
Audio-SpeechTypeScriptApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 395
★ 3952026-08-28이슈 5
izwi-ai/izwi
88
로컬에서 작동하는 음성 인식, 화자 분리, TTS 및 음성 복제 기능을 제공합니다.
Audio-SpeechRustMIT
최근 30일 내 활발 · 라이선스 MIT · stars 381
★ 3812026-08-31이슈 18
🆕FrigadeHQ/yap
88
Free, open source voice dictation for macOS. On-device transcription with Apple's Speech framework. No cloud/no API keys/no account.
Audio-SpeechSwiftMIT
최근 30일 내 활발 · 라이선스 MIT · stars 376
★ 3762026-08-12이슈 10
istupakov/onnx-asr
88
ONNX 모델을 사용한 가벼운 자동 음성 인식 파이썬 패키지입니다.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 369
★ 3692026-08-16이슈 24
crosswk/SayIt
88
음성 입력과 AI 윤색 기능을 제공하는 오픈소스 타이플리스 대체 프로그램이다.
Audio-SpeechTypeScriptAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 360
★ 3602026-08-30이슈 2
PowerBeef/Vocello
88
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
Audio-SpeechSwiftMIT
최근 30일 내 활발 · 라이선스 MIT · stars 357
★ 3572026-08-31이슈 9
daanzu/kaldi-active-grammar
88
디코딩 시 활성화/비활성화 가능한 문법을 가진 파이썬 칼디 음성 인식기입니다.
Audio-SpeechPythonAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 349
★ 3492026-08-29이슈 45
Sharrnah/whispering-ui
88
Native UI for the Whispering Tiger project - https://github.com/Sharrnah/whispering (live transcription / translation)
Audio-SpeechGoMIT
최근 30일 내 활발 · 라이선스 MIT · stars 324
★ 3242026-08-30이슈 11
🆕estebanstifli/LocalText2Voice
88
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 324
★ 3242026-08-21이슈 2
OpenBMB/UltraEval-Audio
88
음성 인식, TTS 등 오디오 관련 모델을 평가하는 통합 벤치마크 프레임워크입니다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 319
★ 3192026-08-25이슈 5
yuga-hashimoto/openclaw-assistant
87
OpenClaw voice assistant app for Android - Wake word activation & system assistant integration
Audio-SpeechKotlinMIT
최근 30일 내 활발 · 라이선스 MIT · stars 311
★ 3112026-08-29이슈 176
sayksii/Aria
87
ARIA - AI Realtime Intelligent Audio | Universal real-time AI subtitles for Windows
Audio-SpeechPythonGPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 307
★ 3072026-08-09이슈 7
NaomiProject/Naomi
87
The Naomi Project is an open source, technology agnostic platform for developing always-on, voice-controlled applications!
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 298
★ 2982026-08-31이슈 54
deepgram/deepgram-js-sdk
87
딥그램의 기능을 자바스크립트로 사용할 수 있게 해주는 공식 개발 도구입니다.
Audio-SpeechTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 272
★ 2722026-08-31이슈 43
Picovoice/cobra
87
딥러닝 기반의 기기 내 음성 활동 감지 기능을 제공합니다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 270
★ 2702026-08-12이슈 0
HAKORADev/VODER
87
음성 작동 및 디자인 엔진으로 음성 복제와 변환 기능을 제공한다.
Audio-SpeechPythonAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 265
★ 2652026-08-23이슈 1
🆕QuintinShaw/openasr
87
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
Audio-SpeechRustApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 254
★ 2542026-08-31이슈 9
Picovoice/web-voice-processor
87
A library for real-time voice processing in web browsers
Audio-SpeechTypeScriptApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 247
★ 2472026-08-11이슈 0
robinhad/ukrainian-tts
87
Ukrainian TTS (text-to-speech) using ESPNET
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 247
★ 2472026-08-18이슈 9
Lyrcaxis/KokoroSharp
87
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
Audio-SpeechC#MIT
최근 30일 내 활발 · 라이선스 MIT · stars 240
★ 2402026-08-14이슈 11
CodeBySonu95/VoxSherpa-TTS
87
안드로이드에서 인터넷 연결 없이 작동하는 자연스러운 음성 합성 엔진입니다.
Audio-SpeechJavaGPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 217
★ 2172026-08-23이슈 8
ChetanXpro/nodejs-whisper
87
NodeJS Bindings for Whisper - the CPU version of OpenAI's Whisper, as initially crafted in C++ by ggerganov.
Audio-SpeechTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 211
★ 2112026-08-03이슈 19
sfortis/openai_tts
87
Custom TTS component for Home Assistant. Utilizes the OpenAI speech engine or any compatible endpoint to deliver high-quality speech. Optionally offers chime and audio normalization features.
Audio-SpeechPythonGPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 211
★ 2112026-08-31이슈 12
ServiceNow/eva
87
음성 에이전트를 평가하기 위한 전체적인 프레임워크를 제공합니다.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 204
★ 2042026-08-27이슈 18
ayutaz/piper-plus
87
다국어 음성 합성 기능을 다양한 언어와 플랫폼에서 지원하는 라이브러리입니다.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 202
★ 2022026-08-28이슈 7
botbahlul/PyAutoSRT
86
PySimpleGUI based DESKTOP APP to AUTO GENERATE SUBTITLE FILE (using free Google Speech Recognition API) and TRANSLATED SUBTITLE FILE (using unofficial online Google Translate API) for any video or audio file
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 190
★ 1902026-08-30이슈 2
ishandutta2007/Awesome-Text-to-Speech
86
텍스트를 음성으로 변환하는 최신 도구와 자료들을 모아 놓은 목록입니다.
Audio-SpeechMIT
최근 30일 내 활발 · 라이선스 MIT · stars 185
★ 1852026-08-27이슈 0
mozilla-ai/document-to-podcast
86
문서를 활용하여 로컬 환경에서 팟캐스트를 생성하는 도구입니다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 182
★ 1822026-08-31이슈 13
BuildWithAIs/voicekey
86
음성으로 텍스트를 입력할 수 있게 도와주는 도구입니다.
Audio-SpeechTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 180
★ 1802026-08-28이슈 3
Aivis-Project/AivisSpeech-Engine
86
텍스트를 음성으로 변환하는 AI 목소리 모방 시스템입니다.
Audio-SpeechPythonLGPL-3.0
최근 30일 내 활발 · 라이선스 LGPL-3.0 · stars 176
★ 1762026-08-22이슈 2
rryam/AuralKit
86
iOS와 macOS에서 실시간 음성 텍스트 변환 기능을 제공하는 스위프트 패키지입니다.
Audio-SpeechSwiftMIT
최근 30일 내 활발 · 라이선스 MIT · stars 167
★ 1672026-08-31이슈 0
soniqo/speech-android
86
안드로이드 기기에서 음성 인식, 합성 등 기능을 구현하는 SDK입니다.
Audio-SpeechKotlinApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 149
★ 1492026-08-30이슈 1
gustavostz/whisper-clip
86
WhisperClip simplifies your life by automatically transcribing audio recordings and saving the text directly to your clipboard. With just a click of a button, you can effortlessly convert spoken words into written text, ready to be pasted wherever you need it. This application harnesses the power of OpenAI’s Whisper for free.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 139
★ 1392026-08-22이슈 1
🆕EveningStudy/asmr-dubber
86
音视频字幕及配音工具:支持 ASR(语音识别)、台本导入、AI 翻译、双语字幕、音色克隆、TTS(语音合成)与混音以得到双语音频。
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 137
★ 1372026-08-27이슈 10
🆕yuxino/mimi
86
Live translated subtitles for anything playing on your Mac or PC.
Audio-SpeechRustMIT
최근 30일 내 활발 · 라이선스 MIT · stars 134
★ 1342026-08-30이슈 0
🆕AbhishekBarali/SpeakoFlow
86
Free, open-source offline voice dictation for Windows, macOS, and Linux. A Wispr Flow alternative with an AI assistant that can read your screen on request and answer questions.
Audio-SpeechRustMIT
최근 30일 내 활발 · 라이선스 MIT · stars 133
★ 1332026-08-30이슈 7
🆕nari-labs/nari-qwen3-tts
86
Ultrafast Qwen3-TTS: sub-50 ms time-to-first-audio at 10 requests per second.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 130
★ 1302026-08-19이슈 1
mitchib1440/SpeakThat
86
가장 포괄적인 알림 읽기 기능을 제공하는 접근성 도구입니다.
Audio-SpeechKotlinGPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 129
★ 1292026-08-28이슈 13
arcosoph/nanowakeword
85
A lightweight, wake word detection engine. Train custom, high-accuracy models with minimal effort.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 123
★ 1232026-08-28이슈 11
botbahlul/crx-live-translate
85
Chrome/Edge BROWSER EXTENSION that can RECOGNIZE any live audio/video streaming then TRANSLATE it for FREE (using unofficial online Google Translate API) then display it as LIVE CAPTION / LIVE SUBTITLE!
Audio-SpeechJavaScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 122
★ 1222026-08-29이슈 1
RWKV-APP/RWKV_APP
85
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
Audio-SpeechDartApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 121
★ 1212026-08-22이슈 19
kadirnar/voicehub
85
VoiceHub: A Unified Inference Interface for TTS Models
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 119
★ 1192026-08-14이슈 2
asterics/Asterics-AAC
85
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
Audio-SpeechJavaScriptAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 117
★ 1172026-08-26이슈 184
asigalov61/tegridy-tools
85
음악의 심볼릭 처리를 위한 인공지능 도구 모음입니다.
Audio-SpeechJupyter NotebookApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 116
★ 1162026-08-20이슈 0
d4n3436/GTranslate
85
A collection of free translation APIs (Google Translate, Bing Translator, Microsoft Translator and Yandex.Translate).
Audio-SpeechC#MIT
최근 30일 내 활발 · 라이선스 MIT · stars 113
★ 1132026-08-30이슈 3
🆕notivn/AIEV
85
Automatic AI video editing. Claude directs HyperFrames (HTML + GSAP motion graphics) and Remotion (timeline assembly) to turn raw footage into a finished MP4 - transcript, kinetic typography, karaoke subtitles, sound effects. Self-hosted, supervised from a web dashboard on port 6868.
Audio-SpeechTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 106
★ 1062026-08-16이슈 2
moeru-ai/unspeech
85
🗣️🔊 Your Text-to-Speech Services, All-in-One.
Audio-SpeechGoAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 105
★ 1052026-08-08이슈 2
🆕callebtc/sayit
85
Private, local text-to-speech for Apple silicon Macs
Audio-SpeechSwiftMIT
최근 30일 내 활발 · 라이선스 MIT · stars 103
★ 1032026-08-23이슈 2
Metacreation-Lab/MIDI-GPT
85
GPT-2 transformer for controllable, multitrack symbolic music generation
Audio-SpeechC++MIT
최근 30일 내 활발 · 라이선스 MIT · stars 97
★ 972026-08-19이슈 2
mgonzs13/whisper_ros
85
Speech-to-Text based on SileroVAD + whisper.cpp (GGML Whisper) for ROS 2
Audio-SpeechC++MIT
최근 30일 내 활발 · 라이선스 MIT · stars 96
★ 962026-08-08이슈 0
gabriele-mastrapasqua/qwen3-tts
85
Qwen3-TTS 음성 합성을 위한 순수 C 기반 추론 엔진입니다.
Audio-SpeechCMIT
최근 30일 내 활발 · 라이선스 MIT · stars 89
★ 892026-08-31이슈 2
artcc/freelingo
85
Open-source, self-hosted AI language learning platform with local or cloud LLMs, CEFR study plans, an AI tutor, voice conversations, flashcards, and spaced repetition.
Audio-SpeechJavaScriptAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 89
★ 892026-08-26이슈 7
attevon-llc/OpenTranscribe
85
AI 기반의 음성 인식 및 화자 분리 기능을 갖춘 자체 구축 플랫폼입니다.
Audio-SpeechPythonAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 89
★ 892026-08-31이슈 57
🆕NVIDIA/NeMo-Speech.cpp
85
NeMo-Speech.cpp is a lightweight C++ inference runtime for Speech models
Audio-SpeechC++Apache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 87
★ 872026-08-31이슈 4
maxmelichov/BlueTTS
85
빠르고 오픈 소스로 사용할 수 있는 다국어 텍스트 음성 변환 모델이다.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 86
★ 862026-08-12이슈 1
VocaHQ/vocamac
85
Open-source, offline voice-to-text for macOS. Hold a hotkey, speak, text appears. Private on-device dictation with multiple speech engines.
Audio-SpeechSwiftAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 85
★ 852026-08-31이슈 13
SahilAggarwal2004/react-text-to-speech
85
웹 스피치 API를 이용해 텍스트를 음성으로 변환하는 쉬운 리액트 라이브러리입니다.
Audio-SpeechTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 85
★ 852026-08-19이슈 0
maemreyo/omnivoice-server
85
OpenAI-compatible HTTP server for OmniVoice text-to-speech
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 82
★ 822026-08-31이슈 9
HumeAI/hume-typescript-sdk
85
Add Hume AI to any TypeScript project
Audio-SpeechTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 81
★ 812026-08-18이슈 5
chrisurf/obsidian-voice
85
옵시디언에서 작성한 내용을 음성으로 들을 수 있게 해주는 플러그인입니다.
Audio-SpeechTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 81
★ 812026-08-20이슈 8
🆕mat-nolen/tldr-radio
85
Turn the daily TLDR newsletters into a podcast. Local, deterministic, no LLM.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 80
★ 802026-08-29이슈 0
🆕PolinniZhong/dsh-omi-voice
85
DeepSeek Harness 语音朗读插件:沉浸式听朗读,用豆包 TTS 自然音色读 AI 回复(BYOK · 点读/暂停/继续)
Audio-SpeechSwiftMIT
최근 30일 내 활발 · 라이선스 MIT · stars 79
★ 792026-08-28이슈 0
🆕PolinniZhong/omi-read-aloud
84
A lightweight macOS menu bar companion that reads copied conversation text and AI responses from Codex, Kimi Work, Deepseek, QianWen, and other apps aloud via Doubao TTS. BYOK.
Audio-SpeechSwiftMIT
최근 30일 내 활발 · 라이선스 MIT · stars 78
★ 782026-08-14이슈 0
JuiceBoxxGames/utsuwa
84
Utsuwa is an open-source alternative to Grok Companion. This is a platform where you can have a virtual AI waifu that learns and grows with you, bundled with optional mechanics inspired by Japanese dating sim games.
Audio-SpeechTypeScriptAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 78
★ 782026-08-31이슈 7
🆕iannuttall/natter
84
Fast, local-first dictation for macOS
Audio-SpeechSwiftApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 77
★ 772026-08-31이슈 0
davidacm/NVDA-IBMTTS-Driver
84
This project is aimed at developing and maintaining the NVDA IBMTTS driver. IBMTTS is a synthesizer similar to Eloquence. Please send your ideas and contributions here!
Audio-SpeechPythonGPL-2.0
최근 30일 내 활발 · 라이선스 GPL-2.0 · stars 77
★ 772026-08-25이슈 31
jorge-menjivar/super-stt
84
최신 음성 모델을 활용하여 모든 애플리케이션에서 간편하게 음성을 텍스트로 변환합니다.
Audio-SpeechRustGPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 74
★ 742026-09-01이슈 9
soniqo/speech-core
84
C++로 구현된 온디바이스 음성 활동 감지 및 스트리밍 STT/TTS 기능을 제공한다.
Audio-SpeechC++Apache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 74
★ 742026-08-30이슈 1
JaySpiffy/draft-to-take
84
Draft to Take beta: local-first AI audio production studio powered by IndexTTS2, Docker, Qwen, OmniVoice, SFX, ambience, and music sidecars.
Audio-SpeechBatchfileMIT
최근 30일 내 활발 · 라이선스 MIT · stars 74
★ 742026-08-12이슈 1
hyeonsangjeon/computing-Korean-STT-error-rates
84
한국어 음성 인식 출력의 다양한 오류율을 평가하는 파이썬 패키지입니다.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 73
★ 732026-08-22이슈 1
Amey-Thakur/DEEPFAKE-AUDIO
84
🎙️ Deepfake Audio – A neural voice cloning studio powered by SV2TTS technology.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 73
★ 732026-08-28이슈 0
mgsgde/whisper-shortcut
84
음성 인식 및 음성을 프롬프트로 변환하는 macOS 애플리케이션입니다.
Audio-SpeechSwiftAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 72
★ 722026-08-31이슈 1
RisorseArtificiali/anti-vocale
84
Android app for transcribing voice messages locally on-device, with no internet required.
Audio-SpeechKotlinApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 71
★ 712026-08-31이슈 18
🆕Saganaki22/Higgs_v3-TTS-ComfyUI
84
ComfyUI nodes for higgs-audio-v3-tts-4b multilingual (100 languages) conversational TTS, zero-shot voice cloning, inline emotion/style/prosody/SFX tags, longform chunking, multi-speaker dialogue, and AIMDO memory management
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 71
★ 712026-08-28이슈 0
kahne/fastwer
84
A PyPI package for fast word/character error rate (WER/CER) calculation
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 70
★ 702026-08-24이슈 3
zakuro-ai/asr
84
ASRDeepspeech x Sakura-ML (English/Japanese) with deepspeech2 model in pytorch with support from Zakuro AI.
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 69
★ 692026-08-20이슈 0
botbahlul/autosrt
84
A python script COMMAND LINE utility to AUTO GENERATE SUBTITLE FILE (using free Google Speech Recognition API) and TRANSLATED SUBTITLE FILE (using unofficial online Google Translate API) for any video or audio file
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 69
★ 692026-08-25이슈 3
taigrr/elevenlabs
84
Unofficial Go client for the ElevenLabs API: text-to-speech, speech-to-text, sound generation, and voice management.
Audio-SpeechGo0BSD
최근 30일 내 활발 · 라이선스 0BSD · stars 68
★ 682026-08-30이슈 1
oboroge0/AITuberFlow
84
AI 기반 버츄얼 유튜버 제작을 위한 시각적 워크플로우 편집기입니다.
Audio-SpeechTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 66
★ 662026-08-31이슈 66
Mobile-Artificial-Intelligence/maise
84
Maise is an open-source android speech engine designed to provide a powerful and flexible platform for speech sythesis on the edge.
Audio-SpeechKotlinMIT
최근 30일 내 활발 · 라이선스 MIT · stars 65
★ 652026-08-31이슈 3
mattmireles/kokoro-coreml
84
PyTorch 기반의 음성 합성 모델을 CoreML로 변환하여 기기 내 음성 합성을 가능하게 합니다.
Audio-SpeechPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 62
★ 622026-08-31이슈 1
Nanboy-Ronan/RVCBench
84
다양한 음성 모델의 음성 복제 강건성과 개인정보 보호를 평가하는 벤치마크입니다.
Audio-SpeechPythonCC0-1.0
최근 30일 내 활발 · 라이선스 CC0-1.0 · stars 56
★ 562026-08-31이슈 0
deepgram/deepgram-dotnet-sdk
84
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
Audio-SpeechC#MIT
최근 30일 내 활발 · 라이선스 MIT · stars 55
★ 552026-08-31이슈 31
rudrankriyam/Glosik
84
Sample project for F5-TTS using MLX Swift
Audio-SpeechSwiftMIT
최근 30일 내 활발 · 라이선스 MIT · stars 55
★ 552026-08-31이슈 0
IhorShevchuk/piper-app
84
iOS와 macOS용으로 구동되는 원본 Piper 음성 합성 애플리케이션입니다.
Audio-SpeechSwiftGPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 53
★ 532026-08-31이슈 11
AmphionTeam/FlexiCodec
84
[ICLR2026] FlexiCodec: A Dynamic Neural Audio Codec for Low Frame Rates
Audio-SpeechPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 52
★ 522026-08-20이슈 1
elevenlabs/examples
81
음성 합성 및 더빙 관련 예제들을 모아 놓은 저장소입니다.
Audio-SpeechTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 623
★ 6232026-08-28이슈 1
index-tts/index-tts
77
산업 수준의 제어 가능하고 효율적인 제로샷 텍스트 음성 변환 시스템입니다.
Audio-SpeechPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 23629
★ 23,6292026-08-18이슈 402
voicepaw/so-vits-svc-fork
75
실시간 지원과 개선된 인터페이스를 갖춘 So-VITS 서비스 포크입니다.
Audio-SpeechPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 9329
★ 9,3292026-08-31이슈 156
flashlight/wav2letter
74
Facebook AI Research's Automatic Speech Recognition Toolkit
Audio-SpeechC++NOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 6437
★ 6,4372026-08-28이슈 107
cmusphinx/pocketsphinx
73
작고 가벼운 음성 인식 기능을 제공하는 라이브러리입니다.
Audio-SpeechCNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 4335
★ 4,3352026-08-30이슈 41
🆕0xShug0/audio.cpp
72
An all-in-one, pure C++ inference engine for audio models, powered by ggml. Supports TTS, STT, VAD, voice conversion, music generation, and more, with highly optimized performance. No Python dependency.
Audio-SpeechC++NOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 2166
★ 2,1662026-08-31이슈 30
nyrahealth/CrisperWhisper
71
정확한 단어 단위 시간 정보와 필러 탐지가 가능한 음성 인식 시스템이다.
Audio-SpeechPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 1365
★ 1,3652026-08-23이슈 34
diodiogod/TTS-Audio-Suite
70
로컬에서 여러 엔진과 언어를 지원하는 텍스트 음성 변환 및 음성 변환 기능을 제공합니다.
Audio-SpeechPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 1185
★ 1,1852026-08-31이슈 56
Azure-Samples/Cognitive-Speech-TTS
70
Microsoft Text-to-Speech API sample code in several languages, part of Cognitive Services.
Audio-SpeechC#NOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 1011
★ 1,0112026-08-07이슈 18
BinWang28/audio-ai-hub
70
오디오 AI 연구를 위한 논문, 모델, 벤치마크 및 데이터셋을 모아놓은 허브입니다.
Audio-SpeechPython
최근 30일 내 활발 · 라이선스 불명확 · stars 950
★ 9502026-08-31이슈 98
fluxions-ai/vui
69
실시간 음성 비서 기능을 제공하며 로컬에서 작동하는 AI 애플리케이션입니다.
Audio-SpeechPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 749
★ 7492026-08-25이슈 4
EmulationAI/awesome-large-audio-models
69
Collection of resources on the applications of Large Language Models (LLMs) in Audio AI.
Audio-Speech
최근 30일 내 활발 · 라이선스 불명확 · stars 737
★ 7372026-08-08이슈 0
EDCD/EDDI
69
엘리트 데인저러스 게임을 위한 보조 애플리케이션입니다.
Audio-SpeechC#NOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 522
★ 5222026-08-31이슈 18
echogarden-project/echogarden
68
Cross-platform speech toolset, used from the command-line or as a Node.js library. Includes a variety of engines for speech synthesis, speech recognition, forced alignment, speech translation, voice isolation, language detection and more.
Audio-SpeechTypeScript
최근 30일 내 활발 · 라이선스 불명확 · stars 449
★ 4492026-08-30이슈 47
agan-j/xiaoniu
68
로컬 및 유튜브 영상의 자동 음성 인식과 다국어 번역을 지원하는 AI 영상 번역 도구입니다.
Audio-Speech
최근 30일 내 활발 · 라이선스 불명확 · stars 398
★ 3982026-08-26이슈 5
🆕kigner/audio.cpp-webui
68
C++ 기반의 오디오 모델 추론 엔진으로 다양한 음성 기능을 제공한다.
Audio-SpeechC++NOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 342
★ 3422026-08-14이슈 3
🆕oboroge0/hayamimi
68
早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.
Audio-SpeechPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 317
★ 3172026-09-01이슈 14
CokoIya/MioVRC_Translator
65
미오 브이알씨에서 음성을 텍스트로 변환하고 번역하는 플러그인이다.
Audio-SpeechPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 121
★ 1212026-08-29이슈 2
lihaiya/freeipcc
65
Call Center,Contact Center,AI,呼叫中心,客服系统,工单系统,智能外呼,大模型呼叫中心,智能呼叫中心,FreeSWITCH
Audio-SpeechTypeScriptNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 119
★ 1192026-08-24이슈 1
🆕timoncool/dub-studio
65
윈도우에서 작동하는 오프라인 AI 영상 더빙 스튜디오입니다.
Audio-SpeechRustNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 110
★ 1102026-08-31이슈 5
hwdsl2/docker-whisper
65
Docker로 배포하는 음성 인식 서버로 화자 분리와 API 기능을 제공합니다.
Audio-SpeechPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 96
★ 962026-08-18이슈 4
straff2002/OpenGlasses
65
메타 레이밴이나 오클리 같은 스마트 안경을 더 똑똑하게 만드는 프로젝트입니다.
Audio-SpeechSwiftNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 90
★ 902026-09-01이슈 1

상위 200개 표시 · 전체 210개는 메인에서 검색·정렬