📡 Multimodal 지금 흐름
멀티모달 분야는 다양한 모드의 모델 정의 및 학습 프레임워크를 제공하며, 이를 실제 서비스 환경에 효과적으로 배포하고 구동하는 인프라 구축에 초점을 맞추고 있습니다. 또한, 로봇 데이터 시각화나 모바일 에이전트 구현처럼 특정 사용 사례에 특화된 응용 및 경량화 연구가 활발하게 진행되고 있습니다.
multimodalvision-language-modelvlmcomputer-visionlarge-language-modelsqwen
huggingface/transformers
100
텍스트, 비전, 오디오 등 다양한 최신 모델을 정의하고 학습 및 추론하는 프레임워크입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 164673
★ 164,6732026-09-01이슈 2,402
sgl-project/sglang
98
대규모 언어 모델과 멀티모달 모델을 위한 고성능 서빙 프레임워크입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 32999
★ 32,9992026-09-01이슈 5,000
microsoft/unilm
97
Large-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 22199
★ 22,1992026-08-26이슈 684
rerun-io/rerun
95
다중 모드 로봇 데이터 시각화, 질의응답 및 학습 스트리밍을 지원합니다.
MultimodalRustApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 11380
★ 11,3802026-08-31이슈 1,279
CVHub520/X-AnyLabeling
95
AI 지원을 받아 이미지 데이터 라벨링 작업을 간편하게 수행하는 도구입니다.
MultimodalPythonGPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 10279
★ 10,2792026-08-28이슈 8
yzhao062/pyod
95
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
MultimodalPythonBSD-2-Clause
최근 30일 내 활발 · 라이선스 BSD-2-Clause · stars 9977
★ 9,9772026-08-19이슈 237
modelscope/modelscope
95
다양한 모델을 서비스 형태로 제공하는 플랫폼입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 9121
★ 9,1212026-08-31이슈 16
bentoml/BentoML
95
AI 애플리케이션과 모델을 쉽게 배포하고 추론 API를 구축하는 도구입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 8815
★ 8,8152026-08-28이슈 211
jingyaogong/minimind-v
95
👀 Train a 65M-parameter VLM from scratch in just 2h!
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 8513
★ 8,5132026-08-06이슈 21
qualcomm/GenieX
95
퀄컴 기기에서 NPU, GPU, CPU로 최신 LLM과 VLM을 구동합니다.
MultimodalRustBSD-3-Clause
최근 30일 내 활발 · 라이선스 BSD-3-Clause · stars 8343
★ 8,3432026-08-31이슈 56
Blaizzy/mlx-audio
94
애플 실리콘 기반의 텍스트 음성 변환 및 음성 분석 라이브러리를 제공한다.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 7812
★ 7,8122026-08-31이슈 109
vllm-project/vllm-omni
94
다양한 모달리티 모델의 효율적인 추론을 위한 프레임워크입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 6513
★ 6,5132026-09-01이슈 1,712
Blaizzy/mlx-vlm
94
맥에서 MLX를 이용해 비전 언어 모델 추론 및 미세 조정을 위한 패키지입니다.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 5450
★ 5,4502026-09-01이슈 176
InternLM/xtuner
94
초거대 MoE 모델을 위한 차세대 훈련 엔진입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 5187
★ 5,1872026-08-31이슈 365
marqo-ai/marqo
94
전자상거래 검색 및 상품 발견을 위한 다중 모드 AI 기능을 제공합니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 5031
★ 5,0312026-08-08이슈 195
open-compass/VLMEvalKit
93
다양한 대규모 멀티모달 모델을 평가하는 오픈소스 도구 모음입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 4368
★ 4,3682026-08-31이슈 298
OpenMOSS/MOSS-TTS
93
MOSS‑TTS Family is an open‑source speech and sound generation model family from MOSI.AI and the OpenMOSS team. It is designed for high‑fidelity, high‑expressiveness, and complex real‑world scenarios, covering stable long‑form speech, multi‑speaker dialogue, voice/character design, environmental sound effects, and real‑time streaming TTS.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 4052
★ 4,0522026-08-30이슈 17
liustack/modlens
93
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
MultimodalTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 3807
★ 3,8072026-08-30이슈 4
vortex-data/vortex
93
컬럼 기반 압축을 위한 확장 가능하고 최신 파일 형식 프레임워크입니다.
MultimodalRustApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 3166
★ 3,1662026-09-01이슈 365
xlang-ai/OSWorld
92
실제 컴퓨터 환경에서 멀티모달 에이전트를 평가하는 벤치마크를 제공한다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 3115
★ 3,1152026-08-30이슈 202
Yutong-Zhou-cv/Awesome-Text-to-Image
92
(ෆ`꒳´ෆ) A Survey on Text-to-Image Generation/Synthesis.
MultimodalMIT
최근 30일 내 활발 · 라이선스 MIT · stars 2444
★ 2,4442026-08-13이슈 2
google-gemini/genai-processors
92
효율적이고 병렬적인 콘텐츠 처리를 위한 경량 파이썬 라이브러리입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 2120
★ 2,1202026-08-04이슈 15
🆕HUANGCHIHHUNGLeo/claude-real-video
92
영상 내용을 장면별로 분석하여 LLM이 시청할 수 있게 하는 도구입니다.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 2099
★ 2,0992026-08-31이슈 0
fikrikarim/parlor
92
기기에서 작동하는 실시간 음성 및 시각 멀티모달 AI 대화 기능을 제공합니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 2047
★ 2,0472026-08-03이슈 1
2U1/Qwen-VL-Series-Finetune
91
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 1962
★ 1,9622026-08-22이슈 57
kyegomez/BitNet
91
비트 단위로 트랜스포머를 구현하여 대규모 언어 모델에 적용하는 코드입니다.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 1946
★ 1,9462026-08-31이슈 8
UbiquitousLearning/mllm
91
Fast Multimodal LLM on Mobile Devices
MultimodalC++MIT
최근 30일 내 활발 · 라이선스 MIT · stars 1600
★ 1,6002026-08-19이슈 84
bytedance/SALMONN
91
다양한 모달리티를 처리하는 고급 멀티모달 대규모 언어 모델군이다.
MultimodalApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 1520
★ 1,5202026-08-24이슈 29
valentinfrlch/ha-llmvision
91
홈 자동화 시스템을 위한 시각 정보를 활용하는 인공지능 기능입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 1449
★ 1,4492026-08-30이슈 48
llm-jp/awesome-japanese-llm
91
일본어 대규모 언어 모델들을 모아놓은 개요 자료입니다.
MultimodalTypeScriptApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 1428
★ 1,4282026-08-22이슈 0
lucidrains/transfusion-pytorch
91
Pytorch implementation of Transfusion, "Predict the Next Token and Diffuse Images with One Multi-Modal Model", from MetaAI
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 1395
★ 1,3952026-08-27이슈 10
EvolvingLMMs-Lab/LLaVA-OneVision-2
90
다양한 모달리티 학습을 위한 완전 개방형 프레임워크를 제공한다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 1195
★ 1,1952026-08-31이슈 68
🆕magicrew/doc7
90
Turn documents into AI-ready Markdown with visual understanding
MultimodalGoMIT
최근 30일 내 활발 · 라이선스 MIT · stars 1180
★ 1,1802026-08-07이슈 1
🆕Anionex/agent-vision-toolkit
90
为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 1127
★ 1,1272026-08-27이슈 6
OpenMOSS/MOVA
90
MOVA: Towards Scalable and Synchronized Video–Audio Generation
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 1106
★ 1,1062026-08-31이슈 32
🆕ysr666/dsh-vision-router
90
Eyes for text-only DeepSeek Harness agents: built-in free vision chain (no key) + pixel-level vision tools (Q&A, grounding, crop, pixel diff, colors, OCR, SVG trace, cutout, screenshots). One-command install, no Python, image turns work like ordinary tool-calling turns.
MultimodalJavaScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 1039
★ 1,0392026-08-31이슈 5
tong-io/tongflow
90
다양한 모달리티를 지원하는 오픈소스 생성형 AI 워크플로우 스튜디오입니다.
MultimodalTypeScriptAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 1007
★ 1,0072026-08-28이슈 7
sgl-project/sglang-omni
90
SGLang-Omni is a high-performance serving framework for audio models (TTS, ASR) and unified multimodal models.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 988
★ 9882026-09-01이슈 542
candle-org/MindAct
90
MindSpore + 🤗Huggingface: Run any Transformers/Diffusers model on MindSpore with seamless compatibility and acceleration.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 920
★ 9202026-08-31이슈 1
OpenDCAI/OpenWorldLib
90
고급 월드 모델을 위한 통합 코드베이스를 제공합니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 864
★ 8642026-08-23이슈 6
🆕Anionex/dsh-vision-toolkit
90
[dsh]为纯文本模型设计更强大的视觉工具箱:一行安装使用、粘贴图片直接识别、多张图片问答、截图到前端UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
MultimodalTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 847
★ 8472026-08-31이슈 3
suzuran0y/CCTV-Smartphone-AI-Monitoring
89
本地监控 + AI 视觉 — LAN-based smartphone-powered AI monitoring framework with structured event output for data acquisition and analysis.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 760
★ 7602026-08-19이슈 3
MigoXLab/dingo
89
AI 데이터, 모델 및 애플리케이션의 전반적인 품질을 평가하는 도구입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 752
★ 7522026-08-28이슈 5
taco-group/SparkVSR
89
[ECCV 2026] SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 700
★ 7002026-08-03이슈 21
FluxVLA/FluxVLA
89
체화된 인공지능을 위한 데이터부터 실제 로봇 배포까지 통합 플랫폼입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 642
★ 6422026-08-31이슈 13
🆕cosmo-wander-ai/cosmo-edge
89
비디오 분석을 위한 프로덕션급 C++ 엣지 AI 엔진입니다.
MultimodalCApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 634
★ 6342026-08-31이슈 12
huggingface/optimum-intel
89
인텔 최적화 도구를 이용해 추론 속도를 높이는 라이브러리입니다.
MultimodalJupyter NotebookApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 616
★ 6162026-08-31이슈 187
gokayfem/ComfyUI_VLM_nodes
89
ComfyUI nodes for vision-language models: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Plus open-vocabulary detection, SAM2/SAM3 segmentation, video temporal reasoning, GGUF via llama.cpp, and hosted LLM/VLM APIs.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 589
★ 5892026-08-08이슈 0
RobotecAI/rai
89
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 576
★ 5762026-08-12이슈 100
motis-project/motis
89
다중 모드 라우팅, 지오코딩 및 지도 타일을 제공하는 프로젝트입니다.
MultimodalC++MIT
최근 30일 내 활발 · 라이선스 MIT · stars 571
★ 5712026-08-31이슈 109
monatis/clip.cpp
89
CLIP inference in plain C/C++ with no extra dependencies
MultimodalC++MIT
최근 30일 내 활발 · 라이선스 MIT · stars 568
★ 5682026-08-24이슈 29
Fabric-Project/Fabric
89
노드 기반의 창의적인 코딩, 3D 및 이미지 처리 도구입니다.
MultimodalSwiftBSD-3-Clause
최근 30일 내 활발 · 라이선스 BSD-3-Clause · stars 548
★ 5482026-08-31이슈 43
Mengqi-Lei/count-anything
89
다양한 객체를 세기 위한 코드와 구현 가이드라인을 제공합니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 537
★ 5372026-08-12이슈 5
mll-lab-nu/VAGEN
88
다중 턴 환경에서 세계 모델 추론을 활용하는 RL 기반 VLM 에이전트를 구현합니다.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 493
★ 4932026-08-30이슈 4
OpenMOSS/MOSS-VL
88
시각 이해에 특화된 핵심 멀티모달 모델 시리즈입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 489
★ 4892026-08-31이슈 4
worldbench/awesome-vla-for-ad
88
🌐 Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
MultimodalHTMLMIT
최근 30일 내 활발 · 라이선스 MIT · stars 468
★ 4682026-08-21이슈 0
sh4den/Montscan
88
🖨️ Automated scanner document processor with AI-powered naming and WebDav integration. Receives scans via FTP, extracts text using Vision AI, generates intelligent filenames with Ollama AI, and uploads to your cloud storage.
MultimodalGoMIT
최근 30일 내 활발 · 라이선스 MIT · stars 444
★ 4442026-08-24이슈 1
gyunggyung/AGI-Papers
88
에이전트, 아키텍처 등 인공지능 분야의 주요 연구 논문을 모아 놓은 자료실입니다.
MultimodalMIT
최근 30일 내 활발 · 라이선스 MIT · stars 420
★ 4202026-08-26이슈 1
HorizonWind2004/reconstruction-alignment
88
[ICLR 2026] Official repo of paper "Reconstruction Alignment Improves Unified Multimodal Models". Unlocking the Massive Zero-shot Potential in Unified Multimodal Models through Self-supervised Learning.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 414
★ 4142026-08-24이슈 5
opendilab/LightRFT
88
LightRFT: Light, Efficient, Omni-modal & Reward-model Driven Reinforcement Fine-Tuning Framework
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 404
★ 4042026-08-17이슈 14
jabberjabberjabber/ImageIndexer
88
이미지 인덱스를 생성하고 로컬 LLM으로 이미지에 태그를 추가합니다.
MultimodalPythonGPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 391
★ 3912026-08-17이슈 0
zhongkaifu/TensorSharp
88
GGUF 모델을 위한 네이티브 .NET LLM 추론 엔진을 제공한다.
MultimodalC#BSD-3-Clause
최근 30일 내 활발 · 라이선스 BSD-3-Clause · stars 390
★ 3902026-08-31이슈 5
ALEEEHU/World-Simulator
88
다양한 모달리티를 아우르는 현실 세계 시뮬레이션 관련 최신 연구 자료와 리소스를 제공합니다.
MultimodalMIT
최근 30일 내 활발 · 라이선스 MIT · stars 384
★ 3842026-08-23이슈 0
laminlabs/lamindb
88
Open-source data management for multimodal AI. Query, trace, and govern with a lineage-native, format-agnostic lakehouse for agents and teams. With support for biological formats and registries by the creators of Scanpy. 🍊YC S22
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 365
★ 3652026-08-31이슈 40
syswonder/robonix
88
The Agentic Operating System for Robots
MultimodalRustMulanPSL-2.0
최근 30일 내 활발 · 라이선스 MulanPSL-2.0 · stars 347
★ 3472026-08-31이슈 36
friedrichor/Awesome-Multimodal-Papers
88
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
MultimodalMIT
최근 30일 내 활발 · 라이선스 MIT · stars 345
★ 3452026-08-04이슈 1
Jinfeng-Xu/Awesome-Multimodal-Recommender-Systems
88
[TMM'26] Continuously Updated Awesome Multimodal Recommendation Paper List
MultimodalMIT
최근 30일 내 활발 · 라이선스 MIT · stars 323
★ 3232026-08-07이슈 0
CVHub520/X-AnyLabeling-Server
87
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
MultimodalPythonAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 303
★ 3032026-08-08이슈 4
kyegomez/NaViT
87
다양한 종횡비와 해상도에 적용 가능한 비전 트랜스포머를 구현함.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 274
★ 2742026-08-28이슈 4
HKUSTDial/DeepEar
87
DeepEar | 顺风耳 An open-source framework for Deep Research and Financial Signal Tracking. 一个用于深度研究与金融信号追踪的开源框架。
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 274
★ 2742026-08-22이슈 3
xlang-ai/OSWorld-V2
87
실제 환경의 장기 작업에서 컴퓨터 사용 에이전트를 벤치마킹하는 데이터셋입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 267
★ 2672026-08-31이슈 11
line/lighthouse
87
[EMNLP2024 Demo], [ICASSP 2025], [ICASSP 2026] A user-friendly library for reproducible video moment retrieval and highlight detection. It also supports audio moment retrieval.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 265
★ 2652026-08-30이슈 7
kyegomez/RT-X
87
Pytorch implementation of the models RT-1-X and RT-2-X from the paper: "Open X-Embodiment: Robotic Learning Datasets and RT-X Models"
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 244
★ 2442026-08-28이슈 7
TUM-AVS/FM-AD-Survey
87
[Survey Paper] This repository collects research papers of large Foundation Models for Scenario Generation and Analysis in Autonomous Driving. The repository will be continuously updated to track the latest update.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 233
★ 2332026-08-07이슈 0
🆕Somnusochi/VLM-AutoYOLO
87
AI Auto Annotation & YOLO Training Pipeline, End-to-end object detection auto-labeling and YOLO training platform. VLM-powered annotation with NVIDIA LocateAnything-3B, manual refinement, one-click YOLO training, video keyframe extraction, and model validation. Supports image and video.
MultimodalPythonAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 222
★ 2222026-08-11이슈 2
withceleste/celeste-python
87
다양한 모달리티와 제공자를 위한 타입 안전한 AI 기본 기능을 제공하는 라이브러리입니다.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 219
★ 2192026-08-31이슈 39
ForeverBlue816/GRACE
87
[ICML 2026] GRACE-VLM: deployable INT4 Qwen3-VL via quantization-aware distillation.
MultimodalJupyter NotebookApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 217
★ 2172026-08-15이슈 0
🆕Hebbian-Robotics/hflow
87
SDK for robotics teams to verify the quality of their data used for AI model training.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 209
★ 2092026-08-31이슈 39
gokayfem/ComfyUI-fal-API
87
Production-ready ComfyUI custom nodes for 1,400+ fal.ai models, auto-updated image, video, audio, LLM and VLM APIs with native media, caching and cost controls.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 207
★ 2072026-08-31이슈 1
ayushh0110/ScreenMind
87
AI 기반으로 화면 기록을 캡처하고 분석하여 검색 및 대화할 수 있게 합니다.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 204
★ 2042026-08-22이슈 0
🆕six-nut/PocketMen-with-you
87
Create high-fidelity Codex companions from 2+ photos with local open-weight neural editing and no OpenAI API key.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 202
★ 2022026-08-27이슈 11
🆕worldbench/awesome-embodied-data-pyramid
86
🔥 Data Pyramid for Embodied Manipulation: A Survey
MultimodalHTMLApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 177
★ 1772026-08-28이슈 0
TsinghuaC3I/MedXpertQA
86
[ICML 2025] MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 174
★ 1742026-08-30이슈 6
xiincs/claude-code-vision-skill
86
为 Claude Code 赋能多模态视觉能力,适配 纯文本 LLM 底座,用于截图 / UI / 图表分析;搭配 browser-harness 可做前端布局自动化检查。
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 171
★ 1712026-08-25이슈 0
tongjingqi/Game-RL
86
다중 모드 검증 가능한 게임 데이터를 생성하여 VLM의 추론 능력을 향상시킨다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 159
★ 1592026-08-21이슈 0
isLinXu/paper-list
86
다양한 주제의 논문 목록을 자동으로 업데이트하는 저장소입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 153
★ 1532026-08-31이슈 0
kyegomez/swarms-pytorch
86
Swarming algorithms like PSO, Ant Colony, Sakana, and more in PyTorch 😊
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 153
★ 1532026-08-29이슈 8
🆕HVision-NKU/OraRL
86
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 152
★ 1522026-08-28이슈 1
gammahazard/locate-anything
86
사용자 GPU에서 개방형 어휘 객체 탐지 및 위치 파악을 위한 웹 UI를 제공한다.
MultimodalTypeScriptApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 148
★ 1482026-08-12이슈 10
kyegomez/PALI3
86
Implementation of PALI3 from the paper PALI-3 VISION LANGUAGE MODELS: SMALLER, FASTER, STRONGER"
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 146
★ 1462026-08-28이슈 4
MICA-MNI/micapipe
85
micapipe from the Multimodal imaging and connectome analysis lab (http://mica-mni.github.io) at the Montreal Neurological Institute. Read The Docs documentation below
MultimodalShellGPL-3.0
최근 30일 내 활발 · 라이선스 GPL-3.0 · stars 120
★ 1202026-08-10이슈 48
vinhnx/VT.ai
85
다양한 기능을 가진 멀티모달 인공지능 채팅 애플리케이션입니다.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 118
★ 1182026-08-31이슈 18
Jian-Lang/awesome-modality-missing-learning
85
A collection of research studies centered on Modality Missing Learning (MML) (also referred to as Incomplete Multimodal Learning).
MultimodalMIT
최근 30일 내 활발 · 라이선스 MIT · stars 118
★ 1182026-08-23이슈 0
Picovoice/pico-cookbook
85
실시간 개인용 음성, 언어, 비전 기능을 구현하는 코드 예제 모음입니다.
MultimodalCApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 114
★ 1142026-08-28이슈 1
oidlabs-com/Lexoid
85
다양한 데이터를 LLM이 사용할 수 있는 깨끗한 컨텍스트로 변환하는 범용 어댑터입니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 108
★ 1082026-08-31이슈 31
tridz-dev/huf
85
팀과 앱을 위한 자체 호스팅 다중 에이전트 AI 인프라를 제공한다.
MultimodalPythonAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 108
★ 1082026-08-29이슈 74
aws-samples/bedrock-claude-chatbot
85
Personal private Chatbot powered by Amazon Bedrock LLMs with a data analytics feature that provides isolated servereless compute on for data analysis. Chatbot features web-based intuitive user interface that can be accessed from any device (laptops, phones, etc.), handles multi-modal document upload and chat and maintains privacy of conversations.
MultimodalPythonMIT-0
최근 30일 내 활발 · 라이선스 MIT-0 · stars 106
★ 1062026-08-18이슈 0
VectorInstitute/vector-inference
85
슬럼 클러스터에서 효율적인 대규모 언어 모델 추론을 지원합니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 106
★ 1062026-08-31이슈 8
🆕Stormycry-cryp/dsh-AuthInOne
85
Self-contained DeepSeek Harness (DSH) plugin for Provider/Auth login, model switching, image fallback, token/cost analytics, and same-port Web restart. Useful? A star helps.
MultimodalJavaScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 105
★ 1052026-08-15이슈 0
🆕unknowlei/minimax-h3-opencode-skills
85
OpenCode skill suite for MiniMax H3 directing, routing, multishot planning, prompt generation, and review.
MultimodalPowerShellMIT
최근 30일 내 활발 · 라이선스 MIT · stars 103
★ 1032026-08-09이슈 1
ParisNeo/lollms
85
모든 알려진 AI 서비스와 호환되는 통합 인공지능 솔루션입니다.
MultimodalVueApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 96
★ 962026-08-31이슈 14
🆕To3akaRin/VLMForge
85
Evaluate visual models on your own images, JSON Schema, and production constraints with LangGraph, Pareto analysis, and a no-key Replay demo.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 90
★ 902026-08-20이슈 1
🆕oil-oil/dsh-vision
85
Near-native image understanding for DeepSeek Harness
MultimodalTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 88
★ 882026-08-18이슈 3
CCI-Bonn/OHIF-AI
85
OHIF 뷰어에 서버 측 AI를 통합하여 의료 영상 분석을 지원합니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 85
★ 852026-08-21이슈 0
parsee-ai/parsee-core
85
Retrieval of fully structured data made easy. Use LLMs or custom models. Specialized on PDFs and HTML files. Extensive support of tabular data extraction and multimodal queries.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 84
★ 842026-08-25이슈 0
mstar-project/mstar
85
모든 종류의 모델을 위한 고성능 범용 서빙 프레임워크를 제공합니다.
MultimodalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 82
★ 822026-09-01이슈 56
🆕itsmeadarsh2008/opencode-senses
85
The vision plugin for OpenCode that truly understands images. Inspect, read, and reason about any screenshot or picture with deeper understanding than any other plugin — fully local, private, and free.
MultimodalTypeScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 82
★ 822026-08-31이슈 1
kyegomez/Kosmos2.5
84
My implementation of Kosmos2.5 from the paper: "KOSMOS-2.5: A Multimodal Literate Model"
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 75
★ 752026-08-28이슈 4
rustic-ai/rustic-ui-components
84
React component library for crafting user-friendly and engaging conversational experiences
MultimodalJavaScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 71
★ 712026-08-11이슈 16
automatika-robotics/embodied-agents
84
ROS2 기반으로 환경 정보를 이해하고 기억하며 상호작용하는 물리적 에이전트 제작 프레임워크입니다.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 67
★ 672026-08-31이슈 1
kyegomez/HLT
84
강화 학습을 이용한 실제 휴머노이드 로봇 동작 구현 코드입니다.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 64
★ 642026-08-29이슈 4
richardChenzhihui/Med-Banana-80K
84
Official code release for the EMNLP 2026 paper "Med-Banana: Learning Quality-Controlled Medical Image Editing from Success-and-Failure Trajectories" — Med-Banana-80K dataset + edit–verify–refine system
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 64
★ 642026-08-25이슈 0
seanpedrick-case/doc_redaction
84
GUI로 PDF, 이미지, 문서 파일의 개인정보를 가리는 기능을 제공합니다.
MultimodalPythonAGPL-3.0
최근 30일 내 활발 · 라이선스 AGPL-3.0 · stars 60
★ 602026-08-28이슈 1
SuhZhang/GeoSR
84
[ECCV 2026 Oral] Official implementation of "Make Geometry Matter for Spatial Reasoning"
MultimodalHTMLApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 56
★ 562026-08-06이슈 0
Allessyer/awesome-kaz-datasets
84
Datasets in kazakh language for different tasks
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 55
★ 552026-08-28이슈 1
billpsomas/icir
84
[NeurIPS 2025] Official implementation of "Instance-Level Composed Image Retrieval".
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 55
★ 552026-08-15이슈 0
THUSI-Lab/GameVerse
84
비전-언어 모델이 비디오 기반 반성 학습을 할 수 있는지 검증하는 벤치마크입니다.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 53
★ 532026-08-02이슈 0
ymrohit/openscenesense-ollama
84
OpenSceneSense Ollama is a Python library that harnesses AI for advanced local video analysis, offering customizable frame and audio insights for dynamic applications in media, education, and content moderation.
MultimodalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 52
★ 522026-08-24이슈 5
RunanywhereAI/runanywhere-sdks
75
AI 모델을 로컬 환경에서 구동할 수 있도록 지원하는 개발 도구 모음입니다.
MultimodalC++NOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 10281
★ 10,2812026-08-31이슈 64
roboflow/notebooks
75
최신 컴퓨터 비전 모델과 기술을 다루는 튜토리얼 모음입니다.
MultimodalJupyter Notebook
최근 30일 내 활발 · 라이선스 불명확 · stars 9634
★ 9,6342026-08-14이슈 89
changyeyu/LLM-RL-Visualized
73
🌟100+ 原创 LLM / RL 原理图📚,《大模型算法》作者巨献!💥(100+ LLM/RL Algorithm Maps )
MultimodalPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 4835
★ 4,8352026-08-29이슈 3
EvolvingLMMs-Lab/lmms-eval
73
텍스트, 이미지, 비디오, 오디오 등 다양한 모달리티를 평가하는 도구 모음입니다.
MultimodalPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 4385
★ 4,3852026-08-31이슈 61
Hunyuan-PromptEnhancer/PromptEnhancer
73
[CVPR 2026] PromptEnhancer is a prompt-rewriting tool, refining prompts into clearer, structured versions for better image generation.
MultimodalPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 3762
★ 3,7622026-08-18이슈 13
software-mansion/react-native-executorch
71
React Native에서 기기 상으로 AI 모델을 선언적으로 실행하게 돕는다.
MultimodalC++NOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 1706
★ 1,7062026-08-31이슈 56
Tencent/AngelSlim
71
모델 압축을 위한 도구 모음으로 사용 편의성과 효율성을 높입니다.
MultimodalPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 1598
★ 1,5982026-08-07이슈 66
Capsize-Games/airunner
71
Offline inference engine for art, real-time voice conversations, LLM powered chatbots and automated workflows
MultimodalPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 1314
★ 1,3142026-08-29이슈 2
🚀🆕Tencent/WeMM-Embedding
70
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
MultimodalPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 1002
★ 1,0022026-08-28이슈 5
EvolvingLMMs-Lab/lmms-engine
70
다양한 모달리티를 통합하여 모델을 훈련할 수 있는 엔진입니다.
MultimodalPython
최근 30일 내 활발 · 라이선스 불명확 · stars 824
★ 8242026-08-06이슈 11
microsoft/psi
69
Platform for Situated Intelligence
MultimodalC#NOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 572
★ 5722026-08-20이슈 62
OpenEnvision/Awesome-Multimodal-Modeling
69
다양한 모달리티를 다루는 모델링 관련 자료들을 모아놓은 목록입니다.
Multimodal
최근 30일 내 활발 · 라이선스 불명확 · stars 541
★ 5412026-08-07이슈 3
🆕Dicklesworthstone/franken_ocr
67
순수 Rust로 구현된 CPU 전용 OCR 엔진으로 이미지에서 텍스트를 추출합니다.
MultimodalRustNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 313
★ 3132026-08-31이슈 0
MrGiovanni/RadGPT
67
[ICCV 2025] AbdomenAtlas 3.0 (9,262 CT volumes + medical reports). These “superhuman” reports are more accurate, detailed, standardized, and generated faster than traditional human-made reports.
MultimodalPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 217
★ 2172026-08-26이슈 1
JiazheWei/PosterCopilot
67
Official implementation for PosterCopilot
MultimodalPython
최근 30일 내 활발 · 라이선스 불명확 · stars 201
★ 2012026-08-03이슈 1
ydyhello/Awesome-VLM-Streaming-Video
66
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
Multimodal
최근 30일 내 활발 · 라이선스 불명확 · stars 197
★ 1972026-08-17이슈 1
mll-lab-nu/MindCube
66
Benchmark and training code for MindCube: spatial mental modeling in vision-language models from limited views.
MultimodalPython
최근 30일 내 활발 · 라이선스 불명확 · stars 168
★ 1682026-08-23이슈 5
🆕ShadowSafin/AndroLLM
66
Open-source Android AI using LiteRT-LM with hardware acceleration, cloud providers, memory, and voice.
MultimodalKotlinNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 135
★ 1352026-08-29이슈 0
MrGiovanni/R-Super
66
[MICCAI 2025 Best Paper Award] Learning Segmentation from Radiology Reports
MultimodalPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 131
★ 1312026-08-25이슈 3
avanturist322/awesome-memory-vla
66
기억 기능을 갖춘 시각-언어-행동 모델들을 모아 놓은 목록입니다.
Multimodal
최근 30일 내 활발 · 라이선스 불명확 · stars 126
★ 1262026-08-17이슈 0
OpenEnvision/Awesome-Multimodal-Agent
65
Awesome Multimodal Agent
Multimodal
최근 30일 내 활발 · 라이선스 불명확 · stars 112
★ 1122026-08-15이슈 3
isjinghao/OralGPT
65
구두 평가를 위한 공식 저장소와 벤치마크 자료를 제공합니다.
MultimodalPython
최근 30일 내 활발 · 라이선스 불명확 · stars 106
★ 1062026-08-31이슈 6
🆕Shuo-Liang-0111/RA-Bench
65
Real-event-anchored benchmark for detecting AI-generated videos in real-world crisis settings.
MultimodalPython
최근 30일 내 활발 · 라이선스 불명확 · stars 97
★ 972026-08-17이슈 0
kesimeg/awesome-turkish-language-models
65
A curated list of Turkish AI models, datasets, papers
Multimodal
최근 30일 내 활발 · 라이선스 불명확 · stars 96
★ 962026-08-29이슈 4
🆕kwai/MemGUI-Agent
65
Official code for "MemGUI-Agent: An End-to-End Long-Horizon Mobile GUI Agent with Proactive Context Management"
MultimodalPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 88
★ 882026-08-29이슈 1
SiyuanYan1/Derm1M
64
[ICCV'25 Highlight] Derm1M: A Million‑Scale Vision‑Language Dataset Aligned with Clinical Ontology Knowledge for Dermatology
MultimodalPython
최근 30일 내 활발 · 라이선스 불명확 · stars 76
★ 762026-08-11이슈 0
🆕starVLA/VLAct
64
Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
MultimodalPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 67
★ 672026-08-31이슈 1
sutdcv/SUTD-TrafficQA
64
[CVPR 2021] SUTD-TrafficQA: A Question Answering Benchmark and an Efficient Network for Video Reasoning over Traffic Events
MultimodalJavaScript
최근 30일 내 활발 · 라이선스 불명확 · stars 66
★ 662026-08-31이슈 2