📡 Eval 지금 흐름
LLM 애플리케이션의 전반적인 성능 검증과 평가를 위한 통합 플랫폼 및 프레임워크가 핵심적으로 발전하고 있습니다. 또한, 단순한 모델 평가를 넘어 운영 환경에서의 추적(Observability), 모니터링, 그리고 에이전트 개발부터 배포까지의 전체 라이프사이클 관리가 주요 흐름으로 부상하고 있습니다.
observabilityllm-evaluationevaluationllmopsopen-sourcellm-observability
comet-ml/opik
97
LLM 애플리케이션과 RAG 시스템을 추적하고 평가하는 도구입니다.
EvalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 21719
★ 21,7192026-09-01이슈 226
confident-ai/deepeval
96
대규모 언어 모델 평가를 위한 프레임워크와 지표를 제공합니다.
EvalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 18011
★ 18,0112026-08-31이슈 570
traceloop/openllmetry
94
오픈텔레메트리를 기반으로 생성형 AI 또는 LLM 애플리케이션의 관측 가능성을 제공한다.
EvalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 7410
★ 7,4102026-08-10이슈 660
apache/hertzbeat
94
AI 기반의 실시간 관측 시스템을 제공하는 오픈소스 에이전트입니다.
EvalJavaApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 7380
★ 7,3802026-09-01이슈 305
open-compass/opencompass
94
다양한 모델과 데이터셋으로 대규모 언어 모델을 평가하는 플랫폼입니다.
EvalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 7380
★ 7,3802026-08-31이슈 392
Helicone/helicone
94
오픈소스 LLM 관측 플랫폼으로 모델 모니터링과 평가를 지원합니다.
EvalTypeScriptApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 6117
★ 6,1172026-08-31이슈 156
coze-dev/coze-loop
94
AI 에이전트 개발부터 모니터링까지 전 주기를 관리하는 플랫폼이다.
EvalGoApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 5706
★ 5,7062026-08-31이슈 80
pydantic/logfire
93
운영 중인 대규모 언어 모델 및 에이전트 시스템을 위한 AI 관측 플랫폼입니다.
EvalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 4448
★ 4,4482026-08-31이슈 186
langwatch/langwatch
93
LLM 평가와 AI 에이전트 테스트를 위한 플랫폼입니다.
EvalTypeScriptApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 3519
★ 3,5192026-08-31이슈 852
pezzolabs/pezzo
93
🕹️ Open-source, developer-first LLMOps platform designed to streamline prompt design, version management, instant delivery, collaboration, troubleshooting, observability and more.
EvalTypeScriptApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 3268
★ 3,2682026-08-21이슈 54
sintel-dev/Orion
91
비지도 학습 기반의 시계열 데이터 이상 탐지 라이브러리입니다.
EvalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 1368
★ 1,3682026-08-31이슈 62
microsoft/prompty
90
AI 애플리케이션을 위한 프롬프트 생성, 관리, 디버깅 및 평가를 용이하게 합니다.
EvalRustMIT
최근 30일 내 활발 · 라이선스 MIT · stars 1255
★ 1,2552026-08-31이슈 10
ENTERPILOT/GoModel
90
다양한 AI 모델을 위한 경량의 통합 API 게이트웨이입니다.
EvalGoMIT
최근 30일 내 활발 · 라이선스 MIT · stars 1103
★ 1,1032026-08-31이슈 52
mlcommons/ck
89
다양한 환경에서 AI 및 머신러닝 워크로드를 효율적으로 실행하기 위한 공동 연구 프로젝트입니다.
EvalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 651
★ 6512026-08-08이슈 11
sb-ai-lab/RePlay
88
A Comprehensive Framework for Building End-to-End Recommendation Systems with State-of-the-Art Models
EvalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 411
★ 4112026-08-31이슈 13
traceopt-ai/traceml
86
PyTorch 학습 실행에 대한 오픈소스 관측 가능성 도구입니다.
EvalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 184
★ 1842026-08-31이슈 64
zhangxjohn/LLM-Agent-Benchmark-List
86
A banchmark list for evaluation of large language models.
EvalApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 170
★ 1702026-08-19이슈 3
🆕weavebench/WeaveBench
86
컴퓨터 사용 에이전트를 위한 장기적이고 실제적인 평가 벤치마크를 제공한다.
EvalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 160
★ 1602026-08-22이슈 5
loganrjmurphy/LeanEuclid
86
LeanEuclid is a benchmark for autoformalization in the domain of Euclidean geometry, targeting the proof assistant Lean.
EvalLeanMIT
최근 30일 내 활발 · 라이선스 MIT · stars 140
★ 1402026-08-10이슈 5
🆕ktwu01/benchmark-radar
86
Daily evidence-first radar for AI benchmarks, evaluations, datasets, and data quality.
EvalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 128
★ 1282026-09-01이슈 68
THU-BPM/Omni-SafetyBench
85
[ACM MM 2026 Oral] Code for paper "Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models".
EvalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 115
★ 1152026-08-26이슈 0
evaleval/every_eval_ever
85
다양한 AI 평가 결과를 표준화된 형식으로 저장하고 비교하는 공유 데이터베이스입니다.
EvalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 108
★ 1082026-08-28이슈 22
🆕azrtydxb/Fastllm-proxy
85
The lowest-overhead LLM router. Production-ready, highly available, one OpenAI-compatible endpoint in front of 80 providers and your own vLLM/SGLang — 0.76 µs per request, no I/O on the request path, cache-affinity routing, RBAC, budgets and a 13-screen UI in the binary.
EvalRustApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 107
★ 1072026-08-20이슈 2
Netis/heron
85
Agent and LLM API performance monitoring via network packet probe. Measures performance of OpenClaw, Claude, Codex, DeepAgents and more — deployed on the provider side, no SDK changes required.
EvalRustApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 95
★ 952026-08-18이슈 3
🆕FedericoTs/quantprobe
85
Run a 110B on a 2016 PC with 16 GB RAM. Know your tok/s before you download. Placement beats budget: predicts speed + memory fit for any GGUF on your exact hardware, self-calibrates, emits the exact llama.cpp command — or 'quantprobe auto' does it all. Falsification-tested laws; misses published at full size. pip install quantprobe
EvalPythonMIT
최근 30일 내 활발 · 라이선스 MIT · stars 91
★ 912026-08-24이슈 0
wink-run/tokenbank
85
Token Bank — the local LLM gateway that sits between your AI agents and every provider. Know where tokens go · Spend less with smart routing to Ollama, Groq, GitHub Models · Earn by sharing idle quota on a community P2P network. One-click onboarding for Cursor, Claude Code, Codex CLI, Gemini CLI — no agent changes. Full trace, seamless model swap
EvalJavaScriptApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 86
★ 862026-08-26이슈 3
🆕aaron-for-value/VeriRun
84
Evidence-first infrastructure for reproducible, isolated executable evaluation and online rewards.
EvalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 75
★ 752026-08-30이슈 9
langfuse/langfuse-java
84
Langfuse API를 위한 자동 생성된 자바 클라이언트 라이브러리입니다.
EvalJavaMIT
최근 30일 내 활발 · 라이선스 MIT · stars 73
★ 732026-08-24이슈 9
AQ-MedAI/MedMemoryBench
84
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
EvalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 70
★ 702026-08-07이슈 2
tolitius/cupel
84
discover LLMs punching above their weight
EvalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 61
★ 612026-08-31이슈 2
🆕DeepTempo/socbench
84
질의응답에 초점을 맞춘 신경망 모델을 탐구하는 코드 저장소입니다.
EvalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 58
★ 582026-08-31이슈 17
meshkovQA/Eval-ai-library
84
Comprehensive AI Model Evaluation Framework with advanced techniques including Temperature-Controlled Verdict Aggregation via Generalized Power Mean. Support for multiple LLM providers and 15+ evaluation metrics for RAG systems and AI agents.
EvalPythonApache-2.0
최근 30일 내 활발 · 라이선스 Apache-2.0 · stars 56
★ 562026-08-27이슈 1
🆕aleclindz/seo-skill-bench
84
Open benchmark for Claude Code SEO skills — real headless execution against fixture sites with planted-defect answer keys. Deterministic scoring, pre-registered rubric.
EvalJavaScriptMIT
최근 30일 내 활발 · 라이선스 MIT · stars 51
★ 512026-08-21이슈 0
hugalafutro/model-hotel
84
다양한 AI 모델을 연결하고 안정적으로 사용할 수 있게 돕는 게이트웨이입니다.
EvalGoMIT
최근 30일 내 활발 · 라이선스 MIT · stars 51
★ 512026-09-01이슈 2
langfuse/langfuse
78
LLM 평가, 관측성, 프롬프트 관리 등을 위한 오픈소스 AI 엔지니어링 플랫폼입니다.
EvalTypeScriptNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 33998
★ 33,9982026-08-31이슈 864
verifywise-ai/verifywise
68
다양한 AI 규제 및 프레임워크를 지원하는 종합적인 AI 거버넌스 평가 플랫폼입니다.
EvalTypeScriptNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 343
★ 3432026-08-31이슈 67
sdv-dev/SDGym
67
합성 데이터 생성 방법을 벤치마킹하는 도구입니다.
EvalPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 311
★ 3112026-08-31이슈 24
alopatenko/LLMEvaluation
67
다양한 사용 사례에 맞는 LLM 평가 방법을 안내하고 모범 사례를 제시합니다.
EvalHTML
최근 30일 내 활발 · 라이선스 불명확 · stars 200
★ 2002026-08-03이슈 4
🆕Blackwellboy/model-serving-minefield
66
Community registry of LLM serving-path traps that produce confidently wrong measurements: templates, tool parsers, reasoning fields, quant kernel paths, CUDA toolchains, KV allocation, eval harnesses, versioning. Symptom-first, with the check that catches each.
EvalPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 127
★ 1272026-08-31이슈 9
ianarawjo/evalstats
66
LLM 평가 시 프롬프트와 모델 성능을 비교하는 통계 분석 방법 제공.
EvalPythonNOASSERTION
최근 30일 내 활발 · 라이선스 불명확 · stars 126
★ 1262026-08-28이슈 1