LiteLLM: 100개 이상의 LLM을 하나의 API로 다루는 오픈소스 AI 게이트웨이

  • 카카오톡 공유하기
  • 네이버 블로그 공유하기
  • 네이버 밴드에 공유하기
  • 페이스북 공유하기
  • 트위터 공유하기
  • 링크 복사하기

들어가며

요즘 서비스에 AI 기능을 넣으려면 흔히 OpenAI의 GPT, Anthropic의 Claude, Google의 Gemini, AWS Bedrock 등 여러 LLM(대규모 언어 모델) 제공업체 중 하나 이상을 선택해서 연동하게 됩니다. 문제는 이들 각각이 서로 다른 SDK, 인증 방식, 요청/응답 형식을 사용한다는 점입니다. 모델을 바꾸거나 여러 모델을 동시에 운영하려면 그만큼 코드를 다시 짜야 하죠.

LiteLLM은 바로 이 문제를 해결하기 위해 만들어진 오픈소스 프로젝트입니다. 100개가 넘는 LLM 제공업체를 단 하나의 통일된 인터페이스(OpenAI API 형식)로 호출할 수 있게 해주는 “AI 게이트웨이”이자 Python 라이브러리입니다.

<liteLLM Website, 출처: https://litellm.ai>

LiteLLM이란 무엇인가

LiteLLM은 OpenAI, Anthropic, Gemini, Bedrock, Azure 등 100개 이상의 LLM 제공업체를 OpenAI 형식으로 호출할 수 있는, 단일하고 통일된 인터페이스를 제공하는 오픈소스 AI 게이트웨이입니다. 즉, 어떤 LLM을 쓰든 코드 상에서는 항상 같은 방식(OpenAI의 chat.completions 형식)으로 요청을 보내고 응답을 받을 수 있다는 뜻입니다.

이 도구는 크게 두 가지 방식으로 사용할 수 있습니다. 하나는 Python 코드에 직접 라이브러리로 통합하는 Python SDK이고, 다른 하나는 팀이나 조직을 위한 중앙 서비스로 배포하는 AI 게이트웨이(프록시 서버)입니다. 2023년 YC(Y Combinator) W23 배치에 참여한 BerryAI가 개발했으며, GitHub에서 5만 개 이상의 스타를 받은 활발한 커뮤니티 프로젝트입니다.

왜 LiteLLM을 쓰는가?

여러 제공업체에 걸쳐 LLM 호출을 관리하는 일은 금방 복잡해집니다. 제공업체마다 SDK, 인증 방식, 요청 형식, 오류 유형이 모두 다르기 때문입니다. LiteLLM은 이런 번거로움을 없애줍니다.

  • 통일된 API — 100개 이상의 LLM을 하나의 인터페이스로 다루기 때문에 제공업체별 SDK를 따로 학습하거나 사용할 필요가 없습니다.
  • OpenAI 호환성 — 기존 코드를 다시 작성하지 않고도 제공업체를 손쉽게 교체할 수 있습니다.
  • 프로덕션 준비가 된 게이트웨이 — 가상 키(virtual key), 사용량/비용 추적, 가드레일, 로드밸런싱, 관리자 대시보드가 기본으로 제공됩니다.
  • 뛰어난 성능 — 초당 1,000 요청(RPS) 기준 P95 지연시간이 8ms 수준으로 알려져 있습니다.
  • 다양한 엔드포인트 지원 — Chat Completions뿐 아니라 Responses, Embeddings, 이미지 생성, 음성(오디오), 배치 작업, 리랭킹 등 여러 API 유형을 지원합니다.
  • 재시도/폴백(fallback) 로직 — 특정 제공업체(예: Azure)에 장애가 생기면 다른 배포(예: OpenAI)로 자동 전환하는 라우터 기능을 갖추고 있습니다.
  • 에이전트·MCP 연동 — A2A(Agent-to-Agent) 프로토콜과 MCP(Model Context Protocol) 서버를 게이트웨이 차원에서 연결할 수 있어, 에이전트형 AI 서비스를 구축할 때도 유용합니다.

실제로 Netflix, Stripe 등 다양한 기업이 오픈소스 버전의 LiteLLM을 도입해 사용하고 있는 것으로 알려져 있습니다.

사용 방식: Python SDK vs AI 게이트웨이(프록시 서버)

LiteLLM은 프록시 서버(AI 게이트웨이)와 Python SDK, 두 가지 방식으로 사용할 수 있으며 둘 다 100개 이상의 LLM에 접근할 수 있는 통일된 인터페이스를 제공합니다. 상황에 맞게 선택하면 됩니다.

구분AI 게이트웨이 (프록시 서버)Python SDK
주요 용도여러 LLM에 접근하는 중앙 서비스(LLM 게이트웨이)파이썬 코드에 직접 통합
주 사용자Gen AI 인에이블먼트 / ML 플랫폼 팀LLM 프로젝트를 만드는 개발자
핵심 기능인증·인가가 포함된 중앙 집중형 API 게이트웨이, 프로젝트/사용자별 비용 추적 및 예산 관리, 로깅·가드레일·캐싱 등 프로젝트별 커스터마이징, 접근 제어용 가상 키, 모니터링용 관리자 대시보드 UI코드베이스에 바로 통합되는 라이브러리, 여러 배포에 걸친 재시도/폴백 라우터, 애플리케이션 레벨 로드밸런싱 및 비용 추적, OpenAI 호환 예외 처리, Langfuse·MLflow 등 관측 도구 콜백

즉, 팀 전체가 공유하는 LLM 게이트웨이가 필요하다면 프록시 서버를, 내 애플리케이션 코드 안에서 가볍게 LLM을 호출하고 싶다면 Python SDK를 선택하면 됩니다. 둘을 함께 쓰는 것도 가능합니다.

지원하는 주요 Service Provider

LiteLLM이 지원하는 제공업체는 100개가 넘으며, 아래는 그중 대표적인 것들입니다.

분류주요 제공업체
대형 클라우드/빅테크OpenAI, Anthropic (Claude), Google (Gemini, Vertex AI, PaLM), Microsoft Azure(OpenAI/AI), AWS (Bedrock, SageMaker), IBM watsonx
오픈소스/추론 인프라Hugging Face, VLLM, Ollama, LM Studio, Llamafile, NVIDIA NIM, Triton
고성능 추론 특화Groq, Cerebras, Fireworks AI, Together AI, DeepInfra, SambaNova
특화 모델·업체Cohere, Mistral AI, xAI (Grok), DeepSeek, Perplexity AI, Moonshot, Replicate, OpenRouter
음성/멀티모달ElevenLabs, Deepgram, AssemblyAI, Fal AI

각 제공업체는 Chat Completions, Messages, Responses, Embeddings, 이미지 생성, 음성 변환 등 지원하는 엔드포인트가 조금씩 다릅니다. 전체 목록과 각 제공업체가 지원하는 엔드포인트는 공식 문서의 지원 제공업체 페이지에서 표 형태로 확인할 수 있습니다.

설치 방법

1) Python SDK 설치

파이썬 프로젝트에서 라이브러리로 바로 쓰고 싶다면 다음처럼 설치합니다.

2) 프록시 서버(AI 게이트웨이) 설치

팀 단위로 공용 게이트웨이를 운영하고 싶다면 프록시 서버용 패키지를 설치합니다.

Docker, Render, Railway, AWS, GCP 등 다양한 환경에 원클릭 또는 Terraform/Helm으로 배포하는 방법도 공식 문서에 안내되어 있습니다. 실서비스 환경에서는 12시간 부하 테스트를 통과한 -stable 태그가 붙은 Docker 이미지를 사용하는 것이 권장됩니다.

<docker 기반 설치 , 출처:https://litellm.ai>

사용 방법

1) Python SDK로 바로 호출하기

가장 간단한 사용법은 completion() 함수를 호출하는 것입니다. 모델 이름 앞에 제공업체명/모델명 형식으로 붙이면, LiteLLM이 알아서 해당 제공업체의 API로 요청을 변환해줍니다.

from litellm import completion
import os

os.environ["OPENAI_API_KEY"] = "your-openai-key"
os.environ["ANTHROPIC_API_KEY"] = "your-anthropic-key"

# OpenAI 모델 호출
response = completion(
    model="openai/gpt-4o",
    messages=[{"role": "user", "content": "안녕하세요!"}]
)

# Anthropic(Claude) 모델 호출 — 코드 구조는 동일
response = completion(
    model="anthropic/claude-sonnet-4-20250514",
    messages=[{"role": "user", "content": "안녕하세요!"}]
)

이처럼 서로 다른 제공업체를 호출하더라도 API 키만 다르게 설정하면 되고, 요청·응답 형식과 코드 구조는 그대로 유지됩니다. 모델을 바꾸고 싶으면 model 파라미터의 문자열만 바꾸면 되는 것이죠.

2) 프록시 서버(AI 게이트웨이)로 사용하기

프록시 서버는 CLI 명령 한 줄로 실행할 수 있습니다.

litellm --model gpt-4o

서버가 뜨면, 애플리케이션에서는 OpenAI SDK를 그대로 사용하되 base_url만 로컬 게이트웨이 주소로 바꿔주면 됩니다.

import openai

client = openai.OpenAI(
    api_key="anything",              # 프록시 인증은 별도의 virtual key로 관리
    base_url="http://0.0.0.0:4000"
)

response = client.chat.completions.create(
    model="gpt-4o",
    messages=[{"role": "user", "content": "안녕하세요!"}]
)

이 방식은 인증·인가가 포함된 중앙 집중형 게이트웨이 역할을 하며, 프로젝트나 사용자 단위로 비용을 추적하고 예산을 관리하거나, 로깅과 가드레일, 캐싱 등을 프로젝트별로 다르게 설정할 수 있고, 접근 제어를 위한 가상 키와 모니터링용 관리자 대시보드도 함께 제공됩니다. 여러 팀이 하나의 LLM 게이트웨이를 공유하며 사용량과 비용을 통제해야 하는 조직에 특히 적합한 구조입니다.

3) MCP·에이전트 연동 (참고)

LiteLLM은 최근 MCP(Model Context Protocol) 서버를 게이트웨이에 연결해 여러 LLM에서 동일한 도구(tool)를 사용할 수 있게 하는 기능과, A2A(Agent-to-Agent) 프로토콜을 통해 외부 에이전트를 호출하는 기능도 지원합니다. Cursor 같은 IDE에서도 LiteLLM 게이트웨이를 MCP 서버로 등록해 바로 활용할 수 있습니다.

이런 분들께 추천합니다

  • 여러 LLM 제공업체를 테스트하거나 상황에 따라 전환해서 써야 하는 개발자
  • 특정 제공업체 장애 시에도 서비스가 끊기지 않도록 폴백 구조를 구축하고 싶은 팀
  • 사내에서 여러 프로젝트/팀이 LLM을 사용하는데, 비용과 접근 권한을 한곳에서 관리하고 싶은 ML 플랫폼 조직
  • 오픈소스 모델(Ollama, VLLM 등)과 상용 API(OpenAI, Anthropic 등)를 함께 운영하고 싶은 경우

맺음말

LiteLLM은 “LLM판 OpenAI 호환 어댑터“라고 부를 만한 도구입니다. 하나의 API 형식으로 100개 이상의 제공업체를 다룰 수 있게 해주고, 여기에 비용 추적·로드밸런싱·가드레일 같은 프로덕션 운영 기능까지 더해져 있어, 간단한 개인 프로젝트부터 여러 팀이 공유하는 사내 AI 게이트웨이까지 폭넓게 활용할 수 있습니다. 오픈소스로 공개되어 있으므로 직접 설치해 가볍게 테스트해보는 것을 추천합니다.


참고자료

  • 공식 문서: https://docs.litellm.ai/
  • GitHub 저장소: https://github.com/BerriAI/litellm

댓글

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다