[카테고리:] AI

  • 생성형 AI 인프라 구축 전략: 온프레미스 GPU 서버, 클라우드 GPU 및 Managed API의 총소유비용(TCO) 및 경제성 비교 분석

    생성형 AI 인프라 구축 전략: 온프레미스 GPU 서버, 클라우드 GPU 및 Managed API의 총소유비용(TCO) 및 경제성 비교 분석

    AI 인프라 의사결정의 핵심 패러다임 기업이 생성형 인공지능(Generative AI) 및 대규모 언어 모델(LLM)을 도입할 때 직면하는 가장 중대한 재무적·기술적 의사결정은 온프레미스(On-Premise) GPU 인프라를 직접 구축할 것인지, 클라우드 GPU 인프라(IaaS/Neocloud)를 임대할 것인지, 아니면 관리형 AI 플랫폼 및 API(SaaS/PaaS)를 활용할 것인지 선택하는 문제입니다. 과거 정보기술(IT) 인프라 도입 패러다임이 단순히 자본지출(CapEx)과 운영지출(OpEx)의 재무적 전환에 집중되었다면, 초고성능 GPU 인프라…

  • RAG 시스템, 어떻게 평가해야 할까? — RAGAS로 정량적 품질 검증

    RAG 시스템, 어떻게 평가해야 할까? — RAGAS로 정량적 품질 검증

    들어가며 LLM의 할루시네이션을 극복하기 위한 대안으로 RAG(Retrieval-Augmented Generation)가 나왔지만, RAG에서도 어떻게 설정하는가에 따라 품질이 극명하게 갈립니다. 결국 RAG(Retrieval-Augmented Generation)를 구축해서 벡터 DB 검색과 LLM 답변 생성이 정상적으로 동작하는 걸 확인했다고 해서 끝이 아니란 이야기 입니다. “답이 그럴듯하게 나온다”와 “답이 실제로 정확하고 근거가 있다”는 전혀 다른 이야기이기 때문입니다. RAG는 두 단계로 구성됩니다. 이 두 단계가 유기적으로…

  • 생성형 AI 이후의 패러다임 전환: 기업 AI 에이전트 개발 투자 타당성 및 시장 전망

    생성형 AI 이후의 패러다임 전환: 기업 AI 에이전트 개발 투자 타당성 및 시장 전망

    대화형 코파일럿에서 자율형 에이전트 모델로의 구조적 격변 생성형 인공지능 기술의 발전 축이 대형언어모델(LLM) 기반의 단발성 프롬프트-응답 체계에서 자율적 목표 달성을 지향하는 에이전트형 AI(Agentic AI)로 급격히 전환되고 있습니다. 기존의 기술이 인간 사용자의 명시적 지시에 따라 텍스트를 생성하거나 데이터를 요약하는 수동적 코파일럿(Copilot)에 머물렀다면, AI 에이전트는 주어진 상위 목표를 스스로 해석하여 세부 작업으로 분해하고, 필요한 외부 시스템 도구…

  • LiteLLM: 100개 이상의 LLM을 하나의 API로 다루는 오픈소스 AI 게이트웨이

    LiteLLM: 100개 이상의 LLM을 하나의 API로 다루는 오픈소스 AI 게이트웨이

    들어가며 요즘 서비스에 AI 기능을 넣으려면 흔히 OpenAI의 GPT, Anthropic의 Claude, Google의 Gemini, AWS Bedrock 등 여러 LLM(대규모 언어 모델) 제공업체 중 하나 이상을 선택해서 연동하게 됩니다. 문제는 이들 각각이 서로 다른 SDK, 인증 방식, 요청/응답 형식을 사용한다는 점입니다. 모델을 바꾸거나 여러 모델을 동시에 운영하려면 그만큼 코드를 다시 짜야 하죠. LiteLLM은 바로 이 문제를 해결하기…

  • AI 에이전트를 위한 프론트엔드 도구, WebMCP

    AI 에이전트를 위한 프론트엔드 도구, WebMCP

    화면 스크래핑은 끝났다 — 웹과 AI 에이전트가 대화하는 새로운 계약, WebMCP 브라우저 안에서 움직이는 AI 에이전트가 빠르게 늘고 있습니다. 사용자가 “이 항공권 예약해줘”, “이 티셔츠 장바구니에 담아줘”라고 말하면, 에이전트는 화면을 스크린샷으로 찍거나 DOM 트리를 분석해서 어떤 버튼을 누르고 어떤 칸에 무엇을 입력해야 하는지 스스로 “추측”해왔습니다. 사람이 마우스를 움직이고 키보드를 두드리는 행동을 그대로 흉내 내는 방식입니다.…

  • MCP, 상태(state)를 버리다 — 2026-07-28 스펙 변경 예고

    MCP, 상태(state)를 버리다 — 2026-07-28 스펙 변경 예고

    2026년 7월 28일, Model Context Protocol(MCP) 공식 블로그에 차세대 스펙 방향을 알리는 글이 올라왔습니다. 새 스펙 버전은 2026-07-28이며, 이번 릴리스 후보는 MCP가 출시된 이후 가장 큰 폭의 개정입니다. 핵심은 하나로 요약됩니다. “MCP를 무상태(stateless) 프로토콜로 만든다.“ 이 글에서는 MCP 블로그가 밝힌 정책 변화들을 중심으로 정리합니다. 1. 프로토콜 자체, 무상태로 변경 기존 2025-11-25 버전에서는 도구를 호출하려면 먼저…

  • AI 에이전트를 제대로 활용하기: AI Orchestration으로 워크플로우 설계

    AI 에이전트를 제대로 활용하기: AI Orchestration으로 워크플로우 설계

    혼자서도 코드를 짜고, 버그를 찾고, 리서치 보고서를 쓰는 AI 에이전트가 이제는 매우 일반적인 흐름이 되었습니다. 문제는 그 다음입니다. “에이전트 하나가 잘한다면, 여러 개를 붙이면 몇 배는 더 잘하지 않을까?”라는 자연스러운 기대에서 AI Orchestration이라는 영역이 태어났습니다. 오늘 포스트에서는 AI Orchestration이 무엇인지, 어떤 기능이 핵심인지, 어떤 도구와 상용 플랫폼이 있는지, 그리고 앞으로 전망을 조심스럽게 예측해봅니다. 1. AI…

  • AI 에이전트, 기업 사용에서 두 배로 늘었지만 여전히 ‘인간의 감독’ 아래

    AI 에이전트, 기업 사용에서 두 배로 늘었지만 여전히 ‘인간의 감독’ 아래

    2026년 5월, Stack Overflow의 최신 펄스 서베이(Pulse Survey) 결과가 공개되었습니다. 이번 조사에는 약 1,100명의 개발자 및 직장인이 참여했으며, AI 에이전트의 업무 활용 현황에 대한 흥미로운 인사이트를 담고 있습니다. 핵심 메시지는 단 하나입니다. “AI 에이전트 사용은 폭발적으로 늘었지만, 완전한 자율 운영은 아직 이다”라는 것입니다. AI 에이전트 사용률, 1년 만에 두 배 가까이 급증 가장 눈에 띄는…

  • Gemma 4 12B 공개 — 인코더 없이 노트북에서 구동되는 통합 멀티모달 AI

    Gemma 4 12B 공개 — 인코더 없이 노트북에서 구동되는 통합 멀티모달 AI

    들어가며 2026년 4월 3일, Google DeepMind는 Gemma 4 라인업을 공개했습니다. 모바일 엣지용 E2B·E4B부터 대규모 서버급 31B Dense와 26B MoE 모델까지, 다양한 환경을 커버하는 포트폴리오였습니다. 그리고 그로부터 약 두 달 뒤인 2026년 6월 3일, 그 라인업의 빈칸을 채우는 중간 라인업 Gemma 4 12B가 등장했습니다. 이 모델은 단순히 “중간 크기”를 채우는 데 그치지 않습니다. 인코더 없는(Encoder-free) 통합…