Skip to main content
J.Insights

설계 Agent Design

LLM 하나로는 부족하다

김정기 · JK

J.Insight Founder

2026년 8월 8일7분 읽기
악기를 혼자 다 연주하는 1인 밴드 로봇과, 역할을 나눠 맡아 하나의 신호로 합치는 기계들의 대비
Share

Executive Summary

LLM(Large Language Model, 대규모 언어 모델)은 강력하지만, 기업 현장에서 단독으로 쓰기에는 한계가 뚜렷하다. 환각, 비용, 감사 불가능성이 대표적이다. Composite AI는 LLM을 포함한 여러 AI 기법을 결합해 이 한계를 넘는 접근법이다. Gartner는 이를 2024년 AI 핵심 트렌드로 선정했다.

Executive Summary

LLM(Large Language Model, 대규모 언어 모델)은 강력하지만, 기업 현장에서 단독으로 쓰기에는 한계가 뚜렷하다. 환각, 비용, 감사 불가능성이 대표적이다. Composite AI는 LLM을 포함한 여러 AI 기법을 결합해 이 한계를 넘는 접근법이다. Gartner는 이를 2024년 AI 핵심 트렌드로 선정했다.

핵심 수치

  • 개방형 질문 환각률 40~80%, 2026년 프론티어 모델도 4.6~6.1%: SQ Magazine, 2026
  • 기업 LLM API 지출, 6개월 만에 35억 → 84억 달러: TrueFoundry, 2025
  • 모델 라우팅으로 프론티어 성능 95% 유지하며 비용 75~85%↓
  • LinkedIn GraphRAG, 티켓 해결시간 40시간 → 15시간
  • McKinsey 내부 플랫폼 Lilli, 컨설턴트 72% 사용·월 50만 건 쿼리

설계 배경: LLM 단독 배치의 문제

LLM의 성능은 놀랍다. 그러나 기업 환경에서 LLM만으로 시스템을 구축하면 예상치 못한 문제가 발생한다.

첫째, 환각(hallucination)이다. LLM은 사실과 다른 내용을 그럴듯하게 만들어낸다. 개방형 질문에서 환각 발생률은 4080%에 달한다[1]. 법률 리서치에서 GPT-4의 환각률은 58%였다. 2026년 프론티어 모델에서도 환각률은 4.66.1%로, 줄어들고 있지만 0이 아니다[1]. 여신 심사 보고서에 환각이 섞이면, 잘못된 대출 결정으로 이어진다.

둘째, 결정론적 처리가 불가능하다. 같은 질문에 같은 답을 보장하지 못한다. 규제 산업에서 "왜 이런 결정을 내렸는가"를 설명해야 할 때, LLM의 확률적 출력은 감사 요건을 충족하지 못한다.

셋째, 비용이 빠르게 늘어난다. 기업의 LLM API 지출은 2024년 말 35억 달러에서 2025년 중반 84억 달러로 6개월 만에 2배 이상 증가했다[2]. 프로덕션 LLM 앱의 토큰 예산 중 40~60%가 낭비되고 있다는 분석도 있다.

2026년 5월 발표된 한 논문은 이 문제를 정면으로 다뤘다. "LLM을 기업의 런타임으로 쓰지 마라"는 제목이다[3]. 기업 업무는 결정론적이고, 구조화되어 있고, 반복적이며, 감사 가능해야 한다. LLM은 이 네 가지 요건에 모두 약하다. LLM은 인터페이스로 쓰되, 지식과 연산은 전용 엔진으로 분리해야 한다는 주장이다.

Composite AI란 무엇인가

Composite AI는 서로 다른 AI 기법을 결합하여 단일 기법의 한계를 넘는 접근법이다. Gartner는 "학습 효율을 높이고 지식 표현의 폭을 넓혀, 더 넓은 범위의 비즈니스 문제를 해결하는 플랫폼"이라고 정의했다[4].

핵심은 LLM을 버리는 것이 아니라, LLM이 잘하는 일만 맡기는 것이다. 나머지는 각 분야의 전문 엔진이 처리한다.

구성 요소: 6가지 엔진

Composite AI의 주요 구성 요소는 여섯 가지다.

첫째, 지식그래프(Knowledge Graph)다. LLM의 환각을 잡는 가장 검증된 방법이다. 사실 관계를 점과 선으로 구조화해두면, LLM이 답변을 생성할 때 이 구조를 참조하게 만들 수 있다. LinkedIn은 지식그래프와 LLM을 결합한 GraphRAG로 티켓 해결 시간을 40시간에서 15시간으로 줄였다[5]. 지식그래프 구축의 ROI(Return on Investment, 투자 수익률)는 300~320%로 보고되고 있다.

둘째, 규칙 엔진(Rules Engine)이다. "대출 한도는 연소득의 3배를 넘을 수 없다"는 규칙은 LLM이 해석할 필요가 없다. 규칙 엔진이 결정론적으로 처리하면 된다. 결과가 항상 같고, 감사가 가능하다. 뉴로심볼릭 AI(Neuro-Symbolic AI, 신경망과 기호논리를 결합한 AI) 분야에서 이런 접근이 주목받고 있다[6]. 대표적 패턴이 Text-to-SQL이다. LLM이 사용자의 자연어 질문을 해석하고, 결정론적 SQL 엔진이 정확한 쿼리를 실행한다. LLM의 유연성과 SQL의 정확성을 결합한 구조다. Amazon의 Vulcan 로봇도 같은 원리다. 딥러닝이 물체를 인식하고, 심볼릭 플래너가 물리적 제약을 계산해서 로봇 팔을 움직인다[6].

셋째, 수리 최적화 엔진(Optimization Solver)이다. "10개 공장에서 50개 매장으로 물류를 보낼 때 비용을 최소화하라"는 문제는 LLM이 풀 수 없다. 수학적 최적화 알고리즘이 필요하다. IBM 연구팀은 2025년 AAAI 학회에서 LLM과 OR(Operations Research, 경영과학) 최적화를 통합하는 프레임워크를 발표했다[7]. OptiMUS라는 LLM 기반 최적화 에이전트는 MILP(Mixed-Integer Linear Programming, 혼합 정수 선형 계획법) 문제에서 80% 이상의 정답률을 보였다. 기본 LLM 프롬프팅만으로는 절반 수준이었다[7].

넷째, 컴퓨터 비전(Computer Vision)이다. 공장의 불량품 검사, 문서의 OCR(Optical Character Recognition, 광학 문자 인식) 처리는 LLM이 아니라 전문 비전 모델이 담당한다. McKinsey에 따르면 제조사의 76%가 18개월 내에 AI 비주얼 검사를 도입할 계획이다[8]. 최첨단 시스템은 0.1mm 표면 결함을 99.8% 정확도로 탐지한다. 2025년에는 비전 모델과 언어 모델을 결합한 하이브리드 비전-언어 모델이 등장했다[10]. 불량을 탐지하는 것은 비전 모델이 하고, 불량의 원인을 자연어로 설명하는 것은 언어 모델이 하는 구조다.

다섯째, 프로세스 마이닝(Process Mining)이다. 기업의 실제 업무 흐름을 데이터로 분석하는 기술이다. 어디서 병목이 생기는지, 어떤 단계가 불필요한지를 발견한다. LLM은 프로세스를 분석하지 못한다. 프로세스 마이닝 엔진이 분석하고, LLM이 결과를 자연어로 설명하는 역할 분담이 효과적이다.

여섯째, 시뮬레이션 엔진(Simulation Engine)이다. "이 공급업체가 납품을 못 하면 어떤 일이 벌어지는가"를 예측하려면 시뮬레이션이 필요하다. LLM은 시나리오를 서술할 수 있지만, 정량적 시뮬레이션은 전용 엔진의 영역이다.

설계 판단과 트레이드오프

Composite AI를 설계할 때 가장 중요한 판단은 "무엇을 LLM에 맡기고, 무엇을 전용 엔진에 맡기는가"다.

판단 기준은 세 가지다.

첫째, 결정론성이다. 같은 입력에 항상 같은 출력이 나와야 하는가. 그렇다면 규칙 엔진이나 최적화 엔진이 적합하다. LLM은 적합하지 않다.

둘째, 감사 가능성이다. 왜 이런 결정을 내렸는지 설명할 수 있어야 하는가. 규제 산업(금융, 의료, 공공)에서는 필수다. 지식그래프와 규칙 엔진은 결정 과정을 추적할 수 있다. LLM은 "왜"를 설명하기 어렵다.

셋째, 비용이다. 모든 처리를 LLM API로 보내면 비용이 기하급수적으로 늘어난다. 프론티어 모델에 1426%의 쿼리만 보내고 나머지를 소형 모델이나 전용 엔진으로 라우팅하면, 프론티어 성능의 95%를 유지하면서 비용을 7585% 줄일 수 있다[2].

최신 적용 사례

Composite AI는 이미 현장에서 작동하고 있다.

Siemens는 2025년 Inspekto를 인수했다[8]. Inspekto의 비전 AI는 20~30장의 이미지만으로 학습이 가능하다. Siemens의 산업 자동화 플랫폼에 비전 AI를 통합하고, 지식그래프로 불량 패턴을 축적하며, 규칙 엔진으로 품질 기준을 자동 적용하는 Composite AI 구조를 구축하고 있다.

IBM은 2025년 AAAI 학회에서 LLM과 수리 최적화를 통합하는 프레임워크를 발표했다[7]. LLM이 사용자의 자연어 질문을 해석하고, OR 솔버가 수학적 최적해를 계산하고, LLM이 결과를 자연어로 설명하는 구조다. "10개 공장에서 50개 매장으로 물류를 최적화하라"는 질문에 자연어로 답하면서도, 계산의 정확성은 수학적으로 보장된다.

Goldman Sachs는 2026년 Anthropic과 공동으로 거래 대사, 회계, 컴플라이언스 분야에 Composite AI 에이전트를 개발하고 있다[9]. LLM이 문서를 해석하고, 규칙 엔진이 규제 적합성을 판단하고, 지식그래프가 거래 관계를 추적하는 구조다. 12,000명의 엔지니어에게 에이전트를 배정하면서 "Agent as a Service" 모델을 도입했다.

McKinsey도 내부에서 Composite AI를 실천하고 있다. 자체 플랫폼 Lilli는 45,000명의 컨설턴트 중 72%가 사용하며, 월 50만 건의 쿼리를 처리한다[11]. LLM이 질문을 해석하고, McKinsey의 내부 지식 베이스(보고서, 케이스, 방법론)를 검색하고, 구조화된 답변을 생성하는 구조다.

Composite AI는 만능이 아니다. 구성 요소가 늘어날수록 시스템의 복잡도가 올라간다. 통합, 유지보수, 모니터링의 부담이 커진다. "필요한 만큼만 결합한다"는 원칙이 중요하다.

JK's Take

LLM은 범용 도구다. 범용 도구가 전문 도구를 이기는 영역은 제한적이다. 망치로 나사를 박을 수는 있지만, 드라이버가 더 낫다.

기업 AI의 본질은 여러 전문 도구를 하나의 시스템으로 엮는 것이다. LLM은 그 시스템의 인터페이스다. 사용자의 자연어를 이해하고, 결과를 자연어로 전달하는 역할이다. 판단은 지식그래프가, 계산은 최적화 엔진이, 검사는 비전 모델이, 규칙 적용은 규칙 엔진이 한다.

이것이 Composite AI의 설계 철학이다. LLM 하나로 모든 것을 해결하려는 유혹을 이겨야 한다. 잘하는 것만 맡기는 설계가 결국 더 강하다.

What to Watch

— Gartner가 2024년 공급망 기술 트렌드에서 Composite AI를 최고 임팩트 기술로 선정했다. 2025~2026년에 다른 산업으로 확산되는지 주목하라.

— 뉴로심볼릭 AI 스타트업 AUI가 7.5억 달러 밸류에이션으로 펀딩을 받았다[6]. LLM과 심볼릭 추론의 결합이 상용화 단계에 진입하고 있다.

— LLM 비용 최적화의 핵심은 모델 라우팅이다. 어떤 쿼리를 프론티어 모델에 보내고, 어떤 쿼리를 소형 모델에 보내느냐가 비용과 품질을 동시에 결정한다.

References

[1] SQ Magazine, "LLM Hallucination Statistics 2026", 2026. https://sqmagazine.co.uk/llm-hallucination-statistics/ — 환각(hallucination)은 LLM이 사실과 다른 내용을 그럴듯하게 생성하는 현상이다.

[2] RWS / TrueFoundry, "Scaling Enterprise AI: LLM Cost Optimization", 2025. https://www.truefoundry.com/blog/llm-cost-optimization — 모델 라우팅(model routing)은 쿼리의 복잡도에 따라 적합한 모델로 분배하는 기법이다.

[3] arXiv:2605.09365, "Position: Avoid Overstretching LLMs for every Enterprise Task", 2026. https://arxiv.org/html/2605.09365 — 기업 업무의 결정론적, 구조화, 반복적, 감사 가능 요건에 LLM 단독 배치가 부적합하다는 학술 논문이다.

[4] Gartner, "Composite AI Definition", 2024. https://www.gartner.com/en/information-technology/glossary/composite-ai — Composite AI는 서로 다른 AI 기법을 결합하여 단일 기법의 한계를 넘는 접근법이다.

[5] Medium / Atlan, "From LLMs to Knowledge Graphs: Production-Ready Graph Systems", 2025. https://atlan.com/know/combining-knowledge-graphs-llms/ — GraphRAG는 지식그래프와 RAG(Retrieval-Augmented Generation, 검색 증강 생성)를 결합한 기법이다.

[6] VentureBeat, "Neuro-symbolic AI startup AUI at $750M valuation", 2025. https://venturebeat.com/ai/the-beginning-of-the-end-of-the-transformer-era-neuro-symbolic-ai-startup — 뉴로심볼릭 AI(Neuro-Symbolic AI)는 신경망의 학습 능력과 기호논리의 추론 능력을 결합하는 접근법이다.

[7] IBM Research, "Enhancing Decision Making through LLM and Operations Research Optimization", AAAI 2025. https://research.ibm.com/publications/enhancing-decision-making-through-the-integration-of-large-language-models-and-operations-research-optimization-bridge-talk — OR(Operations Research, 경영과학)은 수학적 모델로 최적의 의사결정을 찾는 학문이다.

[8] VoxelFiftyOne / UnitX Labs, "Visual AI in Manufacturing: 2025 Landscape", 2025. https://voxel51.com/blog/visual-ai-in-manufacturing-2025-landscape — Siemens는 2025년 Inspekto를 인수하여 20~30장 이미지로 학습 가능한 비전 AI를 산업 자동화에 통합했다.

[9] AI Agent Corps, "AI Agents in Banking: JPMorgan, Goldman, BofA", 2026. https://agentcorps.co/blog/ai-agents-banking-jpmorgan-goldman-bofa-autonomous-finance-2026 — Goldman Sachs는 Anthropic과 공동으로 Composite AI 에이전트를 개발하고 있다.

[10] arXiv:2605.26533, "Hybrid Vision-Language Models for Industrial Inspection", 2025. https://arxiv.org/pdf/2605.26533 — 하이브리드 비전-언어 모델은 비전 모델의 탐지 능력과 언어 모델의 설명 능력을 결합한 구조다.

[11] Consulting Huber, "Big Consulting AI Frameworks Compared", 2026. https://consulting-huber.com/ai-consulting-frameworks-compared.html — McKinsey Lilli는 45,000명 중 72%가 활용하는 내부 Composite AI 플랫폼이다.

Share

AI 전환 프로젝트를 논의합니다

과제 진단부터 Agent 설계·구축까지, 전문가와 함께합니다.

Contact Us