로컬 LLM (Local LLM)
로컬 LLM은 원격 모델 서비스에 추론을 맡기는 대신 자신의 컴퓨터나 서버에서 실행하는 대규모 언어 모델입니다. 모델의 실행 위치와 이를 사용하는 앱·도구의 외부 연결 여부는 따로 확인해야 합니다.
BOAZ · 최종 업데이트 2026-09-13
앱의 위치와 모델의 위치는 다르다
데스크톱 앱을 열었다고 그 안의 모델이 내 컴퓨터에서 실행되는 것은 아닙니다. 앱이 입력을 원격 서버에 보내 응답을 표시할 수 있습니다. 로컬 LLM을 구분할 때는 실제 추론을 처리하는 컴퓨터나 서버를 확인합니다.
내 컴퓨터에서 모델을 실행할 수도 있고, 사내 서버의 모델에 접속할 수도 있습니다. 후자는 조직 관점의 자체 실행이지만 사용자 기기 내부에서 추론하는 구성과는 다릅니다. 온프레미스 AI에서는 이 배치와 운영 책임을 함께 다룹니다.
모델·실행 도구·하네스를 나눠 본다
| 요소 | 역할 | 확인할 질문 |
|---|---|---|
| 모델 | 입력을 처리해 출력을 생성 | 필요한 언어와 작업을 다루는가? |
| 실행 도구 | 모델을 적재하고 추론 요청 처리 | 장비와 모델 형식을 지원하는가? |
| 앱·하네스 | 문맥·도구·실행·검증 연결 | 오류를 발견하고 복구할 수 있는가? |
Ollama 같은 실행 도구도 사용하는 모델에 따라 로컬 실행과 클라우드 연결을 구분해야 합니다. Ollama FAQ는 로컬 실행의 데이터 처리와 클라우드 기능을 끄는 설정을 별도로 설명합니다.
Harness는 모델 주변의 실행 구조입니다. 모델이 한국어 질문에 답하는지와 AI 에이전트가 파일을 수정하고 테스트까지 완료하는지는 다른 질문입니다.
필요한 메모리는 모델 크기만으로 정해지지 않는다
모델 가중치뿐 아니라 문맥 처리와 실행에 필요한 메모리가 있습니다. 문맥이 길어지거나 동시 요청이 늘면 자원 요구도 달라집니다. CPU·GPU와 사용하는 실행 방식도 영향을 줍니다.
양자화는 가중치 등의 수치 표현을 줄이는 방법입니다. 메모리 부담을 낮출 수 있지만 품질과 속도에 미치는 영향은 모델·방식·작업에 따라 검증해야 합니다. 특정 장비에서 실행됐다는 사실만으로 모든 길이의 작업이 원활하다고 일반화하지 않습니다.
로컬 실행과 외부 전송 여부를 따로 확인한다
모델 추론이 로컬이어도 웹 검색, 외부 API, 오류 로그 전송이나 클라우드 대체 호출을 사용할 수 있습니다. 입력에서 결과 저장까지 어떤 서비스가 연결되는지 확인해야 합니다.
인터넷 없이 쓰려면 모델과 필요한 패키지를 먼저 준비하고 외부 의존 경로를 점검합니다. 사내에 서버를 공개할 때는 누가 접속할 수 있고 어떤 자료를 처리할 수 있는지도 정해야 합니다.
토큰 속도보다 작업 완료를 평가한다
가상 문서 분류 업무라면 정해둔 샘플에서 분류가 맞는지, 애매한 자료를 표시하는지, 결과 형식이 일관되는지를 확인할 수 있습니다. 코딩 업무라면 수정 범위, 테스트 결과, 실패 후 복구까지 살펴봅니다.
응답이 빨라도 여러 번 다시 시키거나 사람이 대부분 고치면 전체 시간은 길어집니다. 검증 Loop에 완료 조건과 실패 기록을 연결하고 동일한 입력·환경에서 비교합니다.
BOAZ 실험 기록의 해석 범위
BOAZ의 로컬 모델·코딩 하네스 연구는 2026년 9월 9일 종료 기록으로 정리돼 있습니다. 미완 실험을 포함하므로 특정 모델이 상용 모델을 대체했다거나 경제성이 입증됐다는 결론으로 사용하지 않습니다.
실무에 적용할 때도 제한된 작업에서 먼저 평가하고 범위를 넓힙니다. 사용할 모델의 조건과 운영 부담을 확인하면서, 성능 비교에는 작업·모델 버전·문맥·도구·검증 조건을 함께 남겨야 결과를 해석할 수 있습니다.
자주 묻는 질문
AI 앱을 컴퓨터에 설치하면 로컬 LLM인가요?+
설치된 앱이 원격 모델 서버로 요청을 보낼 수도 있습니다. 앱의 설치 위치보다 실제 모델 추론이 어디서 실행되는지를 확인해야 합니다.
로컬 LLM은 인터넷 없이 쓸 수 있나요?+
모델과 실행에 필요한 파일을 준비하고 외부 서비스에 의존하지 않는 구성이라면 가능합니다. 모델 다운로드, 업데이트, 웹 검색과 도구 호출은 별도의 연결을 요구할 수 있습니다.
로컬 LLM과 온프레미스 AI는 어떻게 다른가요?+
로컬 LLM은 모델의 실행 위치에 초점을 둡니다. 온프레미스 AI는 조직의 자체 인프라에서 데이터·모델·도구와 운영 책임을 함께 다루는 배치 방식입니다.
모델이 실행되면 코딩 에이전트도 잘 작동하나요?+
채팅 응답과 여러 단계의 도구 사용은 평가 대상이 다릅니다. 도구 호출 형식, 오류 복구, 파일 변경과 검증을 연결하는 하네스까지 실제 작업으로 확인해야 합니다.
작은 모델이면 항상 더 빠르고 저렴한가요?+
모델 크기뿐 아니라 하드웨어, 문맥 길이, 동시 요청, 재시도와 사람 수정 시간이 영향을 줍니다. 토큰 생성 속도만으로 업무 전체의 시간이나 비용을 결론 내리기 어렵습니다.
LINE 엔지니어 출신이, 실효성 있는 AX 프로그램을 진행합니다. 대기업 임원 및 실무자 대상 AX 프로그램 진행 경험을 바탕으로, 기업의 실제 업무를 분석하고 작동하는 AI 활용 결과물까지 함께 만듭니다.
관련 용어
온프레미스 AI (On-premises AI)
온프레미스 AI는 조직의 자체 시설과 관리 인프라에서 AI 시스템을 운영하는 배치 방식입니다. 모델 실행 위치뿐 아니라 데이터 저장, 검색, 도구 연결과 운영 책임까지 함께 설계해야 합니다.
AI Agent (AI 에이전트)
AI 에이전트는 모델이 목표와 현재 상태를 바탕으로 필요한 도구와 다음 행동을 선택하며 작업을 이어가는 시스템입니다. 계획·실행·확인을 반복할 수 있지만, 자율적으로 동작한다는 사실이 작업의 성공이나 정확성을 보장하지는 않습니다.
Context (컨텍스트) 관리
Context는 모델이 이번 응답이나 행동을 만들 때 입력으로 받는 정보입니다. Context 관리는 지시·대화·자료·도구 결과 중 필요한 내용을 선택하고, 작업이 길어져도 중요한 결정과 근거를 이어주는 일입니다.
Harness (하네스)
AI 하네스(Harness)는 모델이 작업을 수행하도록 도구, 실행 상태, Context, 권한, 검증과 종료 조건을 연결하는 주변 시스템입니다. 모델의 응답을 실제 업무 실행으로 이어주며, 어떤 조건에서 계속하거나 멈출지를 관리합니다.
Loop (검증 Loop·개선 Loop)
검증 Loop는 결과물을 정해진 기준과 대조하고 필요한 부분을 수정해 다시 확인하는 반복입니다. 개선 Loop는 실행에서 얻은 피드백으로 지식·Skill·도구·기준을 고칩니다. 두 과정 모두 통과뿐 아니라 중단·보류 조건이 필요합니다.
우리 조직에 맞는 AX가 궁금하다면
조직 상황과 대상(임원·실무자·전사)을 알려주시면, 어떤 프로그램이 맞는지 — 혹은 아직 워크숍이 필요 없는 단계인지 — 솔직하게 답해드립니다.