가드레일 (Guardrail)
가드레일은 AI 시스템의 입력·출력·실행이 정해진 범위를 따르도록 안내·탐지·제한하는 장치입니다. 지침, 필터, 검증, 접근 권한, 사람 확인 등으로 구성할 수 있으며 각 방식의 강제력과 한계는 다릅니다.
BOAZ · 최종 업데이트 2026-09-13
가드레일(Guardrail)은 AI 시스템이 정해진 범위를 따르도록 안내·탐지·제한하는 장치입니다. 입력 지침, 출력 필터, 검증 코드, 도구 권한, 사람 확인처럼 여러 형태로 구현할 수 있습니다.
업무를 위임할 때는 무엇을 막을지와 함께 어디까지 별도 확인 없이 진행해도 되는지를 정합니다. 이 범위가 명확하면 사람이 판단할 지점과 AI가 이어서 수행할 지점을 나눌 수 있습니다.
지침과 실행 제한은 강제력이 다르다
| 방식 | 하는 일 | 확인할 한계 |
|---|---|---|
| 지침·프롬프트 | 따를 기준을 모델에 전달 | 누락·오해·지시 불이행 가능 |
| 필터·검증기 | 입력이나 결과가 조건에 맞는지 검사 | 검사하지 않은 오류, 오탐·누락 가능 |
| 권한·실행 코드 | 허용하지 않은 작업이나 자원 접근을 제한 | 적용되지 않은 경로와 우회 권한 확인 필요 |
| 사람 확인 | 맥락과 영향을 검토해 결정 | 검토 정보와 시간, 실제 판단이 필요 |
모델에게 ‘검증을 잊지 마’라고 말하는 것과, 검증을 통과해야 배포 코드가 실행되는 것은 다릅니다. 검사에 LLM을 사용한다면 그 검사도 오류를 낼 수 있으므로 중요한 조건은 독립적으로 확인합니다.
BOAZ가 업무 위임에서 살펴보는 세 영역
이 구분은 실무 설계를 위한 틀이며 모든 가드레일의 공식 분류는 아닙니다.
- 실행 범위: 사용할 파일·계정·도구와 허용된 동작을 정합니다. 읽기, 초안 수정, 외부 반영은 영향이 다릅니다.
- 결과 검증: 어떤 조건을 만족해야 다음 단계로 갈지 정합니다. 검증 Loop에 실패 피드백과 중단 조건을 연결합니다.
- 책임과 기록: 누가 결정하며 어떤 근거와 변경 이력을 남길지 정합니다. AI 거버넌스와 연결되는 부분입니다.
예를 들어 비용 정리 초안을 만드는 일에서는 허용된 자료를 읽고 합계를 대조하게 할 수 있습니다. 그 결과를 회계 시스템에 반영하는 일은 별도의 권한과 검증 조건이 필요합니다. 이미 승인한 범위 안의 반복 작업은 매번 같은 질문을 되풀이하지 않도록 설계합니다.
프롬프트 인젝션은 자료 속 지시를 구분하는 문제다
프롬프트 인젝션은 외부 문서나 도구 결과에 섞인 지시가 AI를 사용자의 의도와 다른 행동으로 유도하는 공격입니다. 웹 자료에 무관한 작업을 실행하라는 문장이 있어도 그것은 사용자가 승인한 새 업무가 아닙니다.
Anthropic의 실행 환경 보호 설명은 신뢰하지 않는 입력과 도구·하위 에이전트 결과를 다룰 때의 경계를 설명합니다. 읽어온 내용이 요약되거나 다른 에이전트를 거쳤다는 이유만으로 높은 신뢰의 지시가 되지는 않습니다.
출처와 지시의 권한을 구분하고, 도구에는 필요한 접근만 허용하며, 외부 변경에는 실제 요청 범위를 검사합니다. 탐지 문구나 필터 하나로 모든 인젝션이 막힌다고 가정하지 않습니다. MCP로 연결된 도구도 같은 구분이 필요합니다.
승인 요청은 판단할 내용을 담아야 한다
확인 창이 많이 뜬다는 이유만으로 통제가 잘된다고 볼 수 없습니다. 무엇이 달라지는지 모른 채 승인하면 중요한 변경을 놓칠 수 있습니다.
추가 판단이 필요한 시점에는 변경 전후, 영향을 받는 대상, 확인한 내용, 되돌릴 방법을 함께 보여줍니다. 기존 허용 범위와 새 결정을 구분하면 반복 확인을 줄이면서 필요한 판단에 집중할 수 있습니다. 휴먼 인 더 루프는 이런 검토가 실제 작업 흐름에 들어가는 구조입니다.
위키 운영에서 확인한 경계
BOAZ 위키의 검토 도구는 승인한 변경과 반영할 버전을 대조합니다. 그러나 파일을 직접 수정할 수 있는 환경이라면 그 도구 하나가 모든 우회 경로를 막는 것은 아닙니다.
문서 규칙, 검토 도구, 파일 쓰기 권한은 서로 다른 층입니다. 어떤 경로에서 규칙이 적용되는지 확인해야 실제 통제 범위를 설명할 수 있습니다. 이 차이를 이해하는 것이 Harness를 설계할 때도 중요합니다.
자주 묻는 질문
가드레일과 AI 거버넌스는 무엇이 다른가요?+
거버넌스는 허용 범위·책임·의사결정 절차를 정하고, 가드레일은 이를 입력·출력·실행 경로에 반영하는 장치입니다. 지침으로 안내할지 권한과 코드로 제한할지에 따라 강제력이 다릅니다.
AI에게 하지 말라고 지시하는 것도 가드레일인가요?+
행동을 안내하는 가드레일에 포함될 수 있습니다. 다만 모델의 지시 준수에 의존합니다. 실행을 제한해야 하는 조건은 도구 권한과 코드 검사 등으로 보완해야 합니다.
승인 요청을 많이 띄우면 더 안전한가요?+
횟수만으로 판단할 수 없습니다. 습관적인 승인은 검토 효과를 떨어뜨릴 수 있습니다. 이미 허용한 범위와 추가 판단이 필요한 범위를 구분하고, 확인할 때는 변경 내용·영향·복구 방법을 보여주는 편이 좋습니다.
어떤 가드레일부터 설계해야 하나요?+
사용할 데이터, 실행할 수 있는 작업, 결과 통과 조건, 책임자를 먼저 정합니다. 모든 작업에 같은 통제를 넣기보다 오류의 영향과 복구 가능성에 맞춰 조합합니다.
프롬프트 인젝션은 일반적인 잘못된 답과 무엇이 다른가요?+
외부 자료나 도구 결과에 포함된 지시로 AI의 행동을 바꾸려는 공격이라는 점이 다릅니다. 자료의 내용을 해석하는 것과 그 안의 지시를 실행할 권한을 받는 것을 구분해야 합니다.
LINE 엔지니어 출신이, 실효성 있는 AX 프로그램을 진행합니다. 대기업 임원 및 실무자 대상 AX 프로그램 진행 경험을 바탕으로, 기업의 실제 업무를 분석하고 작동하는 AI 활용 결과물까지 함께 만듭니다.
관련 용어
데이터베이스 (Database)
데이터베이스는 데이터를 구조에 맞게 저장하고 조회·변경할 수 있도록 관리하는 체계입니다. 업무 앱에서는 화면을 닫은 뒤에도 기록을 유지하고 여러 사용자가 권한에 따라 같은 데이터를 다루는 기반이 됩니다.
휴먼 인 더 루프 (Human-in-the-Loop)
휴먼 인 더 루프(HITL)는 AI를 학습·평가하거나 업무에 사용하는 과정에 사람의 피드백과 판단을 넣는 방식입니다. 업무에서는 무엇을 검토하고 어떤 근거로 수정·채택·보류할지 정해야 개입이 실제 품질 개선으로 이어집니다.
AI 거버넌스
AI 거버넌스는 조직이 AI를 쓸 때 무엇을 성과로 볼지, 어디까지 허용할지, 누가 승인할지를 정하는 기준과 절차입니다. 규제 준수만이 아니라 AI 결과물을 신뢰 가능한 상태로 만드는 뼈대이며, 이것이 없으면 성공한 PoC도 전사 표준으로 이어지지 못합니다.
API (Application Programming Interface)
API는 프로그램이 다른 소프트웨어의 기능이나 데이터에 접근할 때 사용하는 인터페이스입니다. 웹 API에서는 정해진 주소와 형식으로 요청을 보내고 응답을 받아 조회·저장 등의 작업을 수행합니다.
Attention (어텐션)
Attention은 입력의 각 표현을 얼마나 참고할지 가중치를 계산하고, 그 가중치로 정보를 조합하는 신경망의 연산입니다. LLM의 문맥 활용을 이해하는 핵심 개념이지만, 개별 지시 누락의 원인을 Attention만으로 단정할 수는 없습니다.
Claude Code
Claude Code는 Anthropic의 AI 코딩 에이전트로, 프로젝트의 파일을 읽고 수정하며 명령과 도구를 사용해 작업을 수행합니다. 터미널뿐 아니라 IDE·데스크톱·웹 등 지원 환경에서 사용할 수 있으며, 실제 파일 접근 범위는 실행 환경과 권한에 따라 달라집니다.
Harness (하네스)
AI 하네스(Harness)는 모델이 작업을 수행하도록 도구, 실행 상태, Context, 권한, 검증과 종료 조건을 연결하는 주변 시스템입니다. 모델의 응답을 실제 업무 실행으로 이어주며, 어떤 조건에서 계속하거나 멈출지를 관리합니다.
Loop (검증 Loop·개선 Loop)
검증 Loop는 결과물을 정해진 기준과 대조하고 필요한 부분을 수정해 다시 확인하는 반복입니다. 개선 Loop는 실행에서 얻은 피드백으로 지식·Skill·도구·기준을 고칩니다. 두 과정 모두 통과뿐 아니라 중단·보류 조건이 필요합니다.
MCP (Model Context Protocol)
MCP(Model Context Protocol)는 AI 모델을 외부 도구·데이터·시스템에 표준화된 방식으로 연결하기 위해 앤트로픽이 제안한 개방형 프로토콜입니다. 매번 자료를 붙여 넣거나 개별 연동을 새로 짜는 대신, 한 번 정해진 방식으로 AI와 사내 시스템을 잇는다는 점이 핵심입니다.
우리 조직에 맞는 AX가 궁금하다면
조직 상황과 대상(임원·실무자·전사)을 알려주시면, 어떤 프로그램이 맞는지 — 혹은 아직 워크숍이 필요 없는 단계인지 — 솔직하게 답해드립니다.