Published on

기업 AX 인프라 구축: 경력직 기술 면접 단골 질문 8선 모범 답변 정리

최근 기업의 채용 전형에서 "AX(AI 전환) 인프라 구축 경험이 있는지" 확인하는 질문의 빈도가 크게 높아지고 있습니다. 경력직 면접에서는 단순히 LLM API를 호출하는 방식을 넘어, 조직 전반에 AI를 온전히 스며들게 하는 플랫폼 설계, 비용 제어, 거버넌스, 레거시 이식 능력을 검증합니다.

이 글에서는 최근 경력직 개발자 기술 면접에서 단골로 출제되는 AX 관련 질문 8선을 선별하고, 면접관이 듣고 싶어 하는 모범 답변 스케치를 함께 정리합니다. 기초적인 AI/LLM 개념 질문은 AI/LLM 기술 면접 단골 질문 유형 정리 글을 먼저 참고하시길 권합니다.


1. 기업 내 AX 인프라를 구축하기 위한 필수 구성 요소는 무엇인가요?

  • 면접관의 질문 의도: AI 도구를 단품으로 도입하려는 사고가 아니라, 재사용 가능한 내부 플랫폼(Internal Platform) 구축 관점에서 답하는지를 파악합니다.
  • 답변 요령: 모델 게이트웨이, 데이터 파이프라인, 검증·가드레일, 관측성(Observability), 비용 거버넌스의 계층을 구분해 답하면 안정적입니다. 핵심은 각 계층을 재사용하고 벤더 Lock-in을 줄이는 것입니다.
[기업 AX 인프라 필수 계층]

모델 게이트웨이 (LiteLLM / vLLM / 다중 벤더 중계)
검색·지식층  (RAG, 벡터DB, 사내 지식 허브)
데이터 파이프라인 (스토리지 | ETL | 이벤트)
프롬프트·검증 (평가 프레임워크, 가드레일)
거버넌스·비용 (관측 가능성, FinOps, 보안 정책)

💡 모범 답변 스케치 "기업 AX 인프라는 크게 네 가지로 설계합니다. 첫째, 모델 게이트웨이입니다. 여러 벤더(OpenAI, Anthropic, 국내 모델)의 API를 하나의 표준 인터페이스로 통일하고, 인증·키 관리·모델 라우팅을 중앙에서 처리합니다. 둘째, 데이터 파이프라인입니다. 사내 문서·DB·로그를 안전하게 정제하여 벡터 DB와 프롬프트 컨텍스트로 재사용할 수 있는 표준 데이터 레이어를 만듭니다. 셋째, 검증과 가드레일입니다. 자동 평가(Prompt Evaluation)와 프롬프트 인젝션 방어, 개인정보 마스킹을 모든 서비스가 공통으로 사용할 수 있게 합니다. 마지막으로 관측·비용 거버넌스입니다. 요청별 토큰·모델·레이턴시·비용을 한 곳에서 집계해 부서별로 배정합니다. 이렇게 하면 각 부서가 독자적으로 처음부터 다시 만들지 않아도 되는 것이 가장 큰 목적입니다."


2. RAG와 Fine-tuning, 상황별로 어떻게 선택하나요?

  • 면접관의 질문 의도: 두 기법의 트레이드오프를 정확히 알고 상황에 맞게 선택할 수 있는지를 판단합니다.
  • 답변 요령: "지식 획득 vs 동작 변경"이라는 기준으로 나누어 답하고, 최신성·비용·목적을 비교표로 제시하세요.
비교 항목RAG (Retrieval-Augmented Generation)파인튜닝 (Fine-tuning)
목적외부 지식 덧붙이기, 근거 기반 추론모델의 스타일·형식·특수 작업 숙달
데이터 관리지식이 늘면 인덱스 갱신만데이터 확보 시 추가 학습 필요
최신성문서 갱신 즉시 반영반영 시 재학습 필요
환각 제어검색 근거를 함께 제시하여 감소지식을 주입하므로 잘못 학습 시 위험
비용·운영벡터 DB 유지 + 호출 토큰학습·호스팅 자원
권장도메인 지식(법률, 매뉴얼, 뉴스)특정 출력 형식(JSON 고정 등)

💡 모범 답변 스케치 "저는 두 기법을 목적 기준으로 나눕니다. 모델이 아직 모르는 사내 문서·규정을 근거로 추론해야 하는 경우에는 RAG가 정답입니다. 지식이 변경될 때마다 인덱스를 갱신하고, 근거·출처를 함께 제시할 수 있어 결과의 신뢰성이 높아집니다. 반면 모델의 동작 방식 자체를 바꿔야 하는 경우, 예를 들어 특정 출력 형식(항상 JSON 반환, 태그 분류)이나 업무 스타일을 고정해야 하면 파인튜닝이 필요합니다. 두 기법은 상호 배제가 아니라 함께 사용되는 경우가 많습니다. 예를 들어 먼저 출력 형식을 파인튜닝으로 굳히고, 회사 지식은 그때그때 RAG로 보강하는 결합 방식이 실무에서 자주 쓰입니다."


3. LLM 프로덕션 배포시 급증하는 추론 비용을 절감할 엔지니어링 방안은 무엇인가요?

  • 면접관의 질문 의도: LLM 운영 비용을 API 단가 절약 수준에서 끝내지 않고, 인프라·아키텍처 수준의 다층적 제어 역량이 있는지 확인합니다.
  • 답변 요령: 요청 계층, 모델 계층, 호스팅 계층으로 나누어 답하는 것이 이상적입니다.
계층기법효과
요청 계층시맨틱 캐시(Semantic Cache)유사 질문을 벡터 유사도로 검출하여 API 호출 절감
호출 계층모델 라우팅단순 분류→소형 모델, 심층 분석→대형 모델 분기
상황 계층프롬프트 캐싱(Prompt Caching)긴 시스템 프롬프트 반복 시 최대 50~90% 절감
컨텍스트 계층토큰 압축·Top-K 필터링RAG 문서 중 관련 청크만 주입
호스팅 계층양자화·vLLM 배치GPU 성능 극대화·처리량 확보

💡 모범 답변 스케치 "추론 비용은 한 가지로만 줄어들지 않습니다. 첫째, 요청 계층에서 Redis의 벡터 DB로 질문의 임베딩 유사도를 계산해 이미 답한 질문은 LLM 호출 없이 캐시에서 반환합니다. 둘째, 모델 라우팅으로 작업 특성에 따라 소형(Flash/mini)과 대형 모델을 나눠 토큰 단가를 낮춥니다. 셋째, 긴 시스템 프롬프트나 RAG 문서가 반복되면 프롬프트 캐싱을 켜서 TTFT와 비용을 동시에 줄입니다. 그리고 자체 GPU로 인퍼런스를 운영한다면 **양자화 + vLLM(PagedAttention·continuous batching)**을 적용해 한 장의 GPU로 최대 처리량을 확보합니다."


4. 임직원의 외부 LLM API 사용으로 인한 사내 중요 데이터 유출을 어떻게 방어하나요?

  • 면접관의 질문 의도: 회사 내부 데이터의 안전을 전체 시스템 관점에서 고민하는지 확인합니다.
  • 답변 요령: 정책, 인터페이스 게이트웨이, 개인정보 보호·감사라는 3중 방어를 답변의 축으로 삼으세요.

💡 모범 답변 스케치 "먼저 외부 LLM 호출을 반드시 중앙 게이트웨이(LiteLLM 등) 하나로 강제합니다. 여기에 세 가지 기능을 둡니다. 첫째, 인증·접근 통제 — 회사가 승인한 서비스와 팀만 호출할 수 있게 하여, 임직원 개인이 자체 키로 원격 호출하는 것을 막습니다. 둘째, 개인정보 마스킹 — 호출 전에 Regex·LLM 탐지로 주민번호·카드번호·전화번호 등을 제거하거나 마스킹합니다. 셋째, 감사 기록(DLP) — 호출 내용과 응답을 안전하게 로깅하여 유출 사고 시 추적 가능하게 합니다. 동시에 임직원이 안전하게 쓰도록 사내 지식 기반의 내부 RAG 챗봇을 우선 제공하고, 개인 계정으로 업무 데이터를 올리지 못하도록 정책·교육을 병행합니다. 한국 기업은 특히 개인정보보호법에 따라 민감정보의 해외 클라우드 전송에 대한 통제 규정을 계약과 정책 모두로 명확히 두는 것이 중요합니다."


5. 기존 레거시 시스템을 유지하면서 AI 기능을 점진적으로 이식할 전략은 무엇인가요?

  • 면접관의 질문 의도: '전체를 갈아엎기'가 아니라 반복적 개선(Strangler Pattern)으로 리스크를 통제할 수 있는지를 확인합니다.
  • 답변 요령: 변경 최소화, 평가 지표를 기반으로 단계적 전환을 제안하고, 롤백 가능성을 유지하는 전략을 제시하세요.
[Strangler Fig 패턴 접목 (점진적 모듈 이식)]

기존 서비스 ── AI 보조 기능 (신규) ── 평가(Gauge) ── 충족 시 대체
                                   └ 병행 운영 └ 롤백 가능

💡 모범 답변 스케치 "레거시를 유지하면서 AI를 올리는 가장 안정적 방법은 Strangler Fig(스트랭글러) 패턴입니다. 먼저 AI가 도움이 될 지점을 선정합니다. 예를 들어 완전히 신규이거나 지원성 기능(문서 분류, 요약 등)은 초기에 AI로 시도하고, 정확해야 하는 거래·결제 영역은 기존 로직을 유지합니다. 그리고 평가 지표(정확도, 처리율) 를 기준으로 이식 여부를 판단하세요. 특히 AI 에이전트/코파일럿을 기존 마이크로 서비스 뒤에 단계적으로 붙입니다. (1) 병렬로 응답하여 비교, (2) 사람 검증 후 전환, (3) 완전 대체 순입니다. 이렇게 하면 중단 없이 점진적으로 이식하고, 문제 발생 시 즉시 롤백할 수 있습니다. 핵심은 배포 속도와 롤백 전략을 통제하는 것입니다."


6. AX 인프라 구축 시 FinOps 관점의 비용 최적화 계획은 무엇인가요?

  • 면접관의 질문 의도: 비용 문제가 조직 프로세스와 책임(FinOps)과 연결되어 있다고 이해하는지를 확인합니다.
  • 답변 요령: Inform → Optimize → Operate 순환 구조와 부서별 책임 인식을 강조하세요.
단계주요 활동
Inform (관측)모델·서비스·부서 단위 토큰·대기시간·비용 집계 대시보드
Optimize (최적화)모델 라우팅, 캐시, 배치 처리, 예약 인스턴스 도입
Operate (운영)예산(budget) 설정·알람, 부서별 비용 태그·청구

💡 모범 답변 스케치 "FinOps는 공유 책임입니다. 먼저 Inform 단계에서 모든 호출을 중앙 게이트웨이에 로깅하여 부서·모델·기능 단위의 토큰과 요금을 대시보드로 보고, 이를 기반으로 각 부서에 예산을 배정합니다. Optimize 단계에서는 비용이 큰 부분을 우선으로 모델 라우팅, 시맨틱 캐시, 배치 처리를 적용합니다. Operate 단계에서는 부서 예산 초과 시 자동 경고와 부서별 표시(showback)로 책임을 명확히 합니다. 핵심은 이 비용 지표를 팀의 문화로 지속 반복 개선하는 것입니다."


7. 오픈소스 기반 온프레미스 구축과 클라우드 SaaS/PaaS 선택 기준은 무엇인가요?

  • 면접관의 질문 의도: 이분법이 아니라 상황에 따라 트레이드오프를 판단하는지 확인합니다.
  • 답변 요령: 데이터 주권, 초기 비용, 운영 부담, 확장성, 신모델 접근을 기준으로 결정 트리를 제안하세요.
구분온프레미스(오픈소스)클라우드 SaaS/PaaS
데이터 주권최고 수준 (외부 전송 없음)공급사 의존
초기 비용높음 (GPU 투자)낮음 (사용량 기반)
운영 부담GPU·K8s 관리 필요공급사가 일부 위임
확장성초기 용량에 한정탄력적·즉시 확장
신모델 접근직접 도입 필요최신 모델 즉시

💡 모범 답변 스케치 "두 가지를 배타적으로 보지 않고, 데이터 종류와 목적 우선순위로 나눕니다. 첫째, 금융·법률·보안처럼 데이터가 외부로 나가면 문제가 되는 영역은 오픈소스(Llama·Mistral)에 vLLM과 벡터 DB를 올려 온프레미스로 운영해 데이터 자산을 지킵니다. 둘째, 개발 속도가 우선이라면 클라우드 전문 모델 API를 써서 인프라 구축 없이 기능을 올립니다. 셋째, 비용 관점에서 GPU 보유·활용을 계산해 규모가 크지 않은 작업은 클라우드로 하고, 트래픽이 많은 영역은 온프레미스로 하는 하이브리드도 검토합니다. 그리고 중앙 게이트웨이(LiteLLM)를 붙여 온프레미스와 클라우드를 같은 인터페이스로 중계하면 이중 전환을 원활하게 할 수 있습니다."


8. 최근 기업에서 LiteLLM을 proxy 레이어로 구성하는 이유는 무엇인가요?

  • 면접관의 질문 의도: LiteLLM이 단순 '또 하나의 API'가 아니라, 다양한 벤더·비용·보안 정책을 하나의 중앙 인터페이스로 통합하는 도구라는 것을 이해하는지 봅니다.
  • 답변 요령: 벤더 전환 자유도, 사용량 집계, 보안·키 관리, 모델 라우팅, 표준 API 통일을 강조하세요.

💡 모범 답변 스케치 "기업에서는 부서별로 GPT, 클로드(Claude), Gemini, 국내 모델을 다양하게 쓰는데, 이를 각각 연동하면 인증·보안·비용 체계가 흩어지고 벤더 교체 시마다 변경 작업이 생깁니다. 그래서 LiteLLM을 모든 호출 앞의 중앙 프록시로 두면 다음과 같은 이점이 있습니다."

  • 표준 API 통일: OpenAI 스타일의 인터페이스 하나를 노출해 벤더가 바뀌어도 애플리케이션의 Base URL 몇 줄만 변경하면 됩니다.
  • 중앙 인증·키 관리: 벤더 키를 팀·사람이 직접 노출하지 않고 조직 단위로 호출 정책을 정의합니다.
  • 라우팅·페이백: 요청 특성에 따라 소형·대형 모델을 라우팅하고, 예산·쿼터를 관리합니다.
  • 캐시·가드레일: 시맨틱 캐시, 프롬프트 캐싱, 입력 필터(검증)를 프록시 한 곳에서 일괄 적용합니다.
  • 로그 징비준(FinOps): 실제 사용량(토큰·레턴시·모델)을 프록시 지점에서 한 곳으로 기록합니다. 결국 LiteLLM을 거버넌스의 허브로 두는 것이 기업 AX 인프라를 안정적·유연하게 만드는 이유입니다."

🔑 경력직을 위한 답변 핵심 요약(Cheat Sheet)

  1. "비용·보안·운영·거버전" 종합 사고
    • 단순 코드가 아니라 조직 전체의 플랫폼, 즉 재사용·반복·거버넌스 관점으로 답하면 점수를 얻습니다.
  2. 트레이드오프와 근거 제시하기
    • "온프레미스는 보안이 좋지만 운영·GPU 비용이 있으며, 클라우드는 빠르지만 비선형 비용이 있다"처럼 양면을 이야기하세요.
  3. 숫자·구체 지표로 설명하기
    • 예: "시맨틱 캐시로 중복 질의 호출을 35% 절감, 모델 라우팅으로 토큰 비용을 20% 줄였다"처럼 구체 수치로 설명하세요.

AX 인프라 구축 질문은 더 이상 '모델을 더 크게 쓰자'가 아니라 데이터 주권, 비용 경제성, 보안, 벤더 통합이 얽힌 복합적인 엔지니어링 판단을 검증합니다. 위 8가지를 트레이드오프와 운영 관점으로 준비해 두면 기술 면접을 확실히 대응할 수 있을 것입니다.

마치며

경력직 기술 면접에서 묻는 AX 관련 질문은 개념 암기보다 기업의 AI 플랫폼을 어떻게 설계하고, 데이터를 안전하게 지키고, 비용을 통제할지에 대한 실무 판단을 봅니다. RAG와 파인튜닝의 선택 기준, 온프레미스/클라우드의 트레이드오프, LiteLLM 프록시가 담은 거버넌스까지를 본인이 참여한 프로젝트 맥락과 결합해 설명한다면 큰 응용력을 얻을 수 있을 것입니다.

실제로 본인이 담당했었던 프로젝트에 이 원칙들을 대입해 자신만의 사례로 구체화하는 연습을 꾸준히 한다면, 답변의 설득력이 크게 달라질 것입니다.


참고 자료: