AI Engineer
손성준
LLM Serving · AI Search · MCP Agents · DevOps
LLM 서빙, AI 검색엔진, RAG, MCP 에이전트, Kubernetes 인프라를 다루는 기술 블로그입니다. 커머스 검색엔진에서 출발해 AI 에이전트 플랫폼(XGEN)까지, 실전에서 직접 만들고 운영한 경험을 기록합니다.
Topics
관심사별로 바로 읽기
Featured
- AI수정일:
graph-tool-call: LLM Agent를 위한 그래프 기반 도구 검색 엔진
1,077개 API endpoint를 가진 커머스 플랫폼에서 LLM Agent가 적절한 도구를 찾는 문제를 해결하기 위해 그래프 기반 도구 검색 엔진을 설계하고 구현한 과정을 정리한다. OpenAPI 스펙 자동 수집, 관계 그래프 구축, BM25+그래프확장+임베딩 하이브리드 검색, MCP Annotation-Aware Retrieval까지 8일간의 개발 여정을 다룬다.
LLM AgentTool Retrieval - AI수정일:
vLLM에서 llama.cpp로: LLM 서빙 아키텍처 통합 마이그레이션
vLLM Ray Serve 분산 구조에서 통합 모델 서빙 서비스로 마이그레이션한 과정. 백엔드 스위칭 매니저 설계, llama.cpp와 vLLM 런타임 전환까지.
모델서빙리팩토링 - Search
Rust로 커머스 검색 엔진을 처음부터 만들기
NestJS 기반 검색 서비스의 한계를 넘어, Rust로 이커머스 검색 엔진을 처음부터 설계하고 구현한 과정을 다룬다.
Rust검색엔진
Recent Posts
아이폰이 잠겨도 AI 코딩 작업은 계속된다: SSH 재접속과 분리 실행 설계
iOS 앱의 SSH 연결이 끊겨도 Claude Code와 Codex 작업이 서버에서 계속되도록 프로세스, 출력 파일, 재개 위치를 분리했다. 바이트 오프셋 복구, APNs 완료 알림, SQLite 동시성 문제까지 실제 시행착오를 정리한다.
graph-tool-call v0.36: LLM이 필요한 도구를 안전하게 고르게 만들기
수정일:LLM 에이전트가 수백 개 API 도구 중 필요한 도구를 고르고, 선행 호출을 안전하게 붙이고, 그 근거를 재현 가능한 실험 파일로 남긴 과정을 정리한다.
884만 문서에서 알게 된 것: 검색보다 어려운 건 검색을 시키는 일
수정일:synaptic-memory를 884만 MS MARCO passage 위에서 평가하며, 검색 정확도보다 agent loop의 도구 선택, query rewrite, 증거 누적, 실패 기억이 더 큰 병목으로 드러난 과정을 정리한다.
XGEN K3s 인프라 완전 해부 (1) — 전체 구조와 컨테이너 빌드 전략
수정일:XGEN 2.0 AI 에이전트 플랫폼의 K3s 기반 인프라를 처음부터 끝까지 해부한다. 1편에서는 전체 아키텍처 구조, Python/Rust/Node.js 4종 Dockerfile 멀티스테이지 빌드 전략, Docker Compose 인프라 스택, K8s-Docker 경계 연결 패턴을 다룬다.