AI TOOLS
다양한 LLM 모델별 특성을 테스트를 위한 환경을 고민하다가 X의 링크를 보고 Visual Studio Code 플러그인을 깔아보기로 한다.
다른 기능보다 Bulk run 기능으로 다양한 질문셋을 등록해서 한번에 돌릴 수 있어 유용하다.
GitHub 코파일럿으로 주요기능 내용을 뽑고 수정해서 정리해본다.
[2026-07-14 업데이트] 이 글에서 소개한 AI Toolkit for Visual Studio Code는 2026년 4월 16일 Microsoft Foundry Toolkit for VS Code라는 이름으로 정식 출시(GA)되었다. 이름만 바뀐 것이 아니라 Agent Builder, Agent Inspector 등 에이전트 개발 기능이 크게 확장되었고, 기존 Bulk Run 탭은 별도 메뉴가 사라지고 Evaluation 기능에 통합되었다. 아래에 현재 버전 기준으로 내용을 보완한다.
Foundry Toolkit for Visual Studio Code (구 AI Toolkit)
Foundry Toolkit for VS Code는 모델 카탈로그에서 Microsoft Foundry, OpenAI, Anthropic, Google, GitHub, Ollama 등에서 서빙하는 100개 이상의 모델을 선택하고 플레이그라운드에서 멀티모달을 테스팅할 수 있다.
GPU서버나 모델이 돌아가는 환경이 있으면 Custom으로 엔드포인트를 등록하여 테스트할 수도 있다.
설치 방법
- Visual Studio Code 열기
- 확장 마켓플레이스에서 “Foundry Toolkit” 검색 (확장 ID는 예전 그대로
ms-windows-ai-studio.windows-ai-studio라서 기존 AI Toolkit 사용자는 자동 업데이트된다) - 설치 후 재시작 (.NET Runtime 필요)
주요 기능
- Playground: 다양한 모델을 선택해서 Inference 인터페이스를 제공하고, 문서를 첨부하여 테스트할 수 있는 기능도 제공한다.
- Model Catalog: OpenAI, Anthropic, Google, GitHub, ONNX, Ollama 등의 모델 검색/선택
- Agent Builder: 보일러플레이트 코드 없이 프롬프트 엔지니어링과 MCP 툴 연동으로 에이전트를 만들 수 있다.
- Agent Inspector: 툴 호출과 에이전트 체인을 실시간 시각화, 브레이크포인트, 로컬 트레이싱으로 디버깅
- Evaluation: 데이터셋 기반 모델 성능 평가 (기존 Bulk Run 기능이 여기로 통합됨)
- Fine-tuning: 로컬 GPU 또는 클라우드 기반 모델 미세 조정
- Model Conversion / Tracing: 로컬(Windows) 배포용 모델 변환, AI 앱 성능 모니터링
Bulk Run → Evaluation 통합
예전에는 Bulk Run 탭에서 CSV/JSONL로 질문셋을 올려 한 번에 실행했지만, 현재 버전에서는 별도 Bulk Run 메뉴가 없어지고 Evaluation에서 같은 작업을 수행한다.
사용 방법 (현재 버전 기준)
- Foundry Toolkit 뷰에서 TOOLS > Evaluation을 열거나, Agent Builder의 Evaluation 탭 사용
query,response,ground truth필드를 가진 JSONL 파일로 데이터셋 업로드- 실행할 모델과 Inference parameters 설정 후 데이터셋 전체 실행
- 결과는 화면에 실시간으로 표시되며 다운로드하거나 평가 지표로 분석할 수 있다.
Evaluation
데이터셋 실행 결과는 준비된 여러 가지 평가항목을 선택하여 모델 성능을 평가할 수 있다. 현재 제공되는 평가 지표는 다음과 같다.
- 에이전트 평가: Intent Resolution, Task Adherence, Tool Call Accuracy
- 일반 평가: Coherence, Fluency
- 특화 평가: Retrieval(RAG), Similarity, F1 Score, BLEU, GLEU, METEOR
- LLM 프롬프트 또는 Python 코드로 커스텀 평가자도 만들 수 있다.

참고
- Foundry Toolkit for Visual Studio Code (공식 문서)
- GitHub: microsoft/foundry-toolkit
- Microsoft Foundry Toolkit GA 발표
관련글 목록
- RAG & AI 에이전트 주간 연구 동향 (2026-08-03 ~ 08-09)
- Prompt Caching 실전 가이드 — 원리·프롬프트 설계·프로바이더별 차이·운영 팁
- RAG & AI 에이전트 주간 연구 동향 (2026-07-27 ~ 08-02)
- 오케스트레이션이란 무엇인가 — 루프에서 그래프로, 에이전트 협업의 구조 이해하기
- 시맨틱 하이라이트란? — RAG 초보자를 위한 5분 요약
- RAG의 숨은 병목 — 시맨틱 하이라이트(의미 강조)로 검색과 설명의 불일치 해결
- 에이전트는 어떻게 '배우고' 고치는가 — 기억·스킬·피드백 루프의 실제 구조
- Hermes 파이프라인에 OKF 지식 번들 올리기
- Hermes Agent 설치부터 설정까지 - Windows에서 시작하기
- 오픈소스 가드레일 모델과 온프레미스 에이전트 파이프라인 구성
- 구글 OKF(Open Knowledge Format)는 RAG를 대체하나?
- Claude Code로 제안서 작성 파이프라인 만들기
- RAG & AI 에이전트 주간 연구 동향 (2026-07-12 ~ 07-19)
- 나디르 위성영상 캡셔닝을 위한 오픈웨이트 멀티모달 모델 비교
- 위성 영상 처리: 멀티모달 LLM vs 이미지 임베딩 모델
- Caller/Executor 패턴으로 멀티 에이전트 구성하기
- OpenRouter 무료 모델을 API로 사용하기
- PaperBanana - 문장으로 아키텍처 다이어그램 그리기
- AI TOOLS