NVIDIA NeMo Switchyard — 에이전트 워크로드를 여러 모델에 라우팅하기
에이전트 시스템의 API 비용은 대부분 프론티어 모델 호출에서 나온다. 그런데 에이전트가 처리하는 요청의 상당수는 굳이...
2026, Aug 22 — 2 minute read에이전트 시스템의 API 비용은 대부분 프론티어 모델 호출에서 나온다. 그런데 에이전트가 처리하는 요청의 상당수는 굳이...
2026, Aug 22 — 2 minute readNVIDIA AI Factory 설계 가이드에서 인프라 레이어를 봤다면, 이번에는 그 위에서 돌아가는 대규모 멀티모달 학습...
2026, Aug 22 — 2 minute readGemma 4 MTP 서빙 가이드에서 모델 서빙 레이어를 다뤘다면, 이번에는 리트리버 레이어다. 하이브리드 검색(키워드 +...
2026, Aug 17 — 5 minute readHermes 에이전트가 배치 작업으로 수집한 RAG·AI 에이전트 분야 주간 논문 보고서(arXiv cs.IR/cs.CL/cs.MA/cs.AI/cs.LG + Hugging Face...
2026, Aug 16 — 3 minute readLLM 디코딩 지연의 근본 병목은 연산이 아니라 GPU 메모리 대역폭이다 — 토큰 하나를 만들 때마다...
2026, Aug 15 — 5 minute readHermes 대화 루프 심층 글에서 에이전트 루프의 핵심으로 툴 호출이 정화→디스패치→실행→관측 4단계를 거치는 것을 다뤘다....
2026, Aug 12 — 9 minute readHermes 에이전트가 배치 작업으로 수집한 RAG·AI 에이전트 분야 주간 논문 보고서(arXiv cs.IR/cs.CL/cs.MA/cs.AI/cs.LG + Hugging Face...
2026, Aug 12 — 4 minute read오늘은 Hermes Agent의 영구 메모리(Memory) 와 스킬(Skill) 두 계층을 정비했다. 기존 발행 글 3개(NVIDIA AI...
2026, Aug 08 — 3 minute readLLM을 프로덕션에서 쓸 때 가장 먼저 부딪히는 비용 문제는 같은 시스템 프롬프트를 매 요청마다 다시...
2026, Aug 05 — 6 minute readPerplexity 배치 작업으로 수집한 RAG·AI 에이전트 분야 주간 논문 보고서(arXiv cs.IR/cs.CL/cs.MA/cs.AI/cs.LG + Hugging Face Daily...
2026, Aug 04 — 3 minute read