Gemma 4 MTP 서빙 가이드 해설 — 페어드 드래프터·MIG 슬라이싱·vLLM 설정
LLM 디코딩 지연의 근본 병목은 연산이 아니라 GPU 메모리 대역폭이다 — 토큰 하나를 만들 때마다...
2026, Aug 15 — 5 minute readLLM 디코딩 지연의 근본 병목은 연산이 아니라 GPU 메모리 대역폭이다 — 토큰 하나를 만들 때마다...
2026, Aug 15 — 5 minute readHermes 대화 루프 심층 글에서 에이전트 루프의 핵심으로 툴 호출이 정화→디스패치→실행→관측 4단계를 거치는 것을 다뤘다....
2026, Aug 12 — 9 minute readHermes 에이전트가 배치 작업으로 수집한 RAG·AI 에이전트 분야 주간 논문 보고서(arXiv cs.IR/cs.CL/cs.MA/cs.AI/cs.LG + Hugging Face...
2026, Aug 12 — 4 minute read오늘은 Hermes Agent의 영구 메모리(Memory) 와 스킬(Skill) 두 계층을 정비했다. 기존 발행 글 3개(NVIDIA AI...
2026, Aug 08 — 3 minute readLLM을 프로덕션에서 쓸 때 가장 먼저 부딪히는 비용 문제는 같은 시스템 프롬프트를 매 요청마다 다시...
2026, Aug 05 — 6 minute readPerplexity 배치 작업으로 수집한 RAG·AI 에이전트 분야 주간 논문 보고서(arXiv cs.IR/cs.CL/cs.MA/cs.AI/cs.LG + Hugging Face Daily...
2026, Aug 04 — 3 minute read최근 유튜브에서 오르카(Orca) IDE로 그래프 엔지니어링을 시연하는 영상(-pk2umNC-18)을 봤다. 클로드 코드(Claude Code) 하나가 오케스트레이터가 돼서,...
2026, Aug 03 — 7 minute readLM Studio가 발표한 에이전트 앱 LM Studio Bionic(2026-07-16 공개)을 읽고 핵심만 추려 정리한다. (이 글의...
2026, Aug 04 — 3 minute readNVIDIA AI Factory 해설에서 인프라 요구사항으로 “CNCF 바닐라 K8s”라는 표현이 나온다. 그런데 실제 구축 현장에서는...
2026, Aug 03 — 3 minute readNVIDIA의 Enterprise AI Factory Design Guide(공식 백서, 2026-05 최종 갱신)는 “데이터 센터를 AI를 핵심 생산...
2026, Jul 30 — 7 minute read