NVIDIA 양자화 기술과 TensorRT-LLM으로 MoE 모델 서빙 최적화 — Kakao Kanana-Flex FP8 사례
NVIDIA 테크니컬 블로그에 올라온 「NVIDIA 양자화 기술과 TensorRT-LLM을 이용한 서비스 최적화」를 읽고 핵심 기술 스택과...
2026, Aug 30 — 5 minute readNVIDIA 테크니컬 블로그에 올라온 「NVIDIA 양자화 기술과 TensorRT-LLM을 이용한 서비스 최적화」를 읽고 핵심 기술 스택과...
2026, Aug 30 — 5 minute readHermes 에이전트가 배치 작업으로 수집한 RAG·AI 에이전트 분야 주간 논문 보고서(arXiv cs.IR/cs.CL/cs.MA/cs.AI/cs.LG + Hugging Face...
2026, Aug 30 — 4 minute readAndrej Karpathy가 2026년 3월 공개한 autoresearch는 “AI 에이전트에게 작지만 실제로 돌아가는 LLM 학습 셋업을 주고...
2026, Aug 30 — 7 minute readNVIDIA 테크니컬 블로그에 8월 28일 올라온 「NVIDIA Vera Rubin·Blackwell, 와트당 에이전틱 AI 성능의 새로운 기준을...
2026, Aug 29 — 3 minute readDavid Marco(@David_TornAI)가 2026년 8월 28일 X에 올린 스레드 “PEOPLE ARE USING NOTEBOOKLM TO MASS-PRODUCE SPECIALIZED...
2026, Aug 29 — 7 minute readAndrew Ng가 2026년 8월 28일 뉴스레터 The Batch와 X에 올린 에세이 “How have software engineering...
2026, Aug 29 — 5 minute readRAG 시스템을 프로덕션에 올리기 전 “우리 파이프라인이 진짜 잘 작동하는가?”를 정량적으로 답하기란 의외로 까다롭다. 검색...
2026, Aug 29 — 12 minute read어제 다룬 Vera 스토리지 벤치마크가 AI 팩토리의 스토리지 계층 이야기였다면, 이번에는 추론 계층이다. NVIDIA 테크니컬...
2026, Aug 26 — 3 minute readNVIDIA AI Factory 설계 가이드에서 다룬 인프라 스택 중 스토리지 계층의 후속 소식이다. NVIDIA 테크니컬...
2026, Aug 25 — 3 minute read에이전트 벤치마크 소식 중에서도 눈에 띄는 결과다. NVIDIA 테크니컬 블로그에 올라온 AVO의 ARC-AGI-3 100% 달성...
2026, Aug 25 — 2 minute read