Prompt Caching 실전 가이드 — 원리·프롬프트 설계·프로바이더별 차이·운영 팁
LLM을 프로덕션에서 쓸 때 가장 먼저 부딪히는 비용 문제는 같은 시스템 프롬프트를 매 요청마다 다시...
2026, Aug 05 — 6 minute readLLM을 프로덕션에서 쓸 때 가장 먼저 부딪히는 비용 문제는 같은 시스템 프롬프트를 매 요청마다 다시...
2026, Aug 05 — 6 minute readPerplexity 배치 작업으로 수집한 RAG·AI 에이전트 분야 주간 논문 보고서(arXiv cs.IR/cs.CL/cs.MA/cs.AI/cs.LG + Hugging Face Daily...
2026, Aug 04 — 3 minute read최근 유튜브에서 오르카(Orca) IDE로 그래프 엔지니어링을 시연하는 영상(-pk2umNC-18)을 봤다. 클로드 코드(Claude Code) 하나가 오케스트레이터가 돼서,...
2026, Aug 03 — 7 minute readLM Studio가 발표한 에이전트 앱 LM Studio Bionic(2026-07-16 공개)을 읽고 핵심만 추려 정리한다. (이 글의...
2026, Aug 04 — 3 minute readNVIDIA AI Factory 해설에서 인프라 요구사항으로 “CNCF 바닐라 K8s”라는 표현이 나온다. 그런데 실제 구축 현장에서는...
2026, Aug 03 — 3 minute readNVIDIA의 Enterprise AI Factory Design Guide(공식 백서, 2026-05 최종 갱신)는 “데이터 센터를 AI를 핵심 생산...
2026, Jul 30 — 7 minute read“RAG”라는 말은 들어봤는데, 정작 검색 결과에서 왜 하이라이트가 이상하게 되는지 의아했던 적이 있다면 이 글이...
2026, Jul 28 — 3 minute readX의 @akshay_pachaar 포스트에서 “RAG는 검색은 잘하는데 사용자 경험은 조용히 망가뜨린다”는 지적을 봤다. 핵심은 검색은 시맨틱(의미)인데...
2026, Jul 28 — 6 minute read대화 루프 심층 글에서 agent/ 코어 루프를 추적했다. 이번에는 같은 코어가 텔레그램·디스코드·슬랙에서 어떻게 도는지 —...
2026, Jul 25 — 2 minute read소스 트리 투어 글에서 agent/conversation_loop.py의 run_conversation()이 툴 호출 루프임을 짚었다. 이번에는 그 루프를 열어 LLM이...
2026, Jul 25 — 3 minute read