모든 주제

apple-silicon

  1. 128GB Mac에서도 메모리가 부족할 수 있는 이유

    128GB면 큰 모델도 여러 개 돌릴 수 있을까? 모델 파일 외에 KV Cache와 실행 공간, 개발 도구가 쓰는 메모리를 정리하고 상주 모델과 필요할 때 불러올 모델을 나눠봤다.

  2. 로컬 LLM은 왜 느릴까? — Prefill과 Decode

    로컬 LLM의 첫 답변 대기와 생성 속도는 왜 다를까? Prefill, Decode, TTFT와 KV Cache를 정리하고 Mac Studio에서 비교할 조건을 잡아봤다.