tag: Inference · 3건
- 근거: LLM 추론 최적화(KV cache, PagedAttention, vLLM 등) 학습 자료 — AI/LLM 관심 분야에 해당하나 실행 가능한 코드 저장소는 아님
- 액션: README 및 학습 자료 통독하여 LLM 추론 엔지니어링 핵심 개념 정리
- 근거: AI/LLM 분야 — Kimi K3 모델을 단일 기기에서 실행하고 OpenAI 호환 API 서버로 로컬 추론 환경 구성
- 액션: git clone https://github.com/gavamedia/deltafin && pip install -r requirements.txt 후 로컬에서 OpenAI 호환 API 서버 기동 및 chat/coding agent 연결 동작 확인
- 근거: AI/LLM 분야 트렌드 — 신규 모델 출시 후 수요 급증으로 인한 인프라 병목 사례
- 액션: 기사 읽고 LLM 서비스 스케일링 병목 패턴(inference bottleneck) 사례로 참고하기