tag: Inference-Optimization · 4건
- 근거: AI/LLM 추론 최적화 분야 — FPGA 기반 경량 LLM 온칩 추론 실험 사례
- 액션: 블로그 글 읽고 KV260 FPGA 기반 LLM 추론 구현 방식 및 성능 수치 파악하기
- 근거: AI/LLM 분야 관심 주제이나 OpenAI 상용 모델 가격 변동 뉴스로, 클론하거나 시도해볼 오픈소스 저장소가 없음
- 액션:
- 근거: AI/LLM 추론 최적화 및 멀티모델 앙상블 전략 — AI·LLM 관심 분야에 해당하나 오픈소스 저장소가 아닌 상용 서비스 소개
- 액션: echo.tracerml.ai 데모에서 실제 멀티모델 라우팅 결과 확인 후, 유사 오픈소스 구현체(RouteLLM, LLM-Blender 등) 비교 탐색
- 근거: LLM 추론 최적화 분야 — M-series MacBook에서 Gemma 4 26B를 2GB RAM으로 실행하는 Swift 기반 로컬 추론 엔진
- 액션: git clone https://github.com/drumih/turbo-fieldfare && swift run으로 Gemma 4 26B-A4B 로컬 추론 동작 확인