tag: Moe · 2건
- 근거: AI/LLM 추론 최적화 관심 분야 — 아이폰에서 20B MoE 모델을 120 tok/s로 구동하는 on-device 추론 기술 사례
- 액션: deepgrove.ai/maple-preview 페이지에서 ternary quantization 방식과 MoE 구조 확인, 관련 오픈소스(BitNet, llama.cpp iOS 브랜치 등) 비교 학습
- 근거: AI/LLM 추론 최적화 분야 — Expert Parallelism 기반 MoE 모델 분산 학습 라이브러리
- 액션: README와 benchmarks 폴더 읽고 기존 MoE 병렬화 대비 성능 이득 파악하기