Daily OSS

tag: Llm-Inference · 11건

2026-08-16 · Simon Willison · 원문 ↗ #local-llm#qwen#llm-inference
  • 근거: AI/LLM 관심 분야 — 로컬 LLM 실행 및 추론 설정(reasoning_effort) 관련 블로그 기사
  • 액션: LM Studio에서 Qwen 3.8 27B Q4_K_M 모델 다운로드 후 reasoning_effort를 xhigh 대신 medium/low로 설정해 응답 속도·품질 비교 테스트
2026-08-14 · GitHub Trending (topic:llm) · 원문 ↗ #on-device-ai#llm-inference#ai-agent
  • 근거: 온디바이스 AI 에이전트 프레임워크 — LLM 추론 최적화 및 AI 에이전트 관심 분야에 해당
  • 액션: git clone https://github.com/OpenSparX/MasterAgent && CMake로 빌드 후 examples/ 디렉토리의 샘플 에이전트 실행해보기
2026-08-14 · HN (show hn) · 원문 ↗ #llm-inference#p2p#distributed-ai
  • 근거: AI/LLM 추론 최적화 영역 — MoE 모델을 P2P 분산 스웜으로 실행하는 개념으로 흥미롭지만, 저장소 [검증 신호](루트 파일·크기·이슈/포크)를 확인할 수 없어 보수적 판정
  • 액션: https://github.com/JustVugg/lumabri 방문해 README·루트 파일 구성·이슈 수 직접 확인 후, 실제 코드가 있으면 재판정
2026-08-03 · GitHub Trending (topic:llm) · 원문 ↗ #llm-inference#ai-optimization#learning-roadmap
  • 근거: AI/LLM 추론 최적화(vLLM, SGLang, 양자화, 투기적 디코딩) 로드맵으로 관심 분야에 해당하나, 실제 코드가 아닌 학습 커리큘럼 문서(HTML+README)임
  • 액션: index.html 열어 10주 커리큘럼 구성 확인 후 vLLM/SGLang 관련 주차 북마크
2026-08-02 · GitHub Trending (topic:llm) · 원문 ↗ #llm-inference#cpu-only#ai-llm
  • 근거: AI/LLM 추론 최적화 — GPU 없이 CPU 단독으로 대형 LLM 인퍼런스를 구현한 C99 구현체, AI 에이전트/LLM 실험 환경에 직접 활용 가능
  • 액션: git clone https://github.com/FareedKhan-dev/kimi-k3-in-c && make && ./examples/… 로 로컬 CPU 인퍼런스 동작 확인
2026-08-01 · GitHub Trending (stars:>200) · 원문 ↗ #llm-inference#ai-optimization#local-llm
  • 근거: AI/LLM 추론 최적화 — NVMe 스트리밍으로 RAM 초과 대형 모델(Kimi K3 2.78조 파라미터) 로컬 실행을 가능하게 하는 C 추론 엔진
  • 액션: git clone https://github.com/sqliteai/waste && make 빌드 후 소형 모델로 NVMe 스트리밍 추론 동작 확인
2026-07-25 · GitHub Trending (stars:>200) · 원문 ↗ #edge-ai#llm-inference#embedded
  • 근거: AI / LLM — ESP32 마이크로컨트롤러 위에서 LLM 추론을 실행하는 엣지 AI 프로젝트로, 추론 최적화 관심 분야에 해당
  • 액션: git clone https://github.com/slvDev/esp32-ai 후 RESULTS.md와 experiments/ 폴더로 어떤 모델을 어느 수준 정확도로 돌렸는지 확인; ESP32 없이도 Python 실험 코드(src/) 구조 파악 가능
2026-07-20 · Product Hunt - Open Source · 원문 ↗ #llm-inference#ai-runtime#performance
  • 근거: LLM 추론 최적화(llama.cpp·MLX 대비 성능 비교) — AI/LLM 관심 분야에 해당하나, GitHub 저장소 URL이 없고 Product Hunt 링크만 존재해 실제 오픈소스 여부 불명확
  • 액션: ‘BaseRT llama.cpp site:github.com’ 검색으로 실제 저장소 확인 후 클론 여부 재판정
2026-07-14 · GitHub Trending (topic:self-hosted) · 원문 ↗ #llm-inference#self-hosted#llama-cpp
  • 근거: AI/LLM 추론 서버 — 저사양 하드웨어에서 OpenAI 호환 API 제공, CPU 캐싱으로 반복 추론 비용 절감
  • 액션: git clone https://github.com/swellweb/reame && ./build.sh 후 로컬 CPU에서 소형 모델로 OpenAI 호환 엔드포인트 테스트
2026-07-11 · DEV Community - showdev · 원문 ↗ #llm-inference#llamacpp#kv-cache
  • 근거: llama.cpp의 공개 API를 활용한 KV 캐시 상태 재사용으로 로컬 LLM 추론 TTFT를 최대 9.9배 단축하는 기법 소개 — AI/LLM 추론 최적화 분야
  • 액션: DEV 게시글 내 EdgeSync-LLM 프로젝트의 GitHub 저장소 링크를 직접 확인하고, llama_state_seq_get_data/set_data API 사용 패턴과 벤치마크 재현 방법 검토
  • 근거: AI/LLM 추론 최적화 영역 — 744B MoE 모델을 소비자 PC(RAM 32GB)에서 int4 + 전문가 디스크 스트리밍으로 구동하는 실험적 오픈소스 프로젝트
  • 액션: git clone https://github.com/JustVugg/colibri 후 README 확인, GLM 5.2 int4 로딩 방식 및 MoE 전문가 디스크 오프로딩 구현 코드 살펴보기