tag: Benchmark · 5건
- 근거: AI/LLM 모델 동향 — Google Gemini 3.7 Flash 성능 벤치마크 소개 기사
- 액션: 기사 읽고 DeepSWE 벤치마크 기준으로 현 LLM 코딩 에이전트 성능 현황 파악
- 근거: AI 에이전트 벤치마크 프레임워크 — LLM 에이전트/AI 도구 관심 분야에 해당
- 액션: git clone https://github.com/Accio-org/RealReplicaBench && docker compose로 로컬 환경 띄우고 샘플 에이전트 태스크 1개 실행해보기
- 근거: AI/LLM 코딩 도구 벤치마크 비교 기사 — 특정 오픈소스 저장소 없음
- 액션: Kimi K3 API 공식 문서 확인 후 Claude Fable 5와 코딩 태스크 직접 비교 테스트해보기
- 근거: AI/LLM 분야 신규 모델 릴리즈 — 코딩 벤치마크 성능 화제
- 액션: MiniMax M2.5 API 및 벤치마크 결과 페이지 확인 후 기존 LLM 코딩 도구와 성능 비교 메모
- 근거: AI/LLM 분야 신규 모델 출시 — 특정 오픈소스 저장소가 아닌 상용 모델 비교 기사
- 액션: GPT-5.6 vs Claude Fable 5 벤치마크 요약 읽고 API 가격/성능 trade-off 파악해두기