tag: Llm-Benchmark · 4건
- 근거: DeepSeek 공식팀이 공개한 LLM 평가/벤치마크 하네스 프레임워크 — AI/LLM 도구 관심 분야에 직접 해당하며, 39k+ 스타·3103 포크·117MB 실제 TypeScript 코드베이스로 즉시 검증 가능한 완성도
- 액션: git clone https://github.com/deepseek-ai/deepseek-harness && cd deepseek-harness && cat README.md BENCHMARK.md AGENTS.md — 플러그인 구조 파악 후 examples/ 디렉터리에서 샘플 평가 파이프라인 실행해보기
- 근거: AI 에이전트 / 멀티에이전트 시스템 설계 및 실증 평가 관련 인사이트
- 액션: 단일 LLM 호출 vs 멀티에이전트 파이프라인의 비용·품질·지연을 비교하는 간단한 벤치마크 스크립트를 작성해 자신의 에이전트 구성에 적용해보기
- 근거: AI/LLM 모델 비교(Grok 4.5 vs Claude Opus) — AI 코딩 도구 관심 분야에 해당
- 액션: Grok 4.5 API 또는 xAI 플레이그라운드에서 코딩 태스크로 Claude Opus와 토큰 효율 직접 비교해보기
- 근거: AI 에이전트 평가 벤치마크 — AI/LLM 관심 분야에 해당
- 액션: https://senior-swe-bench.snorkel.ai/ 방문해 벤치마크 방법론 및 리더보드 확인