백로그 대기smevals — 모델·프롬프트·하네스를 비교 평가하는 경량 LLM eval 프레임워크2026-07-31 23:40 · Simon Willison · 원문 보기 ↗ #llm-eval#ai-tooling#prompt-engineering근거: AI/LLM 평가(eval) 프레임워크 — 여러 모델/프롬프트/하네스를 YAML 기반 챌린지로 비교 측정하는 도구로 AI·LLM 관심 분야에 직접 해당액션: uvx smevals docs 실행해 README 파악 후, 간단한 YAML eval 하나 작성해 claude-opus-5 vs claude-haiku-4-5 비교 실험