Agent evaluation reporting Use when summarizing agent evaluations where autonomous, assisted, failed, timed-out, or invalid outcomes must remain distinct and comparable. Agent EvaluationTemplatesGrokBot
Run deep swe Run reproducible DeepSWE coding-agent benchmark evaluations through OpenRouter and mini-swe-agent. Agent EvaluationTemplatesGrokBot