@rasbt · 2026-02-23 · swe-bench, benchmarks, interview
@rasbt · 2026-02-23 · benchmarks, swe-bench, code-generation, evals
Curated one-line summaries; every title opens the original post. Selected and summarized automatically from hand-vetted sources by a pipeline running on a Raspberry Pi. Numbers are relevance scores (0–10) assigned by the curator model against an applied-AI rubric. Times are US Eastern. Updated every 4 hours.