SWE-Rebench V2 vira referência anti-contaminação em benchmarks de coding agent
SWE-Rebench (Nebius) consolida-se como referência ao usar issues GitHub fresh contra contaminação, com Claude Opus 4.6 (65,3%) liderando seguido de GLM-5 (62,8%); paper SWE-PRBench em março mostrou que frontier models detectam só 15-31% dos issues humanos em PR review.