Complete cross-LLM comparison: Sonnet 4.6 wins 3-2 across all 5 datasets
Final two datasets complete:
- SlimPajama: S4.0 wins (1.5259 vs 1.5267), both models find it near-impervious
- FineWeb-Edu-High: S4.6 wins (1.3345 vs 1.3463), spectacular beta2 walk
(5 consecutive keeps: 0.98->0.975->0.970->0.968->0.966->0.964)
Overall: S4.6 crashes 2.1x less, explores 60% more parameters, discovered
AR=21 architecture. S4.0 wins where it had pre-optimized baseline advantage.
New: SlimPajama + FineWeb-Edu-High Sonnet 4.6 run pages
Updated: Cross-LLM-Comparison (complete 5-dataset analysis),
Cross-Dataset-Comparison, Home.md, chart (5 datasets)
Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>