Skip to content

Navigation Menu

Sign in
Sign up

History / Sonnet 4.6 SlimPajama Agent Run Mar 24 2026

Revisions

  • Add Sonnet 4.6 SlimPajama results — S4.0 wins, score now 2-1-1 SlimPajama completed: 101 experiments, 2 keeps, best 1.5267 (vs S4.0's 1.5259). First dataset where Sonnet 4.0 clearly wins — flat optimization landscape where both models barely improve from baseline. Sonnet 4.6 struggled with reproducibility (exp36-49 couldn't replicate baseline). Series score: Sonnet 4.6 leads 2-1-1 with FineWeb-Edu-High remaining as the tiebreaker. New: Sonnet-4.6-SlimPajama-Agent-Run-Mar-24-2026.md Updated: Cross-LLM-Comparison.md (4 datasets), Cross-Dataset-Comparison.md, Home.md, cross-llm-comparison.png chart (4 datasets) Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 24, 2026

AltStyle によって変換されたページ (->オリジナル) /