This incident occurred during an internal evaluation which prompts models to pursue advanced exploitation using complex attack paths, in an effort to quantify their cyber capabilities. We estimate maximal cyber capabilities by running this evaluation without production classifiers used to prevent models from pursuing high-risk cyber activity.
Tout est dit dans ce petit paragraphe. OpenAI a "prompté" les modèles pour vérifier leur capacité à mener des attaques complexes. Les modèles ont fait exactement ça. Et bien sûr ça sert la communication de l'entreprise, comme ce qu'Anthropic nous a déjà fait, « Ouaw nos modèles sont monstrueux regardez ce dont ils sont capables.» Ils (Anthropic puis le gouvernement US) avaient bloqué la sortie de Mythos/Fable parce qu'il était trop dangereux et cette semaine ils publient Opus 5 qui est présenté comme plus capable que Fable sur la plupart des tâches mais cette fois-ci sans le sensationnalisme. Allez comprendre... Entre les PR Strunt, les benchmarks maison et la réalité des faits, la communication de ces entreprises est bien difficile à décoder.
# Le modèle a juste fait ce qu'on lui a demandé
Posté par Faya . En réponse à la dépêche OpenAI attaque Hugging Face "sans faire exprès". Évalué à 10 (+15/-0).
De OpenAI :
Tout est dit dans ce petit paragraphe. OpenAI a "prompté" les modèles pour vérifier leur capacité à mener des attaques complexes. Les modèles ont fait exactement ça. Et bien sûr ça sert la communication de l'entreprise, comme ce qu'Anthropic nous a déjà fait, « Ouaw nos modèles sont monstrueux regardez ce dont ils sont capables.» Ils (Anthropic puis le gouvernement US) avaient bloqué la sortie de Mythos/Fable parce qu'il était trop dangereux et cette semaine ils publient Opus 5 qui est présenté comme plus capable que Fable sur la plupart des tâches mais cette fois-ci sans le sensationnalisme. Allez comprendre... Entre les PR Strunt, les benchmarks maison et la réalité des faits, la communication de ces entreprises est bien difficile à décoder.
Hack this system