Le modèle Bell d'OpenAI est imparable, mais Grok 4.7 relève d'une autre catégorie
OpenAI a déployé un modèle interne nommé Bell qui a résolu plus de 100 problèmes mathématiques persistants par auto-amélioration récursive. SpaceX a lancé Grok 4.7 à un prix de 6 dollars le jeton, mais les premiers tests révèlent des sorties paresseuses et une précision visuelle inférieure à celle de GPT-6 Astra Pro. Les benchmarks indiquent que Grok 4.7 obtient 46.3% sur les tâches d'ingénierie logicielle tout en coûtant nettement moins que GPT 5.6 SOL Max. Ce nouveau modèle accuse un retard face aux concurrents en ingénierie électrique et en droit malgré son prix inférieur à celui de Kimi K3.
Je ne sais pas comment évaluer Grok 4.7...
Grok 4.7 offre des performances comparables à Opus 5.0 pour environ la moitié du coût par tâche. XAI présente ce modèle comme une option de premier plan pour le codage et le travail de connaissances, avec un score de 71% sur les benchmarks DeepSuite. Le modèle utilise une fenêtre de contexte de 500k tokens et propose des coûts nettement inférieurs à Fable 5.1 malgré une efficacité de sortie similaire. Les analystes notent que Grok 4.7 est inférieur à Opus 5.0 en capacités brutes mais excelle dans l'efficacité économique pour les flux de travail d'entreprise.