La semaine dernière, NovaSky, une équipe de chercheurs du Sky Computing Lab de l’Université de Californie à Berkeley, a publié Sky-T1-32B-Preview, un modèle de raisonnement qui concurrence efficacement les versions précédentes du modèle o1 d’OpenAI sur plusieurs indicateurs clés.
Sky-T1 se distingue comme le premier modèle de raisonnement véritablement open source, car il peut être répliqué à partir de zéro ; L’équipe a non seulement publié les poids du modèle, mais également l’ensemble de données utilisé pour l’entraîner et le code nécessaire à son entraînement.
Explorons les principales caractéristiques de ce modèle, sa comparaison avec d’autres modèles similaires et ce qu’implique sa désignation de modèle open source.
Principales caractéristiques du modèle Sky-T1-32B-Preview
Sky-T1-32B-Preview est un modèle de langage conçu pour exceller dans des domaines spécifiques tels que les mathématiques et la programmation. Certaines de ses principales caractéristiques incluent :
- Conception efficace : NovaSky a réussi à entraîner le modèle avec un budget nettement inférieur à la moyenne des modèles de taille similaire. Cela démontre une approche innovante de l’optimisation des ressources et de la formation.
- Performances compétitives : Bien qu’il soit en phase de prévisualisation, Sky-T1 s’est avéré capable de rivaliser avec des modèles plus coûteux dans les tests liés aux mathématiques et aux tâches de codage.
- Accès aux poids des modèles : NovaSky a rendu les poids des modèles disponibles, permettant ainsi aux développeurs d’expérimenter et de créer plus facilement des applications personnalisées.
Contrairement à certains concurrents, Sky-T1 propose un ensemble complet de ressources, conforme aux principes de l’open source.
Qu’est-ce que cela signifie pour un modèle d’être open source ?
L’Open Source Initiative (OSI) a récemment publié la version 1.0 de sa définition de l’intelligence artificielle Open Source (OSAID). Cette norme établit les exigences auxquelles un modèle doit répondre pour être considéré comme véritablement ouvert :
Transparence totale
Un modèle open source doit fournir des informations détaillées sur sa conception, y compris les données de formation et le code utilisé.
Accès et modification
Les développeurs doivent être libres d’utiliser, de modifier et de redistribuer le modèle sans restrictions significatives.
Provenance des données
Il est nécessaire de divulguer l’origine et le traitement des données utilisées dans le cadre de la formation.
NovaSky garantit que le Sky-T1-32B-Preview remplit ces conditions, offrant aux développeurs un accès sans précédent aux composants clés du modèle.
Cependant, cette conformité doit être évaluée selon les normes établies par l’OSI pour garantir qu’il ne s’agit pas d’un cas « d’open source seulement de nom ».
Comparaison avec d’autres modèles
Le tableau ci-dessous montre comment le Sky-T1-32B-Preview se compare à d’autres modèles populaires sur plusieurs aspects clés. Sky-T1 se distingue en offrant un accès complet aux données, au code et aux poids des modèles, ce qui le rend attrayant pour les développeurs et les chercheurs.
En revanche, des modèles comme Journey et o1 ont une approche plus spécialisée de la programmation, mais manquent de transparence sur d’autres aspects. Cela limite son adoption dans les projets qui nécessitent un accès complet aux ressources.
À l’aide d’une variété de tests évaluant les compétences en mathématiques et en codage, nous examinerons les performances de Sky-T1 par rapport à des concurrents tels que Qwen-2.5-32B-Instruct, QwQ et o1-preview.
- Math500 : Sky-T1-32B-Preview a obtenu un score élevé (82,4), juste derrière QwQ (85,4). Cela indique sa forte capacité à résoudre des problèmes mathématiques.
- AIME2024 : Sky-T1-32B-Preview a montré une bonne performance (43,3), bien que QwQ soit en tête dans cette métrique. Pourtant, le Sky-T1 rivalise efficacement avec les autres modèles.
- LiveCodeBench-Easy : Sky-T1 a obtenu de bons résultats (86,3), bien qu’il ait été surpassé par o1-preview (92,9) et QwQ (90,7).
- LiveCodeBench-Medium : Sky-T1 est en tête avec un score de 56,8, surpassant QwQ et o1-preview, démontrant sa force dans les tâches de codage de difficulté moyenne.
- LiveCodeBench-Hard : Même si tous les scores étaient faibles, Sky-T1 était en tête avec 17,9, démontrant sa capacité à effectuer des tâches de codage difficiles.
- GPQA-Diamond : o1-preview a dominé ce test avec 75,2, tandis que Sky-T1 a obtenu un score de 56,8, montrant de bonnes performances dans la génération de réponses de haute qualité.
Sky-T1-32B-Preview démontre des performances solides et compétitives dans divers tests, excellant particulièrement dans les tâches de codage de difficulté moyenne et difficiles et les problèmes mathématiques avancés.
Comment tester Sky-T1-32B-Preview ?
NovaSky a mis à la disposition de la communauté plusieurs moyens d’expérimenter Sky-T1 :
- Poids téléchargeables : Les développeurs peuvent accéder aux poids des modèles à partir de la page NovaSky Github. Cela permet au modèle d’être implémenté dans sa propre infrastructure.
- Environnements cloud : NovaSky a également laissé des liens vers des plateformes cloud pour tester le modèle sans avoir besoin de matériel spécialisé. Par exemple, vous pouvez essayer Sky-T1 sur HuggingFace.
- Documentation complète : La documentation comprend des exemples de code et des applications pratiques, rendant le modèle facile à utiliser même pour les utilisateurs débutants.
Ces options renforcent l’engagement de NovaSky à démocratiser l’IA et à promouvoir des pratiques ouvertes.
Le débat sur l’open source dans l’IA
La définition OSI de l’open source a suscité une controverse dans l’industrie. Bien que Sky-T1 réponde à des exigences clés, d’autres géants de la technologie, tels que Meta, ont été critiqués pour avoir qualifié leurs modèles d’« open source » malgré l’imposition de restrictions importantes.
Par exemple, les modèles Llama de Meta nécessitent des licences spéciales pour les grandes plates-formes, tandis que Stability AI limite l’utilisation commerciale de ses modèles.
Ces cas soulignent la nécessité de normes claires et applicables pour empêcher les abus du terme « open source ». L’OSI espère que la communauté de l’IA adoptera sa définition comme référence, mais il existe encore des défis juridiques et techniques qui pourraient entraver sa large application.
This post is also available in: