Alpamayo de NVIDIA est la première IA de véhicule autonome qui explique chaque décision de conduite en texte clair, en temps réel. Cet article couvre l'architecture, nos résultats de tests et ce que cela signifie pour votre organisation.

Le problème qui bloquait la conduite autonome

For more than a decade, autonomous vehicle development has relied on imitation learning: train a model on millions of hours of footage, and it learns to drive like a human. It works well in common situations. It fails in rare ones – the long tail of unpredictable scenarios that do not appear often enough in training data to be learned reliably. No amount of additional data fully solves this, because a truly novel situation has no historical example to learn from.

Le deuxième problème est l'opacité. Lorsqu'un système de véhicule autonome traditionnel prend une mauvaise décision, vous ne pouvez pas lui demander pourquoi. Pour les régulateurs, les opérateurs de flottes et les assureurs, il s'agit d'un obstacle direct à la certification et au déploiement commercial.

Ce qu'est Alpamayo – trois piliers, une architecture

Alpamayo est un portefeuille de développement open source construit autour de trois composants qui fonctionnent ensemble : le modèle d'IA Alpamayo 1, le framework de simulation AlpaSim et les jeux de données ouverts Physical AI.

Alpamayo 1 : un modèle qui explique ses décisions

Alpamayo 1 is a Vision-Language-Action (VLA) model with 10 billion parameters. It takes multi-camera sensor input (front, left, right, and rear cameras) alongside the vehicle’s recent movement history (position and rotation sampled at 10Hz over the last 1.6 seconds), and produces both a text-based reasoning trace and a physical trajectory.

La trace de raisonnement est la différence clé. Avant de générer toute sortie de mouvement, le modèle écrit pourquoi il prend sa décision. C'est la Chaîne de Causalité (CoC). Dans des scénarios de test réels, le modèle produit des sorties telles que : «Changez pour la voie de gauche afin de rester dans la voie de passage et d'éviter d'être contraint dans la voie de décélération pour tourner à droite à la prochaine intersection, tout en modérant votre vitesse pour maintenir l'écart avec le véhicule qui précède et en approchant prudemment du passage piéton balisé.» Ou, à un feu de circulation : «Arrêtez-vous à la ligne d'arrêt – le feu tout droit est rouge.”

This is not a post-hoc summary. The reasoning is generated first and directly informs the trajectory output. Because the model works from understood concepts (not memorised patterns) it can apply the same logic to situations it has never encountered before.

Pour les trajectoires de véhicules, les sorties discrètes par jetons créent des imprécisions. Alpamayo 1 utilise des modèles de diffusion à appariement de flux pour générer des trajectoires sous forme de valeurs continues – produisant ainsi une planification de mouvement fluide et physiquement réaliste.

AlpaSim et l'ensemble de données Physical AI

AlpaSim is a closed-loop simulation environment built on neural reconstruction of real-world scenes. It allows development teams to test against realistic road conditions without requiring physical test miles for every scenario. The Physical AI open dataset provides the multi-sensor real-world data that grounds both training and simulation in physical reality. Together, they significantly reduce the time between initial development and fleet-ready validation.

Découvrez nos services de développement pilotés par l'IA

Découvrez comment nous pouvons vous aider

Passer à la pratique : à quoi ressemble l'exécution d'Alpamayo

Alpamayo 1 is not a research paper. The model weights are available on Hugging Face and can be deployed today. Our team downloaded the 10B model weights (originally released at NeurIPS in December 2025) and ran the full inference pipeline on our DGX Spark, feeding it real multi-sensor inputs from the Physical AI AV dataset.

The setup involves passing a tokenised input dictionary – camera images from multiple viewpoints, attention masks, and ego-trajectory history sampled at 10Hz over the preceding 1.6 seconds – alongside a system prompt instructing the model to act as a safety-focused driving system. The model generates a Chain-of-Thought reasoning sequence first, then produces the corresponding continuous trajectory prediction.

Scénario 1 : arrêt à un feu rouge

Le véhicule se trouve à une intersection. La caméra avant montre clairement un feu rouge. Le modèle ingère quatre angles de caméra sur les 0,3 secondes les plus récentes et génère le raisonnement suivant avant de produire une quelconque trajectoire.

Sortie de chaîne de causalité – générée par Alpamayo 1 lors de notre test :

  • “Arrêtez-vous à la ligne d'arrêt car le feu de circulation tout droit est rouge.“
  • “Accélérez pour traverser l'intersection puisque le feu de circulation en ligne droite passe au vert.“

The camera grid below shows the multi-view input the model received at t=0.0s. The trajectory plot confirms the model’s predicted paths (Pred #1–4) align tightly with the ground truth future path (GT Future) – a straight stop at the line, with no lateral deviation.

Scenario 1: stopping at a red light 
BEV Ego History
Scenario 1: stopping at a red light 
camera views
Scenario 1: stopping at a red light 
BEV: Ego History + Predicted & GT Trajectories

Scénario 2 : changement de voie de nuit à une intersection

The vehicle is approaching a night-time intersection where staying straight requires an active lane change to avoid a right-turn slip lane. Visibility is low. The model generates four candidate reasoning traces (one per predicted trajectory) all converging on the same safe decision.

Sortie de chaîne de causalité – générée par Alpamayo 1 lors de notre test :

  • “Changez pour la voie de gauche afin de rester dans la voie de passage et d'éviter d'être contraint dans la voie de décélération pour tourner à droite à la prochaine intersection, tout en modérant votre vitesse pour maintenir l'écart avec le véhicule qui précède et en approchant prudemment du passage piéton balisé.“
  • “Changez de voie vers la gauche pour rester dans la voie de passage et éviter d'être contraint dans la voie de décélération pour tourner à droite, tout en maintenant une distance de sécurité avec le véhicule qui précède et la zone de passage piéton.“
  • “Changez pour la voie de gauche afin de dépasser le véhicule de tête plus lent et de maintenir une distance de sécurité plus grande par rapport au trottoir de droite après le passage piéton.“
  • “Changer de voie vers la gauche pour dépasser un véhicule plus lent devant dans la voie de droite et maintenir la fluidité en approchant de la zone de passage piéton.“

This scenario is particularly relevant for testing generalisation: the model was not trained on this specific intersection geometry, yet all four predicted trajectories correctly execute the lane change and stay clear of the pedestrian crossing. The reasoning traces are consistent across all four candidates.

Scenario 2: night-time lane change at an intersection 
BEV Ego History
Scenario 2: night-time lane change at an intersection 
Camera views
Scenario 2: night-time lane change at an intersection 
BEV: Ego History + Predicted & GT Trajectories

Scénario 3 : adaptation de la vitesse en courbe d'autoroute

The vehicle is on a winding coastal highway. The road bends ahead. This scenario tests whether the model reasons about geometry, not just reacts to visible lane markings. All four generated reasoning traces say the same thing in slightly different words.

Sortie de chaîne de causalité – générée par Alpamayo 1 lors de notre test :

  • “Adaptez la vitesse pour le virage à gauche à venir.“
  • “Adaptez votre vitesse au virage car la route tourne devant vous.“
  • “Adaptez la vitesse pour la prochaine courbe à gauche.“

What matters here is the consistency: the model identifies the same physical constraint from four independently sampled trajectories, which indicates the reasoning is grounded in actual scene understanding rather than pattern-matching on curve geometry.

Scenario 3: highway curve speed adaptation 
BEV Ego History
Scenario 3: highway curve speed adaptation 
Camera views
Scenario 3: highway curve speed adaptation 
BEV: Ego History + Predicted & GT Trajectories

Aperçu de nos tests DGX Spark : Les traces de raisonnement du modèle étaient immédiatement lisibles par des ingénieurs non spécialistes du ML. Cela importe pour les processus de revue de sécurité : vous n'avez pas besoin d'interpréter les poids du réseau de neurones pour comprendre ce que le système a décidé et pourquoi.

Une réponse directe à la question réglementaire

La sortie Chain-of-Causation résout un problème qui a bloqué la certification de niveau 4 sur la plupart des marchés : la boîte noire.

The EU AI Act, emerging NHTSA guidance in the US, and equivalent frameworks across Asia all move toward the same requirement: safety-critical AI systems must be able to explain their decisions. Alpamayo produces that explanation natively, as part of every inference pass. It is built into the architecture.

The practical implications go further than compliance. Fleet operators can use reasoning traces to identify systematic gaps in model behaviour – not through expensive post-incident reconstruction, but by reading the model’s own output at scale. Insurance companies have concrete evidence to assess risk. Passengers in robotaxi deployments can receive plain-language explanations of what the vehicle is doing and why. That last point matters for public acceptance, which remains one of the underestimated barriers to commercial deployment.

Aperçu : Les organisations qui s'appuient dès maintenant sur l'architecture d'explicabilité d'Alpamayo seront en avance lorsque les normes d'explicabilité obligatoires seront appliquées. Intégrer l'explicabilité dans un système a posteriori est techniquement complexe et coûteux.

Le paradigme Enseignant-Élève : comment cela s'adapte à la production

Un modèle de 10 milliards de paramètres s'exécute sur un GPU de centre de données. Il ne s'exécute pas dans un véhicule. C'est une contrainte connue, et Alpamayo est conçu autour de celle-ci dès le départ.

Alpamayo 1 is the Teacher: a high-capability reasoning model that runs in cloud or on-premise infrastructure. It generates high-quality, labelled reasoning traces and trajectory outputs. Those outputs become the training data for Student models – smaller, optimised versions with 0.5 to 2 billion parameters that are designed to run on production automotive compute hardware, such as the DRIVE AGX Orin or the DRIVE Thor architecture.

The economic logic is straightforward. You pay the computational cost of full reasoning capability once, at training time, using the Teacher. The Student inherits those capabilities through distillation and runs at a fraction of the cost at inference time – fast enough for real-time driving decisions. This is the bridge between a research model and an in-vehicle deployment.

NVIDIA plans to release official distillation scripts in June 2026. That release is the production gateway for the entire ecosystem. Our own roadmap is built around it: using the distillation tools to compress the 10B teacher to a 0.5B–2B student model, then transitioning off the DGX Spark and deploying onto edge devices to measure memory footprint, power consumption, and inference latency. The target is a stable real-time inference rate – the sub-second response time that reactive autonomous driving requires. The end goal is a live, closed-loop demonstration inside a physical vehicle on DRIVE AGX Orin or Thor hardware, validating that the distilled model can perceive, reason, and drive safely in real-time.

Ce que la feuille de route 2026 de NVIDIA signale à l'industrie

NVIDIA a publié un plan de lancement clair et séquencé pour 2026. Chaque jalon répond à une lacune spécifique dans le parcours du modèle au déploiement en production.

JalonVersionCe qui est livré
Mars 2026GTC San JoséScripts de réglage fin + prise en charge de la navigation et des saisies de texte
Juin 2026Alpamayo 1 SuperModèle plus grand + scripts de distillation officiels + framework RL en boucle fermée open source
Décembre 2026Alpamayo 1 UltraModèle de fondation universel pour véhicules autonomes à grande échelle

The March 2026 release at GTC San José delivers fine-tuning tooling and expanded prompt support. This signals that the base model is stable enough for organisations to begin adapting it to their own data. The June release is more significant: distillation scripts and a closed-loop reinforcement learning framework address what NVIDIA calls “embodiment misalignment” – the gap between a model that generates correct reasoning and one that executes correct actions. The fact that this is a dedicated June release indicates it remains the hardest open problem. The December Alpamayo Ultra release frames the end state: a universal foundation model for autonomous vehicles, analogous to what a large language model is for text.

Alpamayo roadmap

For decision-makers, the roadmap creates a specific action window. The six months between March and June 2026 are the optimal period to build fine-tuning capability and data pipelines on the base model, before the distillation tools ship and the production race begins in earnest.

Trois questions avant votre prochain investissement en véhicules autonomes

Alpamayo does not make autonomous vehicle development easy. It changes which problems are hard. Organisations that understand this distinction will allocate resources more effectively. Here is a three-question framework for evaluating your current position:

Question stratégiqueTest opérationnelCe que cela signifie
Votre pile de conduite autonome explique-t-elle ses décisions ?Votre équipe peut-elle auditer ce que le système a fait (et pourquoi) après coup ?Les journaux de chaîne de causalité seront exigés pour l'approbation réglementaire sur la plupart des marchés. Prévoyez-le dès maintenant.
Votre matériel en périphérie peut-il exécuter l'inférence en temps réel ?Quel est votre budget de latence et pouvez-vous le respecter sans calcul cloud dans la boucle ?Prévoyez des modèles distillés (0,5B–2B paramètres). N'architecturez pas autour du modèle enseignant de 10B.
Construisez-vous à partir de zéro ou intégrez-vous ?Disposez-vous de suffisamment de données pour affiner le modèle, ou devriez-vous utiliser l'écosystème ouvert ?Les jeux de données d'IA physique de NVIDIA abaissent considérablement la barrière. Utilisez-les avant de construire des pipelines propriétaires.

Quatre actions à entreprendre dès maintenant :

1. Évaluez votre écart d'explicabilité

Examinez votre pile AV pour sa capacité à produire des journaux de décision lisibles. Si ce n'est pas le cas, déterminez si l'explicabilité peut être ajoutée en tant que couche ou nécessite des modifications architecturales. Cette réponse détermine votre parcours d'intégration.

2. Commencez à développer sur l'écosystème ouvert avant la sortie des outils de juin

Les jeux de données de Physical AI et les poids du modèle Alpamayo 1 sont disponibles dès aujourd'hui. Commencez dès maintenant à construire des pipelines de données et des workflows d'évaluation – l'avantage d'un démarrage plus précoce se cumule rapidement en machine learning.

3. Concevoir dès le départ pour le matériel embarqué

Le modèle à 10 milliards de paramètres est un outil d'entraînement, et non une cible de déploiement. Définissez votre plateforme cible, vos contraintes de mémoire et vos exigences de latence avant de commencer les travaux de personnalisation – et non après.

4. Impliquez les autorités de régulation de manière proactive

Alpamayo’s reasoning traces give you a readable, auditable log of model decisions. Use this to start conversations with regulatory bodies now. Organisations that help shape explainability standards will be better positioned than those that wait to comply.

Utilisez l'IA dans les processus automobiles pour réduire le time-to-market jusqu'à 45 %

Obtenir l'ebook

Conclusion

Le passage de la reconnaissance de motifs au raisonnement explicite répond à deux problèmes structurels au niveau de l'architecture : la longue traîne des cas limites et l'opacité de la boîte noire qui bloque la certification.

NVIDIA’s team has demonstrated it – and we have verified it ourselves – in closed-loop simulation on real-world scenarios (stopping at red lights, navigating night-time intersections, handling highway curves) producing reasoning traces that are coherent, auditable, and directly tied to physical trajectory outputs. The open-source release means the ecosystem can move now, not after a proprietary licensing negotiation.

The window for strategic positioning is specific and finite. The fine-tuning release in March 2026, the distillation framework in June, and the Alpamayo Ultra foundation model in December define a development arc that will look, in hindsight, like the 18 months when the production landscape for autonomous vehicles was decided.

La couche de raisonnement est arrivée. La question est : votre organisation est-elle prête à s'appuyer sur elle ?

C'est là que Spyrosoft comes in, helping automotive and mobility organisations integrate NVIDIA’s AI stack. Our engineers have hands-on experience with Alpamayo on DGX Spark hardware and can help you assess your readiness, define your strategy, and get to a working prototype faster. Fill out the form below to learn more.