NVIDIA presenta TensorRT Model Connect: da Hugging Face a inferenza in C++ in due comandi
NVIDIA lancia TensorRT Model Connect, un progetto open source che converte modelli Hugging Face in inferenza nativa in C++ in due comandi.

NVIDIA ha reso disponibile in anteprima pubblica TensorRT Model Connect (TRTMC), un progetto open source che permette di convertire un checkpoint Hugging Face o locale in inferenza end-to-end con TensorRT in due comandi. L’annuncio, pubblicato il 18 agosto 2026, segna un passo avanti nella semplificazione e nell’ottimizzazione delle operazioni di inferenza, riducendo l’intermediate step di esportazione in ONNX. Il progetto, Apache-2.0 licenziato, è stato sviluppato utilizzando agenti OpenAI Codex sotto la supervisione umana e offre una soluzione per team che già possiedono una stack di inferenza.
da Python a C++ senza intermediari
TRTMC permette di eseguire l’inferenza in C++ senza dipendere da PyTorch, grazie a un file .bundle versionato che funge da ponte tra il processo di costruzione in Python e il runtime in C++. Questo approccio elimina la necessità di passaggi intermedi, come l’esportazione in ONNX, e consente l’integrazione diretta in applicazioni C++, sistemi embedded o stack robotici. L’output finale è un artefatto auditable, con informazioni dettagliate sul tipo di bundle, famiglia del modello, precisione e identità del runtime.
Il progetto elimina i passaggi di conversione e validazione distribuita, migliorando l’efficienza e la coerenza.
Il progetto è attualmente disponibile solo per Linux aarch64, con supporto per Python 3.10 o 3.12 e glibc 2.39 o superiore. Gli utenti x86_64 devono utilizzare il Docker per la compilazione da sorgente. NVIDIA ha anche sottolineato che il progetto è stato costruito utilizzando agenti Codex di OpenAI, sotto la supervisione umana, garantendo una qualità e una conformità elevate. La popolarità del progetto è testimoniata da oltre 2 milioni di visualizzazioni mensili.
applicazioni e settori target
TRTMC è particolarmente adatto a settori in cui l’inferenza deve essere integrata in un ambiente C++ senza dipendenze Python, come robotica, sistemi di controllo industriale, dispositivi medici e applicazioni di elaborazione multimediale. L’uso di API specifiche, come generate(), transcribe() e solve(), semplifica l’integrazione e riduce la complessità delle conversioni. Il progetto è stato testato su 105 profili di 76 famiglie, con 102 di essi superando il riferimento dichiarato del 5% o più. Il progetto si rivolge principalmente a team che già possiedono una stack di inferenza, come startup NVIDIA, aziende di robotica e dispositivi, e team di piattaforma o inferenza all’interno di aziende di medie e grandi dimensioni. I team piccoli che utilizzano servizi Python potrebbero trovare il progetto meno adatto, mentre le aziende regolamentate dovrebbero attendere una versione taggata prima di standardizzare l’uso. L’implementazione di TRTMC rappresenta un’evoluzione significativa nel campo dell’AI, semplificando l’integrazione e migliorando l’efficienza delle operazioni di inferenza.
TRTMC elimina i problemi di esportazione, integrazione ripetuta e validazione distribuita, offrendo una soluzione più coerente e diretta.
Il progetto è disponibile sul GitHub e offre un’alternativa alle tradizionali rotte come PyTorch → ONNX → TensorRT → integrazione C++. TRTMC elimina i problemi di esportazione, integrazione ripetuta e validazione distribuita, offrendo una soluzione più coerente e diretta. Con l’anteprima pubblica, NVIDIA si posiziona come leader nel settore dell’AI, offrendo strumenti open source che semplificano e ottimizzano le operazioni di inferenza in ambienti C++. La sua adozione potrebbe segnare un cambiamento significativo nel modo in cui i modelli di linguaggio vengono integrati e utilizzati in applicazioni reali.
