AI Models
Cosa è AI Models
AI Models è un servizio di inferenza AI che consente di integrare modelli di Intelligenza Artificiale in applicazioni, prodotti digitali e workflow tramite API, senza dover gestire l'infrastruttura sottostante.
Il servizio è erogato su AI Platform e consente di utilizzare modelli AI per generazione di testo, reasoning, embedding, analisi multimodale, supporto al coding, moderazione dei contenuti e, dove previsto, generazione e modifica di immagini.
I modelli sono eseguiti sull'infrastruttura Aruba. Aruba gestisce infrastruttura, disponibilità dei modelli e scalabilità, mentre l'integrazione applicativa e il caso d'uso restano a carico del cliente.
Caratteristiche di AI Models
AI Models mette a disposizione:
- modelli Open Weight eseguiti sull'infrastruttura Aruba;
- API REST compatibili con gli standard di mercato per completions, chat completions, embeddings e responses;
- capability, in base al modello, come streaming, function calling, reasoning e multimodale;
- formati, in base al modello, come raw text, JSON object, JSON schema, output strutturati, embedding e immagini PNG/JPEG;
- metriche tecniche di utilizzo per monitoraggio, sicurezza, fatturazione e analisi delle performance.
L'output generato dal modello viene restituito senza alterazioni da parte della piattaforma.
Categorie di modelli disponibili
I modelli disponibili sono organizzati nelle seguenti categorie:
- LLM Light: generazione di testo e risposte rapide per chatbot, assistenti interni e automazioni leggere;
- LLM Reasoning: reasoning e analisi complesse per agenti autonomi, supporto decisionale e task multi-step;
- LMM Multimodali: comprensione di testo e immagini per OCR, document understanding e analisi visiva;
- Embedding: rappresentazioni vettoriali per ricerca semantica, RAG e knowledge base;
- Coding: generazione e revisione del codice;
- Image Generation / Editing: generazione e modifica di immagini da prompt;
- Guard / Safety: moderazione dei contenuti e classificazione di sicurezza su input e output.
Modelli disponibili
| Categoria |
Modello |
Licenza |
| LLM Light |
gpt-oss-20b |
Apache 2.0 |
| Llama-3.1-8B-Instruct |
Llama 3.1 |
| Mistral-Nemo-Instruct-2407 |
Apache 2.0 |
| LLM Reasoning |
gpt-oss-120b |
Apache 2.0 |
| DeepSeek-R1-Distill-Qwen-32B |
MIT |
| LMM Multimodali |
Qwen2.5-VL-7B |
Apache 2.0 |
| Gemma-4-31B-IT |
Apache 2.0 |
| Mistral-Small-3.2-24B |
Apache 2.0 |
| Qwen3.5-122B-A10B |
Apache 2.0 |
| Embedding |
multilingual-e5-large |
MIT |
| BAAI/bge-m3 |
MIT |
| Coding |
Qwen3-Coder-30B |
Apache 2.0 |
| Qwen3-Coder-Next |
Apache 2.0 |
| Image Generation / Editing |
qwen-image-2512 |
Apache 2.0 |
| qwen-image-edit-2511 |
Apache 2.0 |
| Guard / Safety |
Qwen3Guard-Gen-8B |
Apache 2.0 |
Il catalogo disponibile è indicato nell'offerta e nella documentazione del servizio.
Sicurezza e trattamento dei dati
I modelli Open Weight sono eseguiti sull'infrastruttura Aruba. I dati e le elaborazioni restano nel perimetro Aruba, senza transitare verso i produttori dei modelli o infrastrutture esterne.
I contenuti, come testo, prompt e output, sono trattati da AI Platform per il tempo necessario all'elaborazione della richiesta e non sono conservati all'interno del servizio. Gli output sono trasmessi alla componente applicativa collegata al servizio.
I dati inviati o elaborati dal servizio non vengono utilizzati per addestrare i modelli AI.
I dati tecnici di utilizzo, come numero di token, chiamate API, endpoint invocati e metriche di performance, sono trattati per la misurazione dei consumi e la fatturazione e non includono contenuti, prompt o output. Per le statistiche e il monitoraggio delle prestazioni sono utilizzati dati aggregati e anonimizzati.
Modalità di fatturazione
AI Models è un servizio a consumo. La modalità di fatturazione varia in base alla tipologia di modello:
- per i modelli basati su token, il prezzo è distinto per milione di token in input e in output;
- per i modelli di embedding è previsto il costo dei soli token in input;
- per i modelli di image generation/editing il prezzo è calcolato per singola immagine generata o modificata.
Ciclo di vita dei modelli
Ogni modello disponibile a catalogo può avere uno dei seguenti stati:
- Attivo: il modello è disponibile e aggiornato;
- In dismissione: il ritiro del modello è stato annunciato, ma il modello è ancora utilizzabile;
- Ritirato: il modello non è più disponibile.
Il passaggio allo stato
In dismissione e il successivo ritiro sono comunicati con almeno 60 giorni di preavviso.
Negli stati
Attivo e
In dismissione le chiamate API al modello continuano a essere gestite normalmente. Dopo il ritiro, la chiamata restituisce un errore che segnala l'indisponibilità del modello.
Versione e data di rilascio indicate per ciascun modello sono immutabili.
SLA e rate limit
| Availability (uptime annuale) |
99,8% |
| Rate limit |
400 richieste/minuto per applicazione e/o istanza |
Il superamento del rate limit può comportare throttling. Eventuali limiti specifici per modello, utente o IP sono indicati nella documentazione tecnica.