Public Cloud > AI Platform > AI Models

AI Models

Cosa è AI Models

AI Models è un servizio di inferenza AI che consente di integrare modelli di Intelligenza Artificiale in applicazioni, prodotti digitali e workflow tramite API, senza dover gestire l'infrastruttura sottostante.
 
Il servizio è erogato su AI Platform e consente di utilizzare modelli AI per generazione di testo, reasoning, embedding, analisi multimodale, supporto al coding, moderazione dei contenuti e, dove previsto, generazione e modifica di immagini.
 
I modelli sono eseguiti sull'infrastruttura Aruba. Aruba gestisce infrastruttura, disponibilità dei modelli e scalabilità, mentre l'integrazione applicativa e il caso d'uso restano a carico del cliente.

Caratteristiche di AI Models

AI Models mette a disposizione:
  • modelli Open Weight eseguiti sull'infrastruttura Aruba;
  • API REST compatibili con gli standard di mercato per completions, chat completions, embeddings e responses;
  • capability, in base al modello, come streaming, function calling, reasoning e multimodale;
  • formati, in base al modello, come raw text, JSON object, JSON schema, output strutturati, embedding e immagini PNG/JPEG;
  • metriche tecniche di utilizzo per monitoraggio, sicurezza, fatturazione e analisi delle performance.
L'output generato dal modello viene restituito senza alterazioni da parte della piattaforma.

Categorie di modelli disponibili

I modelli disponibili sono organizzati nelle seguenti categorie:
  • LLM Light: generazione di testo e risposte rapide per chatbot, assistenti interni e automazioni leggere;
  • LLM Reasoning: reasoning e analisi complesse per agenti autonomi, supporto decisionale e task multi-step;
  • LMM Multimodali: comprensione di testo e immagini per OCR, document understanding e analisi visiva;
  • Embedding: rappresentazioni vettoriali per ricerca semantica, RAG e knowledge base;
  • Coding: generazione e revisione del codice;
  • Image Generation / Editing: generazione e modifica di immagini da prompt;
  • Guard / Safety: moderazione dei contenuti e classificazione di sicurezza su input e output.

Modelli disponibili

Categoria Modello Licenza
LLM Light gpt-oss-20b Apache 2.0
Llama-3.1-8B-Instruct Llama 3.1
Mistral-Nemo-Instruct-2407 Apache 2.0
LLM Reasoning gpt-oss-120b Apache 2.0
DeepSeek-R1-Distill-Qwen-32B MIT
LMM Multimodali Qwen2.5-VL-7B Apache 2.0
Gemma-4-31B-IT Apache 2.0
Mistral-Small-3.2-24B Apache 2.0
Qwen3.5-122B-A10B Apache 2.0
Embedding multilingual-e5-large MIT
BAAI/bge-m3 MIT
Coding Qwen3-Coder-30B Apache 2.0
Qwen3-Coder-Next Apache 2.0
Image Generation / Editing qwen-image-2512 Apache 2.0
qwen-image-edit-2511 Apache 2.0
Guard / Safety Qwen3Guard-Gen-8B Apache 2.0

Il catalogo disponibile è indicato nell'offerta e nella documentazione del servizio.

Sicurezza e trattamento dei dati

I modelli Open Weight sono eseguiti sull'infrastruttura Aruba. I dati e le elaborazioni restano nel perimetro Aruba, senza transitare verso i produttori dei modelli o infrastrutture esterne.
 
I contenuti, come testo, prompt e output, sono trattati da AI Platform per il tempo necessario all'elaborazione della richiesta e non sono conservati all'interno del servizio. Gli output sono trasmessi alla componente applicativa collegata al servizio.
 
I dati inviati o elaborati dal servizio non vengono utilizzati per addestrare i modelli AI.
 
I dati tecnici di utilizzo, come numero di token, chiamate API, endpoint invocati e metriche di performance, sono trattati per la misurazione dei consumi e la fatturazione e non includono contenuti, prompt o output. Per le statistiche e il monitoraggio delle prestazioni sono utilizzati dati aggregati e anonimizzati.

Modalità di fatturazione

AI Models è un servizio a consumo. La modalità di fatturazione varia in base alla tipologia di modello:
  • per i modelli basati su token, il prezzo è distinto per milione di token in input e in output;
  • per i modelli di embedding è previsto il costo dei soli token in input;
  • per i modelli di image generation/editing il prezzo è calcolato per singola immagine generata o modificata.

Ciclo di vita dei modelli

Ogni modello disponibile a catalogo può avere uno dei seguenti stati:
  • Attivo: il modello è disponibile e aggiornato;
  • In dismissione: il ritiro del modello è stato annunciato, ma il modello è ancora utilizzabile;
  • Ritirato: il modello non è più disponibile.
Il passaggio allo stato In dismissione e il successivo ritiro sono comunicati con almeno 60 giorni di preavviso.
 
Negli stati Attivo e In dismissione le chiamate API al modello continuano a essere gestite normalmente. Dopo il ritiro, la chiamata restituisce un errore che segnala l'indisponibilità del modello.
 
Versione e data di rilascio indicate per ciascun modello sono immutabili.

SLA e rate limit

Availability (uptime annuale) 99,8%
Rate limit 400 richieste/minuto per applicazione e/o istanza

Il superamento del rate limit può comportare throttling. Eventuali limiti specifici per modello, utente o IP sono indicati nella documentazione tecnica.