Vai al contenuto

Applicazioni → Ollama

Modelli AI privati, sul tuo server.

Ollama esegue modelli di linguaggio open-source di grandi dimensioni localmente sul tuo server ReefOffice. Nessun dato lascia mai il tuo server per essere elaborato da un provider AI esterno — chat privata, Q&A su documenti e attività AI autonome, tutto locale.

Cosa fa Ollama

Ollama gestisce il calcolo AI — scarica, carica ed esegue modelli di linguaggio open-source (LLaMA, Mistral, Qwen, Phi, Gemma e centinaia altri) direttamente sul tuo server. Alimenta la chat privata attraverso Open WebUI, le attività AI autonome attraverso Hermes Agent e le Q&A sui documenti nei piani Private AI.

Perché Ollama su ReefOffice

1

Esecuzione locale di modelli AI

Ollama esegue centinaia di modelli open-source sulla CPU o GPU del tuo server — LLaMA, Mistral, Qwen, Gemma, Phi, DeepSeek e altri. I modelli vengono scaricati, memorizzati nella cache ed eseguiti localmente. Nessuna chiamata API a provider esterni, nessun dato che lascia la tua infrastruttura.

2

Chat privata e Q&A su documenti

Open WebUI fornisce un'interfaccia stile ChatGPT alimentata da Ollama. Fai domande sui tuoi documenti, ottieni risposte con riferimenti alle fonti e chatta privatamente — tutto senza inviare dati a OpenAI o Anthropic.

3

Risposte AI private

Nei piani Private AI, Ollama genera risposte dal tuo corpus documentale. Chiedi "quali fatture non sono state pagate?" o "riassumi l'ultimo contratto" — la risposta viene generata sul tuo server dai tuoi documenti indicizzati, con riferimenti alle fonti.

4

Flessibilità dei modelli

Scegli il modello che si adatta al tuo caso d'uso. Esegui un modello piccolo e veloce per la chat quotidiana, un modello multilingue per le Q&A sui documenti, o un modello più grande per il ragionamento complesso. Passa da un modello all'altro con un singolo comando.

5

Pronto per accelerazione GPU

I piani Private AI includono capacità GPU dedicata sull'infrastruttura ReefOffice in Germania. Per configurazioni solo locali, Ollama utilizza la CPU con inferenza ottimizzata — più lenta ma completamente privata. Chiavi modello esterne opzionali possono integrare la capacità locale.

6

Connesso all'intero stack

Ollama si connette a Open WebUI per la chat e Hermes Agent per le attività autonome, ed è accessibile tramite API per integrazioni personalizzate. Funge da servizio nativo NixOS — sempre disponibile, nessun overhead del container.

Dettagli tecnici

Come funziona

Ollama wrappa llama.cpp per inferenza locale efficiente con supporto per accelerazione GPU, modelli quantizzati (formato GGUF) e cache prompt. Su ReefOffice funge da servizio nativo NixOS. I modelli vengono scaricati dalla libreria Ollama, memorizzati localmente e serviti tramite una API locale a cui si connettono Open WebUI e Hermes.

Come si integra con il tuo stack

Ollama alimenta Open WebUI per la chat privata stile ChatGPT e Hermes Agent per le attività AI autonome. È inoltre accessibile tramite la sua API locale per integrazioni personalizzate. Il servizio è interno e protetto da API — mai esposto direttamente a Internet.

Domande frequenti

L'AI locale sarà abbastanza veloce per l'uso quotidiano? +

Per la ricerca e indicizzazione di documenti, sì — la generazione di embedding con bge-m3 funziona efficientemente sulla CPU e si completa in pochi secondi per volumi documentali tipici. Per chat e risposte AI, le prestazioni dipendono dalla dimensione del modello e dall'hardware. I modelli piccoli (3-8 miliardi di parametri) danno risposte reattive su CPU moderna. Per modelli più grandi o generazione più veloce, i piani Private AI includono capacità GPU sull'infrastruttura ReefOffice.

Quanto spazio di archiviazione usano i modelli AI? +

I modelli variano da 1,5 GB (piccoli quantizzati) a 40+ GB (modelli 70B a precisione piena). ReefOffice pre-installa i modelli raccomandati per il tuo piano (tipicamente bge-m3 per embedding e Qwen 2.5 7B per generazione). Modelli aggiuntivi vengono scaricati su richiesta e memorizzati nella cache. Lo spazio per gli embedding vettoriali dipende dal volume documentale — circa 1 GB per 100.000 pagine.

Posso usare un provider AI esterno invece dei modelli locali? +

Sì. Nei piani senza GPU locale, puoi connettere una chiave provider AI esterna (OpenAI, Anthropic, Mistral AI o qualsiasi API compatibile con OpenAI). Open WebUI e Hermes utilizzeranno l'API esterna per la generazione mantenendo i tuoi dati privati.

Pronto per un AI privato?

Prenota una demo e scopri come Ollama su ReefOffice ti dà capacità AI private — chat, Q&A su documenti ed esecuzione modelli locali — tutto sul tuo stesso server.

Prenota una demo