Applicazioni → Ollama
Modelli AI privati, sul tuo server.
Ollama esegue modelli di linguaggio open-source di grandi dimensioni localmente sul tuo server ReefOffice. Nessun dato lascia mai il tuo server per essere elaborato da un provider AI esterno — chat privata, Q&A su documenti e attività AI autonome, tutto locale.
Cosa fa Ollama
Ollama gestisce il calcolo AI — scarica, carica ed esegue modelli di linguaggio open-source (LLaMA, Mistral, Qwen, Phi, Gemma e centinaia altri) direttamente sul tuo server. Alimenta la chat privata attraverso Open WebUI, le attività AI autonome attraverso Hermes Agent e le Q&A sui documenti nei piani Private AI.
Perché Ollama su ReefOffice
1 Esecuzione locale di modelli AI
Ollama esegue centinaia di modelli open-source sulla CPU o GPU del tuo server — LLaMA, Mistral, Qwen, Gemma, Phi, DeepSeek e altri. I modelli vengono scaricati, memorizzati nella cache ed eseguiti localmente. Nessuna chiamata API a provider esterni, nessun dato che lascia la tua infrastruttura.
2 Chat privata e Q&A su documenti
Open WebUI fornisce un'interfaccia stile ChatGPT alimentata da Ollama. Fai domande sui tuoi documenti, ottieni risposte con riferimenti alle fonti e chatta privatamente — tutto senza inviare dati a OpenAI o Anthropic.
3 Risposte AI private
Nei piani Private AI, Ollama genera risposte dal tuo corpus documentale. Chiedi "quali fatture non sono state pagate?" o "riassumi l'ultimo contratto" — la risposta viene generata sul tuo server dai tuoi documenti indicizzati, con riferimenti alle fonti.
4 Flessibilità dei modelli
Scegli il modello che si adatta al tuo caso d'uso. Esegui un modello piccolo e veloce per la chat quotidiana, un modello multilingue per le Q&A sui documenti, o un modello più grande per il ragionamento complesso. Passa da un modello all'altro con un singolo comando.
5 Pronto per accelerazione GPU
I piani Private AI includono capacità GPU dedicata sull'infrastruttura ReefOffice in Germania. Per configurazioni solo locali, Ollama utilizza la CPU con inferenza ottimizzata — più lenta ma completamente privata. Chiavi modello esterne opzionali possono integrare la capacità locale.
6 Connesso all'intero stack
Ollama si connette a Open WebUI per la chat e Hermes Agent per le attività autonome, ed è accessibile tramite API per integrazioni personalizzate. Funge da servizio nativo NixOS — sempre disponibile, nessun overhead del container.
Dettagli tecnici
Come funziona
Ollama wrappa llama.cpp per inferenza locale efficiente con supporto per accelerazione GPU, modelli quantizzati (formato GGUF) e cache prompt. Su ReefOffice funge da servizio nativo NixOS. I modelli vengono scaricati dalla libreria Ollama, memorizzati localmente e serviti tramite una API locale a cui si connettono Open WebUI e Hermes.
Come si integra con il tuo stack
Ollama alimenta Open WebUI per la chat privata stile ChatGPT e Hermes Agent per le attività AI autonome. È inoltre accessibile tramite la sua API locale per integrazioni personalizzate. Il servizio è interno e protetto da API — mai esposto direttamente a Internet.
Domande frequenti
L'AI locale sarà abbastanza veloce per l'uso quotidiano? +
Per la ricerca e indicizzazione di documenti, sì — la generazione di embedding con bge-m3 funziona efficientemente sulla CPU e si completa in pochi secondi per volumi documentali tipici. Per chat e risposte AI, le prestazioni dipendono dalla dimensione del modello e dall'hardware. I modelli piccoli (3-8 miliardi di parametri) danno risposte reattive su CPU moderna. Per modelli più grandi o generazione più veloce, i piani Private AI includono capacità GPU sull'infrastruttura ReefOffice.
Quanto spazio di archiviazione usano i modelli AI? +
I modelli variano da 1,5 GB (piccoli quantizzati) a 40+ GB (modelli 70B a precisione piena). ReefOffice pre-installa i modelli raccomandati per il tuo piano (tipicamente bge-m3 per embedding e Qwen 2.5 7B per generazione). Modelli aggiuntivi vengono scaricati su richiesta e memorizzati nella cache. Lo spazio per gli embedding vettoriali dipende dal volume documentale — circa 1 GB per 100.000 pagine.
Posso usare un provider AI esterno invece dei modelli locali? +
Sì. Nei piani senza GPU locale, puoi connettere una chiave provider AI esterna (OpenAI, Anthropic, Mistral AI o qualsiasi API compatibile con OpenAI). Open WebUI e Hermes utilizzeranno l'API esterna per la generazione mantenendo i tuoi dati privati.
Pronto per un AI privato?
Prenota una demo e scopri come Ollama su ReefOffice ti dà capacità AI private — chat, Q&A su documenti ed esecuzione modelli locali — tutto sul tuo stesso server.
Prenota una demo