Aplicações → Ollama
Modelos IA privados, no seu próprio servidor.
O Ollama executa modelos de linguagem de grande escala de código aberto localmente no seu servidor ReefOffice. Nenhum dado sai do seu servidor para ser processado por um fornecedor IA externo — chat privado, perguntas sobre documentos e tarefas IA autónomas, tudo local.
O que o Ollama faz
O Ollama trata da computação IA — descarrega, carrega e executa modelos de linguagem de código aberto (LLaMA, Mistral, Qwen, Phi, Gemma e centenas mais) diretamente no seu servidor. Alimenta chat privado através do Open WebUI, tarefas IA autónomas através do Agente Hermes e perguntas sobre documentos nos planos Private AI.
Porquê o Ollama no ReefOffice
1 Execução local de modelos IA
O Ollama executa centenas de modelos de código aberto na CPU ou GPU do seu servidor — LLaMA, Mistral, Qwen, Gemma, Phi, DeepSeek e mais. Os modelos são descarregados, cacheados e executados localmente. Sem chamadas API a fornecedores externos, sem dados a saírem da sua infraestrutura.
2 Chat privado e perguntas sobre documentos
O Open WebUI oferece uma interface ao estilo do ChatGPT alimentada pelo Ollama. Faça perguntas sobre os seus documentos, obtenha respostas com referências às fontes e converse privadamente — tudo sem enviar dados para a OpenAI ou Anthropic.
3 Respostas IA privadas
Nos planos Private AI, o Ollama gera respostas a partir do seu corpus de documentos. Pergunte "quais faturas estão por pagar?" ou "resuma o contrato mais recente" — a resposta é gerada no seu servidor a partir dos seus documentos indexados, com referências às fontes.
4 Flexibilidade de modelos
Escolha o modelo que se adequa ao seu caso de uso. Execute um modelo pequeno e rápido para chat quotidiano, um modelo multilingue para perguntas sobre documentos, ou um modelo maior para raciocínio complexo. Alterne entre modelos com um único comando.
5 Pronto para aceleração GPU
Os planos Private AI incluem capacidade GPU dedicada na infraestrutura ReefOffice na Alemanha. Para configurações apenas locais, o Ollama usa CPU com inferência optimizada — mais lento mas totalmente privado. Chaves de modelos externos opcionais podem complementar a capacidade local.
6 Ligado à stack completa
O Ollama liga-se ao Open WebUI para chat, ao Agente Hermes para tarefas autónomas, e pode ser acedido via API para integrações personalizadas. Executa como um serviço nativo NixOS — sempre disponível, sem sobrecarga de contentor.
Detalhe técnico
Como funciona
O Ollama encapsula o llama.cpp para inferência local eficiente com suporte para aceleração GPU, modelos quantizados (formato GGUF) e cache de prompts. No ReefOffice executa como um serviço nativo NixOS. Os modelos são descarregados da biblioteca Ollama, cacheados localmente e servidos via uma API local a que o Open WebUI e o Hermes se ligam.
Como se integra na sua stack
O Ollama alimenta o Open WebUI para chat privado ao estilo do ChatGPT e o Agente Hermes para tarefas IA autónomas. Também pode ser acedido via API local para integrações personalizadas. O serviço é interno e protegido por API — nunca exposto diretamente à internet.
Questões frequentes
A IA local será rápida o suficiente para uso diário? +
Para pesquisa e indexação de documentos, sim — a geração de embeddings com bge-m3 executa eficientemente na CPU e completa dentro de segundos para volumes típicos de documentos. Para chat e respostas IA, o desempenho depende do tamanho do modelo e do hardware. Modelos pequenos (3-8B parâmetros) oferecem respostas responsivas em CPU moderno. Para modelos maiores ou geração mais rápida, os planos Private AI incluem capacidade GPU na infraestrutura ReefOffice.
Quanto armazenamento os modelos IA utilizam? +
Os modelos variam de 1,5 GB (pequeno quantizado) a 40+ GB (modelos 70B de precisão total). O ReefOffice pré-instala os modelos recomendados para o seu plano (tipicamente bge-m3 para embeddings e Qwen 2.5 7B para geração). Modelos adicionais são descarregados a pedido e cacheados. O armazenamento para embeddings vetoriais depende do volume de documentos — aproximadamente 1 GB por 100.000 páginas.
Posso usar um fornecedor IA externo em vez de modelos locais? +
Sim. Nos planos sem GPU local, pode ligar uma chave de fornecedor IA externo (OpenAI, Anthropic, Mistral AI ou qualquer API compatível com OpenAI). O Open WebUI e o Hermes usarão a API externa para geração enquanto mantêm os seus dados privados.
Pronto para IA privada?
Agende uma demonstração e veja como o Ollama no ReefOffice lhe dá capacidades IA privadas — chat, perguntas sobre documentos e execução de modelos locais — tudo no seu próprio servidor.
Agendar uma demonstração