Saltar para o conteúdo

Aplicações → Ollama

Modelos IA privados, no seu próprio servidor.

O Ollama executa modelos de linguagem de grande escala de código aberto localmente no seu servidor ReefOffice. Nenhum dado sai do seu servidor para ser processado por um fornecedor IA externo — chat privado, perguntas sobre documentos e tarefas IA autónomas, tudo local.

O que o Ollama faz

O Ollama trata da computação IA — descarrega, carrega e executa modelos de linguagem de código aberto (LLaMA, Mistral, Qwen, Phi, Gemma e centenas mais) diretamente no seu servidor. Alimenta chat privado através do Open WebUI, tarefas IA autónomas através do Agente Hermes e perguntas sobre documentos nos planos Private AI.

Porquê o Ollama no ReefOffice

1

Execução local de modelos IA

O Ollama executa centenas de modelos de código aberto na CPU ou GPU do seu servidor — LLaMA, Mistral, Qwen, Gemma, Phi, DeepSeek e mais. Os modelos são descarregados, cacheados e executados localmente. Sem chamadas API a fornecedores externos, sem dados a saírem da sua infraestrutura.

2

Chat privado e perguntas sobre documentos

O Open WebUI oferece uma interface ao estilo do ChatGPT alimentada pelo Ollama. Faça perguntas sobre os seus documentos, obtenha respostas com referências às fontes e converse privadamente — tudo sem enviar dados para a OpenAI ou Anthropic.

3

Respostas IA privadas

Nos planos Private AI, o Ollama gera respostas a partir do seu corpus de documentos. Pergunte "quais faturas estão por pagar?" ou "resuma o contrato mais recente" — a resposta é gerada no seu servidor a partir dos seus documentos indexados, com referências às fontes.

4

Flexibilidade de modelos

Escolha o modelo que se adequa ao seu caso de uso. Execute um modelo pequeno e rápido para chat quotidiano, um modelo multilingue para perguntas sobre documentos, ou um modelo maior para raciocínio complexo. Alterne entre modelos com um único comando.

5

Pronto para aceleração GPU

Os planos Private AI incluem capacidade GPU dedicada na infraestrutura ReefOffice na Alemanha. Para configurações apenas locais, o Ollama usa CPU com inferência optimizada — mais lento mas totalmente privado. Chaves de modelos externos opcionais podem complementar a capacidade local.

6

Ligado à stack completa

O Ollama liga-se ao Open WebUI para chat, ao Agente Hermes para tarefas autónomas, e pode ser acedido via API para integrações personalizadas. Executa como um serviço nativo NixOS — sempre disponível, sem sobrecarga de contentor.

Detalhe técnico

Como funciona

O Ollama encapsula o llama.cpp para inferência local eficiente com suporte para aceleração GPU, modelos quantizados (formato GGUF) e cache de prompts. No ReefOffice executa como um serviço nativo NixOS. Os modelos são descarregados da biblioteca Ollama, cacheados localmente e servidos via uma API local a que o Open WebUI e o Hermes se ligam.

Como se integra na sua stack

O Ollama alimenta o Open WebUI para chat privado ao estilo do ChatGPT e o Agente Hermes para tarefas IA autónomas. Também pode ser acedido via API local para integrações personalizadas. O serviço é interno e protegido por API — nunca exposto diretamente à internet.

Questões frequentes

A IA local será rápida o suficiente para uso diário? +

Para pesquisa e indexação de documentos, sim — a geração de embeddings com bge-m3 executa eficientemente na CPU e completa dentro de segundos para volumes típicos de documentos. Para chat e respostas IA, o desempenho depende do tamanho do modelo e do hardware. Modelos pequenos (3-8B parâmetros) oferecem respostas responsivas em CPU moderno. Para modelos maiores ou geração mais rápida, os planos Private AI incluem capacidade GPU na infraestrutura ReefOffice.

Quanto armazenamento os modelos IA utilizam? +

Os modelos variam de 1,5 GB (pequeno quantizado) a 40+ GB (modelos 70B de precisão total). O ReefOffice pré-instala os modelos recomendados para o seu plano (tipicamente bge-m3 para embeddings e Qwen 2.5 7B para geração). Modelos adicionais são descarregados a pedido e cacheados. O armazenamento para embeddings vetoriais depende do volume de documentos — aproximadamente 1 GB por 100.000 páginas.

Posso usar um fornecedor IA externo em vez de modelos locais? +

Sim. Nos planos sem GPU local, pode ligar uma chave de fornecedor IA externo (OpenAI, Anthropic, Mistral AI ou qualquer API compatível com OpenAI). O Open WebUI e o Hermes usarão a API externa para geração enquanto mantêm os seus dados privados.

Pronto para IA privada?

Agende uma demonstração e veja como o Ollama no ReefOffice lhe dá capacidades IA privadas — chat, perguntas sobre documentos e execução de modelos locais — tudo no seu próprio servidor.

Agendar uma demonstração