Aplicaciones → Ollama
Modelos de IA privados, en tu propio servidor.
Ollama ejecuta modelos de lenguaje grandes de código abierto localmente en tu servidor ReefOffice. Ningún dato sale nunca de tu servidor para ser procesado por un proveedor de IA externo — chat privado, preguntas de documentos y tareas autónomas de IA, todo local.
Qué hace Ollama
Ollama maneja el cómputo de IA — descarga, carga y ejecuta modelos de lenguaje de código abierto (LLaMA, Mistral, Qwen, Phi, Gemma y cientos más) directamente en tu servidor. Impulsa el chat privado a través de Open WebUI, tareas autónomas de IA a través de Hermes Agent y preguntas de documentos en planes Private AI.
Por qué Ollama en ReefOffice
1 Ejecución de modelos de IA local
Ollama ejecuta cientos de modelos de código abierto en la CPU o GPU de tu servidor — LLaMA, Mistral, Qwen, Gemma, Phi, DeepSeek y más. Los modelos se descargan, almacenan en caché y ejecutan localmente. Sin llamadas a APIs de proveedores externos, sin datos que salgan de tu infraestructura.
2 Chat privado y preguntas de documentos
Open WebUI ofrece una interfaz estilo ChatGPT impulsada por Ollama. Haz preguntas sobre tus documentos, obtén respuestas con referencias de fuentes y chatea de forma privada — todo sin enviar datos a OpenAI ni Anthropic.
3 Respuestas privadas de IA
En planes Private AI, Ollama genera respuestas de tu corpus de documentos. Pregunta «¿qué facturas están sin pagar?» o «resume el último contrato» — la respuesta se genera en tu servidor a partir de tus documentos indexados, con referencias de fuentes.
4 Flexibilidad de modelos
Elige el modelo que se adapte a tu caso de uso. Ejecuta un modelo pequeño y rápido para chat cotidiano, un modelo multilingüe para preguntas de documentos o un modelo más grande para razonamiento complejo. Cambia entre modelos con un único comando.
5 Listo para aceleración por GPU
Los planes Private AI incluyen capacidad de GPU dedicada en la infraestructura de ReefOffice en Alemania. Para configuraciones solo locales, Ollama usa CPU con inferencia optimizada — más lento pero completamente privado. Claves de modelos externas opcionales pueden complementar la capacidad local.
6 Conectado al stack completo
Ollama se conecta a Open WebUI para chat, Hermes Agent para tareas autónomas y se puede acceder vía API para integraciones personalizadas. Se ejecuta como un servicio nativo de NixOS — siempre disponible, sin sobrecarga de contenedor.
Detalle técnico
Cómo funciona
Ollama envuelve llama.cpp para inferencia local eficiente con soporte para aceleración por GPU, modelos cuantizados (formato GGUF) y caché de prompts. En ReefOffice se ejecuta como un servicio nativo de NixOS. Los modelos se descargan de la biblioteca de Ollama, se almacenan en caché localmente y se sirven a través de una API local a la que se conectan Open WebUI y Hermes.
Cómo se adapta a tu stack
Ollama impulsa Open WebUI para chat privado estilo ChatGPT y Hermes Agent para tareas autónomas de IA. También se puede acceder a través de su API local para integraciones personalizadas. El servicio es interno y protegido por API — nunca expuesto directamente a internet.
Preguntas frecuentes
¿La IA local será suficientemente rápida para uso diario? +
Para búsqueda e indexación de documentos, sí — la generación de embeddings con bge-m3 se ejecuta eficientemente en CPU y se completa en segundos para volúmenes de documentos típicos. Para chat y respuestas de IA, el rendimiento depende del tamaño del modelo y el hardware. Los modelos pequeños (3-8 mil millones de parámetros) dan respuestas ágiles en CPU moderna. Para modelos más grandes o generación más rápida, los planes Private AI incluyen capacidad de GPU en la infraestructura de ReefOffice.
¿Cuánto almacenamiento usan los modelos de IA? +
Los modelos varían desde 1,5 GB (pequeños cuantizados) hasta más de 40 GB (modelos 70B de precisión completa). ReefOffice preinstala los modelos recomendados para tu plan (típicamente bge-m3 para embeddings y Qwen 2.5 7B para generación). Los modelos adicionales se descargan bajo demanda y se almacenan en caché. El almacenamiento para embeddings vectoriales depende del volumen de documentos — aproximadamente 1 GB por cada 100.000 páginas.
¿Puedo usar un proveedor de IA externo en lugar de modelos locales? +
Sí. En planes sin GPU local, puedes conectar una clave de proveedor de IA externo (OpenAI, Anthropic, Mistral AI o cualquier API compatible con OpenAI). Open WebUI y Hermes usarán la API externa para generación mientras mantienen tus datos privados.
¿Listo para IA privada?
Reserva una demo y descubre cómo Ollama en ReefOffice te ofrece capacidades de IA privada — chat, preguntas de documentos y ejecución de modelos locales — todo en tu propio servidor.
Reservar una demo