El blog de Deska
Ollama CLI: Modelos, Modelfiles y Serving
Guía técnica de Ollama CLI. Aprende a gestionar modelos locales, crear Modelfiles personalizados y servir LLMs para flujos de trabajo local-first.
· 10 min de lectura
Ejecutar Modelos de Lenguaje Extensos de forma local ha pasado de ser un pasatiempo de nicho a una decisión arquitectónica fundamental para desarrolladores que valoran la privacidad. Ollama CLI facilita esta transición al proporcionar una interfaz simplificada para descargar, gestionar e interactuar con modelos de pesos abiertos. Al dominar Ollama CLI, puedes integrar capacidades de razonamiento sofisticadas en tus aplicaciones local-first sin depender de APIs externas. Esta guía explora la estructura de comandos, la creación de Modelfiles personalizados y la mecánica para servir modelos para consumo externo.
Los Fundamentos de Ollama CLI
La interfaz de línea de comandos es la forma principal de interactuar con el demonio de Ollama. Una vez que el servicio está en ejecución, el comando ollama te permite orquestar toda tu biblioteca local. La sintaxis sigue un patrón estándar de comando seguido de argumentos.
Para verificar tu instalación y ver los comandos disponibles, simplemente ejecuta ollama. Las operaciones más frecuentes incluyen obtener nuevos modelos de la biblioteca y ejecutarlos en una sesión interactiva. Por ejemplo, ollama run llama3 descargará los pesos si no están presentes e iniciará una interfaz de chat.
Los comandos clave incluyen:
ollama list: Muestra todos los modelos almacenados actualmente en tu disco local.ollama pull: Descarga un modelo sin iniciar una sesión de ejecución.ollama rm: Elimina un modelo para liberar espacio de almacenamiento.ollama cp: Crea un duplicado de un modelo existente, lo cual es útil para probar diferentes prompts de sistema.
Gestión Eficaz de Modelos Locales
Gestionar los recursos locales es crítico porque los LLMs consumen una cantidad significativa de espacio en disco y memoria. Cuando usas Ollama CLI, estás interactuando con un manifiesto local que mapea los nombres de los modelos con sus archivos binarios subyacentes.
Al trabajar en un entorno complejo como el canvas de Deska, puedes tener múltiples terminales abiertas. Deska te permite colocar estas terminales en cualquier lugar de un espacio de trabajo infinito, facilitando la monitorización de ollama list en un panel mientras ejecutas un modelo en otro. Esta visibilidad es útil cuando estás alternando entre diferentes versiones de Mistral o Llama para comparar sus resultados lado a lado.
Entendiendo la Cuantización y los Tags
Ollama utiliza etiquetas (tags) para identificar versiones específicas de los modelos. Si no especificas una etiqueta, el CLI usará latest por defecto. Sin embargo, los usuarios técnicos a menudo necesitan niveles de cuantización específicos para equilibrar rendimiento y precisión.
| Nombre del Modelo | Ejemplo de Tag | Caso de Uso |
|---|---|---|
| Llama 3 | llama3:8b-instruct-q4_K_M | Cuantización de 4 bits estándar para uso general |
| Mistral | mistral:7b-instruct-v0.2-fp16 | Alta precisión, requiere más VRAM |
| Phi-3 | phi3:mini | Modelo ligero para entornos con restricciones |
| CodeLlama | codellama:7b-python | Especializado para generación de código Python |
Creación de Modelfiles Personalizados
El Modelfile es el plano de configuración para Ollama. Te permite definir el comportamiento, los parámetros y las instrucciones de sistema para un modelo. Esto es similar a cómo un Dockerfile define una imagen de contenedor.
Un Modelfile típico contiene la instrucción FROM para especificar un modelo base. Luego añades capas como PARAMETER para controlar la temperatura o SYSTEM para definir la personalidad.
FROM llama3
PARAMETER temperature 0.7
SYSTEM "Eres un arquitecto de software senior. Proporciona ejemplos de código concisos y eficientes."
Una vez que hayas guardado este archivo, usas el CLI para crear el nuevo modelo: ollama create mi-arquitecto -f Modelfile. Este nuevo modelo aparecerá ahora en tu lista y podrá usarse como cualquier otro.
En el editor de código de Deska, puedes escribir estos Modelfiles y probarlos inmediatamente en un panel de terminal situado justo al lado de tu código. Esta disposición minimiza el cambio de contexto. Debido a que Deska es local-first, tus configuraciones de modelos personalizados y tu código fuente permanecen en tu máquina.
Servir e Integración de API
El comando ollama serve inicia el proceso del servidor que expone una API REST. Esto es lo que permite que otras aplicaciones se comuniquen con Ollama. Por defecto, el servidor escucha en 127.0.0.1:11434.
La integración con herramientas de desarrollo suele ocurrir a través de esta API. Por ejemplo, los agentes de codificación pueden usar tu instancia local de Ollama para proporcionar completado de código o refactorización. En el entorno de Deska, puedes ejecutar agentes de programación como Claude Code o Codex CLI. Aunque algunos agentes prefieren APIs de nube específicas, muchos pueden configurarse para apuntar a tu endpoint local de Ollama.
Usar modelos locales para agentes ofrece varias ventajas:
- Sin latencia por viajes de red.
- Coste cero por token durante sesiones largas de refactorización.
- Privacidad mejorada para bases de código propietarias sensibles.
Monitoreo y Acceso Remoto
Cuando tus modelos están en ejecución, monitorear el uso de recursos es vital. Puedes usar herramientas estándar del sistema o flags dedicados del CLI para ver cuánta VRAM está asignada.
Si necesitas revisar una tarea de larga duración mientras no estás frente a tu escritorio, la aplicación mobile de Deska ofrece una forma segura de monitorear tu espacio de trabajo. Utiliza un relevo seguro para emparejar tu teléfono directamente con tu computadora sin exponer ningún puerto a la internet pública. Esto te permite verificar el estado de una descarga de modelo o una generación larga desde tu teléfono.
Preguntas Frecuentes
¿Cómo cambiar la ubicación de almacenamiento de modelos de Ollama?
Puedes cambiar dónde almacena Ollama sus modelos configurando la variable de entorno OLLAMA_MODELS. En Linux o macOS, exportarías esta variable en tu perfil de shell. En Windows, la añades a las Variables de Entorno del Sistema. Esto es particularmente útil si deseas mover archivos de modelos grandes a un SSD externo.
¿Puedo ejecutar modelos de Ollama en paralelo?
Ollama gestiona múltiples solicitudes poniéndolas en cola o cargando múltiples modelos si tu VRAM lo permite. Puedes ajustar la variable de entorno OLLAMA_NUM_PARALLEL para definir cuántas solicitudes concurrentes debe manejar un modelo. Ten en cuenta que aumentar este número incrementará significativamente el consumo de memoria del servicio.
¿Cómo usar Ollama con agentes de código externos?
Para usar Ollama con agentes, generalmente necesitas configurar la URL base hacia tu instancia local. La mayoría de las herramientas esperan el formato de endpoint compatible con OpenAI. Ollama proporciona esto en las rutas /v1. Puedes configurar las terminales en Deska para exportar las variables de entorno necesarias para que tus agentes encuentren automáticamente el servicio local de Ollama.
Primeros pasos con espacios de trabajo de IA local
Ollama CLI proporciona la potencia, pero tu entorno determina tu productividad. Al combinar modelos locales con un espacio de trabajo flexible, creas una tubería de desarrollo robusta que no compromete la privacidad ni la velocidad.
Si estás buscando una manera de organizar tus terminales, código y agentes de IA en un solo lugar, deberías explorar el espacio de trabajo de Deska. La aplicación es gratuita para Mac, Windows y Linux. Puedes descargar el instalador en /download para comenzar a construir tu kit de herramientas de IA local-first hoy mismo.