Dois projetos, um template
Porquê alojar o Ollama e o Open WebUI por conta própria
O Ollama puxa modelos abertos e serve-os atrás de uma API local. Um só comando põe a correr o Llama, o Qwen, o Gemma, o DeepSeek ou o gpt-oss. O endpoint na porta 11434 fala o formato OpenAI, por isso a maior parte do código de cliente existente aponta para lá só com uma mudança de URL. O projeto tem licença MIT.
O Open WebUI é a interface de chat que vem no mesmo template. Trata dos logins, do carregamento de documentos para RAG e das permissões por grupo. Também fala com qualquer backend compatível com OpenAI, por isso o Ollama não tem de ser a única coisa por trás. Correr os dois no seu próprio VPS mantém os prompts, os documentos carregados e os pesos dos modelos num disco que você aluga em vez de um de um fornecedor.