🔀Openllm: de roteador de LLMs a plataforma multimodal đŸ€– - Texto, Imagem, Áudio/MĂșsica e vĂ­deo por centavos (e como aproveitar a VRAM que sobra) - VastAI

No artigo anterior apresentei o openllm: CLI + daemon em Go que aluga GPUs no Vast.ai, sobe Ollama, expĂ”e tudo por tĂșnel SSH com watchdog de auto-destruição. Desde entĂŁo o projeto cresceu de "roteador de LLMs" para orquestrador de IA multimodal — e tudo foi validado em produção com dinheiro real. RepositĂłrio: github.com/MrJc01/crom-openllm-vastai

O que mudou desde o Ășltimo artigo

  • Um modelo de cada tipo: catĂĄlogo interno resolve automaticamente engine + VRAM pelo nome do modelo (texto → Ollama/vLLM, imagem/vĂ­deo → ComfyUI, ĂĄudio → faster-whisper/XTTS, etc.)
  • Escala horizontal: openllm scale --model X --instances 3 sobe N mĂĄquinas atrĂĄs do mesmo endpoint com load balancer (round-robin/least-connections, health-check por instĂąncia)
  • Swap sem re-aluguel: openllm swap baixa o novo modelo na mĂĄquina que jĂĄ estĂĄ paga, mantendo o antigo no ar, e troca o LB quando fica pronto — validamos llama3.2:3b → qwen2.5:0.5b em ~80s (vs ~15 min de redeploy completo)
  • Stacks multimodais: openllm stack up multimodal.yaml sobe texto + imagem + ĂĄudio + vĂ­deo num Ășnico endpoint com roteamento por path
  • Engines sem recompilar: um JSON em ./engines/ (docker image + cmd + porta + health) ou --custom-image/--custom-cmd ad-hoc
  • Endurecimento de produção: chaves ed25519 (hosts novos recusam RSA), anti-vazamento (deploy que falha se auto-destrĂłi — mesmo apĂłs crash do daemon), timeout de deploy configurĂĄvel, seleção de oferta por banda de rede e guarda de label (nunca destrĂłi instĂąncia de outros projetos na mesma conta)

VRAM que sobra = velocidade de graça

Um Qwen-3B usa ~4GB de uma RTX 4070 de 12GB — os 8GB restantes nĂŁo precisam ficar parados. Com OLLAMA_NUM_PARALLEL (via env/custom-cmd da engine) vocĂȘ aumenta requisiçÔes simultĂąneas no mesmo container; sobra vira contexto maior (KV cache) ou workers sidecar — rĂ©plicas ou serviços distintos convivendo na mesma GPU, cada um na sua rota do proxy. Como tudo Ă© config (JSON/flags), mexer Ă© trivial.

Comparativo real por tipo (fontes verificadas em ago/2026)

VĂ­deo (clipe de 5s):

Opção$/clipe1.000 clipes
Runway Gen-4.5 (API)$1,15$1.150
Replicate Wan 2.1 14B 720p (mesmo modelo que rodamos!)$1,25$1.250
Nosso: Wan 14B na 4090 alugada~$0,09$94
Nosso: LTX-Video 2B na 4070S~$0,002$2

(OpenRouter: 0 modelos de vídeo — verificado via API deles)

MĂșsica (completa, com vocais):

Opção$/mĂșsicaPegou
Suno v5.5$0,012–0,016downloads limitados a 20–60/mĂȘs
ElevenLabs Music~$0,60créditos compartilhados com TTS
Nosso: ACE-Step (Apache 2.0) na 4070S~$0,002sem caps, prompts privados, fine-tune livre

Imagem/Áudio/Texto: SD1.5 na 4070S ≈ $0,0001/imagem (vs $0,03–0,09 nas APIs); whisper-small ≈ $0,0005/transcrição (vs $0,006+/min); texto na 4070S fica na casa de $0,001–0,01 por milhares de tokens dependendo do modelo — e com openllm search vocĂȘ vĂȘ o custo/hora da GPU antes de alugar.

O padrĂŁo se repete: volume Ă© 10–500× mais barato local, API vence no clique Ășnico de qualidade SOTA. Custo ocioso? openllm stop --all mata tudo na hora — e o watchdog cobre se vocĂȘ esquecer.

ConclusĂŁo

O projeto virou o que eu queria ter: qualquer modelo, qualquer modalidade, um endpoint, centavos — com privacidade total e configuração 100% editável (catálogo JSON, engines JSON, custom engine, perfis). Testes com -race, CI no push e incidents reais viraram testes de regressão.

⭐ Repo: github.com/MrJc01/crom-openllm-vastai — PRs e issues abertos.

1
·
#tag categoriza
%video:link vĂ­deos

Crom Ecossistema

Todas as ferramentas conectadas em um Ășnico lugar.

arrow_outward language

ENGLISH

arrow_outward watch

MODO HACKER

arrow_outward menu_book

CROM Wiki

arrow_outward dynamic_feed

MiniBlog

arrow_outward build

Ferramentas

arrow_outward movie

Cromva

arrow_outward map

GeoFlowMap

arrow_outward library_books

Sume

arrow_outward folder_zip

OmniFiles

arrow_outward newspaper

MarketNews

arrow_outward sync_alt

P2PFile

arrow_outward database

DbFakeAI

arrow_outward code

Verbo

arrow_outward apps

MiniApps