Infraestrutura Digio

Modelos de IA e GPU

Execute agentes em modelos de fronteira gerenciados hoje mesmo — ou alugue capacidade de GPU, implante seus próprios pesos e encaminhe tarefas Digio para endpoints privados no mesmo espaço de trabalho.

Claude, GPT, Gêmeos Escolha de modelo por agente Aluguel de GPU e BYOM
Modelos gerenciados

Modelos disponíveis no Digio hoje

Atribua um modelo padrão por agente ou substitua por tarefa. O uso é medido em Digio Tokens a partir do saldo do seu plano – a mesma carteira, quer o agente ligue para Sonnet, GPT-4o ou Gemini Flash.

Claude antrópico

  • Claude Opus 4.7 Raciocínio emblemático, contexto longo, trabalho de arquitetura e estratégia.
  • Claude Opus 4.6 Opus da geração anterior para análises estáveis ​​e de alta qualidade.
  • Claude Sonnet 4.6 Driver diário – codificação, gravação e loops de agente de várias etapas.
  • Claude Sonnet 4.5 / 4 Camadas Fast Sonnet com cache imediato em cargas de trabalho suportadas.
  • Claude Haiku 4.5 Rascunhos de baixa latência, classificação e subtarefas de alto volume.

Rótulo de interface do usuário do site SaaS B2B. Traduzir para natural pt-br: OpenAI

  • GPT-5.5 / GPT-5.4 / GPT-5.2 A mais recente família GPT-5 para cargas de trabalho gerais e de agente.
  • GPT-4.1 & GPT-4o Bate-papo multimodal confiável e uso de ferramentas para agentes de produção.
  • GPT-4o mini Roteamento econômico para resumos e etapas leves.
  • o3 / o3-pro / o3-mini / o4-mini Modelos focados no raciocínio para matemática, planejamento e verificação.
  • GPT-5.3 Codex & Codex mini Geração de código, refatoradores e habilidades de agente com reconhecimento de repositório.

Google Gêmeos

  • Gemini 2.5 Pro Pesquisa de longo contexto e extração estruturada.
  • Gemini 2.5 Flash Etapas de agente de alto rendimento com taxas de token competitivas.
  • Gemini 2.0 Flash Passagens ultrarrápidas para análise, marcação e trabalhos em lote.

APIs abertas e especializadas

  • DeepSeek Chat & Reasoner Forte valor para tarefas de bate-papo e estilo de cadeia de pensamento.
  • Mistral Large Opção hospedada na Europa para equipes de agentes multilíngues.
  • Llama 3.3 70B Modelo de classe de pesos abertos via API – combina bem com GPU privada.
  • Grok 3 Modelo orientado em tempo real para agentes de notícias e monitoramento social.
  • Sonar Pro Respostas baseadas em pesquisa para agentes de pesquisa.
  • Command R+ Fluxos de trabalho de recuperação e bate-papo empresarial compatíveis com RAG.

Model list and token economics evolve with provider releases. Your workspace shows live options when you assign a model to an agent; Digio Tokens debit from the same balance as in pricing.

Uso

Como os agentes escolhem um modelo

O Coordenador pode recomendar Sonnet vs Opus vs um modelo flash mais barato com base no tipo de tarefa. Usuários avançados definem padrões por função de agente: pesquisa no Sonnet, revisão final no Opus, marcação em massa no Haiku ou Gemini Flash.

  • Per agent — default model in agent settings; override in To do or chat when needed.

  • Metered fairly — input, output, and cached tokens map to Digio Token charges (see usage in your wallet).

  • Skills stay the same — tools and integrations work across models; only latency and cost profile change.

  • Plan limits — more agents and monthly Digio Tokens on higher tiers; top up anytime on the pricing page.

Aluguel de GPU

Alugue GPU e execute seus próprios modelos

Precisa de um ajuste fino, de um ponto de verificação isolado ou de preços de inferência previsíveis? Adicione capacidade de GPU dedicada ao seu espaço de trabalho Digio, instale a pilha de serviços de sua preferência e aponte agentes para seu endpoint privado.

Instâncias dedicadas

Nós de GPU por hora ou por mês (classe A100, H100, L40S) anexados ao seu locatário, isolados de outros clientes.

Seus pesos

Faça upload de safetensors, GGUF ou extraia de seu registro; execute Llama, Mistral, Qwen e ajustes personalizados.

Porção padrão

vLLM, TGI, Ollama ou imagens de contêiner que você mantém – os agentes Digio chamam um URL base compatível com OpenAI.

Mesma orquestração

Para fazer isso, o bate-papo em equipe, as habilidades e a colaboração permanecem inalterados – apenas o back-end de inferência é seu.

Roteamento híbrido

Envie etapas confidenciais para GPU privada e use Claude ou GPT para pesquisas públicas em um único fluxo de trabalho.

Controles empresariais

peering de VPC, saída estática, registros de auditoria e listas de permissões de modelos para equipes regulamentadas.

Traga seu próprio modelo

Instalar e conectar um modelo personalizado

Configuração típica de zero até agentes ligando para seu endpoint:

  1. Reservar GPU

    Escolha VRAM, região e tempo de atividade (intermitente versus sempre ativo). O armazenamento para pesos é enviado com a instância ou montado em seu bucket.

  2. Implantar a pilha

    Inicie uma imagem de serviço ou SSH, instale drivers CUDA e carregue pontos de verificação. As verificações de integridade confirmam que o modelo está pronto.

  3. Registrar endpoint

    Adicione URL base, chave de API e ID do modelo nas configurações do espaço de trabalho. Digio valida a latência e o formato do token antes de entrar no ar.

  4. Atribuir a agentes

    Escolha seu modelo privado como padrão para agentes selecionados; os modelos Claude/GPT gerenciados permanecem disponíveis lado a lado.

O aluguel da GPU é cobrado separadamente das assinaturas do plano Digio. Contate-nos para planejamento de capacidade, SLAs e migração de um cluster de inferência existente.

Perguntas frequentes

Perguntas sobre modelos e GPU

Escolhendo APIs gerenciadas versus inferência auto-hospedada no Digio.

Pago duas vezes – plano mais API?

Sua assinatura Digio cobre infraestrutura, agentes e Digio Tokens incluídos. Débitos de uso do modelo gerenciado que são balanceados por tokens de entrada/saída reais. O aluguel de GPU é um complemento para as máquinas que você controla.

Diferentes agentes podem usar modelos diferentes?

Sim, cada agente pode ter seu próprio padrão. Tarefas e chats podem ser substituídos em uma única execução sem alterar o padrão global.

Qual é a diferença entre Soneto e Opus?

Opus está sintonizado para raciocínios mais difíceis e planos mais coerentes; O Sonnet é mais rápido e barato para loops diários de agentes. Os modelos Haiku e da classe flash são melhores para subtarefas de volume.

Posso executar apenas meu próprio modelo e bloquear APIs de nuvem?

Os espaços de trabalho corporativos podem restringir provedores de modelos de saída e rotear todo o tráfego do agente para o endpoint da GPU. O modo híbrido é o padrão para a maioria das equipes.

Quais tamanhos de GPU estão disponíveis?

As ofertas dependem da região e da demanda – geralmente níveis de VRAM de 24 a 80 GB para modelos de classe 7B a 70B e nós multi-GPU para pilhas maiores. Ajudamos a dimensionar a VRAM a partir da contagem e quantização de parâmetros.

O uso privado de GPU ainda consome Digio Tokens?

A orquestração (agentes, tarefas, armazenamento) permanece no seu plano. A inferência na sua GPU é cobrada como tempo de GPU; opcionalmente, você pode medir o uso em formato de token para estorno interno.

Escolha modelos gerenciados ou traga sua GPU

Comece hoje mesmo com Claude e GPT e, em seguida, adicione GPU dedicada quando estiver pronto para hospedar pesos personalizados — mesmos agentes, mesmas tarefas, sua inferência.