Pular para o conteúdo principal
Replicate é uma plataforma para executar modelos de aprendizado de máquina de código aberto na nuvem. O modelo de cobrança deles é um dos exemplos mais puros de precificação baseada em uso na indústria de IA. Não há taxa de assinatura mensal nem valor fixo por execução de modelo. Em vez disso, eles cobram pelo exato tempo de computação consumido, segundo a segundo, com tarifas que variam conforme o hardware subjacente. Essa abordagem funciona bem para cargas de trabalho de IA porque os tempos de execução são imprevisíveis. Um único usuário pode executar um modelo leve por alguns segundos ou um modelo generativo enorme por vários minutos. Ao vincular o custo aos recursos de computação em vez do modelo em si, a Replicate mantém os preços transparentes e escaláveis.

Como a Replicate Cobra

Os preços da Replicate são desacoplados do modelo específico em execução. Quer você esteja gerando uma imagem com SDXL ou executando o Llama 3, a cobrança é determinada pelo nível de hardware e pela duração da execução. Isso permite que eles hospedem milhares de modelos de código aberto sem precisar de um plano de preços separado para cada um.
  1. Tarifas específicas por hardware: O custo por segundo varia com base nos recursos de computação necessários. Cada nível de hardware tem um ponto de preço diferente.
  2. Modelo puramente baseado no uso: Não há taxas mensais, excedentes ou limites. Os usuários são cobrados pelo tempo exato de computação (por exemplo, “12.4 seconds on an A100”) em vez de por geração.
  3. Granularidade por segundo: Provedores em nuvem tradicionais cobram por hora ou minuto, o que gera desperdício em tarefas curtas. A cobrança por segundo elimina essa ineficiência tanto para experimentos rápidos quanto para cargas de produção pesadas.
Inícios a frio também são cobrados. A primeira requisição a um modelo frequentemente leva de 10 a 30 segundos para carregar o modelo na memória. Esse tempo de carregamento é cobrado à mesma tarifa da execução.
  • Métricas específicas por hardware: O mesmo modelo custa mais em hardware melhor. Os usuários escolhem entre velocidade e custo. Uma GPU T4 serve para tarefas sem sensibilidade a tempo, enquanto uma A100 atende aplicações em tempo real.
  • Granularidade por segundo: A cobrança é calculada segundo a segundo, portanto os usuários nunca pagam a mais por tarefas curtas.
  • Sem assinatura: Compromisso zero para começar. Escala infinitamente com o uso, sendo ideal para startups e desenvolvedores experimentando diferentes modelos.
  • Independente de modelo: A lógica de cobrança permanece a mesma independentemente do tipo de tarefa (geração de imagem, processamento de texto, transcrição de áudio ou síntese de vídeo). Isso permite que a plataforma suporte um vasto ecossistema de modelos sem tabelas de preços complexas.

Recrie isso com Dodo Payments

Você pode reproduzir esse modelo de cobrança usando os recursos de faturamento baseado no uso da Dodo Payments. O segredo é usar múltiplos medidores para rastrear os diferentes níveis de hardware e associá-los a um único produto.
1

Create Usage Meters (One Per Hardware Class)

Crie medidores separados para cada nível de hardware. Cada tipo de hardware tem um custo por segundo diferente, então a medição independente permite que a Dodo precifique cada nível de forma distinta e forneça faturas itemizadas.A agregação Sum na propriedade execution_seconds calcula o tempo total de computação por nível de hardware durante o período de cobrança.
2

Create a Usage-Based Product

Crie um novo produto no painel da Dodo Payments:
  • Tipo de precificação: Cobrança baseada no uso
  • Preço base: $0/mês (sem taxa de assinatura)
  • Frequência de cobrança: Mensal
Anexe todos os medidores com seus preços por unidade:Defina o Limite Gratuito como 0 para todos os medidores. Cada segundo de execução é cobrável.
3

Send Usage Events

Envie eventos de uso para a Dodo sempre que uma execução de modelo for concluída. Inclua um event_id único para cada previsão a fim de garantir idempotência.
4

Measure Execution Time Precisely

Envolva a execução do modelo com temporização precisa usando performance.now(). Arredonde para o décimo de segundo mais próximo para cobrança.
5

Create Checkout

Quando um usuário se cadastra, crie uma sessão de checkout para o produto baseado no uso. A Dodo lida automaticamente com cobrança recorrente e faturamento.

Acelere com o Blueprint de Ingestão Time Range

O Time Range Ingestion Blueprint simplifica o rastreamento de computação por segundo. Crie uma instância de ingestão por nível de hardware e use trackTimeRange para uma submissão de eventos mais limpa.
O blueprint cuida da formatação da duração e da construção dos eventos. Combinado com instâncias de ingestão por hardware, esse padrão mapeia de forma organizada para a metrificação multi-nível da Replicate.
Para trabalhos de longa duração, combine o Blueprint Time Range com monitoramento por batimentos intervalados. Consulte a documentação completa do blueprint para padrões avançados.

Estimativa de Custos para Usuários

Como a cobrança baseada no uso pode ser imprevisível, forneça aos usuários estimativas de custo antes que eles executem um modelo. Isso reduz surpresas na fatura e gera confiança.

Cálculos de Custos de Exemplo

Construindo um Calculador de Custos

Empresarial: Capacidade Reservada

Para clientes empresariais que precisam de disponibilidade garantida e ausência de inícios a frio, a Replicate oferece “Instâncias Privadas” a uma tarifa horária fixa. Com a Dodo Payments, modelei isso como um produto de assinatura:
  • Tipo de Produto: Assinatura
  • Preço: Valor mensal fixo (por exemplo, “Instância Reservada A100 - $500/mês”)
  • Ciclo de Cobrança: Mensal
Você ainda pode enviar eventos de uso para monitoramento e análises, mas a assinatura cobre o custo. À medida que o volume de um usuário cresce, migrar do modelo pay-as-you-go para capacidade reservada geralmente se torna mais econômico.

Avançado: Medição por Heartbeat

Para tarefas que levam vários minutos ou horas, enviar um único evento no final é arriscado. Se o processo travar, você perde os dados de uso. Uma abordagem melhor é enviar eventos de uso a cada 30-60 segundos durante a execução.

Principais Recursos da Dodo Utilizados

Usage-Based Billing

Configure produtos que cobram com base no consumo.

Meters

Defina as métricas que você deseja rastrear e cobrar.

Event Ingestion

Envie dados de uso para a Dodo em tempo real.

Subscriptions

Gerencie cobranças recorrentes para capacidade reservada e planos empresariais.

Time Range Blueprint

Rastreamento de computação por segundo com auxiliares de duração.
Última modificação em 1 de abril de 2026