Cloud HPC vs On-Premises: Guia de Decisão e TCO para 2026

Em 2026, decidir onde executar cargas de HPC e IA deixou de ser uma escolha puramente técnica. Segundo a Hyperion Research (apresentada no SC25 e reportada pelo HPCwire em janeiro de 2026), o mercado total de HPC cresceu 23,5% em 2024 e superou US$ 60 bilhões. O gasto em nuvem cresceu 21,3% e chegou a US$ 9,5 bilhões.

O desafio é que os dois modelos ficaram mais caros e mais complexos ao mesmo tempo. A nuvem oferece acesso imediato a hardware de nova geração, mas cobra por hora, por gigabyte transferido e por decisões de arquitetura difíceis de reverter. O on-premises oferece controle e custo marginal baixo, mas exige capital, energia, refrigeração líquida e equipe especializada.

O custo da inação também é real. Quem decide por inércia paga por capacidade ociosa ou por contas de nuvem que crescem de forma linear, sem perceber qual modelo está perdendo dinheiro. Neste guia, analisamos o problema estratégico, os riscos de não decidir, os fundamentos de cada modelo, a implementação, as melhores práticas e as métricas que sustentam a decisão.

1. O problema estratégico: onde cada carga de trabalho deve viver

A decisão virou uma questão de portfólio

Tratar “cloud ou on-premises” como escolha única é o erro mais comum. Uma empresa de engenharia pode ter simulações CFD em campanhas trimestrais, um cluster de inferência com carga constante e um laboratório de P&D com picos imprevisíveis. Cada perfil tem uma economia diferente (exemplo ilustrativo).

A Hyperion projeta que o gasto total em HPC chegue a US$ 119 bilhões em 2029, com US$ 23 bilhões em nuvem. A fatia da nuvem sobe de cerca de 15% em 2024 para cerca de 20%. Ou seja, a nuvem cresce, mas o on-premises continua sendo a maior parte do mercado.

Isso significa que a pergunta correta é qual proporção de cada modelo, e não qual vence. O ponto de partida é classificar as cargas por previsibilidade, sensibilidade a latência, volume de dados e exigência regulatória.

Três variáveis que mudaram o cenário em 2026

A primeira é o custo de hardware. A TrendForce reportou alta de 48% a 53% nos preços de contrato de SSD enterprise no 2T26, e projetou novas altas de NAND (10% a 15%) e DRAM (13% a 18%) no 3T26. Montar um cluster próprio hoje custa mais do que há doze meses, e os prazos de entrega são menos previsíveis.

A segunda é a densidade de energia. A AFCOM (State of the Data Center 2026) aponta densidade média de 27 kW por rack, contra 16 kW um ano antes. Racks de GPU como o GB200 NVL72 chegam a 120-132 kW e exigem refrigeração líquida direta.

A terceira é a regulação. A Resolução CD/ANPD nº 19/2024 passou a exigir cláusulas-padrão contratuais em transferências internacionais de dados pessoais, o que inclui armazenamento em nuvem com servidores no exterior. O período de adaptação de 12 meses já terminou.

2. Consequências da inação

Riscos financeiros de decidir por inércia

Na nuvem, o custo cresce de forma linear com o uso. O que começa como experimentação flexível pode virar uma conta recorrente alta quando a carga se estabiliza. A Hyperion registra o custo como a principal barreira percebida para HPC em nuvem, seguido por localidade e velocidade de acesso aos dados.

No on-premises, o risco é inverso. Um relatório citado pelo HPCwire (McKinsey) estima queda de cerca de 50% no valor das GPUs em cinco anos, por causa do ritmo de lançamentos. Capital imobilizado em hardware que perde valor rápido é custo de oportunidade.

Sem modelagem, a empresa descobre o erro tarde. Uma carga com utilização baixa em hardware próprio, ou uma carga estável em instâncias sob demanda, queima orçamento sem sinal claro de alerta.

Riscos de capacidade, conformidade e competitividade

Quem espera para decidir enfrenta filas de entrega de hardware e escassez de energia em colocation de alta densidade. Na nuvem, a escassez de GPU nos grandes provedores levou clientes aos neoclouds. A McKinsey, citada pelo HPCwire, conta mais de 100 neoclouds no mundo e fala em preços até 85% menores que os dos hyperscalers.

No campo regulatório, a penalidade da LGPD pode chegar a R$ 50 milhões por infração. Dados pessoais enviados para uma região no exterior sem o instrumento contratual correto criam passivo jurídico independente do custo de computação.

Competitivamente, concorrentes que iteram mais rápido em simulação ou treinamento chegam antes ao mercado. A Hyperion indica que acesso às GPUs mais recentes é um dos principais benefícios que os clientes veem na nuvem.

3. Fundamentos da solução: o que cada modelo entrega

O que a nuvem HPC entrega hoje

Em fevereiro de 2026, a AWS lançou as instâncias Hpc8a, com processadores AMD EPYC de 5ª geração, 192 núcleos, 768 GiB de memória e 300 Gbps de rede EFA. Segundo a AWS, elas entregam até 40% mais desempenho e até 25% melhor relação preço-desempenho que as Hpc7a. O alvo são cargas fortemente acopladas, como CFD, previsão do tempo e FEA explícito.

A Azure HBv5, analisada em relatório de abril de 2026 da Signal65, usa um processador EPYC customizado e, segundo a análise, mais que triplica a velocidade de simulação frente à HBv4 em cargas limitadas por memória. Valide esse tipo de resultado com seu próprio código, já que ganhos variam por aplicação.

Há um ponto de atenção local: os anúncios de lançamento da Hpc8a listam regiões nos EUA, na Europa e na Ásia. Confirme a disponibilidade na região de São Paulo antes de planejar latência e residência de dados.

O que o on-premises ainda faz melhor

Na pesquisa da Hyperion, clientes percebem vantagens no on-premises em suporte técnico, domínio da pilha de software, tempo até o resultado, sustentabilidade e filas menores. São percepções de usuários, mas indicam onde a nuvem ainda tem atrito.

O controle sobre localidade dos dados é o segundo ponto forte. Cargas que movimentam centenas de terabytes entre armazenamento e computação ganham com storage NVMe local, sem tarifa de saída. Isso conecta com a inflação de SSD: o custo de montar esse storage subiu, e deve entrar no TCO.

O terceiro ponto é a previsibilidade em regime estável. Quando a utilização é alta e constante, o custo marginal do hardware já pago tende a ser menor. O preço é a responsabilidade pela infraestrutura física.

4. Implementação estratégica

Modelagem de TCO sem viés

Estudos de TCO publicados em 2026 chegam a conclusões opostas. Um guia da io.net concluiu que a nuvem é mais barata que o on-premises mesmo com utilização de 100% no cenário de baixo custo. Já a Deploybase calculou que o on-premises custa cerca de 3 vezes menos por GPU-hora em clusters grandes de alta utilização. Ambos têm interesses comerciais no tema.

Uma referência frequente, que aparece em conteúdos de fornecedores como a BytePlus, é que o on-premises só compensa acima de 70% a 80% de utilização sustentada. Trate-a como hipótese a testar, e não como regra.

O modelo deve incluir hardware, energia, refrigeração, equipe, depreciação, licenças, egress, armazenamento em nuvem e câmbio. Como a nuvem é cobrada em dólar, a variação do real afeta diretamente o orçamento brasileiro.

Critério Cloud HPC On-premises
Modelo financeiro OPEX variável, em dólar CAPEX inicial, custo marginal baixo
Acesso a hardware novo Rápido, sujeito à disponibilidade Depende de compra e entrega
Energia e refrigeração Responsabilidade do provedor Projeto próprio, densidade crítica
Movimentação de dados Egress pago Sem tarifa de saída
Conformidade LGPD Exige cláusulas se houver transferência Controle direto
Melhor perfil de carga Picos, pesquisa, testes Carga estável e previsível

Arquitetura híbrida e pontos de falha

A abordagem mais citada em 2026 é a híbrida: infraestrutura própria para a carga de base e nuvem para picos (cloud bursting). Exemplo ilustrativo: um cluster dimensionado para 70% da demanda média, com campanhas extras na nuvem.

O principal ponto de falha é o dado. Se o conjunto de dados precisa ser copiado a cada burst, o tempo e o custo de transferência anulam o ganho. Os dados devem ficar próximos de onde são processados, ou ser replicados antes da demanda.

O segundo ponto de falha é a portabilidade. Código otimizado para uma família específica de instância pode exigir retrabalho. Use contêineres, escalonadores padrão (como Slurm) e testes de desempenho antes de migrar.

5. Melhores práticas avançadas

Governança, LGPD e controle de egress

Mapeie quais cargas processam dados pessoais e onde ficam os servidores. Se houver transferência internacional, formalize as cláusulas-padrão da ANPD ou escolha região no Brasil. Dados anonimizados e dados de simulação sem informação pessoal têm exigência menor.

Calcule o egress antes de assinar. Segundo levantamento publicado em junho de 2026, a saída padrão para internet custa cerca de US$ 0,09/GB na AWS, US$ 0,087 na Azure e US$ 0,12 no Google Cloud (regiões dos EUA). Recuperar 500 TB de resultados custaria cerca de US$ 45 mil na tarifa da AWS, sem descontos por volume (cálculo ilustrativo).

Na União Europeia, o Data Act proíbe cobranças de troca de provedor a partir de 12 de janeiro de 2027, mas não elimina o egress operacional do dia a dia. Para empresas brasileiras com operação europeia, vale incluir a data no planejamento contratual.

Segurança, FinOps e refrigeração

Em cargas na nuvem, aplique FinOps: orçamentos por projeto, alertas de consumo, instâncias reservadas ou Savings Plans para carga estável e spot para tarefas tolerantes a interrupção. O objetivo é impedir que a conta cresça sem dono.

No on-premises, valide a infraestrutura antes da compra. A Uptime Institute considera impraticável a refrigeração a ar acima de cerca de 50 kW por rack, e a Schneider Electric indica que cold plates dominam a refrigeração líquida, com 55% de participação em 2026. Contrate a potência entregável por rack, e não a capacidade nominal do projeto.

Em ambos os modelos, aplique criptografia em repouso e em trânsito, controle de acesso por privilégio mínimo e trilhas de auditoria. A responsabilidade muda de lugar, mas continua sendo da empresa.

6. Medição de sucesso

KPIs técnicos

Meça utilização média e de pico por cluster ou por conta de nuvem. É o indicador que mais influencia o ponto de equilíbrio entre os modelos.

Acompanhe também o tempo até o resultado (da submissão ao job concluído, incluindo fila), a eficiência de escalonamento e a taxa de falhas de job. A própria pesquisa da Hyperion mostra que filas e tempo até o resultado pesam na percepção dos usuários.

Para armazenamento, monitore throughput efetivo e tempo de movimentação de dados. Um gargalo de I/O pode esconder uma CPU ou GPU subutilizada.

KPIs de negócio e gatilhos de revisão

Calcule o custo por job ou custo por simulação, que permite comparar nuvem e on-premises na mesma unidade. Acrescente o custo por GPU-hora efetiva, ou seja, dividido pelas horas realmente usadas.

Defina gatilhos de revisão: utilização sustentada acima de um limite, aumento de egress mensal, mudança relevante de preço de hardware ou nova exigência regulatória. A cada gatilho, reavalie a distribuição entre os dois modelos.

Por fim, acompanhe o tempo de entrega de novos projetos, que é o indicador de negócio mais direto da vantagem competitiva da infraestrutura.

Conclusão

Em 2026, a escolha entre cloud HPC e on-premises depende do perfil de cada carga. A nuvem vence em picos, pesquisa e acesso rápido a hardware novo. O on-premises tende a vencer em regime estável, com alta utilização e dados volumosos. Estudos de TCO divergem, o que reforça a necessidade de modelar o seu caso.

Os custos de hardware, a densidade de energia e a regulação de dados mudaram a conta nos últimos doze meses. Por isso, a decisão deve ser revisada periodicamente, e não tomada uma única vez.

O mercado indica um caminho de crescimento para ambos: a Hyperion projeta a nuvem chegando a US$ 23 bilhões em 2029, dentro de um mercado total de US$ 119 bilhões. Neoclouds e novas gerações de instâncias HPC devem pressionar preços, enquanto a refrigeração líquida se torna requisito para clusters próprios.