Latência Sub-Microsegundo: Guia Estratégico para TI 2026

Em 2026, a expressão latência sub-microsegundo deixou de ser exclusividade das mesas de trading. Ela aparece hoje em especificações de clusters de IA, redes de HPC e arquiteturas de memória composável. Quando milhares de GPUs sincronizam gradientes a cada passo de treinamento, cada fração de microssegundo se multiplica por milhões de operações.

O desafio é que o termo é impreciso. Um fornecedor pode falar da latência de um salto de switch, outro da latência de uma placa de rede, outro do tempo de acesso à memória, e todos podem estar corretos ao dizer “sub-microsegundo”. Comparar esses números sem entender o ponto de medição leva a decisões de compra caras e a arquiteturas que não entregam o que o negócio esperava.

Ignorar o tema também tem custo. Segundo um guia de decisão publicado em 2026 pela Spheron, um cluster grande de GPUs H100 pode gastar entre 15% e 30% dos ciclos esperando a rede durante operações coletivas pesadas. Nesse cenário, a rede deixa de ser um detalhe de compras e passa a ser uma decisão que determina o retorno do investimento em aceleradores.

Este artigo analisa onde a latência realmente se perde, o que muda com InfiniBand XDR, Ultra Ethernet e CXL, e como medir e governar um projeto de baixa latência. O foco é a decisão de arquitetura, não a lista de produtos.

O problema estratégico: “sub-microsegundo” depende de onde você mede

Existem pelo menos quatro pontos de medição que costumam ser confundidos: o salto de switch, a viagem completa entre dois servidores (NIC a NIC), o acesso à memória e o ciclo de decisão de uma aplicação, como o tick-to-trade em mercados financeiros. Cada um tem ordem de grandeza e engenharia próprias, e otimizar um não otimiza os demais.

A tabela abaixo reúne números publicados entre 2025 e 2026 para dar uma noção de escala. Eles vêm de fontes e condições de teste diferentes e servem como referência de ordem de grandeza, não como garantia de desempenho em seu ambiente.

Ponto de medição Latência reportada Fonte
Acesso a DRAM local (Xeon 6) ~115 ns Pesquisa arXiv, 2025
Memória CXL em dispositivo multiporta ~267 ns Pesquisa arXiv, 2025
Memória CXL, média de expansores comerciais 214 a 394 ns ASPLOS (Melody)
NIC AMD Solarflare X4, payload de 4 bytes (10GE) ~590 ns AMD, testes internos (set/2025)
InfiniBand NDR, mensagem de 8 bytes ~0,9 µs Spheron (2026)
Spectrum-X, mensagem de 8 bytes ~1,7 µs Spheron (2026)
RoCEv2 400G bem ajustado, 8 bytes ~2,4 µs Spheron (2026)

Há um ponto de atenção: outras fontes situam o RoCEv2 entre 5 e 10 µs, dependendo da topologia, da carga e do nível de ajuste. A diferença não é erro de ninguém, mas consequência de condições de teste distintas. Por isso, qualquer projeto sério deve validar a latência no próprio ambiente, com a própria carga.

Do ponto de vista de negócio, a pergunta correta não é “qual é a menor latência?”, e sim “qual latência, medida onde, muda o resultado da minha aplicação?”. Para um cluster de treinamento, o que importa é o tempo das operações coletivas. Para um sistema de execução de ordens, é o tempo entre o pacote de mercado chegar e a ordem sair. São problemas diferentes, com soluções diferentes.

Consequências da inação: custo oculto em GPUs ociosas e oportunidades perdidas

O primeiro custo é o ocioso. Se uma fatia relevante dos ciclos de GPU é gasta aguardando a rede, o custo efetivo por hora útil de computação sobe na mesma proporção. Em clusters grandes, isso representa milhões em capital subutilizado, sem que nenhum indicador de servidor acuse o problema.

O segundo custo é a variabilidade. Em operações coletivas, o passo termina quando o participante mais lento termina. Uma rede com boa latência média e cauda longa degrada o cluster inteiro. Não por acaso, o termo tail latency aparece 47 vezes na especificação Ultra Ethernet 1.0, segundo análise da STORDIS, o que mostra o peso que a indústria dá ao tema.

O terceiro custo é competitivo e aparece com mais clareza em mercados financeiros. Guias especializados de 2026 apontam que uma pilha de rede padrão do kernel Linux opera na faixa de 10 a 50 µs, enquanto o kernel bypass reduz isso para 1 a 5 µs e implementações em FPGA chegam a dezenas ou centenas de nanossegundos. Quem permanece no degrau mais lento compete em desvantagem estrutural contra quem já subiu.

O quarto custo é o de decidir tarde. Projetos de baixa latência exigem hardware, software e competências específicas, com ciclos de aquisição e ajuste de meses. Organizações que só descobrem o gargalo depois de comprar a infraestrutura pagam duas vezes: pelo equipamento errado e pela migração.

Fundamentos da solução: como se chega abaixo de um microssegundo

Eliminar o kernel e a CPU do caminho dos dados

A maior parte da latência de uma rede convencional vem do software, não do fio. Chamadas de sistema, trocas de contexto e cópias de memória somam microssegundos antes de o pacote sair da máquina. O kernel bypass (DPDK, OpenOnload) e o RDMA (acesso remoto direto à memória) contornam essa pilha, permitindo que a aplicação ou a placa de rede movam dados diretamente.

No InfiniBand, o RDMA é nativo, e a comunicação é assíncrona: a aplicação enfileira operações e a rede as processa de forma independente, sinalizando a conclusão por uma fila de completude. Em Ethernet, o mesmo princípio chega via RoCEv2 e, mais recentemente, via Ultra Ethernet.

Na prática, isso exige placas de rede especializadas e software ajustado. Como mostra o guia da Quod Financial (2026), o custo do kernel bypass é maior complexidade de software e dependência de NICs específicas. A troca costuma compensar quando a latência é um requisito de negócio, e raramente compensa quando é apenas desejável.

Comutação cut-through e hardware dedicado

Switches de alto desempenho encaminham o pacote assim que leem o cabeçalho de destino, sem esperar o quadro inteiro. No InfiniBand, o encaminhamento é gerenciado por um Subnet Manager central, que calcula rotas e programa as tabelas de cada switch. Isso garante entrega ordenada e sem perdas, com controle de fluxo baseado em créditos.

Em casos extremos, a lógica de decisão sai da CPU e vai para FPGA. Como o caminho é um pipeline síncrono, ele leva o mesmo número de ciclos de clock em toda execução. Isso é diferente do software, em que a mediana e o percentil 99,9 se separam por escalonamento, falhas de cache e outras interferências. Para quem vive de previsibilidade, o determinismo vale tanto quanto a velocidade.

A física impõe o piso

A luz em fibra percorre cerca de 5 ns por metro, o que significa que 100 metros de cabo já consomem aproximadamente 500 ns. Em redes de 10 Gb/s, um quadro de 64 bytes leva cerca de 51 ns apenas para ser serializado, segundo análise técnica publicada pela LibFPGA em 2026. Abaixo de certo ponto, a otimização deixa de ser de software e passa a ser de layout físico, com racks próximos e cabos curtos.

Implementação estratégica: escolhendo a camada certa

Fabrics de IA e HPC: InfiniBand XDR versus Ethernet

O NVIDIA Quantum-X800 é a plataforma InfiniBand XDR atual. O modelo Q3400-RA oferece 144 portas de 800 Gb/s e capacidade de comutação de 115,2 Tb/s, de acordo com a ficha técnica da HPE. Uma topologia fat-tree de dois níveis conecta até 10.368 NICs. O SHARP de quarta geração executa reduções coletivas dentro da própria rede.

Um alerta sobre números: a NVIDIA descreve a latência do Quantum-X800 apenas como “ultra-baixa”, sem valor no datasheet. Fontes secundárias divergem bastante, de 100 a 200 ns por salto até valores como 0,6 µs ou “abaixo de 850 ns”. Trate qualquer número de salto como indicativo e exija medição em prova de conceito.

No lado Ethernet, a Ultra Ethernet Consortium publicou a especificação 1.0 em 11 de junho de 2025. A versão atual é a 1.0.3, de 16 de julho de 2026, após revisões em setembro de 2025 e janeiro de 2026. O padrão traz transporte e RDMA modernos, controle de congestionamento e retransmissão em nível de enlace, que evita o ciclo de timeout e retransmissão fim a fim. A UEC também trabalha em coletivos dentro da rede e na melhoria de mensagens pequenas.

A escolha depende do perfil. Análises de 2026 convergem que o InfiniBand ainda lidera em latência e determinismo para treinamentos grandes e de locatário único, enquanto o Ethernet leva vantagem em custo, diversidade de fornecedores e multi-locação. Para clusters pequenos ou cargas heterogêneas, o ganho de latência do InfiniBand pode não justificar o prêmio.

Memória: CXL e o custo da distância

O CXL permite expandir e compartilhar memória entre servidores com latência de dezenas a poucas centenas de nanossegundos acima da DRAM local. Em um laboratório com Xeon 6, uma leitura de DRAM local leva cerca de 115 ns, e um dispositivo CXL multiporta de duas portas chegou a 267 ns, segundo pesquisa publicada em 2025.

A distância cobra seu preço. O mesmo estudo aponta que um switch CXL adiciona pelo menos 220 ns por ciclo de ida e volta. Dispositivos multiporta evitam o switch e mantêm a latência baixa, mas limitam o tamanho do pod. A decisão é entre escala e latência.

O ponto crítico é a cauda. O estudo Melody (ASPLOS) mediu médias de 214 a 394 ns em expansores de diferentes fabricantes, mas encontrou caudas altas e instáveis, ao contrário da memória local. Um trabalho do VLDB de 2025 também registrou leituras aleatórias no percentil 99,9 com cerca de 785 ns acima da mediana. Para cargas sensíveis, o CXL serve melhor como camada de capacidade do que como substituto da memória local.

Trading e sistemas determinísticos: a escada de latência

Em execução de ordens, a arquitetura mais comum é híbrida: FPGA no caminho rápido (decodificação de feed, verificação de risco) e software com kernel bypass para estratégia. Entre as NICs, a AMD lançou em outubro de 2025 a família Solarflare X4, com ASIC dedicado, PCIe Gen5 x8 e o caminho Express com CTPIO. A AMD reporta até 40% menos latência que a geração anterior e cerca de 590 ns para 4 bytes em 10GE, em testes internos de setembro de 2025.

Melhores práticas avançadas

Ajuste fino e topologia

Ganhos grandes costumam vir de ajustes pequenos e sistemáticos. O guia de ajuste de baixa latência da AMD para EPYC e os recursos como o SDCI, que escreve dados direto no cache da CPU, reduziram a latência de recepção em cerca de 55 a 76 ns (6% a 7%) nos testes da AMD com EPYC de 5ª geração. Os ganhos são modestos em valor absoluto, mas relevantes quando o orçamento total é de centenas de nanossegundos.

O mesmo vale para fixação de núcleos de CPU, isolamento de interrupções e posicionamento físico. Um projeto que ignora a localização dos racks e o comprimento dos cabos pode perder em fibra o que ganhou em silício.

Governança, compliance e segurança

Baixa latência e segurança entram em tensão. Criptografia e inspeção profunda adicionam atraso, de modo que é preciso decidir onde protegê-las: na borda, no enlace ou na aplicação. O Ultra Ethernet inclui criptografia como requisito de projeto, mas o custo em latência deve ser medido na prática.

Em ambientes regulados, como o financeiro, o carimbo de tempo com precisão de nanossegundos, normalmente via PTP e relógios disciplinados, é parte da conformidade. Exigências específicas variam por jurisdição e devem ser validadas com o jurídico e o time de risco.

Evite a otimização prematura

Nem toda carga precisa de nanossegundos. A maioria das mesas institucionais compete em qualidade de execução e roteamento inteligente, não em velocidade bruta, segundo a Quod Financial. Gastar com FPGA e redes dedicadas onde latência previsível já basta é erro de alocação de capital.

Medição de sucesso: o que acompanhar

Médias escondem o problema. Acompanhe a distribuição: mediana (p50), p99 e p99.9, medidos sob carga realista. Para trading, a métrica central é o tick-to-trade; um guia de 2026 da Tuvoc cita como referência competitiva uma mediana abaixo de 800 ns e um p99 abaixo de 1,5 µs, valores que servem de ponto de partida e não de padrão universal.

Em clusters de IA, os indicadores mais úteis são o tempo das operações coletivas, a utilização efetiva das GPUs e a proporção de ciclos aguardando comunicação. Se a utilização cai com o aumento de nós, a rede é suspeita.

Por fim, traduza a técnica em negócio: custo por hora útil de GPU, tempo para concluir um treinamento, receita ou execução preservada por redução de latência. Sem essa ponte, o projeto vira disputa por números de datasheet.

Conclusão

Latência sub-microsegundo não é um número único, e sim uma disciplina que atravessa rede, memória, software e layout físico. O primeiro passo é definir onde medir e qual métrica move o resultado do negócio. O segundo é escolher a camada onde está o gargalo real.

Em 2026, o cenário é de convergência: o InfiniBand XDR segue como referência em determinismo, o Ultra Ethernet amadurece com a versão 1.0.3 e o CXL ganha espaço como camada de memória, com a cauda de latência como ponto de atenção. No trading, a escada vai do kernel bypass ao FPGA, com arquiteturas híbridas dominando.

Como próximos passos, mapeie suas cargas e seus pontos de medição, estabeleça metas de p50, p99 e p99.9, execute provas de conceito com tráfego real e só então defina o orçamento. Nos próximos anos, a tendência é que coletivos dentro da rede e fabrics abertos reduzam a diferença entre as tecnologias, o que torna ainda mais importante manter a arquitetura flexível.