Tendências

Amazon Redshift RG: mais rápido e de menor custo, com tecnologia Graviton

📅 2 Jul 2026 ⏱ 8 min de leitura 📰 Amazon.com
Amazon Redshift RG: mais rápido e de menor custo, com tecnologia Graviton

O Amazon Redshift anunciou recentemente a disponibilidade geral de uma nova instância baseada em Graviton chamada RG. Construído com base nos processadores Graviton da Amazon, o RG oferece: RG é mais rápido e mais barato. Embora os fornecedores de nuvem normalmente cobrem mais por um desempenho mais rápido ou por hardware de geração mais recente, o Amazon Redshift oferece melhor desempenho a um custo menor.

Neste post, descrevemos as inovações que tornam as instâncias RG muito mais rápidas. Também compartilhamos resultados de benchmark que mostram que o RG oferece desempenho de preço até 4,2x melhor do que outros data warehouses líderes. As novas instâncias RG são construídas desde o início para aproveitar as vantagens dos processadores Graviton.

O mecanismo vetorizado do Amazon Redshift é otimizado com kernels de instrução única e dados múltiplos (SIMD) baseados em Graviton para fornecer execução acelerada e paralelizada para cargas de trabalho de análise. Operações como avaliações de predicados em codificações Parquet usam comparação de vetores Graviton, pesquisa de tabela e manipulação de vetores intrínsecos. Para suportar essas velocidades de processamento aumentadas, as instâncias RG usam SSDs Nitro personalizados.

Isso permite que o RG use armazenamento local mais rápido como camada de cache para Amazon Redshift Managed Storage (RMS), verificações de data lake e conjuntos de resultados intermediários para cálculos que não cabem na memória. O recurso de análise JIT (Just-In-Time) do RG também coleta estatísticas de arquivos de data lake automaticamente à medida que as consultas são executadas, para que o otimizador possa produzir planos de consulta significativamente melhores. Juntos, eles representam inovação em toda a pilha: aceleração de hardware com Graviton, execução vetorizada com kernels SIMD, armazenamento de alta velocidade com SSDs Nitro e planejamento inteligente de consultas com JIT Analyze.

Essas otimizações, juntamente com o mecanismo de data lake vetorizado de alto desempenho desenvolvido especificamente para RG, se combinam para tornar as novas instâncias RG do Amazon Redshift até 2,2x mais rápidas que o RA3 para cargas de trabalho de análise a um custo 30% menor. Com o RA3, as consultas do data lake transferem verificações para uma frota de computação separada conhecida como Amazon Redshift Spectrum. Como as consultas do data lake foram executadas nessa computação separada, foi introduzida uma sobrecarga adicional para transferir metadados e resultados de consulta entre clusters RA3 e a frota Spectrum.

As instâncias do Amazon Redshift RG incluem uma camada de verificação integrada completamente nova, projetada desde o início para data lakes. Essa nova camada de varredura inclui um subsistema de E/S específico que incorpora recursos de pré-busca inteligente para reduzir a latência dos dados. A nova camada de varredura também é otimizada para processar arquivos Apache Parquet, o formato de arquivo mais comumente usado para Iceberg, por meio de varreduras vetorizadas rápidas que usam kernels SIMD otimizados para Graviton.

A camada de varredura inclui mecanismos sofisticados de remoção de dados que operam tanto em nível de partição quanto de arquivo, o que reduz significativamente o volume de dados que precisam ser varridos. Esse recurso de remoção funciona com o sistema de pré-busca inteligente para criar uma abordagem coordenada que maximiza a eficiência em todo o processo de recuperação de dados. O novo mecanismo de data lake vetorizado desenvolvido especificamente é até 2,4x mais rápido que o RA3 para consultas Iceberg e 1,5x mais rápido que o RA3 para consultas Parquet.

Como esse novo mecanismo de data lake vetorizado se integra diretamente ao mecanismo de execução principal do Amazon Redshift, novas otimizações de desempenho são possíveis em comparação com o RA3. Com essa arquitetura, as consultas de data lake no RG agora se beneficiam do rápido cache de dados local, filtros de bloom aprimorados, varreduras Parquet vetorizadas e filtragem e remoção avançadas. O RG também resolve um problema comum que os clientes enfrentam ao consultar dados no lago: arquivos de formato aberto como o Iceberg no Amazon Simple Storage Service (Amazon S3) geralmente carecem de metadados e estatísticas úteis, o que dificulta a execução ideal de uma consulta SQL.

Estatísticas são metadados sobre seus dados, como contagens de valores distintos, valores mínimos/máximos, padrões de distribuição e contagens de linhas. O otimizador de consulta usa essas informações para escolher a maneira mais eficiente de executar uma consulta. Por exemplo, ao unir duas tabelas, o otimizador precisa saber quantos valores exclusivos cada lado produz para escolher a estratégia de junção correta.

Sem estatísticas, é preciso adivinhar, o que muitas vezes leva a junções mais lentas e a movimentos desnecessários de dados entre nós. É aqui que entra o novo recurso do Amazon Redshift chamado JIT (Just-In-Time) Analyze. As instâncias RG buscam e armazenam automaticamente estatísticas de seus arquivos Iceberg à medida que as consultas são executadas, para que o Amazon Redshift possa escolher estratégias de execução de consultas que sejam muito mais otimizadas do que seria possível sem essas estatísticas.

Essas melhorias tornam as varreduras de dados Iceberg e Parquet muito mais rápidas que o RA3. A remoção da computação do Amazon Redshift Spectrum também significa que as instâncias RG removem o custo de US$ 5/TB para consultas em data lakes, o que torna as consultas em data lakes mais baratas e os custos previsíveis. Esta é uma vitória tripla em termos de preço-desempenho do data lake: desempenho mais rápido, menor custo de computação e nenhum custo de varredura por TB.

A E/S rápida do Amazon Redshift RG e o mecanismo otimizado para Graviton resultam em carregamentos de dados mais rápidos em comparação com o RA3. Para medir esse desempenho aprimorado, executamos a etapa de ingestão de dados de 10 TB TPC-DS e TPC-H em clusters RA3 e RG de tamanho equivalente. RG ingeriu o conjunto de dados TPC-DS 2x mais rápido e o conjunto de dados TPC-H 1,4x mais rápido, conforme mostrado na figura a seguir.

As novas instâncias RG baseadas em Graviton são até 2,0x mais rápidas para carregamentos de dados em comparação com instâncias RA3. Isso significa que as cargas de trabalho podem ver os dados mais recentes com mais rapidez, e os usuários e agentes podem obter insights atualizados com mais rapidez. Essa ingestão mais rápida no RG tem um custo 30% menor em comparação com o RA3, resultando em um preço-desempenho até 2,9x melhor para cargas de dados em comparação com as instâncias RA3.

Os clientes do Amazon Redshift já estão percebendo benefícios de desempenho e custo ao migrar para RG. A Southwest Airlines e a tombola testaram suas cargas de trabalho críticas para os negócios e descobriram que poderiam obter melhor desempenho e economizar custos: "As instâncias do Amazon Redshift RG têm o potencial de proporcionar um impacto comercial significativo para a Southwest Airlines. Com base em testes iniciais em nosso ambiente de desenvolvimento, nossas cargas de trabalho de data warehouse são executadas de 50 a 60% mais rápido, e a análise de data lake é 45% mais rápida, permitindo que as equipes obtenham insights mais rapidamente, respondam às condições operacionais com mais rapidez e tomem decisões baseadas em dados com menos latência.

Esses resultados iniciais são encorajador, e estamos entusiasmados em validar e dimensionar essas melhorias na produção. Tudo isso sem taxas de varredura do Spectrum por terabyte, proporcionando um custo 30% menor do que o RA3, num momento em que os preços dos combustíveis continuam a pressionar as margens da indústria!!” — Sean Lynch, vice-presidente de dados e arquitetura da Southwest Airlines "As novas instâncias do Amazon Redshift RG baseadas em Graviton proporcionaram uma taxa de transferência de gravação 1,8x a 2x mais rápida e velocidades de leitura até 2,2x mais rápidas em comparação com o RA3 em um conjunto diversificado de trabalhos analíticos e em lote, o que nos permitiu processar 40% mais na mesma janela. Ciclos de ETL compactados, tempo de obtenção de insights acelerado e a tomada de decisões não mais limitada pelo pipeline — juntos, tudo isso se traduziu diretamente em dados mais recentes que chegaram mais cedo aos nossos analistas e equipes de negócios O que tornou isso ainda mais atraente foi uma redução simultânea de 30% nos gastos com computação junto com os ganhos – entregar mais por menos é um resultado raro, e vale a pena destacar em uma indústria de jogos com grande volume na tombola, onde a latência de consulta e os custos aumentam em escala, esta foi uma das decisões de plataforma mais impactantes que tomamos este ano.

— Akshay Srinivasan, engenheiro de dados, tombola “Depois de migrar nosso cluster Amazon Redshift de RA3 para as novas instâncias RG baseadas em Graviton, observamos tempos de processamento de consultas 60 a 70% mais rápidos em nossas cargas de trabalho de BI e análise. Como uma plataforma insurtech em crescimento que lida com milhões de transações de políticas, o tempo de obtenção de insights mais rápido significa que nossa equipe de dados pode fornecer painéis e relatórios para a empresa mais cedo. Mudamos para uma configuração de nó maior para acomodar o crescimento futuro e os ganhos de desempenho excedeu em muito o investimento incremental – tornando esta uma das decisões de infraestrutura mais impactantes que tomamos

AICloudAmazonMetaIntelXfasteramazonredshiftlowercostgraviton
Fonte: Amazon.com

💬 Comentários

Carregando comentários…