Serviços

Open source

PT

GOL

Linhas Aéreas Inteligentes

Como a Getup entregou 80% de economia em infraestrutura para a maior operação Kubernetes do setor aéreo brasileiro

A Gol opera uma das maiores frotas de infraestrutura Kubernetes do setor aéreo brasileiro. Com 25 clusters, 97 nós e quase 4 mil pods distribuídos entre Oracle Cloud e Microsoft Azure, qualquer problema de desempenho tem impacto direto na venda de passagens e na operação de voos. Foi nesse ambiente que a Getup identificou um consumo parasita de CPU que comprometia 80% da capacidade de processamento dos clusters, e desenvolveu uma solução que devolveu essa capacidade ao negócio.

Sem a Getup, não teríamos conseguido tocar nossa jornada de modernização de aplicações com Kubernetes. Além de muito conhecimento em Kubernetes, o time da Getup participou muito do projeto: ajudou nas crises, apoiou com logs, estruturação e troubleshooting, e deram sugestões em código. O trabalho da Getup é fantastico.

Marcos Fabio Faria

Gerente de Tecnologia na Gol

Cenário

A Gol é uma das maiores companhias aéreas do Brasil, com operações que precisam funcionar de forma contínua: venda de passagens, gerenciamento de voos e sistemas críticos rodando ao mesmo tempo, sem margem para instabilidade.

Por trás dessa operação existe uma das maiores frotas de infraestrutura Kubernetes do setor aéreo brasileiro: 25 clusters distribuídos entre Oracle Cloud e Microsoft Azure, com 97 nós, 3.791 pods, mais de 1.500 deployments e 1.063 namespaces ativos. Com esse volume, qualquer problema de desempenho ou disponibilidade tem impacto direto no negócio.

O time interno de tecnologia da Gol era qualificado e estruturado, mas a complexidade do ambiente exigia um parceiro especializado para atuar de forma contínua: capaz de responder a incidentes em qualquer horário, conduzir assessments técnicos com profundidade e participar das decisões de arquitetura junto à equipe. Em janeiro de 2026, a Gol contratou a Getup para ocupar esse papel.

Desafio

Nos primeiros sprints da parceria, a equipe da Getup identificou um problema crítico de desempenho nos 16 clusters Oracle Cloud. Os nós operavam com até 81% de CPU consumida de forma constante, sem relação com a carga real das aplicações. Um cluster com 192 núcleos de processador e 750 GB de RAM tinha 80% dos recursos comprometidos antes de qualquer workload de negócio entrar em execução. A Gol pagava por capacidade que não conseguia usar.

A causa estava no kernel Linux. O ambiente rodava Red Hat como sistema operacional base, mas as ferramentas de observabilidade instaladas, incluindo o Datadog, foram desenvolvidas para Fedora. Essa incompatibilidade fazia o mecanismo de cache de decisões do kernel, chamado AVC, entrar em loop contínuo de revalidação, consumindo CPU e memória em todos os nós afetados, o tempo todo.

No mesmo período, um segundo problema tornou-se urgente: o Ingress NGINX, controller de entrada de tráfego amplamente usado nos clusters da Gol, teve suporte encerrado em março de 2026, abrindo CVEs críticas sem perspectiva de correção. A migração para o HAProxy era necessária, mas a Gol tinha 490 manifestos de configuração para converter. Traduzido manualmente, esse volume levaria centenas de horas de trabalho técnico especializado.

Solução

A equipe da Getup conduziu uma varredura nó a nó nos sistemas operacionais dos clusters Oracle Cloud, identificou a colisão entre as ferramentas Fedora e o ambiente Red Hat e desenvolveu a correção para o problema de AVC no kernel. A solução foi aplicada via cloud-init em todos os 16 clusters afetados. O ambiente estabilizou em menos de um mês.

Para a migração do Ingress NGINX, a equipe desenvolveu o Getup Tradutor, uma ferramenta própria que automatiza a conversão de manifestos. O cliente envia os arquivos de configuração, a ferramenta aplica uma matriz de equivalências entre os dois controladores e devolve o pacote completo traduzido em minutos, pronto para aplicar no cluster. Para os casos em que não existe equivalência direta entre os dois controladores, o Tradutor usa tokenização via GPT para encontrar a melhor aproximação e documenta o raciocínio aplicado em cada decisão.

A Getup opera o ambiente da Gol em duas frentes simultâneas. No Remote Ops, a equipe conduz sprints semanais e quinzenais de melhorias, assessments e otimizações, com acompanhamento direto da liderança de tecnologia da Gol. No suporte 24/7, monitora os clusters e atende alertas críticos em qualquer horário, atuando antes que o cliente precise acionar qualquer chamado. CVEs são pautadas em todas as reuniões e tratadas como prioridade na escala de problemas. O time também participa de testes de estresse com a equipe de desenvolvimento da Gol quando convocado, mesmo fora do escopo contratado.

Resultados

A correção do kernel eliminou o consumo parasita de CPU e memória em todos os 16 clusters Oracle Cloud:

  • 80% de redução no consumo de CPU. O cluster de 192 núcleos, que tinha 80% dos recursos consumidos pelo processo do kernel, passou a ter essa capacidade disponível para carga real de negócio.

  • 33% de RAM liberada nos ambientes mais críticos.

  • 20 GB ou mais recuperados por nó com a limpeza de imagens de containers obsoletas, realizada em fevereiro de 2026.

Na migração do Ingress NGINX para HAProxy, com o Getup Tradutor:

  • 490 manifestos da Gol traduzidos em 50 minutos, processo que levaria centenas de horas de trabalho manual.

  • Mais de 1.000 manifestos traduzidos no total, incluindo outros clientes que passaram pelo mesmo processo de migração.

  • 100% de assertividade nos testes de tradução.

Desde o início da parceria, todos os incidentes foram resolvidos em tempo hábil e todas as entregas de Remote Ops realizadas dentro dos prazos acordados.

Em um dos incidentes mais críticos da parceria, a equipe de desenvolvimento da Gol ficou travada após uma implementação do HAProxy em produção. O ambiente não permitia instalação de ferramentas externas de debug por política interna. O time da Getup escreveu no PowerShell um script que simulava o comportamento de um navegador para testar o backend sem ferramentas externas. O diagnóstico revelou que uma regra de firewall aplicada internamente havia quebrado o balanceamento de carga nos servidores Windows, fora do escopo de suporte contratado. O problema foi identificado e resolvido na mesma sessão.

80%

de redução no consumo de CPU.

33%

de RAM liberada.

20 GB

ou mais recuperados por nó.

Quer entender como a Getup pode atuar na sua infraestrutura?

Conheça o Remote Ops e o suporte 24/7 da Getup e veja como sua equipe pode operar com mais estabilidade, segurança e eficiência.

Há mais de 10 anos operando Kubernetes em produção. Com o Quor, essa experiência alcança também a segurança da cadeia de software.

Há mais de 10 anos operando Kubernetes em produção. Com o Quor, essa experiência alcança também a segurança da cadeia de software.

Há mais de 10 anos operando Kubernetes em produção. Com o Quor, essa experiência alcança também a segurança da cadeia de software.