Services

Open source

EN

GOL

Linhas Aéreas Inteligentes

Como a Getup entregou 80% de economia em infraestrutura para a maior operação Kubernetes do setor aéreo brasileiro

A Gol opera uma das maiores frotas de infraestrutura Kubernetes do setor aéreo brasileiro. Com 25 clusters, 97 nós e quase 4 mil pods distribuídos entre Oracle Cloud e Microsoft Azure, qualquer problema de desempenho tem impacto direto na venda de passagens e na operação de voos. Foi nesse ambiente que a Getup identificou um consumo parasita de CPU que comprometia 80% da capacidade de processamento dos clusters, e desenvolveu uma solução que devolveu essa capacidade ao negócio.

Sem a Getup, não teríamos conseguido tocar nossa jornada de modernização de aplicações com Kubernetes. Além de muito conhecimento em Kubernetes, o time da Getup participou muito do projeto: ajudou nas crises, apoiou com logs, estruturação e troubleshooting, e deram sugestões em código. O trabalho da Getup é fantastico.

Marcos Fabio Faria

Gerente de Tecnologia na Gol

Cenário

A Gol é uma das maiores companhias aéreas do Brasil, com operações que precisam funcionar de forma contínua: venda de passagens, gerenciamento de voos e sistemas críticos rodando ao mesmo tempo, sem margem para instabilidade.

Por trás dessa operação existe uma das maiores frotas de infraestrutura Kubernetes do setor aéreo brasileiro: 25 clusters distribuídos entre Oracle Cloud e Microsoft Azure, com 97 nós, 3.791 pods, mais de 1.500 deployments e 1.063 namespaces ativos. Com esse volume, qualquer problema de desempenho ou disponibilidade tem impacto direto no negócio.

O time interno de tecnologia da Gol era qualificado e estruturado, mas a complexidade do ambiente exigia um parceiro especializado para atuar de forma contínua: capaz de responder a incidentes em qualquer horário, conduzir assessments técnicos com profundidade e participar das decisões de arquitetura junto à equipe. Em janeiro de 2026, a Gol contratou a Getup para ocupar esse papel.

Desafio

Nos primeiros sprints da parceria, a equipe da Getup identificou um problema crítico de desempenho nos 16 clusters Oracle Cloud. Os nós operavam com até 81% de CPU consumida de forma constante, sem relação com a carga real das aplicações. Um cluster com 192 núcleos de processador e 750 GB de RAM tinha 80% dos recursos comprometidos antes de qualquer workload de negócio entrar em execução. A Gol pagava por capacidade que não conseguia usar.

A causa estava no kernel Linux. O ambiente rodava Red Hat como sistema operacional base, mas as ferramentas de observabilidade instaladas, incluindo o Datadog, foram desenvolvidas para Fedora. Essa incompatibilidade fazia o mecanismo de cache de decisões do kernel, chamado AVC, entrar em loop contínuo de revalidação, consumindo CPU e memória em todos os nós afetados, o tempo todo.

No mesmo período, um segundo problema tornou-se urgente: o Ingress NGINX, controller de entrada de tráfego amplamente usado nos clusters da Gol, teve suporte encerrado em março de 2026, abrindo CVEs críticas sem perspectiva de correção. A migração para o HAProxy era necessária, mas a Gol tinha 490 manifestos de configuração para converter. Traduzido manualmente, esse volume levaria centenas de horas de trabalho técnico especializado.

Solução

A equipe da Getup conduziu uma varredura nó a nó nos sistemas operacionais dos clusters Oracle Cloud, identificou a colisão entre as ferramentas Fedora e o ambiente Red Hat e desenvolveu a correção para o problema de AVC no kernel. A solução foi aplicada via cloud-init em todos os 16 clusters afetados. O ambiente estabilizou em menos de um mês.

Para a migração do Ingress NGINX, a equipe desenvolveu o Getup Tradutor, uma ferramenta própria que automatiza a conversão de manifestos. O cliente envia os arquivos de configuração, a ferramenta aplica uma matriz de equivalências entre os dois controladores e devolve o pacote completo traduzido em minutos, pronto para aplicar no cluster. Para os casos em que não existe equivalência direta entre os dois controladores, o Tradutor usa tokenização via GPT para encontrar a melhor aproximação e documenta o raciocínio aplicado em cada decisão.

A Getup opera o ambiente da Gol em duas frentes simultâneas. No Remote Ops, a equipe conduz sprints semanais e quinzenais de melhorias, assessments e otimizações, com acompanhamento direto da liderança de tecnologia da Gol. No suporte 24/7, monitora os clusters e atende alertas críticos em qualquer horário, atuando antes que o cliente precise acionar qualquer chamado. CVEs são pautadas em todas as reuniões e tratadas como prioridade na escala de problemas. O time também participa de testes de estresse com a equipe de desenvolvimento da Gol quando convocado, mesmo fora do escopo contratado.

Resultados

A correção do kernel eliminou o consumo parasita de CPU e memória em todos os 16 clusters Oracle Cloud:

  • 80% de redução no consumo de CPU. O cluster de 192 núcleos, que tinha 80% dos recursos consumidos pelo processo do kernel, passou a ter essa capacidade disponível para carga real de negócio.

  • 33% de RAM liberada nos ambientes mais críticos.

  • 20 GB ou mais recuperados por nó com a limpeza de imagens de containers obsoletas, realizada em fevereiro de 2026.

Na migração do Ingress NGINX para HAProxy, com o Getup Tradutor:

  • 490 manifestos da Gol traduzidos em 50 minutos, processo que levaria centenas de horas de trabalho manual.

  • Mais de 1.000 manifestos traduzidos no total, incluindo outros clientes que passaram pelo mesmo processo de migração.

  • 100% de assertividade nos testes de tradução.

Desde o início da parceria, todos os incidentes foram resolvidos em tempo hábil e todas as entregas de Remote Ops realizadas dentro dos prazos acordados.

Em um dos incidentes mais críticos da parceria, a equipe de desenvolvimento da Gol ficou travada após uma implementação do HAProxy em produção. O ambiente não permitia instalação de ferramentas externas de debug por política interna. O time da Getup escreveu no PowerShell um script que simulava o comportamento de um navegador para testar o backend sem ferramentas externas. O diagnóstico revelou que uma regra de firewall aplicada internamente havia quebrado o balanceamento de carga nos servidores Windows, fora do escopo de suporte contratado. O problema foi identificado e resolvido na mesma sessão.

80%

de redução no consumo de CPU.

33%

de RAM liberada.

20 GB

ou mais recuperados por nó.

Quer entender como a Getup pode atuar na sua infraestrutura?

Conheça o Remote Ops e o suporte 24/7 da Getup e veja como sua equipe pode operar com mais estabilidade, segurança e eficiência.

Operating Kubernetes in production for more than 10 years. With Quor, this experience extends to software supply chain security as well.

Operating Kubernetes in production for more than 10 years. With Quor, this experience extends to software supply chain security as well.

Operating Kubernetes in production for more than 10 years. With Quor, this experience extends to software supply chain security as well.