Pular para o conteúdo

Sua estratégia de IA tem um problema de dados

ai-strategy-data | | Cheesecake Labs
Resumo
  • Projetos de IA travam por falta de dados confiáveis: dados espalhados em ferramentas desconectadas e métricas divergentes entre áreas fazem a infraestrutura de dados ser o bloqueio mais comum, com o Gartner estimando abandono de 60% dos projetos de IA em 2026 e a McKinsey apontando que só 6% das organizações extraem valor relevante.
  • Modernização de dados na prática significa migrar de ETL para ELT e organizar os dados em arquitetura medallion (bronze, silver e gold), sendo a camada silver a mais valiosa para IA por alimentar pipelines de RAG, knowledge graphs e workflows agênticos.
  • O stack moderno é enxuto: Airbyte para extração e carga, BigQuery (ou Snowflake/Databricks) para armazenamento, dbt para transformação e ferramentas como Sigma, Omni, Hex ou Looker para visualização, com governança (controle de acesso por coluna, testes de qualidade e revisão das saídas dos agents) como requisito antes de colocar agents em produção.
  • A recomendação é começar pequeno com um caso de uso que dói de verdade, provar que o dashboard é confiável e só então expandir para agents e RAG, tratando modernização de dados e IA como um único projeto, já que a diferenciação está nos dados e não nos modelo

Empresas em crescimento não sofrem com falta de dados. Sofrem com falta de dados confiáveis. A pergunta que a maioria dos times está fazendo é: como usar IA para ter insights melhores?

A pergunta que deveriam estar fazendo é outra: por que não conseguimos insights confiáveis hoje? A resposta é quase sempre a mesma. Não é estratégia. Não é ferramenta. Não é orçamento. É a infraestrutura de dados.

Por que os projetos de IA travam

Existe uma distância entre como as empresas descrevem a própria situação de dados e o que você encontra quando vai olhar.

A história costuma seguir um padrão conhecido. Os dados moram em uma dúzia de ferramentas desconectadas. Marketing mantém as próprias planilhas. Financeiro tem um número diferente para a mesma métrica. O time de engenharia está ocupado demais mantendo os sistemas atuais de pé para conseguir conectar qualquer coisa. A liderança decide no instinto ou, pior, discute qual planilha está certa em vez de usar os dados para avançar.

Enquanto isso, o conselho pergunta sobre IA.

O Gartner estima que organizações sem dados prontos para IA vão abandonar 60% dos seus projetos de IA em 2026, não por causa de modelos ruins ou ferramentas erradas, mas porque os dados por baixo não estão prontos.

O relatório State of AI 2025 da McKinsey mostrou que 88% das organizações usam IA de alguma forma, mas só 6% extraem valor relevante (impacto de ≥5% no EBIT vindo de IA). A infraestrutura de dados é o primeiro bloqueio mais comum, e o único que está inteiramente sob o seu controle resolver.

Você não constrói um pipeline de RAG em cima de planilhas desatualizadas. Você não treina um agent para agir sobre os seus dados de operação se esses dados vivem em exportações manuais que alguém roda na sexta à tarde. Você não faz a IA responder perguntas sobre o negócio se ninguém concorda com os números para começar.

O que “modernização de dados” quer dizer de verdade

O termo é usado de forma solta, então vale esclarecer o que ele significa na prática.

A arquitetura de dados tradicional foi construída em torno de ETL: Extract, Transform, Load. Você puxava os dados dos sistemas de origem, limpava e formatava antes de armazenar, e só então carregava tudo em um warehouse. O problema é que a transformação acontecia antes de você saber quais perguntas ia querer fazer, incluindo perguntas impossíveis de prever quando a IA mal existia.

A arquitetura de dados moderna inverte isso. ELT: Extract, Load, Transform. Você ingere o dado bruto primeiro, guarda tudo e transforma sob demanda. O armazenamento é altamente escalável e deixou de ser uma restrição real. O processamento é cobrado por consumo, ou seja, você paga pelo que usa, mas isso também significa que custo de query fora de controle é um risco concreto se você não particionar tabelas e gerenciar o acesso com cuidado. 

O valor do ELT não é só ser mais barato; é flexibilidade: você remodela os dados para novos casos de uso de IA sem reconstruir pipelines do zero.

A forma mais duradoura de organizar isso é uma estrutura de três camadas chamada arquitetura medallion:

Bronze é o dado bruto recém-ingerido. Exatamente o que veio do sistema de origem. Intocado. 

Silver é onde o trabalho de verdade acontece. Os dados são limpos, cruzados, enriquecidos e ganham contexto de negócio. Essa é a camada que mais importa para IA: estruturada o suficiente para os modelos usarem, mas perto o bastante do dado bruto para não ter sido moldada demais em torno de um único caso de uso.

Gold é o dado pronto para o negócio: estruturado, agregado e modelado para necessidades específicas de reporte. Dashboards executivos, acompanhamento de KPI, métricas para o conselho.

A maioria das empresas trata o gold como linha de chegada. No contexto de IA, o silver costuma valer mais. É a camada que alimenta pipelines de RAG, knowledge graphs e workflows agênticos, porque IA precisa de contexto e nuance, não só de estatística agregada.

Uma nota sobre dados não estruturados: nem tudo mora em um warehouse. Muitos casos de uso de RAG buscam informação em PDFs, tickets de suporte, contratos, transcrições de ligações e wikis internas. O princípio é o mesmo (documentos bem divididos em chunks, com controle de acesso e metadados limpos), mas o pipeline é diferente. Dados estruturados e não estruturados precisam ser resolvidos em paralelo, não em sequência.

Leia também: Machine Learning explicado: o que é, como funciona e por que importa para o negócio

O stack não é complicado

Uma das razões pelas quais as empresas adiam a modernização de dados é a suposição de que ela exige uma reforma gigante de infraestrutura. Não exige.

Um stack de dados moderno e bem desenhado é enxuto de propósito:

Para extração e carga, o Airbyte é open-source, conecta nativamente a centenas de fontes e custa uma fração de opções estabelecidas como o Fivetran. Para times com folga de engenharia, conectores próprios em Python funcionam bem para fontes específicas.

Para armazenamento, o BigQuery é um padrão sólido para a maioria das empresas de médio porte, com cobrança por consumo e integração profunda com o ecossistema Google. Snowflake e Databricks são alternativas consistentes, dependendo da infraestrutura que você já tem.

Para transformação e modelagem, o dbt é a escolha padrão da maioria dos times nessa área: open-source, com uma comunidade enorme e um histórico comprovado de transformar dado bruto em modelos confiáveis e reutilizáveis.

Para visualização, a escolha depende da necessidade do seu time. O Sigma é nativo de warehouse e habilitado para IA, feito para exploração de verdade. O Omni se apoia em uma camada semântica. O Hex é mais adequado para workflows de data science. O Looker escala bem no nível enterprise.

O objetivo não é construir a arquitetura perfeita no primeiro dia. É demonstrar que o dado é confiável antes de pedir que alguém tome decisões com base nele.

Onde a IA entra

Com uma camada silver limpa, os casos de uso de IA ficam diretos de construir.

Pipelines de RAG funcionam recuperando trechos relevantes dos seus dados e entregando isso a um LLM como contexto. Sem uma camada silver estruturada e governada, sistemas de RAG ou alucinam (quando não têm dado bom para recuperar) ou devolvem resultados inconsistentes (quando o mesmo conceito é modelado de formas diferentes em cada fonte). A camada silver é o banco de recuperação; limpe uma vez, use em todo lugar.

Workflows agênticos são onde está a alavancagem operacional de verdade. Um agent que monitora o health score dos clientes e dispara a conversa de renovação. Um agent que analisa os dados semanais de alocação e sinaliza risco de margem antes de virar problema.

Um agent que junta dados de várias fontes em um brief executivo sem ninguém passar a sexta à tarde em planilhas. Isso não é ficção científica; são workflows do n8n rodando em cima de uma camada de dados bem modelada.

O padrão se repete: as empresas que conseguem de fato colocar esses casos de uso de pé não são as que gastaram mais em ferramenta de IA. São as que fizeram primeiro o trabalho sem glamour de limpar os próprios dados.

Governança

Uma peça que o stack enxuto acima não cobre: governança. 

Quem é dono desses dados? Quem pode consultá-los? O que acontece quando um AI agent expõe o PII de um cliente para o funcionário errado ou alucina um número de receita dentro de um brief executivo? 

Antes de colocar agents em cima da sua camada silver, você precisa no mínimo de: controles de acesso em nível de coluna, testes de qualidade de dados (os testes do dbt são um bom ponto de partida) e um processo definido de revisão das saídas dos agents antes que elas cheguem a quem decide.

Comece pequeno. Construa confiança. Depois expanda.

O maior erro não é escolher as ferramentas erradas. É tentar resolver tudo de uma vez na primeira fase.

Escolha um caso de uso que dói de verdade. Conecte as fontes. Construa o modelo. Mostre que o dashboard é confiável e que ele economiza tempo real. Essa prova de valor é o que garante orçamento e apoio da organização para a fase seguinte.

Aí sim expanda: mais fontes, mais visões por unidade de negócio, modelagem mais sofisticada. Quando você chegar em AI agents e pipelines de RAG, a fundação de dados já vai estar lá, e o time já vai confiar nela.

Essa ordem importa. IA em cima de dado ruim não produz IA ruim. Produz respostas erradas ditas com confiança. E resposta errada dita com confiança é pior do que resposta nenhuma.

A virada de perspectiva

Quando o seu conselho perguntar “qual é a nossa estratégia de IA?”, a resposta honesta talvez seja: “estamos construindo, e ela começa por deixar os nossos dados confiáveis”.

Isso não é atraso. Isso é a estratégia.

Modernização de dados não é o que você faz antes da IA. É o trabalho que torna a IA possível. Os times que tratam as duas coisas como projetos separados estão rodando o mesmo projeto duas vezes, só que mais devagar e mais caro. Os times que entendem que é um projeto só são os que estão de fato entregando.

Modelos de fronteira são commodity. Toda empresa, inclusive os seus concorrentes, tem acesso aos mesmos LLMs. A diferenciação nunca esteve no modelo. Sempre esteve em ter dados bons o suficiente para usar um.

Na Cheesecake Labs, ajudamos empresas em crescimento a construir a fundação de dados que torna a IA possível, da arquitetura e engenharia de pipelines à análise de dados e workflows agênticos. Se o seu time é rico em dados e pobre em insights, vamos conversar.

FAQ

Por que os projetos de IA travam nas empresas em crescimento?

Quase sempre o bloqueio não é estratégia, ferramenta ou orçamento, mas a infraestrutura de dados. Os dados moram em ferramentas desconectadas, cada área tem números diferentes para a mesma métrica e ninguém concorda com os números. O Gartner estima que organizações sem dados prontos para IA vão abandonar 60% dos seus projetos de IA em 2026, e o relatório State of AI 2025 da McKinsey mostrou que 88% das organizações usam IA, mas só 6% extraem valor relevante.

O que é modernização de dados na prática?

É a troca da arquitetura tradicional ETL (Extract, Transform, Load), em que os dados eram transformados antes de saber quais perguntas seriam feitas, pela arquitetura ELT (Extract, Load, Transform), em que o dado bruto é ingerido primeiro, guardado e transformado sob demanda. O valor não é só custo, mas flexibilidade para remodelar os dados para novos casos de uso de IA sem reconstruir pipelines do zero.

O que é a arquitetura medallion e qual camada importa mais para IA?

É uma estrutura de três camadas: Bronze (dado bruto intocado, exatamente como veio da origem), Silver (dados limpos, cruzados, enriquecidos e com contexto de negócio) e Gold (dado pronto para o negócio, agregado e modelado para reporte). A maioria trata o gold como linha de chegada, mas no contexto de IA o silver costuma valer mais, pois alimenta pipelines de RAG, knowledge graphs e workflows agênticos.

Quais ferramentas compõem um stack de dados moderno e enxuto?

Para extração e carga, Airbyte (open-source) ou conectores próprios em Python; para armazenamento, BigQuery, com Snowflake e Databricks como alternativas; para transformação e modelagem, dbt; para visualização, Sigma, Omni, Hex ou Looker, dependendo da necessidade do time. O objetivo não é a arquitetura perfeita no primeiro dia, mas demonstrar que o dado é confiável.

Por que governança é necessária antes de colocar AI agents em produção?

Porque é preciso definir quem é dono dos dados, quem pode consultá-los e evitar que um agent exponha PII de um cliente para o funcionário errado ou alucine um número de receita em um brief executivo. No mínimo, são necessários controles de acesso em nível de coluna, testes de qualidade de dados (os testes do dbt são um bom ponto de partida) e um processo de revisão das saídas dos agents antes de chegarem a quem decide.