O Data-Centric Sampler usa meta-learning para identificar os dados mais relevantes para treinar modelos de IA, reduzindo custos computacionais e a pegada de carbono.
Projeto Automaise Sustainable AI Platform
Durante anos, o mundo da Inteligência Artificial funcionou com uma crença quase religiosa: quanto mais dados, melhor. Mais dados de treino significavam modelos mais precisos, mais robustos, mais capazes. Era uma regra não escrita que impulsionou investimentos massivos em infraestrutura, armazenamento e poder computacional.
O problema? Esta regra está a ser contestada pela própria ciência.
Estudos recentes têm demonstrado que, em muitos contextos, a qualidade dos dados supera a quantidade. Um conjunto de dados menor, mas mais representativo e bem selecionado, pode produzir resultados comparáveis, ou superiores, a um conjunto massivo e ruidoso. É esta ideia que está na base do movimento data-centric AI, e é também o princípio que guia o desenvolvimento do Data-Centric Sampler.
O que é o Data-Centric Sampler?
O Data-Centric Sampler é um módulo que estamos a integrar na nossa plataforma com um objetivo claro: criar amostras eficientes de dados para treino de modelos de IA, reduzindo drasticamente a quantidade de dados necessária sem comprometer a qualidade dos resultados.
Em termos simples, em vez de treinar um modelo com 100% dos dados disponíveis, o Data-Centric Sampler identifica os exemplos mais informativos, aqueles que realmente ensinam algo ao modelo, e constrói uma amostra otimizada. O modelo aprende mais, com menos.
A inovação: meta-learning aplicado à amostragem
O que torna o Data-Centric Sampler verdadeiramente inovador é a abordagem técnica que lhe está subjacente: o meta-learning.
O meta-learning, ou "aprender a aprender", é um ramo da IA em que os sistemas desenvolvem a capacidade de adaptar estratégias de aprendizagem com base em experiências anteriores. Aplicado à amostragem de dados, permite ao sistema compreender, a partir de múltiplos conjuntos de dados e casos de uso, que tipo de exemplos são mais valiosos para treinar um determinado modelo numa determinada tarefa.
Estamos numa posição privilegiada para desenvolver esta tecnologia. A nossa plataforma processa dados de clientes em setores muito diversificados, como contact centers, seguradoras, retalho, energia e banca, o que gera um efeito de rede valioso: quanto mais casos de uso são processados, mais o sistema aprende sobre que dados fazem realmente a diferença.
Esta é uma investigação que dificilmente poderia ser conduzida em contexto puramente académico, precisamente porque os dados industriais, mais ruidosos, maiores e mais complexos do que os dados de investigação open-source, são o ambiente onde estas técnicas precisam de ser testadas e validadas.
O que esperamos alcançar?
Os objetivos do Data-Centric Sampler são quantificados e verificáveis:
Redução de pelo menos 40% no tamanho do conjunto de dados necessário para treinar modelos de IA com desempenho equivalente.
Redução de pelo menos 30% na complexidade dos modelos resultantes, graças a uma melhor qualidade dos dados de treino.
Menor custo computacional no desenvolvimento e manutenção de soluções, com poupanças estimadas de pelo menos 30% nos custos de infraestrutura cloud.
O impacto no mundo real
Para um cliente que desenvolve um assistente virtual na nossa plataforma, isto traduz-se em experiências concretas:
Menos tempo de experimentação. O processo de fine-tuning torna-se mais rápido porque o sistema já sabe que dados usar.
Menos dependência de GPUs caras. Treinar modelos com menos dados reduz a necessidade de infraestrutura de alto custo. Um servidor com GPU Nvidia A100 custa cerca de 2.200€ por mês em plataformas cloud como a Azure ou a Google Cloud. Reduzir o tempo de treino significa reduzir diretamente este custo.
Menor pegada de carbono. Menos computação significa menos emissões. O Data-Centric Sampler é, por isso, também uma ferramenta de sustentabilidade.
Um contributo para a comunidade
Comprometemo-nos a lançar o Data-Centric Sampler como uma biblioteca Python de código aberto, compatível com a popular biblioteca Pandas. Isto significa que qualquer equipa de ciência de dados, em qualquer parte do mundo, poderá beneficiar desta investigação, sem barreiras de acesso.
Acreditamos que tornar a IA mais eficiente é um bem público. E que partilhar o conhecimento desenvolvido é parte integrante desta missão.
O Data-Centric Sampler é um dos três módulos do projeto Automaise Sustainable AI Platform, co-financiado pelo Portugal 2030 e pela União Europeia através do programa COMPETE 2030. No próximo artigo, apresentamos o AI Carbon Emissions Calculator, a ferramenta que mede a pegada carbónica das soluções de IA antes mesmo de estas serem desenvolvidas.




