A mineração de dados revolucionou muitos campos científicos, permitindo que pesquisadores analisassem vastos conjuntos de dados e descobrissem padrões ocultos que seriam impossíveis de detectar através de métodos tradicionais. No campo da ciência de materiais, as técnicas de mineração de dados são cada vez mais usadas para descobrir novos materiais industriais e composições que podem levar a produtos e processos inovadores.A aprendizagem de máquinas transforma a paisagem do design de materiais 2D, particularmente na aceleração dos processos de descoberta, otimização e triagem.Esta abordagem orientada por dados representa uma mudança fundamental na forma como os cientistas de materiais abordam o desafio de desenvolver novos materiais para aplicações industriais.
A abordagem tradicional de testes e erros na descoberta de materiais tem servido bem a ciência durante séculos, mas é cada vez mais inadequada para atender às demandas da indústria moderna. A inovação de materiais desempenha um papel muito importante no progresso tecnológico e desenvolvimento industrial. Exploração experimental tradicional e simulação numérica muitas vezes exigem tempo e recursos consideráveis. Com o crescimento exponencial de dados de materiais de experimentos, simulações e literatura, a mineração de dados oferece uma alternativa poderosa que pode acelerar drasticamente o ritmo de descoberta, reduzindo custos e consumo de recursos.
Compreendendo a mineração de dados em contexto científico de materiais
A mineração de dados em ciência de materiais refere-se à aplicação de técnicas computacionais para extrair padrões, relações e insights significativos de grandes conjuntos de dados de materiais.Esta abordagem interdisciplinar combina elementos de ciência da computação, estatística, ciência de materiais e especialização de domínio para identificar candidatos a materiais promissores que, de outra forma, podem permanecer ocultos em vastas bases de dados.O processo envolve coletar, limpar, integrar e analisar dados de múltiplas fontes para gerar conhecimento acionável que pode orientar o trabalho experimental e acelerar o desenvolvimento de materiais.
A comunidade científica de materiais tem abraçado a mineração de dados como parte de um movimento mais amplo em direção à informática de materiais, um campo que aplica princípios da ciência de dados à pesquisa de materiais. Essa mudança tem sido impulsionada por vários fatores, incluindo a disponibilidade de recursos computacionais de grande escala, o desenvolvimento de algoritmos sofisticados de aprendizado de máquinas e a criação de bases de dados de materiais abrangentes que fornecem os dados brutos necessários para a mineração de dados eficaz.
A Iniciativa Genoma de Materiais e a Descoberta de Dados
A Iniciativa de Genoma de Materiais, lançada nos Estados Unidos em 2011, tem sido fundamental para promover abordagens orientadas por dados para a descoberta de materiais. Esta iniciativa reconheceu que o ciclo tradicional de desenvolvimento de materiais – que pode levar 10-20 anos desde a descoberta inicial até a implantação comercial – precisava ser drasticamente reduzido para manter a competitividade na fabricação avançada. As técnicas de mineração de dados e de aprendizado de máquinas tornaram-se ferramentas centrais para alcançar essa aceleração, permitindo que pesquisadores rastreiem rapidamente milhares ou até milhões de composições de materiais potenciais computacionalmente antes de comprometer recursos para validação experimental.
O papel da mineração de dados na descoberta de materiais
Os métodos tradicionais de descobrir novos materiais envolvem frequentemente experiências de testes e erros, que podem ser demoradas e dispendiosas. Uma única campanha experimental para desenvolver uma nova liga ou material composto pode exigir meses ou anos de trabalho e consumir recursos laboratoriais significativos. A mineração de dados permite que os cientistas pesquise através de grandes conjuntos de dados, incluindo resultados experimentais e simulações computacionais, para identificar candidatos promissores de forma mais eficiente. A aprendizagem de máquinas pode reduzir muito os custos computacionais, reduzir o ciclo de desenvolvimento e melhorar a precisão computacional. Tornou-se uma das abordagens de pesquisa mais promissoras no processo de triagem de novos materiais e previsão de propriedades de materiais.
O poder da mineração de dados na descoberta de materiais reside em sua capacidade de identificar relações complexas e não lineares entre composição, estrutura, condições de processamento e propriedades de materiais. Essas relações são muitas vezes muito complexas para pesquisadores humanos discernirem por intuição, especialmente quando lidam com sistemas multicomponentes ou materiais com microestruturas complexas. Ao aplicar algoritmos sofisticados em conjuntos de dados abrangentes, os pesquisadores podem descobrir correlações ocultas e usá-las para prever as propriedades de materiais que nunca foram sintetizados.
Tipos de dados utilizados na mineração de dados de materiais
A eficácia da mineração de dados na descoberta de materiais depende criticamente da qualidade, quantidade e diversidade dos dados disponíveis. Os cientistas de materiais se baseiam em várias fontes de dados, cada uma fornecendo diferentes tipos de informações que podem ser integradas para criar uma visão abrangente do comportamento do material:
- Dados experimentais de ensaios laboratoriais: Isto inclui medições de propriedades mecânicas (força, dureza, ductilidade), propriedades térmicas (condutividade, coeficiente de expansão), propriedades elétricas (condutividade, constante dielétrica), propriedades ópticas e propriedades químicas. Dados experimentais fornecem informações sobre a verdade do solo, mas é muitas vezes limitada em quantidade devido ao tempo e custo de experimentos.
- Resultados de simulação computacional: Cálculos da teoria funcional da densidade (DFT), simulações de dinâmica molecular e análises de elementos finitos geram vastas quantidades de dados sobre propriedades e comportamento do material. A teoria funcional da densidade foi popular desde 2019 até 2024, permanecendo nas 10 palavras-chave mais importantes durante 5 anos. Portanto, uma combinação de teoria funcional da densidade e aprendizagem de máquina provavelmente continuará a ser usada no futuro. Essas abordagens computacionais podem explorar espaços materiais que são difíceis ou impossíveis de acessar experimentalmente.
- Bases de literatura e patentes:] Décadas de pesquisas publicadas contêm informações valiosas sobre propriedades de materiais, métodos de síntese e características de desempenho.Embutimentos de palavras não perspicazes capturam conhecimento latente da literatura científica de materiais.Técnicas de mineração de texto podem extrair dados estruturados de publicações científicas não estruturadas.
- Bases de dados de propriedades materiais: Bancos de dados curados, como o Projeto Materiais, AFLOW, OQMD (Open Quantum Materials Database), e outros fornecem dados padronizados de alta qualidade em milhares de materiais.Estas bases de dados servem como conjuntos de treinamento para modelos de aprendizado de máquina e fontes de referência para validação.
- Dados experimentais de alta performance: As plataformas automatizadas de síntese e caracterização podem gerar grandes conjuntos de dados, variando sistematicamente os parâmetros de composição e processamento.Essa abordagem combina a confiabilidade dos dados experimentais com as vantagens de escala dos métodos computacionais.
- Dados microestruturais: Técnicas avançadas de imagem, como microscopia eletrônica, tomografia de raios X e tomografia de sonda atômica, fornecem informações detalhadas sobre a estrutura do material em escalas de comprimento múltiplo.Esses dados estão sendo cada vez mais integrados com dados de propriedade para entender as relações estrutura-propriedade.
Técnicas de Mineração de Dados Aplicadas à Descoberta de Materiais
Os cientistas de materiais empregam um conjunto de ferramentas diversas de mineração de dados e técnicas de aprendizado de máquina, cada um adequado para diferentes tipos de problemas e conjuntos de dados. A escolha da técnica depende de fatores como o tamanho e a qualidade dos dados disponíveis, a complexidade das relações que estão sendo modeladas e os objetivos específicos da pesquisa:
- Algoritmos de classificação para agrupar materiais semelhantes: Métodos de aprendizagem não perspicazes, como agrupamento de k-means, agrupamento hierárquico e DBSCAN podem identificar agrupamentos naturais em dados de materiais. Essas técnicas ajudam pesquisadores a descobrir famílias de materiais com propriedades semelhantes ou identificar outliers que podem representar novas classes de materiais.A agregação é particularmente valiosa na análise exploratória de dados quando os pesquisadores querem entender a estrutura de um espaço de materiais sem noções preconcebidas.
- Modelos de classificação para prever propriedades do material: Algoritmos de aprendizagem supervisionados, como máquinas vetoriais de suporte, florestas aleatórias e redes neurais, podem ser treinados para classificar materiais em categorias com base em suas propriedades. Por exemplo, modelos de classificação podem prever se um material será metálico ou semicondutor, magnético ou não magnético, estável ou instável. Estas previsões binárias ou multiclasses são muitas vezes mais fáceis de fazer com precisão do que as previsões de propriedade contínua.
- Análise de regressão para estimar o desempenho do material:Quando são necessárias previsões quantitativas de propriedades, as técnicas de regressão fornecem saídas de valor contínuo.Modelos de aprendizado de máquina podem fornecer previsões rápidas e precisas de propriedades do material, mas muitas vezes carecem de transparência.Regressão linear, regressão polinomial, regressão de processo gaussiana e regressão de rede neural podem ser aplicados dependendo da complexidade da relação propriedade-composição.
- Aprendizado por regras de associação para encontrar relações entre elementos e propriedades: Essas técnicas, emprestadas da análise de cestas de mercado, podem identificar correlações entre a presença de certos elementos ou características estruturais e propriedades desejáveis. As regras de associação podem revelar que certas combinações de elementos tendem a produzir materiais com características específicas, orientando o desenho de novas composições.
- Abordagens de aprendizagem profunda:] Ao usar uma abordagem de aprendizagem profunda, podemos contornar tal engenharia de recursos manuais que requer conhecimento de domínio e alcançar resultados muito melhores, mesmo com apenas alguns milhares de amostras de treinamento. Apresentamos o projeto e implementação de um modelo de rede neural profunda, denominado ElemNet; ele captura automaticamente as interações físicas e químicas e semelhanças entre diferentes elementos usando inteligência artificial que permite prever as propriedades dos materiais com melhor precisão e velocidade. Redes neurais profundas, redes neurais convolucionais e redes neurais gráficas têm mostrado notável sucesso na predição de propriedades de materiais.
- Transferência de aprendizagem: Esta técnica alavanca modelos treinados em grandes conjuntos de dados para fazer previsões de problemas relacionados com conjuntos de dados menores. A transferência de aprendizagem é particularmente valiosa na ciência dos materiais, onde a disponibilidade de dados varia amplamente entre diferentes classes de materiais e propriedades.
- Aprendizagem ativa: Esta abordagem seleciona iterativamente os experimentos ou cálculos mais informativos para realizar, usando previsões de modelos e estimativas de incerteza para orientar a pesquisa.A aprendizagem ativa pode reduzir drasticamente o número de experimentos necessários para descobrir materiais com propriedades alvo.
Previsão de Propriedade de Materiais Baseados em Composição
One of the most powerful applications of data mining in materials discovery is the prediction of material properties directly from chemical composition, without requiring knowledge of the crystal structure. Machine learning has the potential to accelerate materials discovery by accurately predicting materials properties at a low computational cost. We develop a machine abordagem de aprendizagem que toma apenas a estequiometria como entrada e aprende automaticamente descritores apropriados e sistematicamente improváveis a partir de dados, sendo esta capacidade particularmente valiosa para o rastreamento de grandes números de composições potenciais antes de investir em determinação ou síntese de estruturas.
Representando composições químicas para aprendizagem de máquina
Um desafio fundamental na predição de propriedades baseadas em composição é como representar fórmulas químicas em uma forma adequada para algoritmos de aprendizado de máquina. Nosso principal insight metodológico é representar as composições de materiais como gráficos ponderados densos. Mostramos que esta formulação melhora significativamente a eficiência amostral do modelo em comparação com outras abordagens de diagnóstico de estrutura. Vários esquemas de representação foram desenvolvidos, incluindo:
- Vetores de propriedade elementar: Os materiais são representados por vetores contendo médias ponderadas de propriedades elementares, tais como raio atômico, eletronegatividade, energia de ionização e afinidade eletrônica. Os pesos correspondem às proporções estequiométricas de cada elemento.
- Codificação a quente: Cada elemento da tabela periódica é atribuído uma característica binária, com o valor indicando presença ou ausência na composição. Esta abordagem simples pode ser eficaz, mas não captura informações sobre propriedades elementares.
- Representações de grafi: As composições químicas são tratadas como grafos onde elementos são nós e bordas representam suas interações. As redes neurais de grafise podem então aprender a prever propriedades a partir dessas estruturas de grafo.
- Embutimentos aprendidos: Modelos de aprendizagem profunda podem aprender automaticamente representações ótimas de elementos e composições de dados, sem exigir engenharia de recursos manuais com base no conhecimento de domínio.
Aplicações de Previsão Baseada em Composição
Modelos de aprendizado de máquina baseados em composição foram aplicados com sucesso para prever uma ampla gama de propriedades de materiais, incluindo energia de formação, gap de banda, módulo de massa, condutividade térmica e temperatura de fusão. Esses modelos permitem uma rápida triagem de espaços de composição vastos – potencialmente milhões de materiais candidatos – para identificar composições promissoras para investigação experimental. A precisão de velocidade e melhor em classe da ElemNet nos permitem realizar uma triagem rápida e robusta para novos candidatos a materiais em um enorme espaço combinatório; onde nós predizemos centenas de milhares de sistemas químicos que poderiam conter compostos ainda não identificados.
Previsão de Propriedade de Materiais Baseados em Estrutura
Embora as previsões baseadas em composição sejam valiosas para a triagem inicial, muitas propriedades materiais dependem criticamente da estrutura cristalina.Modelos de aprendizado de máquina baseados em estrutura incorporam informações sobre posições atômicas, união e simetria para fazer previsões de propriedades mais precisas para materiais com estruturas conhecidas ou previstas.
Descritores e Representações Estruturais
Várias abordagens foram desenvolvidas para representar estruturas cristalinas para o aprendizado de máquina:
- Matrizes de Coulomb: Essas matrizes codificam informações sobre posições atômicas e cargas nucleares, proporcionando uma representação invariante de rotação de estruturas moleculares e cristalinas.
- Sobreposição suave de posições atômicas (SOAP): Este descritor captura o ambiente atômico local em torno de cada átomo, permitindo que os modelos de aprendizado de máquina aprendam com padrões estruturais.
- Representações de grafos de cristal: Estruturas de cristal são representadas como grafos onde átomos são nós e ligações químicas são bordas. Graficos de redes neurais convolucionais podem então aprender a prever propriedades a partir dessas estruturas de grafos.
- Representações adaptadas à simetria: Estes descritores incorporam informações sobre simetria cristalina, grupos espaciais e grupos de pontos para melhorar a precisão e interpretabilidade de predição.
Estudos de Caso e Aplicações
Estudos recentes têm demonstrado a eficácia da mineração de dados na descoberta de novas ligas, polímeros e materiais compostos em vários setores industriais. Essas histórias de sucesso ilustram o valor prático de abordagens orientadas por dados e fornecem modelos para futuros esforços de descoberta de materiais.
Descoberta de ligas de alto desempenho
Pesquisadores usaram algoritmos de aprendizado de máquina para identificar novas ligas leves e de alta resistência adequadas para aplicações aeroespaciais. Em um estudo sobre a descoberta de compostos de Heusler de aprendizado de máquina, Oliynyk et al. aplicaram ML para auxiliar na previsão de compostos de estrutura AB2C. Este estudo teve como objetivo encontrar as combinações adequadas de estrutura para prever os novos compostos de Heusler e estimar a estabilidade desses compostos preditos. O modelo previu com sucesso 12 novos compostos de Heusler, incluindo os compostos de Gallides Mru2Ga e RuM2Ga (M = Ti-Co), com a taxa positiva e falsa positiva de 0,94 e 0,01, respectivamente. Estas descobertas demonstram como o aprendizado de máquinas pode explorar eficientemente espaços composicionais complexos para identificar sistemas promissores de liga.
Na indústria aeroespacial, a demanda por materiais que combinam alta resistência com baixa densidade tem impulsionado extensa pesquisa em ligas de alumínio, ligas de titânio e ligas de magnésio. As abordagens de mineração de dados têm acelerado esta pesquisa identificando combinações ótimas de elementos de liga e prevendo propriedades mecânicas antes de validação experimental cara. Modelos de aprendizado de máquina treinados em dados históricos de ligas podem agora prever resistência ao rendimento, resistência à tração final e resistência à fratura com precisão aproximando-se do de experimentos físicos.
Descoberta de Polímeros e Materiais Compósitos
A mineração de dados ajudou a descobrir novos materiais compósitos com propriedades térmicas e elétricas aprimoradas, abrindo novas avenidas para indústrias de eletrônicos e armazenamento de energia.A crescente demanda por materiais compostos de alto desempenho e custo-efetivo requer abordagens computacionais avançadas para otimizar sua composição e propriedades.Este estudo teve como objetivo a aplicação de aprendizado de máquinas para a previsão e otimização das propriedades funcionais de compósitos baseados em uma matriz termoplástica com vários enchimentos (dois tipos de fibrosos, quatro tipos de cargas dispersas e dois tipos de cargas nanodispersas).
Os compósitos de polímeros representam uma aplicação particularmente desafiadora para a mineração de dados, pois suas propriedades dependem não só da composição, mas também das condições de processamento, distribuição de cargas e interações interfaciais.O trabalho recente mostrou que os modelos de aprendizado de máquinas podem predizer com sucesso propriedades mecânicas e tribológicas de compósitos de polímeros, permitindo a seleção racional de cargas e otimização de formulações.Essa abordagem otimizará formulações compostas pela seleção racional de cargas para a matriz de polímeros, reduzindo assim o tempo e o custo para trabalhos experimentais, reduzindo o desperdício de materiais e aumentando a eficiência de produção, o que contribui para o SDS 9 (Indústria, Inovação e Infraestrutura).
Materiais Supercondutores
A descoberta de novos materiais supercondutores com temperaturas críticas mais elevadas tem sido um objetivo de longa data na ciência dos materiais. As abordagens de aprendizado de máquina foram aplicadas para prever temperaturas de transição supercondutoras e identificar materiais candidatos promissores. O modelo integrado combinou três algoritmos básicos (árvore de decisão de impulso de gradação, árvore extra e máquina de impulso de gradiente de luz) para melhorar a precisão de previsão.O modelo alcançou um R2 de 95,9% e um RMSE de 6,3 K. O estudo também identificou a importância de várias características materiais na predição de Tc, com condutividade térmica desempenhando um papel crítico.O modelo integrado foi usado para detectar potenciais materiais supercondutores com valores de Tc além de 50,0 K.
Materiais de duas dimensões para aplicações eletroquímicas
Esta revisão tem se aprofundado na integração histórica e contínua do aprendizado de máquina em materiais 2D para aplicações de energia eletroquímica, usando a abordagem KDD para orientar a pesquisa através da mineração de dados do banco de dados Scopus usando a análise de citações, palavras-chave e tendências. Materiais bidimensionais como grafeno, dichalcogenídeos de metais de transição e MXenes têm atraído enorme atenção para aplicações em baterias, supercapacitores e eletrocatalise. O vasto espaço composicional e estrutural de materiais 2D os torna candidatos ideais para abordagens de descoberta orientadas por dados.
Materiais termoelétricos
Materiais termoelétricos, que podem converter calor em eletricidade e vice-versa, são fundamentais para recuperação de calor residual e aplicações de refrigeração em estado sólido. A eficiência dos materiais termoelétricos depende de uma combinação complexa de condutividade elétrica, condutividade térmica e coeficiente Seebeck – propriedades que muitas vezes estão em conflito entre si. As abordagens de aprendizado de máquinas têm sido usadas para navegar nesta paisagem de otimização complexa e identificar materiais com melhor desempenho termoelétrico.
Materiais Catalíticos
A descoberta de novos catalisadores para reações químicas é outra área onde a mineração de dados mostrou uma promessa significativa. A atividade catalítica depende de detalhes sutis da estrutura superficial e propriedades eletrônicas, tornando difícil prever a partir de princípios iniciais. Modelos de aprendizado de máquina treinados em dados de catálise experimental podem identificar composições promissoras de catalisador e prever taxas de reação, seletividade e estabilidade.
Metodologias avançadas de mineração de dados
Lidando com a redundância e o vício do conjunto de dados
Uma consideração importante na mineração de dados de materiais é a questão da redundância de conjuntos de dados. Os conjuntos de dados de materiais geralmente contêm muitos materiais redundantes (altamente semelhantes) devido à abordagem de tinkering historicamente usado no projeto de materiais. Esta redundância distorce a avaliação de desempenho de modelos de aprendizado de máquina (ML) ao usar a divisão aleatória, levando a desempenho preditivo superestimado e desempenho ruim em amostras fora de distribuição. Este problema pode levar a avaliações excessivamente otimistas do desempenho do modelo e má generalização para materiais verdadeiramente novos.
Para abordar este problema, pesquisadores desenvolveram métodos para controlar redundância de conjuntos de dados e garantir uma avaliação de desempenho mais realista. Neste trabalho, nós pesquisamos o desempenho de ML superestimado em ciência de materiais para previsão de propriedades materiais e propomos MD-HIT, um algoritmo de redução de redundância para conjuntos de dados materiais. Essas abordagens ajudam a garantir que os modelos de aprendizado de máquinas estão realmente aprendendo relações estrutura-propriedade fundamentais em vez de simplesmente memorizar exemplos semelhantes do conjunto de treinamento.
Quantificação da incerteza
Quando se usam modelos de aprendizado de máquina para guiar a descoberta de materiais, é crucial entender a incerteza nas previsões de modelos. Os modelos são mais confiáveis ao fazer previsões para materiais semelhantes aos do conjunto de treinamento, mas podem não ser confiáveis quando extrapolando para novas composições ou estruturas. Uma grande força dos modelos de diagnóstico de estrutura é que eles podem ser usados para monitorar grandes conjuntos de dados de candidatos combinados gerados. No entanto, a maioria dos modelos de aprendizado de máquina são projetados para tarefas de interpolação, assim, as previsões para materiais que estão fora da distribuição de treinamento são muitas vezes não confiáveis. Durante uma triagem combinatória de novas composições, não podemos supor que a distribuição de novos materiais corresponda ao de nossos dados de treinamento. Portanto, em tais aplicações, torna-se necessário tentar quantificar a incerteza das previsões.
As abordagens de aprendizado de máquina bayesiana, métodos de conjunto e outras técnicas de quantificação de incerteza podem fornecer estimativas de confiança de previsão. Essas estimativas de incerteza podem ser usadas para priorizar esforços experimentais de validação, com foco em materiais onde o modelo é mais confiante ou, inversamente, onde dados adicionais seriam mais valiosos para melhorar o modelo.
Intuibilidade e Explicabilidade
Embora modelos complexos de aprendizado de máquina, como redes neurais profundas, possam atingir alta precisão de predição, eles muitas vezes funcionam como "caixas negras" que fornecem pouca visão dos princípios físicos e químicos subjacentes às suas previsões. Revisitamos conjuntos de dados de materiais usados em vários trabalhos e demonstramos que podem ser criadas combinações lineares simples de funções de base não lineares, que têm precisão comparável às abordagens de núcleo e rede neural originalmente usadas. Soluções lineares podem prever com precisão o gap de banda e a energia de formação de óxidos condutores transparentes, os estados de spin para complexos de metais de transição e a energia de formação de estruturas de elpasolita. Demonstramos como soluções lineares podem fornecer modelos preditivos interpretáveis e destacar as novas percepções que podem ser encontradas quando um modelo pode ser diretamente compreendido a partir de seus coeficientes e forma funcional.
As abordagens de aprendizado de máquina interpretativas podem revelar os fatores físicos que controlam as propriedades do material, levando a uma compreensão científica mais profunda e estratégias de design de materiais mais racionais. Técnicas como análise de importância de recursos, parcelas de dependência parcial e regressão simbólica podem ajudar a extrair regras interpretáveis e relações de modelos de aprendizado de máquina.
Integração com a experimentação de alto rendimento
O potencial total da mineração de dados na descoberta de materiais é realizado quando está integrado com capacidades experimentais de alto rendimento. Esta abordagem de circuito fechado combina triagem computacional, síntese direcionada, caracterização rápida e refinamento de modelos iterativos para acelerar o processo de descoberta.
Plataformas de síntese automatizadas
As plataformas de síntese robótica podem preparar grandes números de amostras de materiais com composições e condições de processamento sistematicamente variadas. Essas plataformas geram os dados experimentais necessários para treinar e validar modelos de aprendizado de máquina, ao mesmo tempo que testam as previsões feitas por esses modelos. A combinação de síntese automatizada com aprendizado de máquina cria um poderoso ciclo de feedback que pode rapidamente convergir em composições de materiais ideais.
Caracterização de Alta Percussão
Técnicas avançadas de caracterização que podem medir rapidamente as propriedades do material são essenciais para gerar os grandes conjuntos de dados necessários para a mineração de dados eficaz. Técnicas como difração de raios X, microscopia eletrônica, espectroscopia e medição de propriedades podem ser automatizadas e paralelizados para caracterizar centenas ou milhares de amostras por dia.Esses dados de caracterização de alto rendimento se alimentam diretamente em modelos de aprendizado de máquina, permitindo a melhoria contínua do modelo.
Ciclos de Aprendizagem Activa
Estratégias de aprendizagem ativa usam previsões de modelos e estimativas de incerteza para selecionar inteligentemente quais experimentos executar em seguida. Ao invés de aleatoriamente amostrar o espaço de materiais ou seguir a intuição humana, algoritmos de aprendizagem ativa identificam as experiências que fornecerão mais informações para melhorar a precisão do modelo. Esta abordagem pode reduzir drasticamente o número de experimentos necessários para descobrir materiais com propriedades alvo, tornando o processo de descoberta mais eficiente e rentável.
Aplicações industriais e impacto
A aplicação da mineração de dados à descoberta de materiais não é apenas um exercício acadêmico, tem implicações significativas para a inovação industrial e competitividade. Indústrias que vão desde aeroespacial e automotiva à eletrônica e energia estão adotando abordagens orientadas por dados para acelerar o desenvolvimento de materiais e ganhar vantagens competitivas.
Indústria Aeroespacial
A indústria aeroespacial tem sido um dos primeiros a adotar a descoberta de materiais acionados por dados, impulsionados pela necessidade de materiais que combinem desempenho excepcional com redução de peso. Modelos de aprendizado de máquina estão sendo usados para projetar novas ligas de alumínio, ligas de titânio e materiais compostos para estruturas de aeronaves. Esses materiais devem atender requisitos rigorosos para resistência, resistência à fadiga, resistência à corrosão e manufacturabilidade – um problema complexo de otimização bem adequado às abordagens de mineração de dados.
Indústria Electrónica e Semiconductor
The electronics industry requires materials with precisely controlled electrical, thermal, and optical properties. Data mining is being applied to discover new semiconductor materials, dielectric materials, and thermal management materials for next-generation electronic devices. The ability to predict band gaps, carrier mobilities, and thermal conductivities from composition and structure enables rapid screening of candidate materials.
Armazenamento e conversão de energia
A transição para energia renovável requer materiais avançados para baterias, células a combustível, células solares e dispositivos termoelétricos. As abordagens de mineração de dados estão acelerando a descoberta de novos materiais de eletrodos, eletrólitos, catalisadores e materiais fotovoltaicos. Modelos de aprendizado de máquinas podem prever métricas de desempenho importantes, como densidade de energia, densidade de energia, vida útil do ciclo e eficiência de conversão, orientando esforços experimentais para os candidatos mais promissores.
Indústria automóvel
A indústria automotiva está passando por uma transformação impulsionada por preocupações de eletrificação, leveza e sustentabilidade. A mineração de dados está sendo aplicada para descobrir novos materiais estruturais, materiais de bateria e processos de fabricação que podem atender às exigências exigentes dos veículos modernos. A capacidade de rapidamente analisar milhares de materiais potenciais e prever seu desempenho sob várias condições é particularmente valiosa nesta indústria em rápida movimentação.
Mineração e extração de recursos
Nos últimos quatro anos financeiros, nossas iniciativas de análise e digital deram mais de US$ 2 bilhões para a BHP. Esse valor abrangeu muitas partes da cadeia de valor – desde a exploração até as operações até a logística – mas mal arranhamos a superfície e estamos procurando parceiros que possam nos ajudar a cavar mais fundo. A indústria mineira em si está aplicando técnicas de mineração de dados e IA para melhorar a exploração, otimizar as operações e tomar melhores decisões sobre extração de recursos.
Desafios e orientações futuras
Apesar de suas vantagens, a aplicação da mineração de dados na descoberta de materiais enfrenta vários desafios significativos que devem ser enfrentados para realizar todo o potencial dessa abordagem. Compreender esses desafios e desenvolver soluções é uma área ativa de pesquisa que irá moldar o futuro dos materiais da informática.
Qualidade e Disponibilidade dos Dados
A qualidade das previsões de aprendizado de máquina depende criticamente da qualidade dos dados de treinamento. Os conjuntos de dados de materiais muitas vezes contêm erros, inconsistências e valores ausentes que podem degradar o desempenho do modelo. Os dados experimentais podem ser coletados em diferentes condições ou usando diferentes técnicas de medição, tornando difícil combinar dados de várias fontes. Dados computacionais de diferentes métodos de simulação podem não ser diretamente comparáveis.
A disponibilidade de dados é outro desafio significativo. Embora algumas propriedades do material tenham sido medidas para milhares de compostos, outros foram caracterizados por apenas um punhado de materiais. Esta escassez de dados torna difícil treinar modelos precisos de aprendizado de máquina para algumas propriedades. A aprendizagem de transferência e as abordagens de aprendizagem multitarefa podem ajudar a resolver esse desafio, aproveitando dados de propriedades relacionadas ou classes de materiais.
Integração de conjuntos de dados heterogéneos
Os dados de materiais vêm de várias fontes diferentes – medições experimentais, simulações computacionais, literatura, patentes e bases de dados industriais proprietárias. Estes conjuntos de dados usam diferentes formatos, unidades e convenções, tornando a integração desafiadora. Historicamente, muitas informações geológicas foram armazenadas em formatos difíceis de pesquisar ou integrar – desde relatórios digitalizados até conjuntos de dados fragmentados acumulados ao longo de décadas. Na prática, isso significa que os geocientistas gastam uma quantidade considerável de seu tempo de busca, limpeza e conciliação de dados antes que a interpretação possa começar.
Desenvolver formatos de dados padronizados e ontologias para dados de materiais é um esforço contínuo na comunidade de informática de materiais. Iniciativas como o consórcio OPTIMADE estão trabalhando para criar APIs comuns para acessar bases de dados de materiais, enquanto esforços como o Material Data Facility estão desenvolvendo infraestrutura para compartilhar e descobrir conjuntos de dados de materiais.
Necessidade de modelos interpretativos
Embora os modelos de aprendizado de máquina de caixa preta possam alcançar alta precisão de previsão, eles fornecem uma visão limitada dos princípios físicos e químicos que regem o comportamento do material.Para o entendimento científico e design racional de materiais, modelos interpretáveis que revelam relações estrutura-propriedade subjacentes são altamente valiosos. Desenvolver abordagens de aprendizado de máquina que equilibrem a precisão de previsão com interpretabilidade continua sendo um importante desafio de pesquisa.
Regressão simbólica, extração de regras e mecanismos de atenção estão entre as técnicas que estão sendo exploradas para tornar os modelos de aprendizagem de máquina mais interpretáveis, que visam extrair regras e relações compreensíveis entre humanos de modelos treinados, superando o hiato entre previsão e compreensão.
Validação e Confirmação Experimental
As previsões de aprendizado de máquina devem ser validadas por meio de síntese e caracterização experimental. No entanto, nem todos os materiais previstos podem ser sintetizados usando técnicas atuais, e algumas predições podem ser artefatos de limitações de modelo em vez de descobertas genuínas. Desenvolver melhores métodos para avaliar a sintese e viabilidade experimental é uma área importante de pesquisa em andamento.
A colaboração entre pesquisadores computacionais e experimentais é essencial para a descoberta de materiais bem-sucedidos. Previsões computacionais devem ser projetadas para serem experimentalmente testáveis, e os resultados experimentais devem se alimentar de novo no refinamento do modelo.Este ciclo iterativo de predição, síntese, caracterização e melhoria do modelo é fundamental para acelerar a descoberta de materiais.
Manuseamento de Otimização Multiobjetivo
As aplicações de materiais do mundo real normalmente requerem otimização de múltiplas propriedades, muitas vezes conflitantes. Por exemplo, um material estrutural pode precisar ser forte, leve, resistente à corrosão e barato para fabricar. As abordagens de mineração de dados devem ser capazes de lidar com esses problemas de otimização multiobjetivo e identificar materiais que representam trocas ótimas entre requisitos concorrentes.
A otimização Pareto, algoritmos evolutivos multiobjetivos e outras técnicas de pesquisa operacional podem ser integradas com aprendizado de máquina para resolver problemas de projeto de materiais multiobjetivos. Essas abordagens podem identificar conjuntos de soluções não dominadas que representam diferentes trocas entre objetivos, permitindo que os designers de materiais selecionem a solução mais adequada para sua aplicação específica.
Incorporando relações de processamento-estrutura-propriedade
As propriedades do material dependem não só da composição e estrutura cristalina, mas também da história e microestrutura de processamento. Uma dada composição pode apresentar propriedades muito diferentes, dependendo de como foi sintetizada, tratada termicamente e processada mecanicamente. Incorporar informações de processamento em modelos de aprendizado de máquina é desafiador, mas essencial para prever o desempenho do material do mundo real.
Recent work has begun to address this challenge by developing models that incorporate processing parameters alongside composition and structure information. These models can predict how processing conditions affect microstructure and how microstructure influences properties, providing a more complete picture of material behavior.
Tecnologias emergentes e oportunidades futuras
Olhando para o futuro, a integração de inteligência artificial, análise de big data e experimentação de alto rendimento promete acelerar a descoberta de novos materiais, transformando em última análise indústrias e impulsionando a inovação. Várias tecnologias e abordagens emergentes estão prontas para aumentar ainda mais o poder da mineração de dados na descoberta de materiais.
Modelos Generativos para Design de Materiais
Modelos de aprendizado de máquina generativos, como autoencodificadores variacionais e redes de adversarial gerativas, podem criar novas estruturas e composições de materiais que nunca foram vistas antes. Ao invés de simplesmente analisar materiais existentes ou fazer pequenas modificações em compostos conhecidos, modelos generativos podem explorar regiões inteiramente novas de espaço de materiais e propor materiais genuinamente novos com propriedades desejadas.
Estes modelos aprendem os padrões e regras subjacentes que governam as estruturas materiais a partir de dados de treinamento, em seguida, usar esse conhecimento para gerar novas estruturas que seguem os mesmos padrões, enquanto exibem novas combinações de características. Esta abordagem tem o potencial de descobrir materiais que os pesquisadores humanos nunca poderiam conceber através de estratégias de design convencionais.
Processamento de Linguagem Natural para Mineração Literatura
A literatura científica de materiais contém vastas quantidades de informações sobre propriedades de materiais, métodos de síntese e características de desempenho. Técnicas de processamento de linguagem natural podem extrair dados estruturados de texto não estruturado, permitindo que pesquisadores aproveitem décadas de pesquisas publicadas em seus esforços de mineração de dados.
Os recentes avanços em modelos de linguagem de grande porte abriram novas possibilidades para mineração de literatura e extração de conhecimento, que podem compreender o texto científico, responder perguntas sobre propriedades de materiais e até sugerir novos direcionamentos de pesquisa baseados em padrões na literatura.
Sistemas de Descoberta de Materiais Autônomos
A visão final para a descoberta de materiais orientados a dados é sistemas totalmente autônomos que podem projetar, sintetizar, caracterizar e otimizar materiais com intervenção humana mínima. Esses sistemas integrariam modelos de aprendizado de máquina, plataformas de síntese robótica, ferramentas de caracterização automatizada e algoritmos de aprendizagem ativa em um pipeline de descoberta de circuito fechado.
Vários grupos de pesquisa e empresas estão trabalhando para essa visão, desenvolvendo protótipos de laboratórios autônomos que podem realizar ciclos de descoberta completos. Embora a descoberta totalmente autônoma continue sendo um objetivo futuro, esses sistemas já estão demonstrando o potencial de acelerar drasticamente o desenvolvimento de materiais.
Computação quântica para simulação de materiais
Os computadores quânticos têm o potencial de revolucionar a simulação de materiais, permitindo cálculos quânticos precisos para sistemas que são intratáveis para computadores clássicos. À medida que a tecnologia de computação quântica amadurece, ela pode fornecer novas fontes de dados de treinamento de alta qualidade para modelos de aprendizado de máquinas e permitir previsões mais precisas de propriedades de materiais.
A integração da computação quântica com o aprendizado de máquina - às vezes chamado de aprendizado de máquina quântica - é um campo emergente que pode oferecer vantagens para certos tipos de problemas de materiais. Embora as aplicações práticas ainda estejam em estágios iniciais, esta tecnologia poderia eventualmente aumentar o poder das abordagens de mineração de dados.
Integração com a fabricação de aditivos
Tecnologias de fabricação aditiva (3D) permitem a criação de materiais com composições complexas e microestruturas que não podem ser alcançadas através do processamento convencional. A combinação de mineração de dados para o projeto de materiais com fabricação aditiva para síntese de materiais cria novas oportunidades para descobrir e implantar novos materiais.
Modelos de aprendizado de máquina podem ser treinados para prever como parâmetros de processo de fabricação aditivo afetam a microestrutura e propriedades do material, permitindo otimizar tanto a composição do material quanto as condições de processamento.Esta abordagem integrada pode acelerar o desenvolvimento de materiais especificamente projetados para aplicações de fabricação de aditivos.
Plataformas colaborativas e partilha de dados
O futuro da descoberta de materiais dependerá cada vez mais de plataformas colaborativas que permitam aos pesquisadores compartilhar dados, modelos e recursos computacionais.Bases de dados de materiais de código aberto, modelos de aprendizado de máquina compartilhados e plataformas computacionais baseadas em nuvem podem democratizar o acesso a ferramentas de mineração de dados e acelerar o progresso em todo o campo.
As iniciativas de promoção do compartilhamento e padronização de dados são essenciais para a realização dessa visão. Embora as preocupações com a propriedade intelectual e a vantagem competitiva possam criar barreiras ao compartilhamento de dados, os benefícios da colaboração, particularmente para a pesquisa pré-competitiva, são cada vez mais reconhecidos por pesquisadores acadêmicos e industriais.
Melhores práticas para aplicar a mineração de dados para a descoberta de materiais
Para pesquisadores e organizações que procuram aplicar técnicas de mineração de dados à descoberta de materiais, várias práticas recomendadas podem ajudar a garantir o sucesso:
Iniciar com Limpar os Objetivos
Defina objetivos específicos para o esforço de descoberta de materiais, incluindo propriedades alvo, requisitos de desempenho e restrições. Objetivos claros ajudam a orientar os esforços de coleta de dados, desenvolvimento de modelos e validação experimental. Compreender o contexto e os requisitos da aplicação é essencial para fazer trocas apropriadas entre diferentes propriedades de materiais.
Investir em Infra-Estruturas de Dados
A construção de conjuntos de dados de alta qualidade requer investimento significativo na infraestrutura de coleta, curadoria e gestão de dados. Estabelecer protocolos padronizados para coleta de dados, implementar procedimentos de controle de qualidade e desenvolver sistemas para armazenamento e recuperação de dados.
Combinar várias fontes de dados
Aproveite dados experimentais, simulações computacionais, informações da literatura e conhecimento de domínio para criar conjuntos de dados abrangentes. Diferentes fontes de dados fornecem informações complementares e podem melhorar a precisão e robustez do modelo.Desenvolva métodos para integrar dados heterogêneos, enquanto contabiliza as diferenças de qualidade e confiabilidade.
Usar estratégias de validação adequadas
Implementar procedimentos rigorosos de validação para avaliar o desempenho do modelo e evitar o excesso de ajuste. Use técnicas como validação cruzada, conjuntos de teste de hold-out e validação em conjuntos de dados independentes para garantir que os modelos generalizem bem para novos materiais. Tenha particularmente cuidado com redundância de conjuntos de dados e similaridade entre conjuntos de treinamento e testes.
Conhecimento de Domínio Incorporado
Enquanto o aprendizado de máquina pode descobrir padrões automaticamente, incorporar conhecimento de domínio a partir de ciência de materiais pode melhorar o desempenho do modelo e interpretabilidade. Use recursos fisicamente significativos, impor restrições baseadas em leis físicas conhecidas, e validar previsões contra a compreensão científica. As aplicações mais bem sucedidas de mineração de dados combinam aprendizado de máquina com conhecimento especializado.
Iterar entre computação e experiência
Desenho de fluxos de trabalho de descoberta que iteram entre a previsão computacional e validação experimental. Use modelos computacionais para screenar grandes números de candidatos e priorizar esforços experimentais, em seguida, use resultados experimentais para refinar e melhorar modelos. Esta abordagem de circuito fechado acelera a descoberta, garantindo que as previsões são fundamentadas na realidade experimental.
Foco na Inpretabilidade
Quando possível, use modelos de aprendizado de máquina interpretáveis ou aplique técnicas de interpretabilidade para entender o que modelos aprenderam. Modelos interpretativos fornecem insights científicos e constroem confiança em previsões. Eles também ajudam a identificar quando modelos estão fazendo previsões pelas razões certas versus explorar correlações espúrias nos dados de treinamento.
Considerações éticas e sociais
À medida que a mineração de dados se torna cada vez mais central na descoberta de materiais, é importante considerar as implicações éticas e sociais dessa tecnologia. Questões de propriedade de dados, propriedade intelectual, acesso equitativo a ferramentas e recursos, e o impacto ambiental do desenvolvimento de materiais merecem ser cuidadosamente consideradas.
Princípios científicos abertos, que enfatizam o compartilhamento de dados e a transparência, podem ajudar a garantir que os benefícios da descoberta de materiais orientados para dados sejam amplamente distribuídos. Ao mesmo tempo, mecanismos devem estar em vigor para proteger interesses legítimos de propriedade intelectual e fornecer crédito adequado para geradores de dados e desenvolvedores de modelos.
Os impactos ambientais e sociais de novos materiais devem ser considerados juntamente com seu desempenho técnico.A avaliação do ciclo de vida, as métricas de sustentabilidade e as considerações de impacto social podem ser integradas em quadros de otimização multiobjetivo para garantir que os esforços de descoberta de materiais se alinham com objetivos societais mais amplos.
Conclusão
As técnicas de mineração de dados surgiram como ferramentas poderosas para descobrir novos materiais industriais e composições, oferecendo o potencial de acelerar drasticamente o ritmo de inovação de materiais. Ao alavancar grandes conjuntos de dados de experimentos, simulações e literatura, modelos de aprendizado de máquina podem identificar candidatos promissores de materiais, prever propriedades e orientar esforços experimentais de forma mais eficiente do que as abordagens tradicionais de testes e erros.
O campo já demonstrou sucessos significativos na descoberta de novas ligas, polímeros, compósitos e materiais funcionais em diversas áreas de aplicação. À medida que a disponibilidade de dados aumenta, algoritmos melhoram e a integração com experimentos de alto rendimento se aprofunda, o impacto da mineração de dados na descoberta de materiais continuará crescendo.
No entanto, ainda existem desafios significativos, incluindo qualidade e disponibilidade dos dados, integração de conjuntos de dados heterogêneos, interpretabilidade do modelo e validação de previsões.Abordar esses desafios exigirá pesquisa contínua, desenvolvimento de padrões e melhores práticas e estreita colaboração entre pesquisadores computacionais e experimentais.
Olhando para o futuro, a integração de técnicas avançadas de machine learning, experimentação autônoma e plataformas de dados colaborativas promete inaugurar uma nova era de descoberta acelerada de materiais. Essa transformação tem o potencial de enfrentar desafios sociais críticos em energia, sustentabilidade, saúde e manufatura avançada, fornecendo os novos materiais necessários para tecnologias de próxima geração.
Para pesquisadores e organizações que desenvolvem materiais, adotar abordagens orientadas por dados não é mais opcional – é essencial para manter a competitividade em um campo cada vez mais acelerado. Ao combinar o poder da mineração de dados com a expertise em domínio, capacidades experimentais e foco de aplicação claro, a comunidade científica de materiais pode desbloquear novas possibilidades de inovação e criar materiais avançados que irão moldar nosso futuro tecnológico.
Para saber mais sobre materiais informáticos e descoberta orientada por dados, visite o Projeto de Materiais, explore recursos da Iniciativa de Materiais Genoma[, ou confira as últimas pesquisas em periódicos como npj Materiais Computacionais[].O campo de mineração de dados de materiais continua a evoluir rapidamente, oferecendo oportunidades emocionantes para pesquisadores em todas as etapas da carreira para contribuir para esta abordagem transformadora da descoberta de materiais.