Classificação de Fitoplânctons em Ambientes Aquáticos da Costa do Estado do Rio de Janeiro
Jonathan R. Porto1; Matheus H. K. Galvez1; Daniele B. Peçanha1; Matheus C. Ambrozio1; Alexandre S. P. Miloski1; Valeria M. Bastos1; Myrian C. A. Costa1; Nelson F. F. Ebecken1
1 Universidade Federal do Rio de Janeiro
doi:10.20906/CPS/CILAMCE2015-0110
Resumo
Processos de identificação de padrões têm se deparado cada vez mais com o problema de análise de grandes volumes de dados devido ao aumento da capacidade de sensores que coletam informações relevantes. Nem sempre é trivial extrair informações desses volumes de dados e lidar com um alto custo computacional. Este trabalho propõe o desenvolvimento de metodologias computacionais para análise de grandes massas de dados heterogêneos, compostas de assinaturas óticas de espécimes de fitoplânctons coletadas através de um citômetro de fluxo, localizado na costa do estado do Rio de Janeiro, com o objetivo de classificar espécies de fitoplânctons, auxiliando na avaliação da qualidade dos ecossistemas aquáticos. A classificação dos dados coletados foi realizada a partir da geração de um modelo de classificação obtido através do algoritmo k-NN. Para o treinamento foi fornecido como entrada um conjunto de valores que representam as medidas de similaridades entre espécimes já classificados. O algoritmo utilizado para computar essas medidas foi o Dynamic Time Warping (DTW) multidimensional, que quantifica a similaridade entre duas matrizes que correspondem às assinaturas óticas advindas do citômetro de fluxo. A implementação do algoritmo DTW utilizada encontra-se disponível em um pacote do ambiente de computação estatística R e foi combinada com uma otimização do cálculo da matriz de distâncias. Para os primeiros experimentos de classificação, foram utilizadas algumas poucas espécies previamente classificadas em laboratório, porém com um grande número de espécimes cada, gerando um volume expressivo de dados. Devido ao elevado tempo de processamento para a geração das medidas de similaridade, tornou-se impraticável o uso de sistemas computacionais puramente sequenciais. A fim de solucionar este problema, optou-se pelo uso de um cluster, possibilitando a execução do DTW em paralelo, alcançando, assim, resultados satisfatórios no tempo de processamento.
Palavras-chave: Classificação; Aprendizado de Máquina; Dissimilaridade; Ecossistemas Aquáticos