sábado, 2 de novembro de 2013

Divagando: Cloud, Big Data e MapReduce



Quão difícil é contar os grãos de areia de uma praia? Se os grãos estivessem em arquivos ou em uma base dados, poderíamos processá-los e teríamos essa informação de forma rápida e ainda mais detalhada trazendo informações sobre a cor, tamanho, nível de umidade do grão, etc.
Isso é big data! Faz algum tempo que temos grandes quantidades de dados, mas havia uma grande dificuldade em processá-los e devido às limitações computacionais e parte desses dados sempre foi descartado.  Em minha opinião o que define o big data é a possibilidade de analisar TODA informação de forma rápida e a custos viáveis.  Isso abre muitas possibilidades que antes não eram exploradas. Tornou-se e vai se tornar ainda mais uma arma na mão de empresas (ou pessoas) que souberem manipular esses novos dados.  Hoje empresas como a amazon.com alteram a apresentação da página quando um cliente acessa o portal. Baseado em análises de compras ou acessos anteriores é possível definir o que mais interessa a esse cliente e colocar já na primeira página sem ele precisar dar muitos cliques para chegar ao produto de interesse. É como se toda vez que eu entrasse em algum supermercado os chocolates viessem já para as primeiras prateleiras e eu não precisaria ficar procurando, considerando que através das analises descobriram que eu sou um chocólatra :)

Mas como se processa e analisa tanta informação em tão pouco tempo? Tem um ditado grego que diz “Dividir para conquistar” e a ideia na informática é a mesma.  Com processamento distribuído e paralelizado é possível processar e analisar quantos bytes forem necessários. Se precisar processar mais dados, aumenta-se a capacidade computacional e continua. Isso é o conceito de processamento elástico mapeado na arquitetura de nuvem.  O grande pioneiro em analise de grandes quantidades de dados foi a Google. Em 2001 a Google liberou o seu algoritmo de dados para analise das pesquisas em seu buscador. E com isso foi possível a criação anos depois do Hadoop (mantido pela apache.org) que usa o MapReduce (derivação do algoritmo liberado pela Google) para processar enormes quantidades de dados. 

Em resumo o que temos hoje, são grandes quantidade de dados (big data) sendo analisados através de processamento distribuído (MapReduce) e com uma infraestrutura elástica. E esses três componentes (nuvem, big data e processamento distribuído) revolucionaram não apenas a área tecnológica e sim a vida cotidiana.

Vida Longa e Próspera

[]´s


Nenhum comentário:

Postar um comentário