Quão difícil é contar os grãos de
areia de uma praia? Se os grãos estivessem em arquivos ou em uma base dados,
poderíamos processá-los e teríamos essa informação de forma rápida e ainda mais
detalhada trazendo informações sobre a cor, tamanho, nível de umidade do grão,
etc.
Isso é big data! Faz algum tempo
que temos grandes quantidades de dados, mas havia uma grande dificuldade em
processá-los e devido às limitações computacionais e parte desses dados sempre
foi descartado. Em minha opinião o que
define o big data é a possibilidade de analisar TODA informação de forma rápida
e a custos viáveis. Isso abre muitas
possibilidades que antes não eram exploradas. Tornou-se e vai se tornar ainda
mais uma arma na mão de empresas (ou pessoas) que souberem manipular esses
novos dados. Hoje empresas como a
amazon.com alteram a apresentação da página quando um cliente acessa
o portal. Baseado em análises de compras ou acessos anteriores é possível
definir o que mais interessa a esse cliente e colocar já na primeira página sem
ele precisar dar muitos cliques para chegar ao produto de interesse. É como se
toda vez que eu entrasse em algum supermercado os chocolates viessem já para as
primeiras prateleiras e eu não precisaria ficar procurando, considerando que
através das analises descobriram que eu sou um chocólatra :)
Mas como se processa e analisa
tanta informação em tão pouco tempo? Tem um ditado grego que diz “Dividir para conquistar”
e a ideia na informática é a mesma. Com
processamento distribuído e paralelizado é possível processar e analisar
quantos bytes forem necessários. Se precisar processar mais dados, aumenta-se a
capacidade computacional e continua. Isso é o conceito de processamento
elástico mapeado na arquitetura de nuvem.
O grande pioneiro em analise de grandes quantidades de dados foi a
Google. Em 2001 a Google liberou o seu algoritmo de dados para analise das
pesquisas em seu buscador. E com isso foi possível a criação anos depois do
Hadoop (mantido pela apache.org) que usa o MapReduce (derivação do algoritmo
liberado pela Google) para processar enormes quantidades de dados.
Em resumo o que temos hoje, são grandes
quantidade de dados (big data) sendo analisados através de processamento
distribuído (MapReduce) e com uma infraestrutura elástica. E esses três
componentes (nuvem, big data e processamento distribuído) revolucionaram não
apenas a área tecnológica e sim a vida cotidiana.
Vida Longa e Próspera
[]´s
Nenhum comentário:
Postar um comentário