Eu iniciei a minha carreira como estagiário de uma área de analistas funcionais do ERP Oracle eBS em uma empresa chamada TechnipFMC. Por anos eu criei queries SQL para gerar relatórios e montar visões sobre os dados conforme as demandas das áreas de negócio. Isso foi em 2013 e eu estava no início da minha graduação em Análise e Desenvolvimento de Sistemas na UERJ. Na época eu pensava em ser um desenvolvedor de softwares, mas ao mesmo tempo também gostava de entender o negócio da empresa, por isso passava muito tempo lendo os dados do banco de dados e conversando com as áreas de negócios para entender as suas necessidades. Foi nesta época que eu li um artigo falando sobre uma nova área que estava surgindo dentro da tecnologia, a área de dados.

Logo decidi que queria me especializar nesta área, então aprendi a programar em Python e busquei algum projeto focado em dados. A primeira oportunidade que tive foi em um projeto do IRB Brasil para realizar a ingestão de dados em um ambiente Hadoop. Quando fui contratado eles me disseram que eu atuaria como desenvolvedor e a minha função seria criar web scrapers e web crawlers para capturar dados públicos e em seguida realizar um processo de transformação dos dados. Quando os dados estavam normalizados eles eram inseridos no HDFS do Hadoop. Eu só entendi que eu estava criando pipelines de dados e desenvolvendo processos de ETL alguns anos depois de eu ter participado desse projeto.
A minha participação neste projeto fez o meu currículo se tornar atrativo rapidamente e logo surgiu um outro projeto onde estavam recrutando três cientistas de dados para criar um sistema antifraude. Eu fui o último a ser contratado e logo percebi que não havia nenhum processo OLAP (dados analíticos) na empresa, todos os dados estavam em processos OLTP (dados transacionais). Logo, era necessário coletar os dados, tratá-los, disponibilizá-los em uma base de dados para que os processos de data science fossem aplicados. A minha experiência anterior foi muito útil para eu realizar essas atividades já que os outros dois cientistas de dados eram mais focados na parte matemática.

Podemos utilizar essa história das minhas primeiras experiências como um exemplo de como a área de dados é estruturada (basicamente) e como mesmo as empresas muitas vezes não entendem como ela funciona (é importante ressaltar que nenhum desses projetos foi gerido por profissionais experientes na área de dados). No meu projeto seguinte também haviam dois cientistas de dados e nenhum data engineer, porém eu passei a ocupar uma posição de maior senioridade no time e fui responsável por desenhar a solução, falar diretamente com os clientes e até desenhar alguns processos. Hoje eu sei que este foi o momento onde eu comecei a atuar também como um data architect.
Hoje eu vejo como estas minhas primeiras experiências me deram uma boa visão geral sobre a área de dados. Eu comecei fazendo algo muito próximo ao trabalho de um analista de dados, que utiliza SQL para criar relatórios que atendiam as necessidades das áreas de negócio. No entanto, ainda me faltou a criação de métricas e dashboards. A seguir eu atuei como data engineer realizando processos de ETL (Extract-Transform-Load, em português Extrair-Transformar-Carregar) e realizando a modelagem dos dados no modelo estrela (dividindo em fato e dimensão). E, por fim, atuei como cientista de dados, desenvolvendo algoritmos preditivos, desenvolvendo modelos de machine learning e gerando relatórios com métricas de performance dos modelos. Podemos contar também que atuei também como arquiteto de dados, desenhando os pipelines de dados, decidindo a stack, gerando a documentação sobre os processos e desenhando os diagramas com a arquitetura da solução.
Atualmente existem muitas outras posições dentro da área de dados, como data quality, MLOps (Machine Learning Operations), Analytic Engineer, Data Viz, AI Engineer e muitas outras. É claro, muitas destas posições já existiam antes, mas durante o início da minha carreira não era comum ver vagas específicas para elas. Além disso, até hoje é muito comum ver empresas confundirem os papéis, contratando pessoas para a posição de data science esperando que elas também tenham conhecimento em data engineering, ou contratando data engineers assumindo que eles também atuem como SREs.

A área de dados ainda é relativamente nova e isso nos traz muitos desafios interessantes e a oportunidade de acompanharmos tudo enquanto está sendo construído. No entanto, isso também nos traz um grande desafio de saber lidar com projetos onde as posições ainda não estão claras e bem definidas. Por isso, acredito que seja bom termos pelo menos uma noção geral do que cada posição faz.


Deixe um comentário