Ordliste og forkortelser
2 Metodisk tilnærming og gjennomføring
Conforme referido anteriormente, as tarefas que precedem a divulgação dos dados aos consumi- dores finais são desenvolvidas na ARD e costumam designar-se por tarefas de back-room [Kimball & Caserta, 2004]. Estas tarefas compreendem 4 grandes áreas: extracção, limpeza, integração e carregamento dos dados no DW (figura 3-7). Estas tarefas, comummente, designadas por proces- so de ETL, assumem importância capital em SDWs, em especial, por serem altamente responsá- veis na gestão dos dados disponibilizados. Porém, apesar da reconhecida importância, continua a ser uma área subestimada e indevidamente orçamentada em projectos de DW. A principal razão para que a área de ETL contribua com problemas adicionais em vez de apenas solucionar os exis- tentes deve-se, essencialmente, ao desconhecimento sobre a realidade das fontes, situação que se torna explosiva no momento da transformação dos valores dos dados [Gonzales, 2004].
O processo de ETL, na presente dissertação, baseia-se na adaptação da metodologia TDQM (as- sunto do terceiro relatório)a ambientes de DW [Wang, 1998], nomeadamente, no que concerne as actividades do processo de ETL serem encaradas como os meios de produção (semelhante a uma linha de produção de produtos comuns) responsáveis pela elaboração dos resultados (PI) divulga- dos aos consumidores. A exigência de um nível elevado de qualidade na realização destas tarefas é condição fundamental para a obtenção dos melhores resultados, devendo cumprir o processo de ETL a função de fiel da balança na qualidade dos dados disponibilizados pelo DW.
As características desejadas no processo de ETL devem ser: a relevância, a compreensão, o nível de detalhe adequado e a interpretação [Redman, 2004]. Tal qual os produtos produzidos, os da- dos de alta qualidade resultam de processos bem definidos e geridos, que criam, armazenam, movem, manipulam, processam e usam adequadamente os dados. Em [Kimball & Caserta, 2004] são tratados, especificamente, os assuntos relacionados com o conjunto das actividades de ETL e condicionam o resultado da sua acção aos requisitos e exigências impostas pela organização ou pelos meios e recursos que esta dispõe. Os requisitos podem ser encarados como constrangimen- tos ao sistema que tem de se adaptar para lhes dar resposta cabal, tais como: as exigências do negócio; o perfil dos dados existentes no SO; as restrições de segurança no acesso aos dados; a rapidez e frescura com que os dados têm de ser distribuídos aos consumidores finais; o armaze- namento e a linhagem dos dados e a preparação dos dados de modo a serem úteis aos utilizado- res. Previsivelmente, estes factores condicionam a construção do processo de ETL e podem pro- duzir custos aterradoramente elevados no seio dos SDWs porque assimilam avultados recursos materiais, temporais e humanos.
Noutra perspectiva, podemos relevar que a qualidade dos dados num DW, em todas as suas di- mensões é directamente influenciada pelas acções de ETL e consequentemente pelos requisitos a respeitar. Assim, a qualidade de conformidade da informação divulgada resulta da satisfação dos critérios previamente estabelecidos em termos das características dos dados fornecidos aos con- sumidores. Todavia, dadas as exigências do negócio e o insucesso demonstrado ao nível dos dados, o processo de ETL clássico mostra algumas limitações no cumprimento cabal das suas tarefas. Mesmo apesar da preocupação em centrar esforços nas tarefas comuns de ETL, os pro- blemas ao nível dos dados continuam a abundar nos repositórios de DW e podem ser explicados por falhas contraproducentes na execução das suas actividades.
3.6.1 Limitações das tarefas tradicionais de ETL
O processo de ETL, além de defender o tratamento concertado dos dados recebidos das fontes, deve igualmente não ser um agente potenciador de outros problemas a jusante. Este processo constitui-se numa área susceptível de gerar potenciais problemas nos dados porque a variedade de meios envolvidos (extracção, transformação, limpeza e carregamento dos dados) pode denotar falhas, nomeadamente, quanto às especificações que devem ser respeitadas e deste modo con- trariar a conformidade desejada. Em [Gonzales, 2004] é considerado que as incisivas e constantes exigências impostas por um teatro de operações, marcado pelo dinamismo, não são correspondi- das pelas tecnologias tradicionais de tratamento da qualidade dos dados porque estas apresentam sérias limitações na sua acção. Cada uma das áreas de ETL pode revelar questões susceptíveis de gerarem inconformidades nos dados. Assim, no que concerne à extracção dos dados, a hete- rogeneidade e o estado (e.g. idade) das fontes envolvidas pode implicar uma maior ou menor complexidade no processo de extracção (e.g. ficheiros de texto, ficheiros em COBOL, símbolos especiais, imagens, mensagens de email e campos sobrecarregados). Em [Kimball & Caserta, 2004] são descritos 4 factores condicionantes do processo de ETL: a rapidez das acções, a postu- ra preventiva na correcção dos dados, a identificação objectiva dos locais que degeneram a quali- dade dos dados e a necessidade de perfeição no cumprimento das operações realizadas. Aliado às dificuldades de concertação de dados que não foram projectados para junções, a ausência de informações relativas às fontes (metadados) complica ainda mais este processo, situação comum em aplicações antigas porque não disponibilizam metadados e denotam especificidades muito particulares e rudimentares no modo de armazenamento [Olson, 2003] [Ballou & Tayi, 1998]. A nível da limpeza dos dados, os processos devem afiançar a obtenção de dados mais puros e geradores de valor, que sirvam de meios de suporte para a tomada de decisão. Assim, diversas operações de tratamento sobre os dados constantes nas tabelas, bem como os relacionamentos existentes entre as tabelas têm de ser realizadas [Oliveira et al., 2004]. Por isso, a compreensão integral dos dados existentes e provenientes das fontes tem de ser conquistada em vista a efectiva concretização da limpeza dos dados. No que respeita ao carregamento dos dados no DW, importa que os dados tratados se encontrem integrados e disponíveis no momento oportuno. Outras ques- tões, designadas por pré-processamentos devem ser realizadas, como sejam: a verificação das regras de integridade; a ordenação, a agregação de valores e operações que carregam os dados nas tabelas do DW; a construção de índices que facilitem o acesso aos dados e a partição dos dados por vários locais de armazenamento [Chaudhuri & Dayal, 1997]. Deve, igualmente, ser prestada especial atenção aos dados rejeitados pelos processos antecedentes, devendo ser di- reccionados e armazenados num local tendo em vista a compreensão e interpretação das anoma-
lias nos valores dos dados existentes, atendendo a uma possível integração e carregamento no DW num momento posterior.
Em suma, às imperfeições constantes nos dados e que devem ser resolvidas pelo processo de ETL, não devem ser acrescidas outras, eventualmente mais graves, da responsabilidade do referi- do processo. Assim, a opção em incluir actividades precedentes de análise dos dados (e.g. data
profiling), consolidações prévias dos dados e auditoria, bem como, a avaliação dos dados das
fontes tem sido uma das medidas a tomar com o objectivo de obter dados mais puros pela melhor concepção das tarefas de ETL.
3.6.2 Políticas de circulação dos dados num SDW
É possível observar a elaboração de dados como resultado de um sistema de produção capaz de transformar dados brutos em informações úteis aos consumidores [Strong et al., 1997]. Inerente a este conceito, a política de sincronização dos dados entre os diversos patamares da arquitectura dum SDW mostra-se uma questão essencial em vista a disponibilização dos dados mais recentes aos consumidores finais em tempo oportuno e de modo consistente. A concepção arquitectural dum SDW como uma materialização de vistas em cascata, desde as fontes até aos DMs, confere a exigência em possuir os dados mais frescos a cada instante temporal [Fabret et al., 1997]. Este tema, designado por refrescamento dos dados do SDW é um assunto fulcral em relação à qualidade dos dados que o sistema disponibiliza e tem sido alvo de investigação em diversos es- tudos. A divulgação de dados que excedam o limite temporal previsto e aceite como plausível pe- los consumidores influenciará negativamente algumas dimensões da qualidade dos dados (e.g. a oportunidade) e por conseguinte, tendem a reflectir prejuízos pela não tomada de decisão na altu- ra certa. Do mesmo modo, a circulação inconsistente de dados por vistas materializadas desactua- lizadas acarreta certamente elevados custos. Estas questões revelam-se ainda mais preocupantes quando assistimos a SDWs tendentes para respostas próximas do imediatismo que o mercado exige. Logo, é necessário ter em conta as políticas de sincronização dos dados adoptadas porque a forma como se encontra implementado um SDW influência a frescura dos dados entregues aos utilizadores. Segundo o estudo realizado em [Bouzeghoub & Peralta, 2004], as tarefas de extrac- ção dos dados das fontes para o DW, através da ARD respeitam a políticas de push ou pull. Uma política de pull é realizada quando a ARD executa uma consulta dos dados à fonte (e.g. a ARD executa continuamente pedidos de dados à fonte). Enquanto que perante uma política de push, a fonte envia os dados para a ARD (e.g. a entrega de novos dados na ARD pode ocorrer pela intro- dução de um trigger na fonte). Geralmente, os processos de propagação de actualizações recor-
rem a triggers nas fontes, que são activados sempre que o volume de mudanças é superior a um limite. Relativamente, à interacção existente entre o DW e os utilizadores é possível constatar, também, que os processos de consulta podem respeitar a políticas de push ou pull. Uma política
pull permite aos utilizadores colocarem directamente as questões ao DW. Enquanto, uma política push possibilita aos utilizadores subscreverem determinadas consultas e o DW regularmente
transmite os dados aos utilizadores. A importância das políticas a serem implementadas no SDW é um assunto fulcral, na medida que a generalidade destes sistemas se encontram associados a modos assíncronos na disponibilização dos dados aos consumidores.
A frescura dos dados nos DW é uma das traves mestras para a obtenção duma qualidade dos dados efectiva que responda às expectativas dos consumidores finais. Por isso, além das políticas de circulação dos dados pelo SDW, a frescura dos dados deve igualmente ser encarada à luz de outros factores que a influenciam e por inerência a qualidade dos dados, como sejam os perfis dos utilizadores, os perfis das fontes e os modelos de custos atribuídos. Quanto aos perfis dos utiliza- dores implica saber se as expectativas dos utilizadores podem ser satisfeitas e como se encon- tram especificados esses requisitos. Relativamente aos perfis das fontes importa a selecção de um factor de frescura das fontes, os processos de medida e os respectivos metadados que conte- nham a informação necessária sobre a frescura das fontes. Por último, os modelos de custos pre- tendem aferir sobre os custos do atraso na propagação dos dados das fontes até aos consumido- res finais. Estes custos compreendem o custo de avaliação das consultas e o custo de propaga- ção das actualizações [Bouzeghoub & Peralta, 2004].