5 Vedlikehold av eiendomsmassen i utleieporteføljen
5.2 Gjennomføring av vedlikehold
As propostas a integrar nesta zona compreendem, essencialmente, as ferramentas de análise e auditoria aos dados e visam detectar os tipos de defeitos existentes nos dados para posterior reso- lução. A constatação sobre os defeitos a solucionar permite aferir sobre o verdadeiro estado dos dados constantes no SO. A determinação do nível de qualidade dos dados pressupõe conhecer as exigências de informação da organização. Uma consistente qualidade dos dados é o estado do
repositório de dados em que a qualidade dos dados é sobejamente compreendida e a qualidade do repositório dos dados conhecida [Brackett, 1996].
Um importante resultado oriundo da análise e avaliação dos dados consiste na identificação de todos os atributos críticos e assim, obter uma lista dos atributos prioritários. A associação de prio- ridades aos atributos serve como linha orientadora no modo de resolução das anomalias, indican- do o local onde a introdução de padrões de qualidade deve ser realizada. Por exemplo, um valor pode ser considerado indispensável na concretização dum PI, o seu grau de susceptibilidade ao erro ser elevado e o tempo de captura ser único, o que contribui para uma solução na fonte que colmate a ausência de deficiências na recolha e armazenamento dos valores.
As soluções de melhoramento dos dados, integradas nesta categoria, visam a obtenção de infor- mações ou indicadores sobre as características e problemas dos dados e devem ser corporizadas através de metadados. Em seguida, são apresentadas duas aproximações que podem ser classifi- cadas nesta categoria: data profiling e auditoria dos dados.
Data profiling
A aplicação de data profiling no SO justifica-se pela obtenção de informações relativas aos dados existentes nas bases de dados. Em [Olson, 2003] define-se data profiling como a aplicação de técnicas de análise com o propósito de conhecer o conteúdo, a estrutura, e a qualidade dos dados actuais. A existência de metadados que denotem escassez de elementos sobre os esquemas ou os dados armazenados nos sistemas de dados do SO inviabilizam um conhecimento sobre os problemas com esses dados. É importante analisar os valores existentes tendo em vista a obten- ção de metadados sobre as características ou os padrões existentes nos dados. Estes metadados são essenciais na detecção dos defeitos. Além disso, é igualmente útil a disponibilização de meta- dados e informações de qualidade em projectos DW. Estes projectos implicam a transferência dos dados, provenientes do SO, para outras estruturas de dados [Rahm & Do, 2000]. Portanto, a téc- nica de data profiling procura obter informações reais sobre os dados e para isso, baseia-se na assumpção que os metadados nas fontes ou são incompletos ou estão errados.
Em [Olson, 2003] é previsto um modelo geral assente numa componente de fornecimento de in- formações ao processo (figura 4-11): os metadados disponíveis e os dados. Os metadados exis- tentes, mesmo quando incompletos, são importantes porque fornecem informações relativas à estrutura básica mínima dos dados. Os resultados gerados pelo processo de data profiling direc- cionam-se em duas vias. Por um lado, a obtenção de metadados mais correctos, mais descritivos, mais ricos e servindo de precioso auxilio nas actividades de ETL dum SDW. Por outro lado, em
factos que evidenciem as discrepâncias entre os dados e os metadados correctos. Estes factos mostram as deformidades dos dados e tornam-se num ponto de partida para a investigação das causas dos erros verificadas.
Figura 4-11 – Modelo de Data Profiling [Olson, 2003].
O conhecimento sobre a realidade dos dados existentes no SO é condição necessária para uma posterior limpeza dos dados a integrar num DW. A análise dos dados das fontes permite aferir sobre as diversas irregularidades verificadas e os níveis de gravidade dessas irregularidades. Em [Kimball, 2004] é referido que os valores obtidos pelo data profiling determinam o rumo a seguir na implementação dum DW. A primeira hipótese consiste em abandonar o projecto de DW porque as fontes impedem a disponibilização dos dados exigidos pelos decisores. A segunda hipótese condi- ciona o sucesso dum DW, a alterações prementes nas fontes. Por fim, permite determinar as me- lhores soluções a implementar no momento das operações de limpeza dos dados na ARD.
A existência de metadados reveladores dos perfis das fontes de dados mostra-se, igualmente, interessante sobre as perspectivas de actualidade dos dados num DW. Assim, além das preocu- pações relativas às incorrecções dos dados (dimensão correcção), outras necessidades, como a frescura dos dados podem ser pertinentes. A determinação do perfil de frescura das fontes de dados é determinante para as exigências de actualidade dos dados no DW. É, por isso, importante a manutenção de metadados que providenciem a frequência de actualização das fontes (e.g. o tempo da última actualização ou a frequência de actualizações). A contingência apresentada rele- va a urgência em possuir perfis das fontes de dados adequados a uma manutenção dos dados actualizados no DW [Bouzeghoub & Peralta, 2004].
Auditoria dos dados
Ainda no plano de soluções para a análise dos dados existentes no SO é possível recorrer a técni- cas de auditoria dos dados como forma de debelar imperfeições dos dados e proporcionar a ob- tenção de dados mais puros. As aplicações de auditoria caracterizam-se por incorporarem algorit-
mos de mineração para medir e melhorar a qualidade dos dados [Jarke et al., 2003]. Alguns dados apresentam impurezas, nomeadamente em termos de ruído (valores errados ou valores aberran- tes) e de ausência de valores. As atitudes correctivas que tentam colmatar estas deficiências po- dem passar, sinteticamente, pelo preenchimento de dados ausentes, pelo alisamento do ruído e pela identificação de valores aberrantes e inconsistentes [Carvalho, 2003].
No que respeita ao preenchimento de valores ausentes, os tratamentos usuais podem passar pela inserção do valor da média ou moda simples ou por classe, ou por usar o valor mais provável se- gundo um modelo (regressão, regra de Bayes, árvores de decisão). Relativamente ao ruído apre- sentado pelos dados, algumas técnicas, como o alisamento e a regressão permitem a remoção de ruído. O alisamento consiste em distribuir os dados ordenados, tendo como referência os seus vizinhos. Quanto à identificação de valores aberrantes é possível recorrer a técnicas de segmen- tação (figura 4-12) ou de regressão linear (figura 4-13).
Figura 4-12 – Técnicas de segmentação para eliminação de valores aberrantes.
y
y2 y1
x
x1
Figura 4-13 – O alisamento dos dados com recurso à regressão linear.
As técnicas de mineração permitem, igualmente, descobrir padrões dos dados em conjuntos alar- gados de dados. Esta capacidade pode revelar-se bastante útil na identificação de relacionamen- tos entre diversas colunas duma mesma entidade [Rahm & Do, 2000].