<?xml version="1.0" encoding="ISO-8859-1"?><article xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance">
<front>
<journal-meta>
<journal-id>0124-8170</journal-id>
<journal-title><![CDATA[Ciencia e Ingeniería Neogranadina]]></journal-title>
<abbrev-journal-title><![CDATA[Cienc. Ing. Neogranad.]]></abbrev-journal-title>
<issn>0124-8170</issn>
<publisher>
<publisher-name><![CDATA[Universidad Militar Nueva Granada]]></publisher-name>
</publisher>
</journal-meta>
<article-meta>
<article-id>S0124-81702016000200006</article-id>
<article-id pub-id-type="doi">10.18359/rcin.1799</article-id>
<title-group>
<article-title xml:lang="es"><![CDATA[MODELO PARA EL PROCESO DE EXTRACCIÓN, TRANSFORMACIÓN Y CARGA EN BODEGAS DE DATOS. UNA APLICACIÓN CON DATOS AMBIENTALES]]></article-title>
<article-title xml:lang="en"><![CDATA[MODEL FOR THE EXTRACTION, TRANSFORMATION AND LOAD PROCESS IN DATA WAREHOUSES. AN APPLICATION WITH ENVIRONMENTAL DATA]]></article-title>
</title-group>
<contrib-group>
<contrib contrib-type="author">
<name>
<surname><![CDATA[Duque Méndez]]></surname>
<given-names><![CDATA[Néstor Darío]]></given-names>
</name>
<xref ref-type="aff" rid="A01"/>
</contrib>
<contrib contrib-type="author">
<name>
<surname><![CDATA[Hernández Leal]]></surname>
<given-names><![CDATA[Emilcy Juliana]]></given-names>
</name>
<xref ref-type="aff" rid="A02"/>
</contrib>
<contrib contrib-type="author">
<name>
<surname><![CDATA[Pérez Zapata]]></surname>
<given-names><![CDATA[Ángela María]]></given-names>
</name>
<xref ref-type="aff" rid="A01"/>
</contrib>
<contrib contrib-type="author">
<name>
<surname><![CDATA[Arroyave Tabares]]></surname>
<given-names><![CDATA[Adrián Felipe]]></given-names>
</name>
<xref ref-type="aff" rid="A01"/>
</contrib>
<contrib contrib-type="author">
<name>
<surname><![CDATA[Espinosa]]></surname>
<given-names><![CDATA[Daniel Andrés]]></given-names>
</name>
<xref ref-type="aff" rid="A01"/>
</contrib>
</contrib-group>
<aff id="A01">
<institution><![CDATA[,Universidad Nacional de Colombia, sede Manizales Facultad de Administración Grupo de Investigación GAIA]]></institution>
<addr-line><![CDATA[Manizales ]]></addr-line>
<country>Colombia</country>
</aff>
<aff id="A02">
<institution><![CDATA[,Universidad Nacional de Colombia, sede Medellín Facultad de Minas ]]></institution>
<addr-line><![CDATA[Medellín ]]></addr-line>
<country>Colombia</country>
</aff>
<pub-date pub-type="pub">
<day>00</day>
<month>07</month>
<year>2016</year>
</pub-date>
<pub-date pub-type="epub">
<day>00</day>
<month>07</month>
<year>2016</year>
</pub-date>
<volume>26</volume>
<numero>2</numero>
<fpage>95</fpage>
<lpage>109</lpage>
<copyright-statement/>
<copyright-year/>
<self-uri xlink:href="http://www.scielo.org.co/scielo.php?script=sci_arttext&amp;pid=S0124-81702016000200006&amp;lng=en&amp;nrm=iso"></self-uri><self-uri xlink:href="http://www.scielo.org.co/scielo.php?script=sci_abstract&amp;pid=S0124-81702016000200006&amp;lng=en&amp;nrm=iso"></self-uri><self-uri xlink:href="http://www.scielo.org.co/scielo.php?script=sci_pdf&amp;pid=S0124-81702016000200006&amp;lng=en&amp;nrm=iso"></self-uri><abstract abstract-type="short" xml:lang="es"><p><![CDATA[La administración de bodegas de datos o datawarehouse requiere de un procesamiento para garantizar la veracidad, integridad y centralización de los datos cuando existen diversas fuentes de información, haciendo necesario utilizar aplicativos especializados para la Extracción, Transformación y Carga de datos (ETL). Estos aplicativos presentan conflictos en su parametrización, carecen de la implementación de filtros de corrección adaptables a las características de los datos y pueden demandar altos costos para su implementación. En el presente artículo se plantea un modelo genérico que aplica las etapas de ETL y permite realizar seguimiento del proceso al mantener un registro histórico de errores filtrados y calcular indicadores para identificar la calidad en el procesamiento. La validación del modelo fue realizada sobre un caso de estudio con datos ambientales. El modelo demostró obtener resultados satisfactorios. Se plantea realizar más validaciones del modelo, en otros ámbitos, incluyendo nuevos tipos y estructuras de datos.]]></p></abstract>
<abstract abstract-type="short" xml:lang="en"><p><![CDATA[Data warehouse management requires a procedure to ensure the accuracy, completeness, and centralization of data when there are several sources of information, thus making the use of specialized applications for Extraction, Transformation, and Loading of Data -ETL- necessary. These applications have conflicts with the parameterization, lack the implementation of correction filters adaptable to the data characteristics, and can demand high costs for their implementation. In this article, it is presented a generic model that applies the stages of ETL and allows monitoring the process to keep a historical record of errors filtered and to calculate indicators to identify quality in processing. Model validation was performed on a case study with environmental data. The model showed satisfactory results. Finally, it is planned to conduct validations of the model in other areas, including new types and data structures.]]></p></abstract>
<kwd-group>
<kwd lng="es"><![CDATA[bodegas de datos]]></kwd>
<kwd lng="es"><![CDATA[consistencia]]></kwd>
<kwd lng="es"><![CDATA[integridad]]></kwd>
<kwd lng="es"><![CDATA[procesamiento web]]></kwd>
<kwd lng="es"><![CDATA[procesos ETL]]></kwd>
<kwd lng="en"><![CDATA[datawarehouses]]></kwd>
<kwd lng="en"><![CDATA[consistency]]></kwd>
<kwd lng="en"><![CDATA[integrity]]></kwd>
<kwd lng="en"><![CDATA[web processing]]></kwd>
<kwd lng="en"><![CDATA[ETL process]]></kwd>
</kwd-group>
</article-meta>
</front><body><![CDATA[ <p align="right"><font face="verdana" size="2"><b>ART&Iacute;CULO</b></font>      <p align="right"><font face="verdana" size="2"> DOI: <a href="http://dx.doi.org/10.18359/rcin.1799"target="_blank">http://dx.doi.org/10.18359/rcin.1799</a>     <br><img src ="img/revistas/cein/v26n2/CCBY-NC-ND-2.5.jpg"></font></p>     <p align="center"><font face="verdana" size="4"><b>MODELO PARA EL PROCESO DE EXTRACCI&Oacute;N, TRANSFORMACI&Oacute;N Y CARGA EN BODEGAS DE DATOS. UNA APLICACI&Oacute;N CON DATOS AMBIENTALES</b></font></p>     <p align="center"><font face="verdana" size="3"><b>MODEL FOR THE EXTRACTION, TRANSFORMATION AND LOAD PROCESS IN DATA WAREHOUSES. AN APPLICATION WITH ENVIRONMENTAL DATA</b></font></p> <font size="2" face="verdana">     <p align="center"><b>N&eacute;stor Dar&iacute;o Duque M&eacute;ndez<sup>1</sup>, Emilcy Juliana Hern&aacute;ndez Leal<sup>2</sup>, &Aacute;ngela Mar&iacute;a P&eacute;rez Zapata<sup>3</sup>, Adri&aacute;n Felipe Arroyave Tabares<sup>4</sup>, Daniel Andr&eacute;s Espinosa<sup>5</sup></b></center></p>     <p><b><sup>1</sup></b> Ing. Mec&aacute;nico, Ph.D en Ingenier&iacute;a, profesor asociado, director Grupo de Investigaci&oacute;n GAIA, Facultad de Administraci&oacute;n, Universidad Nacional de Colombia, sede Manizales, Manizales, Colombia, <a href="mailto:ndduqueme@unal.edu.co">ndduqueme@unal.edu.co</a>    <br> <b><sup>2</sup></b> Administradora de Sistemas Inform&aacute;ticos, estudiante de Maestr&iacute;a en Ingenier&iacute;a Administrativa, Facultad de Minas, Universidad Nacional de Colombia, sede Medell&iacute;n, Medell&iacute;n, Colombia, <a href="mailto:ejhernandezle@unal.edu.co">ejhernandezle@unal.edu.co</a>    <br> <b><sup>3</sup></b> Estudiante de Administraci&oacute;n de Sistemas Inform&aacute;ticos, Facultad de Administraci&oacute;n, Universidad Nacional de Colombia, sede Manizales, Manizales, Colombia, <a href="mailto:amperezz@unal.edu.co">amperezz@unal.edu.co</a>    <br> <b><sup>4</sup></b> Estudiante de Administraci&oacute;n de Sistemas Inform&aacute;ticos, Facultad de Administraci&oacute;n, Universidad Nacional de Colombia, sede Manizales, Manizales, Colombia, <a href="mailto:afarroyavet@unal.edu.co">afarroyavet@unal.edu.co</a>    ]]></body>
<body><![CDATA[<br> <b><sup>5</sup></b> Estudiante de Administraci&oacute;n de Sistemas Inform&aacute;ticos, Facultad de Administraci&oacute;n, Universidad Nacional de Colombia, sede Manizales, Manizales, Colombia, <a href="mailto:daespinosag@unal.edu.co">daespinosag@unal.edu.co</a></p>     <p>Referencia: N. D. Duque M&eacute;ndez, E. J. Hern&aacute;ndez Leal, &Aacute;. M. P&eacute;rez Zapata, A. F. Arroyave Tabares, D. A. Espinosa (2016). Modelo para el proceso de extracci&oacute;n, transformaci&oacute;n y carga en bodegas de datos. Una aplicaci&oacute;n con datos ambientales. Ciencia e Ingenier&iacute;a Neogranadina, 26 (2), pp. 95-109, DOI: <a href="http://dx.doi.org/10.18359/rcin.1799"target="_blank">http://dx.doi.org/10.18359/rcin.1799</a></p> <hr>     <p><b>Fecha de recepci&oacute;n:</b> 18 de marzo de 2016     <br> <b>Fecha de revisi&oacute;n:</b> 4 de mayo de 2016     <br> <b>Fecha de aprobaci&oacute;n:</b> 31 de mayo de 2016</p>     <p><b>RESUMEN</b></p>     <p>La administraci&oacute;n de bodegas de datos o <i>datawarehouse</i> requiere de un procesamiento para garantizar la veracidad, integridad y centralizaci&oacute;n de los datos cuando existen diversas fuentes de informaci&oacute;n, haciendo necesario utilizar aplicativos especializados para la Extracci&oacute;n, Transformaci&oacute;n y Carga de datos (ETL). Estos aplicativos presentan conflictos en su parametrizaci&oacute;n, carecen de la implementaci&oacute;n de filtros de correcci&oacute;n adaptables a las caracter&iacute;sticas de los datos y pueden demandar altos costos para su implementaci&oacute;n. En el presente art&iacute;culo se plantea un modelo gen&eacute;rico que aplica las etapas de ETL y permite realizar seguimiento del proceso al mantener un registro hist&oacute;rico de errores filtrados y calcular indicadores para identificar la calidad en el procesamiento. La validaci&oacute;n del modelo fue realizada sobre un caso de estudio con datos ambientales. El modelo demostr&oacute; obtener resultados satisfactorios. Se plantea realizar m&aacute;s validaciones del modelo, en otros &aacute;mbitos, incluyendo nuevos tipos y estructuras de datos.</p> <b><i>Palabras clave:</i> </b>bodegas de datos, consistencia, integridad, procesamiento web, procesos ETL. <hr>     <p><b>ABSTRACT</b></p>     <p>Data warehouse management requires a procedure to ensure the accuracy, completeness, and centralization of data when there are several sources of information, thus making the use of specialized applications for Extraction, Transformation, and Loading of Data -ETL- necessary. These applications have conflicts with the parameterization, lack the implementation of correction filters adaptable to the data characteristics, and can demand high costs for their implementation. In this article, it is presented a generic model that applies the stages of ETL and allows monitoring the process to keep a historical record of errors filtered and to calculate indicators to identify quality in processing. Model validation was performed on a case study with environmental data. The model showed satisfactory results. Finally, it is planned to conduct validations of the model in other areas, including new types and data structures.</p>     <p><i><b>Keywords:</b></i> datawarehouses, consistency, integrity, web processing, ETL process.</p> <hr>     ]]></body>
<body><![CDATA[<p><b>INTRODUCCI&Oacute;N </b></p>     <p>Los procesos de extracci&oacute;n, transformaci&oacute;n y carga de datos, mejor conocidos como ETL por sus siglas en ingl&eacute;s (<i>Extract, Transform, Load</i>), se enmarcan dentro de las actividades clave en el contexto de las bases de datos, ya que por medio de su combinaci&oacute;n permiten hacer el traslado de datos de una fuente a otra. Principalmente este t&eacute;rmino se ha asociado a procesos propios de la construcci&oacute;n de bodegas de datos, o <i>datawarehouse</i> &#91;1&#93;. Las bodegas de datos son repositorios de informaci&oacute;n recolectada de m&uacute;ltiples fuentes, unificada bajo un esquema y que usualmente se encuentra en un mismo lugar &#91;2&#93;.</p>     <p>Dentro de las fases de la construcci&oacute;n de un<i> datawarehouse</i>, el ETL es una de las tareas con mayor costo, tanto por tiempo como por recursos, estando esta labor asociada a la unificaci&oacute;n de datos provenientes de diferentes fuentes, con estructuras y formatos variantes. A pesar de que existen diversas herramientas, tanto libres como propietarias &#91;3-5&#93;, para el modelado y ejecuci&oacute;n de estos procesos, no siempre es posible alcanzar el nivel de personalizaci&oacute;n que requieren algunos problemas complejos, donde la variedad de fuentes y esquemas de datos dificultan la labor.</p>     <p>En este art&iacute;culo se presenta un modelo cuyo objetivo es tener un acercamiento a la optimizaci&oacute;n de procesos de ETL y hacerlos m&aacute;s eficientes para la construcci&oacute;n y poblado de bodegas de datos. El modelo incluye un m&oacute;dulo traductor, una fase de filtrado detectivo y correctivo y una migraci&oacute;n final de datos; adem&aacute;s, se proponen tareas adicionales como administraci&oacute;n de la bodega en el tiempo y generaci&oacute;n de indicadores de confianza y soporte. Estos indicadores permiten hacer un seguimiento de la calidad de los datos cargados en la bodega. Se hicieron pruebas del modelo en un caso de estudio con datos ambientales que mostraron resultados satisfactorios.</p>     <p>El resto del art&iacute;culo se estructura de la siguiente manera: en las Secciones 2 y 3 se presentan algunos conceptos b&aacute;sicos y trabajos relacionados, respectivamente. La Secci&oacute;n 4 contiene una descripci&oacute;n de la arquitectura del modelo propuesto, incluyendo las diferentes fases. Por su parte, en la Secci&oacute;n 5 se introduce el caso de estudio, las pruebas realizadas y los resultados obtenidos. Por &uacute;ltimo, en la Secci&oacute;n 6 se traen a consideraci&oacute;n las conclusiones y trabajos futuros.</p>     <p><b>1. CONCEPTOS B&Aacute;SICOS</b></p>     <p> Uno de los aspectos importantes a considerar en un sistema para la administraci&oacute;n de datos es el almacenamiento; dado que de esto dependen muchos factores, como acceso, disponibilidad, escalabilidad, facilidad de recuperaci&oacute;n, estructuraci&oacute;n de consultas, tiempos de respuesta, entre otras. Existen diferentes t&eacute;cnicas de almacenamiento de datos, van desde los modelos m&aacute;s tradicionales (relacionales) hasta las nuevas tendencias que incluyen la posibilidad de almacenar datos no estructurados o semiestructurados &#91;6&#93;. Sin embargo, en los dos casos se requiere de un tratamiento previo de los datos, que ayude a garantizar la consistencia de los mismos. Dicho tratamiento enmarca los procesos de ETL, los cuales se asocian principalmente a los proyectos de <i>datawarehouse</i>. Un <i>datawarehouse</i>, o bodega de datos, es un repositorio de informaci&oacute;n recolectada de m&uacute;ltiples fuentes, unificada bajo un esquema y que usualmente se encuentra en un mismo lugar &#91;7&#93;. Los <i>datawarehouse</i> est&aacute;n construidos por medio de un proceso de limpieza, integraci&oacute;n, transformaci&oacute;n, carga y actualizaci&oacute;n peri&oacute;dica de datos (ver <a href="img/revistas/cein/v26n2/v26n2a06f01.jpg" target="_blank">Figura 1</a>).</p>     <p> Asimismo, los <i>datawarehouse</i> est&aacute;n modelados usualmente por una estructura de base de datos multidimensional, donde se tiene una serie de atributos agrupados en unas dimensiones que, a su vez, hacen parte de un esquema &#91;8&#93;. Las bodegas de datos son utilizadas en diversos campos y organizaciones, ya que el crecimiento del volumen de datos es generalizado y se ha convertido en una tendencia desde los noventa &#91;9&#93;. Existen varios aspectos fundamentales a la hora de caracterizar un <i>datawarehouse</i>, como son la orientaci&oacute;n a un tema espec&iacute;fico, la integraci&oacute;n, la no volatilidad y la variaci&oacute;n en el tiempo &#91;10&#93;.</p>     <p>El hecho de que un <i>datawarehouse </i>sea integrado, implica que va a ser alimentado con datos provenientes de diferentes fuentes, los cuales deber&aacute;n ser limpiados y estructurados bajo un esquema. Ahora bien, cuando se habla de que un <i>datawarehouse</i> debe ser no vol&aacute;til, implica que, contrario a como pasa en los sistemas transaccionales tradicionales (donde se inserta y modifica informaci&oacute;n de forma constante), en un <i>datawarehouse</i> los datos se cargan y acceden generalmente de forma masiva sin ser modificados.</p>     <p>Las arquitecturas utilizadas en los <i>datawarehouse</i> son relacional y multidimensional, la segunda presenta dos estructuras principales, estructura en estrella y estructura copo de nieve. La estructura en estrella es el modelo multidimensional cl&aacute;sico, con una &uacute;nica tabla de hechos rodeada de dos o m&aacute;s tablas de dimensiones. Por su parte, el copo de nieve es una variante que presenta varias tablas de hechos que comparten algunas tablas de dimensiones entre s&iacute; &#91;11&#93;.</p>     ]]></body>
<body><![CDATA[<p>Como se mencion&oacute; anteriormente, los procesos de ETL hacen parte fundamental en acciones que van desde la migraci&oacute;n sencilla de una base de datos hasta unas mucho m&aacute;s complejas, como la construcci&oacute;n de un <i>datawarehouse</i>. Estos se desarrollan en varias fases o actividades, las cuales son definidas en &#91;12&#93; de la siguiente manera. Tarea 1: identificaci&oacute;n de las fuentes de datos de las cuales se har&aacute; la extracci&oacute;n, suelen ser heterog&eacute;neas. Tarea 2: transformaci&oacute;n de las fuentes, despu&eacute;s de extraer los datos estos pueden ser transformados y generar datos derivados; en esta tarea se suelen hacer tareas como filtrado, conversi&oacute;n, c&aacute;lculo de valores derivados, generaci&oacute;n de llaves, entre otros. Tarea 3: uni&oacute;n de las fuentes, consiste en llevar a un solo almac&eacute;n diversas fuentes. Tarea 4: seleccionar el destino para cargar los datos. Tarea 5: uni&oacute;n de los atributos de las fuentes con los atributos previamente almacenados en el destino. Tarea 6: carga de datos, comprende el poblado de la bodega de datos con los datos ya limpios y transformados.</p>     <p><b>2. TRABAJOS RELACIONADOS</b></p>     <p> A continuaci&oacute;n se presentan algunos trabajos relacionados con la formulaci&oacute;n conceptual de modelos de ETL y algunos casos de implementaci&oacute;n, los cuales destacan la importancia de estos procesos en la construcci&oacute;n de los almacenes de datos. Se destaca tambi&eacute;n la existencia de algunas brechas por cubrir, principalmente cuando se cuentan con datos de diferente naturaleza (heterogeneidad), y cuando estos presentan vac&iacute;os que se deben suplir.</p>     <p>Por su parte, en &#91;13&#93; se concretan en la definici&oacute;n conceptual del proceso de ETL; en espec&iacute;fico, hacen hincapi&eacute; en la importancia de la definici&oacute;n de los procesos de ETL dentro del proceso general de construcci&oacute;n de los <i>datawarehouse</i>. Los autores proponen un esquema para el modelado gr&aacute;fico de las actividades de ETL, dando par&aacute;metros para la representaci&oacute;n conceptual de estas. En especial, se hace una propuesta para la customizaci&oacute;n de las relaciones entre los atributos y las respectivas actividades de ETL en cada una de las fases de un proyecto de <i>datawarehouse</i>. El trabajo no presenta una aplicaci&oacute;n concreta del modelo sobre datos reales, pero es un buen aporte a la hora de hacer la esquematizaci&oacute;n conceptual de estos procesos.</p>     <p> En &#91;14&#93; se menciona el desarrollo de un modelo conceptual para un esquema de almacenamiento de series de datos hidroclimatol&oacute;gicas a trav&eacute;s de un <i>datawarehouse</i>. Es de resaltar que en este trabajo se ratifica la importancia de contar con datos limpios y validados, que hayan sido sometidos a una fase de ETL previa a la realizaci&oacute;n de an&aacute;lisis y generaci&oacute;n de conocimiento. Esto con el fin de garantizar la coherencia en cuanto a unidades y periodicidad, y conseguir datos con integridad y consistencia.</p>     <p>En &#91;15&#93; se propone un esquema conceptual para la realizaci&oacute;n del proceso de ETL, los autores resaltan la importancia de contar con un modelo conceptual est&aacute;ndar para simplificar la representaci&oacute;n del proceso de ETL. Se define<i> a novel conceptual model entity mapping diagram</i> (EMD por sus siglas en ingl&eacute;s). Este modelo incluye dos capas. Una primera de abstracci&oacute;n, en la cual se presentan cinco objetos: funciones, contenedor de datos, entidades, relaciones y atributos. Los objetos dentro de esta capa de abstracci&oacute;n son una vista de alto nivel, que pueden ser usados para diagramar un escenario EMD. La segunda capa es la <i>template</i>, la cual es una expansi&oacute;n de la capa de abstracci&oacute;n. Cada usuario puede dise&ntilde;ar su propio escenario de ETL, incluso a&ntilde;adiendo capas. Construyeron tambi&eacute;n un <i>framework </i>para usar el modelo, el cual consiste en un componente para los recursos de datos, otro componente para el esquema de <i>datawarehouse</i> y un &uacute;ltimo componente de mapeo. El modelo no ha sido testeado en un caso real, esto es planteado como trabajo futuro.</p>     <p>En &#91;16&#93; proponen un enfoque de ETL donde se aplican tablas virtuales para realizar la etapa de transformaci&oacute;n antes de la de extracci&oacute;n y de carga. El enfoque es llamado TEL, ya que se cambian las siglas en ingl&eacute;s a <i>Transform- Extract-Load</i>. Seg&uacute;n los autores, el enfoque reduce la carga de transmisi&oacute;n de los datos y mejora el rendimiento de las consultas por medio de capas de acceso; adem&aacute;s muestra el enfoque como factible y pr&aacute;ctico.</p>     <p>En &#91;17&#93; se presenta la implementaci&oacute;n de un sistema multiagente (SMA) para la realizaci&oacute;n del proceso de ETL, en el cual se considera la heterogeneidad y disponibilidad de los datos a la hora de crear un almac&eacute;n de datos. La propuesta presentada por los autores parte de la recopilaci&oacute;n de las fortalezas de otros enfoques como los <i>wrappers </i>y soluciones <i>ad-hoc</i>. El modelo es validado por medio de datos reales y simulados. Se aplicaron algunos indicadores para medir la efectividad y viabilidad t&eacute;cnica de la propuesta, y se obtuvieron resultados satisfactorios; sin embargo, el volumen de datos empleado para las pruebas fue peque&ntilde;o y no se describe con claridad si hay filtrado de datos.</p>     <p> De la revisi&oacute;n de literatura se concluye que existen diversos modelos y enfoques conceptuales que permiten esquematizar procesos de ETL, se identifica que existen espacios para trabajar en el marco de la aplicaci&oacute;n de modelos concretos y en casos de estudio que tomen datos reales, donde se pueda detectar de forma pr&aacute;ctica la problem&aacute;tica asociada a esta fase fundamental dentro de la construcci&oacute;n de los <i>datawarehouse</i>.</p>     <p><b>3. MODELO PROPUESTO</b></p>     ]]></body>
<body><![CDATA[<p> En este trabajo se expone el desarrollo de un modelo para la realizaci&oacute;n del proceso de extracci&oacute;n, transformaci&oacute;n y carga aplicado a una bodega de datos. El modelo, adem&aacute;s de incluir la posibilidad de tomar diferentes fuentes de datos, tambi&eacute;n cuenta con la capacidad de hacer un filtrado, tanto de detecci&oacute;n como de correcci&oacute;n, y garantizar con esto la integridad y consistencia de los datos que se almacenan en la bodega de datos.</p>     <p>El modelo concebido es presentado en la <a href="img/revistas/cein/v26n2/v26n2a05f02.jpg" target="_blank">Figura 2</a>. Este modelo est&aacute; desarrollado para desempe&ntilde;arse en un entorno web. A continuaci&oacute;n se describe en detalle cada uno de los componentes que lo estructuran, y se revisa la figura de izquierda-derecha.</p>     <p><b>3.1 Fase de prerrequisitos (extracci&oacute;n)</b></p>     <p> Los datos pueden estar representados en diferentes formas de almacenamiento, como por ejemplo archivos planos y repositorios de datos estructurados (bases de datos), los cuales pueden presentar problemas y errores en su adquisici&oacute;n. Por lo anterior es necesario contar con un proceso previo que se ha llamado 'traducci&oacute;n'; este proceso consiste en la toma y estandarizaci&oacute;n de la estructura de los datos, para luego proceder a la entrega de los mismos a la siguiente fase del proceso.</p>     <p><b>3.2 Fase principal </b></p>     <p>Consta de filtrado y migraci&oacute;n, es la encargada de recibir los datos organizados en una estructura est&aacute;ndar, construida en la fase de traducci&oacute;n, y a partir de esto realiza la tarea de filtrado; luego, si es el caso, hacer las correcciones predefinidas y, finalmente, migrar a la bodega de datos. Este proceso est&aacute; soportado en una tabla temporal (tbl-temporal), la cual presenta la misma estructura de la tabla a la cual se va a migrar. Despu&eacute;s de ingresar los datos en la tabla temporal, la fase principal de filtrado y migraci&oacute;n se divide en dos tareas consecutivas, las cuales se describen a continuaci&oacute;n.</p>     <p><i> 3.2.1 Tarea de filtrado</i></p>     <p> Est&aacute; compuesta por dos actividades, las cuales son: filtrado de detecci&oacute;n y filtrado de correcci&oacute;n de fallas. En la primera se reciben los datos originales en una estructura est&aacute;ndar, se examinan y detectan posibles errores. En la segunda se aplica el proceso de correcci&oacute;n correspondiente.</p> <ul>      <li><i>Filtrado de detecci&oacute;n:</i> en esta actividad se detectan los errores presentes en las mediciones de cada una de las variables; para ello se emplea una tabla de variables (tbl-variables), la cual contiene los filtros y restricciones para cada variable entrante en el modelo. Estos filtros y restricciones son determinados por profesionales con dominio en el &aacute;mbito de aplicaci&oacute;n del modelo. Es la encargada de detectar los valores at&iacute;picos e inconsistencias en los datos fuente.</li>     <li><i>Filtrado de correcci&oacute;n de fallas:</i> en esta actividad se reciben los datos con los errores detectados y organizados y se sigue un est&aacute;ndar espec&iacute;fico. Los filtros de correcci&oacute;n deben estar determinados por profesionales en el &aacute;rea de aplicaci&oacute;n del modelo. Despu&eacute;s de aplicar las acciones correctivas correspondientes a las mediciones de cada variable, los datos est&aacute;n listos para la siguiente tarea. </li>     ]]></body>
<body><![CDATA[</ul>      <p><i>3.2.2 Tarea de migraci&oacute;n de datos </i></p>     <p>Esta es la encargada de cargar los datos de la tabla central (tbl-temporal) a la bodega de datos.</p>     <p><b>3.3 Fase alternativa </b></p>     <p>Adicional a las fases propias del proceso de ETL, se definen actividades importantes referentes a la evaluaci&oacute;n del proceso, as&iacute; como de su administraci&oacute;n en el tiempo.</p>     <p><i>3.3.1 Historial de errores</i></p>     <p> Esta actividad es la encargada de almacenar la informaci&oacute;n referente a los errores, tal como: descripci&oacute;n del error, valor corregido, posici&oacute;n donde se encuentra el error, tipo de correcci&oacute;n aplicado, estaci&oacute;n, variable, fecha y hora en que fue calculado el error.</p>     <p><i> 3.3.2 Administraci&oacute;n de variables</i></p>     <p> Esta actividad es la encargada de proporcionar los CRUD (<i>Create, Read, Update y Delete</i>, por sus siglas en ingl&eacute;s), para las tablas temporales, las cuales contienen los datos necesarios para administrar los filtros; dicha actividad es desarrollada con el objetivo de hacer el proceso de administraci&oacute;n en el tiempo y facilitar la manutenci&oacute;n y extensi&oacute;n del proceso.</p>     <p><i>3.3.3 C&aacute;lculo de calidad del proceso</i></p>     ]]></body>
<body><![CDATA[<p> A continuaci&oacute;n se describen los indicadores dise&ntilde;ados para determinar la calidad de los datos cargados a la bodega de datos. Estos indicadores permiten a los administradores de la bodega tener la percepci&oacute;n de los datos fuente que son corregidos y los datos que se conservan sin modificaci&oacute;n alguna.</p>     <blockquote>    <li> Confianza (1): representa la relaci&oacute;n entre la cantidad de registros que ingresan sin errores y el total de registros entrantes por cada variable filtrada; este indicador se calcula con el objetivo de obtener informaci&oacute;n relevante en cuanto a la calidad real de los datos por cada variable.</li> </blockquote>     <P align="center"><img src="img/revistas/cein/v26n2/v26n2a06ec01.jpg"></p>     <blockquote>    <li> Soporte (2): representa la relaci&oacute;n entre la cantidad de registros que ingresan sin errores y el total te&oacute;rico de medici&oacute;n por unidad de tiempo (d&iacute;a, semana, mes...), este indicador representa la calidad te&oacute;rica de los datos.</li> </blockquote>     <P align="center"><img src="img/revistas/cein/v26n2/v26n2a06ec02.jpg"></p>     <p>Nota: Cabe destacar que de no calcularse la confianza, el soporte y el historial de errores al momento de ejecutar el proceso de ETL, estos importantes datos no podr&aacute;n calcularse despu&eacute;s.</p>     <p><b>4. CASO DE ESTUDIO, PRUEBAS Y RESULTADOS</b></p>     <p> En esta secci&oacute;n se presenta el caso de estudio utilizado para probar el modelo, algunas pruebas realizadas y los resultados obtenidos en estas.</p>     ]]></body>
<body><![CDATA[<p><b> 4.1 Caso de estudio</b></p>     <p> Para la validaci&oacute;n del modelo se implement&oacute; un caso de estudio real enmarcado en el dominio de los datos ambientales. Actualmente en el departamento de Caldas se cuenta con m&aacute;s de 80 estaciones de monitoreo ambiental, distribuidas en diferentes redes, las cuales est&aacute;n en crecimiento continuo. Dichas estaciones realizan mediciones de variables meteorol&oacute;gicas e hidrom&eacute;tricas, seg&uacute;n se disponga en su dise&ntilde;o e instalaci&oacute;n. Las estaciones meteorol&oacute;gicas comprenden la medici&oacute;n de las variables precipitaci&oacute;n, temperatura del aire, brillo y radiaci&oacute;n solar, humedad relativa, velocidad y direcci&oacute;n del viento, presi&oacute;n barom&eacute;trica y evapotranspiraci&oacute;n. Las variables hidrom&eacute;tricas corresponden a registros de nivel y caudal, tomadas en r&iacute;os y otras fuentes h&iacute;dricas.</p>     <p>La captura de los datos es obtenida a trav&eacute;s de sensores especiales que son controlados por un PLC -Controlador L&oacute;gico Programable-. Este recibe la se&ntilde;al, que es transmitida por los sensores para almacenar su valor num&eacute;rico equivalente, pero en ocasiones las lecturas pueden generar valores err&oacute;neos. Usualmente los valores err&oacute;neos se identifican por tomar valores alfab&eacute;ticos o encontrarse fuera de un rango v&aacute;lido, el cual se establece seg&uacute;n el tipo de variable y la posici&oacute;n geogr&aacute;fica de la estaci&oacute;n.</p>     <p>La transmisi&oacute;n de los datos se hace siguiendo dos metodolog&iacute;as. El primer m&eacute;todo es realizado manualmente, donde se requiere la intervenci&oacute;n del operador de la red. Estas estaciones aportan por cada variable un dato diario. El operador debe desplazarse hasta la estaci&oacute;n para recolectar los datos medidos y registrarlos en archivos planos con diferentes estructuras. La segunda forma es autom&aacute;tica, por medio de telemetr&iacute;a. Las estaciones realizan la captura y transmisi&oacute;n de los datos en un intervalo de tiempo aproximado de cinco minutos. Estos son almacenados en bases de datos localizadas en diversos servidores de adquisici&oacute;n. Las bases de datos contienen varias tablas, donde se establece una correspondencia con cada estaci&oacute;n, adem&aacute;s cuentan con estructuras de diversa naturaleza.</p>     <p>En ambos casos, la transmisi&oacute;n de los datos proporciona diversas estructuras que son definidas seg&uacute;n los requisitos de las variables medidas y el est&aacute;ndar establecido por la organizaci&oacute;n propietaria de la estaci&oacute;n. En el caso de la operaci&oacute;n manual, donde se producen archivos planos, estos pueden variar el orden en el que se citan las variables en sus columnas.</p>     <p> El contexto de los procesos ETL proporciona la facilidad de filtrar y centralizar los datos ambientales del departamento de Caldas. Este proceso permite garantizar el tratamiento adecuado de los datos, puesto que en el modelo se contempla la estandarizaci&oacute;n, la eliminaci&oacute;n o modificaci&oacute;n de informaci&oacute;n inv&aacute;lida generada por ruidos durante la captura de la medici&oacute;n y su carga en una &uacute;nica localizaci&oacute;n.</p>     <p>En este caso de estudio, se presentan diversas fuentes de datos, las cuales no manejan un est&aacute;ndar general en su estructura. Los filtros de detecci&oacute;n aplicados (ver <a href="img/revistas/cein/v26n2/v26n2a06t01.jpg" target="_blank">Tabla 1</a>) permiten encontrar datos at&iacute;picos, y los filtros de correcci&oacute;n (ver <a href="img/revistas/cein/v26n2/v26n2a06t02.jpg" target="_blank">Tabla 2</a>) permiten completar algunos datos faltantes o at&iacute;picos. Los par&aacute;metros de ambos filtros han sido determinados seg&uacute;n el conocimiento de expertos en los temas ambientales, adem&aacute;s fue necesario que dichos expertos realizar&aacute;n un estudio exhaustivo de los datos para identificar los patrones.</p>     <p>Luego de este proceso, es necesario efectuar un volcado de los datos para conservar una &uacute;nica estructura, la cual es presentada en &#91;14&#93;. La estructura de la bodega fue concebida con el objetivo de tener un almacenamiento eficiente de los datos, que garantice un tratamiento eficaz previo a la investigaci&oacute;n meteorol&oacute;gica e hidrol&oacute;gica y que, a su vez, permita cubrir la oportunidad que se vislumbra en el an&aacute;lisis de variables hidroclimatol&oacute;gicas; esta corresponde a un modelo multidimensional de estrella centralizada, este dise&ntilde;o fue adoptado con el fin de permitir diferentes niveles de granularidad en las b&uacute;squedas que se efect&uacute;en para la extracci&oacute;n y futuro procesamiento de los datos. Para el modelo en estrella centralizado se tiene la tabla de hechos que almacena la informaci&oacute;n de las mediciones tomadas en las estaciones, y tres tablas de dimensiones, que hacen referencia a informaci&oacute;n propia de la estaci&oacute;n, fecha y tiempo de la medici&oacute;n; las dimensiones mantienen una relaci&oacute;n con la tabla de hechos a trav&eacute;s de sus identificadores.</p>     <p>Al implementar el modelo presentado en este documento, la etapa inicial del proceso contempla la posibilidad de reestructurar los datos a trav&eacute;s del traductor, el cual recibe los existentes desde diversas fuentes con estructuras variadas y realiza una revisi&oacute;n del origen de llegada de los datos con el fin de identificar las llaves subrogadas de los mismos y as&iacute; mantener la informaci&oacute;n sobre la estaci&oacute;n, la fecha y el momento del d&iacute;a en el que se efectu&oacute; la medici&oacute;n. Es importante resaltar que la implementaci&oacute;n de este modelo ha sido desarrollada de tal manera que sea completamente compatible con la estructura de la base de datos que almacena los datos ambientales.</p>     <p>En la segunda fase, al aplicar las tareas de filtrado y cargue de datos, se aplica la identificaci&oacute;n y correcci&oacute;n de las mediciones ambientales con el fin de mantener veracidad en los datos almacenados. Cuando se aplica este proceso, de forma paralela se genera un reporte, donde es registrado un hist&oacute;rico sobre los datos filtrados y los datos corregidos, lo que aumenta las probabilidades de que el proyecto ambiental sea auditable, garantizando la integridad de la informaci&oacute;n extra&iacute;da del sistema en general. Adicional a la generaci&oacute;n del reporte hist&oacute;rico de las condiciones de llegada y salida de los datos en el proceso ETL, se ha requerido en el proyecto aplicar indicadores que permitan definir la eficiencia del sistema de filtrado de datos en las mediciones ambientales, estos indicadores permiten a los usuarios que consultan los datos ambientales directamente en la bodega de datos, identificar una confiabilidad (E1) sobre la cantidad de datos que fueron necesarios aplicar a los filtros de correcci&oacute;n, y un indicador de soporte (E2) que permita identificar si la estaci&oacute;n transmiti&oacute; la cantidad de datos que deb&iacute;a transmitir seg&uacute;n el periodo de tiempo estipulado, debido a que en algunas ocasiones las estaciones pueden ser suspendidas temporalmente por tareas de mantenimiento preventivo o correctivo. El sistema basado en el modelo finaliza con la etapa de volcado de datos, en la cual se cargan los tratados a la bodega de datos del caso de estudio.</p>     ]]></body>
<body><![CDATA[<p><b>4.2 Pruebas y resultados</b></p>     <p> Para validar el funcionamiento del modelo de ETL propuesto, se realiz&oacute; la gesti&oacute;n de un conjunto de datos medidos en cada una de las diferentes estaciones situadas en el departamento de Caldas. Esta gesti&oacute;n incluye la identificaci&oacute;n de las diferentes estructuras recibidas, que corresponden a las diferentes fuentes de datos.</p>     <p>Como resultado del procesamiento de los datos ambientales tomados de los servidores donde reposan las mediciones de cada red, se recolectaron un total de 7'465.184 datos del periodo comprendido desde enero de 2012 hasta enero de 2016. El proceso tard&oacute; un total de 68 horas y 32 minutos en el filtrado y carga, de manera continua. Con lo anterior se tiene que cada minuto fueron filtrados y cargados aproximadamente 109 datos. Al iniciar las pruebas, la bodega contaba con 12'912.708 datos, logrando llegar a un total de 20'377.892 datos despu&eacute;s del proceso.</p>     <p>Se tom&oacute; una muestra de datos durante el tiempo de pruebas del modelo (<a href="img/revistas/cein/v26n2/v26n2a06t03.jpg" target="_blank">Tabla 3</a>), con el fin de conocer el comportamiento de filtrado en un momento determinado del d&iacute;a.</p>     <p>Con la ejecuci&oacute;n de un an&aacute;lisis estad&iacute;stico &#91;18&#93; sobre una muestra de datos, se obtuvo un promedio de 136.538 datos filtrados y cargados por hora y una desviaci&oacute;n est&aacute;ndar de 19.108 datos cada vez. La media indica que el 50% de los datos filtrados han tenido un rendimiento inferior a 136.538 datos por minuto, as&iacute; como el otro 50% un rendimiento superior al mismo n&uacute;mero de datos mencionado, por minuto. Hay que recordar que la precisi&oacute;n de la media se eval&uacute;a con la varianza y da una cuant&iacute;a de la dispersi&oacute;n general. La desviaci&oacute;n est&aacute;ndar es igual a 19.107,73 datos, este valor indica que en promedio los valores de la variable se desv&iacute;an 19.108 datos de la media. Es decir, la distancia promedio a la que se sit&uacute;an los valores respecto de la media.</p>     <p> La variabilidad de la cantidad de datos filtrados por hora es de 13,99%, lo que muestra que el promedio es representativo, es decir los datos son homog&eacute;neos. La muestra arroja resultados positivos, sin embargo, se pudo detectar que el n&uacute;mero de datos filtrados depende de la estaci&oacute;n y la hora en que se eval&uacute;e; ya que se presentaron espacios de tiempo con sobrecarga en el servidor, disminuyendo con esto el rendimiento del proceso. Se considera que las mejores horas para el procesamiento corresponden a la madrugada (00:00 a 7:00 h).</p>     <p>Al recibir los datos se detectaron inconvenientes con los nombres que presentaban dichos datos, puesto que no eran uniformes, lo cual llev&oacute; a la necesidad de aplicar un proceso de conversi&oacute;n para que fueran homog&eacute;neos en su interpretaci&oacute;n. Como parte de la soluci&oacute;n se realiz&oacute; lectura porcionada de texto, creando una nueva columna dentro de la tabla variables para registrar las formas alternas en que llegan los datos para su identificaci&oacute;n.</p>     <p>El tiempo de respuesta se vio afectado por una sobrecarga en el proceso. Al evaluar los datos de las bases de datos, por lo general tardaba m&aacute;s de 10 minutos, lo que provocaba que el servidor se interrumpiera al sobrepasar este tiempo y al no encontrar respuesta reiniciaba el proceso. Se decidi&oacute; hacer un an&aacute;lisis por lotes, evaluando porciones de 1.000 registros cada vez (se prob&oacute; previamente sobre la bodega de prueba que el an&aacute;lisis de 1.000 datos tardar&aacute; menos de 10 minutos), se deb&iacute;a tomar una cantidad de datos que tardara menos de los 10 minutos en el proceso de filtraci&oacute;n y cargue, pero que fuera una cantidad no tan peque&ntilde;a (no menor a 1.000) para que el servidor no se saturara recargando la p&aacute;gina seguidamente, esta cantidad de datos fue determinada por las pruebas que se iban realizando cada vez.</p>     <p>Asi mismo, se realiz&oacute; un an&aacute;lisis de confiabilidad, donde se detect&oacute; que los datos presentan un promedio de 0,8181 con una desviaci&oacute;n est&aacute;ndar de 0,1397 (Tabla 4). De lo cual, seg&uacute;n la regla emp&iacute;rica &#91;19&#93;, se puede inferir que:</p>     <blockquote>    ]]></body>
<body><![CDATA[<li> Los datos siguen una distribuci&oacute;n normal con sesgo debido a que la desviaci&oacute;n est&aacute;ndar es muy peque&ntilde;a.</li> </blockquote>     <blockquote>    <li> Se puede inferir que entre el 0,6784 y el 0,9578 se encuentran el 68% de los datos.</li></blockquote>     <blockquote>    <li> Se ratifica el sesgo y se determina su direcci&oacute;n hacia 1. Debido a que para las dos y tres desviaciones sobrepasa el tope m&aacute;ximo del valor. Lo cual representa valores at&iacute;picos fuera de las 4 desviaciones hacia el cero, una caracter&iacute;stica importante de los datos a examinar.</li> </blockquote>     <blockquote>    <li> Cabe destacar que el porcentaje de valores que pueden exceder las tres desviaciones seg&uacute;n la regla emp&iacute;rica es de 0,3%, lo cual representa una anomal&iacute;a en la distribuci&oacute;n para los datos cercanos al cero.</li> </blockquote>     <p>Para el an&aacute;lisis de historial de errores se hizo un conteo de la cantidad de errores por variable y se obtuvo el error m&aacute;s com&uacute;n por la misma. Despu&eacute;s se obtuvo el promedio de errores globales por variable, as&iacute; como el error m&aacute;s com&uacute;n global por variable. Se detect&oacute; un promedio de 565.812 errores por variable y el error m&aacute;s com&uacute;n hallado fue "Dato no v&aacute;lido". Tambi&eacute;n se detect&oacute; que la variable con m&aacute;s errores es "Radiaci&oacute;n solar".</p>     <p><b>5. CONCLUSIONES</b></p>     <p> Se destaca la complejidad de las tareas de ETL dentro del proceso de construcci&oacute;n de un <i>datawarehouse</i>, representada tanto en el costo como en el consumo de tiempo y recursos. En este art&iacute;culo se present&oacute; el desarrollo conceptual, implementaci&oacute;n y pruebas de un modelo de ETL para datos hidrometeorol&oacute;gicos, el cual fue probado con fuentes de datos reales y de diversa naturaleza. El caso de estudio incluy&oacute; un volumen considerable de datos y se lograron conseguir buenos resultados.</p>     ]]></body>
<body><![CDATA[<p>Cabe resaltar que al utilizar datos reales, el ejercicio realizado contribuye tanto en el &aacute;mbito investigativo como en la aplicaci&oacute;n del conocimiento en un caso real y de alta relevancia, existiendo un alto inter&eacute;s por parte de diferentes entes y organizaciones en el &aacute;mbito ambiental. Aunque se haya utilizado un caso de aplicaci&oacute;n concreto, se puede aplicar el modelo en otros dominios con facilidad, basta con seguir los pasos, definir los filtros particulares que se deseen aplicar e identificar las fuentes de datos que alimentar&aacute;n el modelo.</p>     <p> Como trabajo futuro se plantea aplicar el modelo ETL para hacer tratamiento de otro tipo de datos ambientales, correspondientes a mediciones de calidad del aire, donde se tratan: di&oacute;xido de azufre (SO<sub>2</sub>), ozono (O<sub>3</sub>), di&oacute;xido de carbono (CO<sub>2</sub>) y materiales particulados de 10 y 2,5 micras (PM10 - PM2,5). Tambi&eacute;n se plantea hacer pruebas en otros dominios, particularmente con datos educativos.</p>     <p><b> AGRADECIMIENTOS </b></p>     <p>El trabajo presentado en este art&iacute;culo fue financiado parcialmente por el programa de la Facultad de Administraci&oacute;n de la Universidad Nacional de Colombia, sede Manizales, titulado: "Fortalecimiento de las capacidades de an&aacute;lisis de datos en ambientes educativos que permitan procesos de adaptaci&oacute;n", con c&oacute;digo 20278.</p> <hr>     <p><b>REFERENCIAS</b></p>     <!-- ref --><p>&#91;1&#93; Kimball, R., Ross, M., Thornthwaite, W., Mundy, J. and Becker, B. (2008). <i>The Data Warehouse Lifecycle Toolkit</i>. Indianapolis, USA: Wiley Publishing, Inc.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159859&pid=S0124-8170201600020000600001&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <!-- ref --><p>&#91;2&#93; Calabria-Sarmiento, C. J. (2011). Construcci&oacute;n y poblamiento de un datawarehouse basado en el paradigma de bases de datos objeto relacional. <i>Prospect</i>, 9(1), pp. 69-77.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159861&pid=S0124-8170201600020000600002&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <!-- ref --><p>&#91;3&#93; Talend (2016). <i>Application Integration. The best way to accelerate delivery of realtime application integration</i>. En: <a href="https://www.talend.com/products/application-integration"target="_blank">https://www.talend.com/products/application-integration</a>(enero de 2016).    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159863&pid=S0124-8170201600020000600003&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <!-- ref --><p>&#91;4&#93; Pentaho (2016). <i>Data Integration. Pentaho Community</i>. En: <a href="http://community.pentaho.com/projects/data-integration/"target="_blank">http://community.pentaho.com/projects/data-integration/</a> (enero de 2016).    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159865&pid=S0124-8170201600020000600004&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <!-- ref --><p>&#91;5&#93; CloverETL (2016). <i>CloverETL Rapid Data Integration</i>. En: <a href="http://www.cloveretl.com/products/community-edition"target="_blank">http://www.cloveretl.com/products/community-edition</a> (enero de 2016).    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159867&pid=S0124-8170201600020000600005&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <!-- ref --><p>&#91;6&#93; Jaramillo Valbuena, S. y Londo&ntilde;o, J. M. (2015). Sistemas para almacenar grandes vol&uacute;menes de datos. <i>Revista Gerencia Tecnol&oacute;gica Inform&aacute;tica, 13</i>(37), pp. 17-28.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159869&pid=S0124-8170201600020000600006&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <!-- ref --><p>&#91;7&#93; Van den Hoven, J. (1998). Data Warehousing: Bringing it All Together. <i>Information Systems Management,</i> 15(2), pp. 92-96. doi: <a href=" http://dx.doi.org/ 10.1201/1078/43184.15.2.19980301/31127.16"target="_blank"> 10.1201/1078/43184.15.2.19980301/31127.16</a>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159871&pid=S0124-8170201600020000600007&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --><!-- ref --><p>&#91;8&#93; Han, J., Kamber, M. &amp; Pei, J. (2011). <i>Data Mining: Concepts and Techniques.</i> Waltham, MA, USA: Elsevier. Tercera edici&oacute;n.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159872&pid=S0124-8170201600020000600008&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     ]]></body>
<body><![CDATA[<!-- ref --><p>&#91;9&#93; Chaudhuri, S. &amp; Dayal, U. (1997). An Overview of Data Warehousing and OLAP Technology. <i>ACM SIGMOD Record,</i> 26(1), pp. 65-74. doi: <a href=" http://dx.doi.org/10.1145/248603.248616"target="_blank">10.1145/248603.248616</a>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159874&pid=S0124-8170201600020000600009&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --><!-- ref --><p>&#91;10&#93; Shi, D., Lee, Y., Duan, X. &amp; Wu, Q. H. (2001). Power system data warehouses.<i> IEEE Computer Applications in Power</i>, 14(3), pp. 49-55. doi: <a href=" http://dx.doi.org/10.1109/mcap.2001.952937"target="_blank">10.1109/mcap.2001.952937</a> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159875&pid=S0124-8170201600020000600010&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --><!-- ref --><p>&#91;11&#93; Tamayo, M. &amp; Moreno, F. J. (2006). An&aacute;lisis del modelo de almacenamiento MOLAP frente al modelo de almacenamiento ROLAP. <i>Ingenier&iacute;a e Investigaci&oacute;n</i>, 26(3), pp. 135-142.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159876&pid=S0124-8170201600020000600011&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <!-- ref --><p>&#91;12&#93; Trujillo, J. &amp; Luj&aacute;n-Mora, S. (2003). A UML Based Approach for Modeling ETL Processes in Data Warehouses. En I.-Y. Song, S. W. Liddle, T.-W. Ling y P. <i>Scheuermann, Conceptual Modeling - ER (2003)</i>, Berlin Heidelberg: Eds. Springer, pp. 307-320. doi: <a href=" http://dx.doi.org/10.1007/978-3-540-39648-2_25"target="_blank">10.1007/978-3-540-39648-2_25</a>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159878&pid=S0124-8170201600020000600012&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --><!-- ref --><p>&#91;13&#93; Vassiliadis, P., Simitsis, A. &amp; Skiadopoulos, S. (2002). Conceptual Modeling for ETL Processes. En:<i> Proceedings of the 5th ACM International Workshop on Data Warehousing and OLAP</i>, New York, NY, USA, pp. 14-21. doi: <a href=" http://dx.doi.org/10.1145/583890.583893"target="_blank">10.1145/583890.583893</a>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159879&pid=S0124-8170201600020000600013&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --><!-- ref --><p>&#91;14&#93; Duque-M&eacute;ndez, N. D., Orozco-Alzate, M. &amp; V&eacute;lez, J. J. (2014). Hydro-meteorological data analysis using OLAP techniques. <i>Revista DYNA,</i> 81(185), pp. 160-167. doi: <a href=" http://dx.doi.org/10.15446/dyna.v81n185.37700"target="_blank">10.15446/dyna.v81n185.37700</a> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159880&pid=S0124-8170201600020000600014&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --><!-- ref --><p>&#91;15&#93; El-Sappagh, S. H. A., Hendawi, A. M. A. &amp; El Bastawissy, A. H. (2011). A proposed model for data warehouse ETL processes. <i>Journal of King  Saud University - Computer and Information Sciences,</i> 23(2), pp. 91- 104. doi: <a href=" http://dx.doi.org/10.1016/j.jksuci.2011.05.005"target="_blank">10.1016/j.jksuci.2011.05.005</a> &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159881&pid=S0124-8170201600020000600015&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --><!-- ref --><p>&#91;16&#93; Guo, S. S., Yuan, Z. M., Sun, A. B. &amp; Yue, Q. (2015). A New ETL Approach Based on Data Virtualization. <i>Journal of Computer Science and Technology</i>, 30(2), pp. 311- 323. doi:<a href=" http://dx.doi.org/10.1007/s11390-015-1524-3"target="_blank">10.1007/s11390-015-1524-3</a>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159882&pid=S0124-8170201600020000600016&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --><!-- ref --><p>&#91;17&#93; Betancur-Calder&oacute;n, D. &amp; Moreno-Cadavid, J. (2012). Una aproximaci&oacute;n multi-agente para el soporte al proceso de extracci&oacute;ntransformaci&oacute;n- carga en bodegas de datos. <i>Revista Tecno L&oacute;gicas,</i> 28, pp. 89-107.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159883&pid=S0124-8170201600020000600017&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <!-- ref --><p>&#91;18&#93; Morales, A. E. (2012). <i>Estad&iacute;stica y probabilidad.</i> Chile.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159885&pid=S0124-8170201600020000600018&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --></p>     <!-- ref --><p>&#91;19&#93; Johnson, R. &amp; Kuby, P. (2012).<i> Estad&iacute;stica elemental</i>. M&eacute;xico, D.F.: Cengage Learning. 11&deg; edici&oacute;n, pp. 95-102.    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=4159887&pid=S0124-8170201600020000600019&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --> </p> </font>      ]]></body><back>
<ref-list>
<ref id="B1">
<label>1</label><nlm-citation citation-type="book">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Kimball]]></surname>
<given-names><![CDATA[R.]]></given-names>
</name>
<name>
<surname><![CDATA[Ross]]></surname>
<given-names><![CDATA[M.]]></given-names>
</name>
<name>
<surname><![CDATA[Thornthwaite]]></surname>
<given-names><![CDATA[W.]]></given-names>
</name>
<name>
<surname><![CDATA[Mundy]]></surname>
<given-names><![CDATA[J.]]></given-names>
</name>
<name>
<surname><![CDATA[Becker]]></surname>
<given-names><![CDATA[B.]]></given-names>
</name>
</person-group>
<source><![CDATA[The Data Warehouse Lifecycle Toolkit]]></source>
<year>2008</year>
<publisher-loc><![CDATA[Indianapolis ]]></publisher-loc>
<publisher-name><![CDATA[Wiley Publishing, Inc.]]></publisher-name>
</nlm-citation>
</ref>
<ref id="B2">
<label>2</label><nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Calabria-Sarmiento]]></surname>
<given-names><![CDATA[C. J.]]></given-names>
</name>
</person-group>
<article-title xml:lang="es"><![CDATA[Construcción y poblamiento de un datawarehouse basado en el paradigma de bases de datos objeto relacional]]></article-title>
<source><![CDATA[Prospect]]></source>
<year>2011</year>
<volume>9</volume>
<numero>1</numero>
<issue>1</issue>
<page-range>69-77</page-range></nlm-citation>
</ref>
<ref id="B3">
<label>3</label><nlm-citation citation-type="">
<collab>Talend</collab>
<source><![CDATA[Application Integration. The best way to accelerate delivery of realtime application integration]]></source>
<year>2016</year>
</nlm-citation>
</ref>
<ref id="B4">
<label>4</label><nlm-citation citation-type="">
<collab>Pentaho</collab>
<source><![CDATA[Data Integration. Pentaho Community]]></source>
<year>2016</year>
</nlm-citation>
</ref>
<ref id="B5">
<label>5</label><nlm-citation citation-type="">
<collab>CloverETL</collab>
<source><![CDATA[CloverETL Rapid Data Integration]]></source>
<year>2016</year>
</nlm-citation>
</ref>
<ref id="B6">
<label>6</label><nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Jaramillo Valbuena]]></surname>
<given-names><![CDATA[S.]]></given-names>
</name>
<name>
<surname><![CDATA[Londoño]]></surname>
<given-names><![CDATA[J. M.]]></given-names>
</name>
</person-group>
<article-title xml:lang="es"><![CDATA[Sistemas para almacenar grandes volúmenes de datos]]></article-title>
<source><![CDATA[Revista Gerencia Tecnológica Informática]]></source>
<year>2015</year>
<volume>13</volume>
<numero>37</numero>
<issue>37</issue>
<page-range>17-28</page-range></nlm-citation>
</ref>
<ref id="B7">
<label>7</label><nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Van den Hoven]]></surname>
<given-names><![CDATA[J.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA[Data Warehousing: Bringing it All Together]]></article-title>
<source><![CDATA[Information Systems Management]]></source>
<year>1998</year>
<volume>15</volume>
<numero>2</numero>
<issue>2</issue>
<page-range>92-96</page-range></nlm-citation>
</ref>
<ref id="B8">
<label>8</label><nlm-citation citation-type="book">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Han]]></surname>
<given-names><![CDATA[J.]]></given-names>
</name>
<name>
<surname><![CDATA[Kamber]]></surname>
<given-names><![CDATA[M.]]></given-names>
</name>
<name>
<surname><![CDATA[Pei]]></surname>
<given-names><![CDATA[J.]]></given-names>
</name>
</person-group>
<source><![CDATA[Data Mining: Concepts and Techniques]]></source>
<year>2011</year>
<edition>Tercera edición</edition>
<publisher-loc><![CDATA[Waltham^eMA MA]]></publisher-loc>
<publisher-name><![CDATA[Elsevier]]></publisher-name>
</nlm-citation>
</ref>
<ref id="B9">
<label>9</label><nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Chaudhuri]]></surname>
<given-names><![CDATA[S.]]></given-names>
</name>
<name>
<surname><![CDATA[Dayal]]></surname>
<given-names><![CDATA[U.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA[An Overview of Data Warehousing and OLAP Technology]]></article-title>
<source><![CDATA[ACM SIGMOD Record]]></source>
<year>1997</year>
<volume>26</volume>
<numero>1</numero>
<issue>1</issue>
<page-range>65-74</page-range></nlm-citation>
</ref>
<ref id="B10">
<label>10</label><nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Shi]]></surname>
<given-names><![CDATA[D.]]></given-names>
</name>
<name>
<surname><![CDATA[Lee]]></surname>
<given-names><![CDATA[Y.]]></given-names>
</name>
<name>
<surname><![CDATA[Duan]]></surname>
<given-names><![CDATA[X.]]></given-names>
</name>
<name>
<surname><![CDATA[Wu]]></surname>
<given-names><![CDATA[Q. H.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA[Power system data warehouses]]></article-title>
<source><![CDATA[IEEE Computer Applications in Power]]></source>
<year>2001</year>
<volume>14</volume>
<numero>3</numero>
<issue>3</issue>
<page-range>49-55</page-range></nlm-citation>
</ref>
<ref id="B11">
<label>11</label><nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Tamayo]]></surname>
<given-names><![CDATA[M.]]></given-names>
</name>
<name>
<surname><![CDATA[Moreno]]></surname>
<given-names><![CDATA[F. J.]]></given-names>
</name>
</person-group>
<article-title xml:lang="es"><![CDATA[Análisis del modelo de almacenamiento MOLAP frente al modelo de almacenamiento ROLAP]]></article-title>
<source><![CDATA[Ingeniería e Investigación]]></source>
<year>2006</year>
<volume>26</volume>
<numero>3</numero>
<issue>3</issue>
<page-range>135-142</page-range></nlm-citation>
</ref>
<ref id="B12">
<label>12</label><nlm-citation citation-type="book">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Trujillo]]></surname>
<given-names><![CDATA[J.]]></given-names>
</name>
<name>
<surname><![CDATA[Luján-Mora]]></surname>
<given-names><![CDATA[S.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA[A UML Based Approach for Modeling ETL Processes in Data Warehouses]]></article-title>
<person-group person-group-type="editor">
<name>
<surname><![CDATA[Song]]></surname>
<given-names><![CDATA[I.-Y.]]></given-names>
</name>
<name>
<surname><![CDATA[Liddle]]></surname>
<given-names><![CDATA[S. W.]]></given-names>
</name>
<name>
<surname><![CDATA[Ling]]></surname>
<given-names><![CDATA[T.-W.]]></given-names>
</name>
<name>
<surname><![CDATA[Scheuermann]]></surname>
<given-names><![CDATA[P.]]></given-names>
</name>
</person-group>
<source><![CDATA[Conceptual Modeling - ER (2003)]]></source>
<year>2003</year>
<page-range>307-320</page-range><publisher-loc><![CDATA[Berlin Heidelberg ]]></publisher-loc>
<publisher-name><![CDATA[Eds. Springer]]></publisher-name>
</nlm-citation>
</ref>
<ref id="B13">
<label>13</label><nlm-citation citation-type="confpro">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Vassiliadis]]></surname>
<given-names><![CDATA[P.]]></given-names>
</name>
<name>
<surname><![CDATA[Simitsis]]></surname>
<given-names><![CDATA[A.]]></given-names>
</name>
<name>
<surname><![CDATA[Skiadopoulos]]></surname>
<given-names><![CDATA[S.]]></given-names>
</name>
</person-group>
<source><![CDATA[Conceptual Modeling for ETL Processes]]></source>
<year>2002</year>
<conf-name><![CDATA[5th ACM International Workshop on Data Warehousing and OLAP]]></conf-name>
<conf-loc>New York NY</conf-loc>
</nlm-citation>
</ref>
<ref id="B14">
<label>14</label><nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Duque-Méndez]]></surname>
<given-names><![CDATA[N. D.]]></given-names>
</name>
<name>
<surname><![CDATA[Orozco-Alzate]]></surname>
<given-names><![CDATA[M.]]></given-names>
</name>
<name>
<surname><![CDATA[Vélez]]></surname>
<given-names><![CDATA[J. J.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA[Hydro-meteorological data analysis using OLAP techniques]]></article-title>
<source><![CDATA[Revista DYNA]]></source>
<year>2014</year>
<volume>81</volume>
<numero>185</numero>
<issue>185</issue>
<page-range>160-167</page-range></nlm-citation>
</ref>
<ref id="B15">
<label>15</label><nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[El-Sappagh]]></surname>
<given-names><![CDATA[S. H. A.]]></given-names>
</name>
<name>
<surname><![CDATA[Hendawi]]></surname>
<given-names><![CDATA[A. M. A.]]></given-names>
</name>
<name>
<surname><![CDATA[El Bastawissy]]></surname>
<given-names><![CDATA[A. H.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA[A proposed model for data warehouse ETL processes]]></article-title>
<source><![CDATA[Journal of King Saud University - Computer and Information Sciences]]></source>
<year>2011</year>
<volume>23</volume>
<numero>2</numero>
<issue>2</issue>
<page-range>91- 104</page-range></nlm-citation>
</ref>
<ref id="B16">
<label>16</label><nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Guo]]></surname>
<given-names><![CDATA[S. S.]]></given-names>
</name>
<name>
<surname><![CDATA[Yuan]]></surname>
<given-names><![CDATA[Z. M.]]></given-names>
</name>
<name>
<surname><![CDATA[Sun]]></surname>
<given-names><![CDATA[A. B.]]></given-names>
</name>
<name>
<surname><![CDATA[Yue]]></surname>
<given-names><![CDATA[Q.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA[A New ETL Approach Based on Data Virtualization]]></article-title>
<source><![CDATA[Journal of Computer Science and Technology]]></source>
<year>2015</year>
<volume>30</volume>
<numero>2</numero>
<issue>2</issue>
<page-range>311- 323</page-range></nlm-citation>
</ref>
<ref id="B17">
<label>17</label><nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Betancur-Calderón]]></surname>
<given-names><![CDATA[D.]]></given-names>
</name>
<name>
<surname><![CDATA[Moreno-Cadavid]]></surname>
<given-names><![CDATA[J.]]></given-names>
</name>
</person-group>
<article-title xml:lang="es"><![CDATA[Una aproximación multi-agente para el soporte al proceso de extraccióntransformación- carga en bodegas de datos]]></article-title>
<source><![CDATA[Revista Tecno Lógicas]]></source>
<year>2012</year>
<volume>28</volume>
<page-range>89-107</page-range></nlm-citation>
</ref>
<ref id="B18">
<label>18</label><nlm-citation citation-type="">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Morales]]></surname>
<given-names><![CDATA[A. E.]]></given-names>
</name>
</person-group>
<source><![CDATA[Estadística y probabilidad]]></source>
<year>2012</year>
</nlm-citation>
</ref>
<ref id="B19">
<label>19</label><nlm-citation citation-type="book">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Johnson]]></surname>
<given-names><![CDATA[R.]]></given-names>
</name>
<name>
<surname><![CDATA[Kuby]]></surname>
<given-names><![CDATA[P.]]></given-names>
</name>
</person-group>
<source><![CDATA[Estadística elemental]]></source>
<year>2012</year>
<edition>11° edición</edition>
<page-range>95-102</page-range><publisher-loc><![CDATA[México, D.F. ]]></publisher-loc>
<publisher-name><![CDATA[Cengage Learning]]></publisher-name>
</nlm-citation>
</ref>
</ref-list>
</back>
</article>
