<?xml version="1.0" encoding="ISO-8859-1"?><article xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance">
<front>
<journal-meta>
<journal-id>0121-1129</journal-id>
<journal-title><![CDATA[Revista Facultad de Ingeniería]]></journal-title>
<abbrev-journal-title><![CDATA[Rev. Fac. ing.]]></abbrev-journal-title>
<issn>0121-1129</issn>
<publisher>
<publisher-name><![CDATA[Universidad Pedagógica y Tecnológica de Colombia]]></publisher-name>
</publisher>
</journal-meta>
<article-meta>
<article-id>S0121-11292023000300006</article-id>
<article-id pub-id-type="doi">10.19053/01211129.v32.n65.2023.15314</article-id>
<title-group>
<article-title xml:lang="en"><![CDATA[Measuring Representativeness Using Covering Array Principles]]></article-title>
<article-title xml:lang="es"><![CDATA[Medición de la representatividad utilizando principios de la matriz de cobertura]]></article-title>
<article-title xml:lang="pt"><![CDATA[Medindo a representatividade usando os princípios da matriz de cobertura]]></article-title>
</title-group>
<contrib-group>
<contrib contrib-type="author">
<name>
<surname><![CDATA[Castro-Romero]]></surname>
<given-names><![CDATA[Alexander]]></given-names>
</name>
<xref ref-type="aff" rid="Aff"/>
</contrib>
<contrib contrib-type="author">
<name>
<surname><![CDATA[Cobos-Lozada]]></surname>
<given-names><![CDATA[Carlos-Alberto]]></given-names>
</name>
<xref ref-type="aff" rid="Aff"/>
</contrib>
</contrib-group>
<aff id="Af1">
<institution><![CDATA[,Universidad Pedagógica y Tecnológica de Colombia  ]]></institution>
<addr-line><![CDATA[Tunja Boyacá]]></addr-line>
<country>Colombia</country>
</aff>
<aff id="Af2">
<institution><![CDATA[,Universidad del Cauca  ]]></institution>
<addr-line><![CDATA[Popayán Cauca]]></addr-line>
<country>Colombia</country>
</aff>
<pub-date pub-type="pub">
<day>00</day>
<month>09</month>
<year>2023</year>
</pub-date>
<pub-date pub-type="epub">
<day>00</day>
<month>09</month>
<year>2023</year>
</pub-date>
<volume>32</volume>
<numero>65</numero>
<copyright-statement/>
<copyright-year/>
<self-uri xlink:href="http://www.scielo.org.co/scielo.php?script=sci_arttext&amp;pid=S0121-11292023000300006&amp;lng=en&amp;nrm=iso"></self-uri><self-uri xlink:href="http://www.scielo.org.co/scielo.php?script=sci_abstract&amp;pid=S0121-11292023000300006&amp;lng=en&amp;nrm=iso"></self-uri><self-uri xlink:href="http://www.scielo.org.co/scielo.php?script=sci_pdf&amp;pid=S0121-11292023000300006&amp;lng=en&amp;nrm=iso"></self-uri><abstract abstract-type="short" xml:lang="en"><p><![CDATA[Abstract Representativeness is an important data quality characteristic in data science processes; a data sample is said to be representative when it reflects a larger group as accurately as possible. Having low representativeness indices in the data can lead to the generation of biased models. Hence, this study shows the elements that make up a new model for measuring representativeness using a mathematical object testing element of coverage arrays called the "P Matrix". To test the model, an experiment was proposed where a data set is taken, divided into training and test data subsets using two sampling strategies: Random and Stratified, and the representativeness values are compared. If the data division is adequate, the two sampling strategies should present similar representativeness indexes. The model was implemented in a prototype software using Python (for data processing) and Vue (for data visualization) technologies, this version of the model only allows to analyze binary data sets (for now). To test the model, the "Wines" dataset (UC Irvine Machine Learning Repository) was fitted. The conclusion is that both sampling strategies generate similar representativeness results for this dataset, although this result is predictable, it is clear that adequate representativeness of the data is important when generating the test and training datasets subsets. Therefore, as future work we plan to extend the model to categorical data and explore more complex datasets.]]></p></abstract>
<abstract abstract-type="short" xml:lang="es"><p><![CDATA[Resumen La representatividad es una característica importante de la calidad de los datos en procesos de ciencia de datos; se dice que una muestra de datos es representativa cuando refleja a un grupo más grande con la mayor precisión posible. Tener bajos índices de representatividad en los datos puede conducir a la generación de modelos sesgados, por tanto, este estudio muestra los elementos que conforman un nuevo modelo para medir la representatividad utilizando un elemento de prueba de objetos matemáticos de matrices de cobertura llamado "Matriz P". Para probar el modelo se propuso un experimento donde se toma un conjunto de datos y se divide en subconjuntos de datos de entrenamiento y prueba utilizando dos estrategias de muestreo: Aleatorio y Estratificado, finalmente, se comparan los valores de representatividad. Si la división de datos es adecuada, las dos estrategias de muestreo deben presentar índices de representatividad similares. El modelo se implementó en un software prototipo usando tecnologías Python (para procesamiento de datos) y Vue (para visualización de datos); esta versión solo permite analizar conjuntos de datos binarios (por ahora). Para probar el modelo, se ajustó el conjunto de datos "Wines" (UC Irvine Machine Learning Repository). La conclusión es que ambas estrategias de muestreo generan resultados de representatividad similares para este conjunto de datos. Aunque este resultado es predecible, está claro que la representatividad adecuada de los datos es importante al generar subconjuntos de conjuntos de datos de prueba y entrenamiento, por lo tanto, como trabajo futuro, planeamos extender el modelo a datos categóricos y explorar conjuntos de datos más complejos.]]></p></abstract>
<abstract abstract-type="short" xml:lang="pt"><p><![CDATA[Resumo A representatividade é uma característica importante da qualidade dos dados nos processos de ciência de dados; Uma amostra de dados é considerada representativa quando reflete um grupo maior com a maior precisão possível. Ter baixos índices de representatividade nos dados pode levar à geração de modelos viesados, portanto, este estudo mostra os elementos que compõem um novo modelo para medir a representatividade utilizando um elemento de teste de objetos matemáticos de matrizes de cobertura denominado &#8220;Matriz P&#8221;. Para testar o modelo foi proposto um experimento onde um conjunto de dados é retirado e dividido em subconjuntos de dados de treinamento e de teste utilizando duas estratégias de amostragem: Aleatória e Estratificada, por fim, os valores de representatividade são comparados. Se a divisão dos dados for adequada, as duas estratégias de amostragem deverão apresentar índices de representatividade semelhantes. O modelo foi implementado em software protótipo utilizando tecnologias Python (para processamento de dados) e Vue (para visualização de dados); Esta versão permite apenas analisar conjuntos de dados binários (por enquanto). Para testar o modelo, foi ajustado o conjunto de dados &#8220;Wines&#8221; (UC Irvine Machine Learning Repository). A conclusão é que ambas as estratégias de amostragem geram resultados de representatividade semelhantes para este conjunto de dados. Embora este resultado seja previsível, fica claro que a representatividade adequada dos dados é importante ao gerar subconjuntos de conjuntos de dados de treinamento e teste, portanto, como trabalho futuro, planejamos estender o modelo para dados categóricos e explorar conjuntos de dados maiores e complexos.]]></p></abstract>
<kwd-group>
<kwd lng="en"><![CDATA[classification algorithms]]></kwd>
<kwd lng="en"><![CDATA[coverage arrays]]></kwd>
<kwd lng="en"><![CDATA[data quality]]></kwd>
<kwd lng="en"><![CDATA[data sets]]></kwd>
<kwd lng="en"><![CDATA[data representativeness]]></kwd>
<kwd lng="es"><![CDATA[algoritmos de clasificación]]></kwd>
<kwd lng="es"><![CDATA[calidad de los datos]]></kwd>
<kwd lng="es"><![CDATA[conjuntos de datos]]></kwd>
<kwd lng="es"><![CDATA[matrices de cobertura]]></kwd>
<kwd lng="es"><![CDATA[representatividad de los datos]]></kwd>
<kwd lng="pt"><![CDATA[algoritmos de classificação]]></kwd>
<kwd lng="pt"><![CDATA[qualidade dos dados]]></kwd>
<kwd lng="pt"><![CDATA[conjuntos de dados]]></kwd>
<kwd lng="pt"><![CDATA[matrizes de cobertura]]></kwd>
<kwd lng="pt"><![CDATA[representatividade dos dados]]></kwd>
</kwd-group>
</article-meta>
</front><back>
<ref-list>
<ref id="B1">
<label>[1]</label><nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Srivastava]]></surname>
<given-names><![CDATA[D]]></given-names>
</name>
<name>
<surname><![CDATA[Scannapieco]]></surname>
<given-names><![CDATA[M]]></given-names>
</name>
<name>
<surname><![CDATA[Redman]]></surname>
<given-names><![CDATA[T. C]]></given-names>
</name>
</person-group>
<article-title xml:lang=""><![CDATA[Ensuring high-quality private data for responsible data science: Vision and challenges]]></article-title>
<source><![CDATA[Journal of Data and Information Quality]]></source>
<year>2019</year>
<volume>11</volume>
<numero>1</numero>
<issue>1</issue>
<page-range>1-9</page-range></nlm-citation>
</ref>
<ref id="B2">
<label>[2]</label><nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Clarke]]></surname>
<given-names><![CDATA[R]]></given-names>
</name>
</person-group>
<article-title xml:lang=""><![CDATA[Big data, big risks]]></article-title>
<source><![CDATA[Information Systems Journal]]></source>
<year>2016</year>
<volume>26</volume>
<numero>1</numero>
<issue>1</issue>
<page-range>77-90</page-range></nlm-citation>
</ref>
<ref id="B3">
<label>[3]</label><nlm-citation citation-type="">
<source><![CDATA[Incorrect Data in the Widely Used Inside Airbnb Dataset]]></source>
<year>2020</year>
</nlm-citation>
</ref>
<ref id="B4">
<label>[4]</label><nlm-citation citation-type="confpro">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Yapo]]></surname>
<given-names><![CDATA[A]]></given-names>
</name>
<name>
<surname><![CDATA[Weiss]]></surname>
<given-names><![CDATA[J]]></given-names>
</name>
</person-group>
<source><![CDATA[Ethical Implications of Bias in Machine Learning]]></source>
<year>2018</year>
<conf-name><![CDATA[ Proceedings of the 51st Hawaii International Conference on System Sciences]]></conf-name>
<conf-loc> </conf-loc>
</nlm-citation>
</ref>
<ref id="B5">
<label>[5]</label><nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Polyzotis]]></surname>
<given-names><![CDATA[N]]></given-names>
</name>
<name>
<surname><![CDATA[Roy]]></surname>
<given-names><![CDATA[S]]></given-names>
</name>
<name>
<surname><![CDATA[Whang]]></surname>
<given-names><![CDATA[S. E]]></given-names>
</name>
<name>
<surname><![CDATA[Zinkevich]]></surname>
<given-names><![CDATA[M]]></given-names>
</name>
</person-group>
<article-title xml:lang=""><![CDATA[Data lifecycle challenges in production machine learning: A survey]]></article-title>
<source><![CDATA[SIGMOD Record]]></source>
<year>2018</year>
<volume>47</volume>
<numero>2</numero>
<issue>2</issue>
<page-range>17-28</page-range></nlm-citation>
</ref>
<ref id="B6">
<label>[6]</label><nlm-citation citation-type="confpro">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Rojas]]></surname>
<given-names><![CDATA[J. A.]]></given-names>
</name>
<name>
<surname><![CDATA[Kery]]></surname>
<given-names><![CDATA[M. Beth]]></given-names>
</name>
<name>
<surname><![CDATA[Rosenthal]]></surname>
<given-names><![CDATA[S]]></given-names>
</name>
<name>
<surname><![CDATA[Dey]]></surname>
<given-names><![CDATA[A]]></given-names>
</name>
</person-group>
<source><![CDATA[Sampling techniques to improve big data exploration]]></source>
<year>2017</year>
<conf-name><![CDATA[ 7Symposium on Large Data Analysis and Visualization]]></conf-name>
<conf-loc> </conf-loc>
<page-range>26-35</page-range></nlm-citation>
</ref>
<ref id="B7">
<label>[7]</label><nlm-citation citation-type="book">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Mayer-Schönberger]]></surname>
<given-names><![CDATA[V.]]></given-names>
</name>
<name>
<surname><![CDATA[Cukier]]></surname>
<given-names><![CDATA[K]]></given-names>
</name>
</person-group>
<source><![CDATA[Big data: La revolución de los datos masivos]]></source>
<year>2013</year>
<publisher-name><![CDATA[Turner]]></publisher-name>
</nlm-citation>
</ref>
<ref id="B8">
<label>[8]</label><nlm-citation citation-type="confpro">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Torres-Jimenez]]></surname>
<given-names><![CDATA[J.]]></given-names>
</name>
<name>
<surname><![CDATA[Izquierdo-Marquez]]></surname>
<given-names><![CDATA[I.]]></given-names>
</name>
</person-group>
<source><![CDATA[Survey of covering arrays]]></source>
<year>2013</year>
<conf-name><![CDATA[ 15International Symposium on Symbolic and Numeric Algorithms for Scientific Computing]]></conf-name>
<conf-loc> </conf-loc>
<page-range>20-7</page-range></nlm-citation>
</ref>
<ref id="B9">
<label>[9]</label><nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Timaná-Peña]]></surname>
<given-names><![CDATA[J. Adriana]]></given-names>
</name>
<name>
<surname><![CDATA[Cobos-Lozada]]></surname>
<given-names><![CDATA[C. Alberto]]></given-names>
</name>
<name>
<surname><![CDATA[Torres-Jimenez]]></surname>
<given-names><![CDATA[J]]></given-names>
</name>
</person-group>
<article-title xml:lang=""><![CDATA[Metaheuristic algorithms for building Covering Arrays A review]]></article-title>
<source><![CDATA[Revista Facultad de Ingeniería]]></source>
<year>2016</year>
<volume>25</volume>
<numero>43</numero>
<issue>43</issue>
<page-range>31-45</page-range></nlm-citation>
</ref>
<ref id="B10">
<label>[10]</label><nlm-citation citation-type="book">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Blake]]></surname>
<given-names><![CDATA[C. L.]]></given-names>
</name>
<name>
<surname><![CDATA[Merz]]></surname>
<given-names><![CDATA[C. J.]]></given-names>
</name>
</person-group>
<source><![CDATA[UCI Repository of Machine Learning Databases]]></source>
<year>1998</year>
<publisher-loc><![CDATA[Oakland ]]></publisher-loc>
<publisher-name><![CDATA[University of California]]></publisher-name>
</nlm-citation>
</ref>
</ref-list>
</back>
</article>
