<?xml version="1.0" encoding="ISO-8859-1"?><article xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance">
<front>
<journal-meta>
<journal-id>0120-1751</journal-id>
<journal-title><![CDATA[Revista Colombiana de Estadística]]></journal-title>
<abbrev-journal-title><![CDATA[Rev.Colomb.Estad.]]></abbrev-journal-title>
<issn>0120-1751</issn>
<publisher>
<publisher-name><![CDATA[Departamento de Estadística - Universidad Nacional de Colombia.]]></publisher-name>
</publisher>
</journal-meta>
<article-meta>
<article-id>S0120-17512012000300006</article-id>
<title-group>
<article-title xml:lang="en"><![CDATA[On the Entropy of Written Spanish]]></article-title>
<article-title xml:lang="es"><![CDATA[Sobre la entropía del español escrito]]></article-title>
</title-group>
<contrib-group>
<contrib contrib-type="author">
<name>
<surname><![CDATA[GUERRERO]]></surname>
<given-names><![CDATA[FABIO G.]]></given-names>
</name>
<xref ref-type="aff" rid="A01"/>
</contrib>
</contrib-group>
<aff id="A01">
<institution><![CDATA[,Universidad del Valle Facultad de Ingeniería Escuela de Ingeniería Eléctrica y Electrónica]]></institution>
<addr-line><![CDATA[Cali ]]></addr-line>
<country>Colombia</country>
</aff>
<pub-date pub-type="pub">
<day>00</day>
<month>12</month>
<year>2012</year>
</pub-date>
<pub-date pub-type="epub">
<day>00</day>
<month>12</month>
<year>2012</year>
</pub-date>
<volume>35</volume>
<numero>3</numero>
<fpage>425</fpage>
<lpage>442</lpage>
<copyright-statement/>
<copyright-year/>
<self-uri xlink:href="http://www.scielo.org.co/scielo.php?script=sci_arttext&amp;pid=S0120-17512012000300006&amp;lng=en&amp;nrm=iso"></self-uri><self-uri xlink:href="http://www.scielo.org.co/scielo.php?script=sci_abstract&amp;pid=S0120-17512012000300006&amp;lng=en&amp;nrm=iso"></self-uri><self-uri xlink:href="http://www.scielo.org.co/scielo.php?script=sci_pdf&amp;pid=S0120-17512012000300006&amp;lng=en&amp;nrm=iso"></self-uri><abstract abstract-type="short" xml:lang="en"><p><![CDATA[A discussion on the entropy of the Spanish language by means of a practical method for calculating the entropy of a text by direct computer processing is presented. As an example of application, thirty samples of Spanish text are analyzed, totaling 22.8 million characters. Symbol lengths from n = 1 to 500 were considered for both words and characters. Both direct computer processing and the probability law of large numbers were employed for calculating the probability distribution of the symbols. An empirical relation on entropy involving the length of the text (in characters) and the number of different words in the text is presented. Statistical properties of the Spanish language when viewed as produced by a stochastic source, (such as origin shift invariance, ergodicity and asymptotic equipartition property) are also analyzed.]]></p></abstract>
<abstract abstract-type="short" xml:lang="es"><p><![CDATA[Se presenta una discusión sobre la entropía de la lengua española por medio de un método práctico para el cálculo de la entropía de un texto mediante procesamiento informático directo. Como un ejemplo de aplicación, se analizan treinta muestras de texto español, sumando un total de 22,8 millones de caracteres. Longitudes de símbolos desde n = 1 hasta 500 fueron consideradas tanto para palabras como caracteres. Para el cálculo de la distribución de probabilidad de los símbolos se emplearon procesamiento directo por computador y la ley de probabilidad de los grandes números. Se presenta una relación empírica de la entropía con la longitud del texto (en caracteres) y el número de palabras diferentes en el texto. Se analizan también propiedades estadísticas de la lengua española cuando se considera como producida por una fuente estocástica, tales como la invarianza al desplazamiento del origen, ergodicidad y la propiedad de equipartición asintótica.]]></p></abstract>
<kwd-group>
<kwd lng="en"><![CDATA[Law of large numbers]]></kwd>
<kwd lng="en"><![CDATA[Shannon entropy]]></kwd>
<kwd lng="en"><![CDATA[Stochastic process]]></kwd>
<kwd lng="en"><![CDATA[Zipf's law]]></kwd>
<kwd lng="es"><![CDATA[entropía de Shannon]]></kwd>
<kwd lng="es"><![CDATA[ley de grandes números]]></kwd>
<kwd lng="es"><![CDATA[ley de Zipf]]></kwd>
<kwd lng="es"><![CDATA[procesos estocásticos]]></kwd>
</kwd-group>
</article-meta>
</front><body><![CDATA[  <font size="2" face="verdana">      <p> <b> <font size="4">     <center> On the Entropy of Written Spanish </center> </font> </b> </p>      <p> <b> <font size="3">     <center> Sobre la entrop&iacute;a del espa&ntilde;ol escrito </center> </font> </b> </p>      <p>     <center> FABIO G. GUERRERO<sup>1</sup> </center> </p>      <p> <sup>1</sup>Universidad del Valle, Facultad de Ingenier&iacute;a, Escuela de Ingenier&iacute;a El&eacute;ctrica y Electr&oacute;nica, Cali, Colombia. Assistant Professor. Email: <a href="mailto:fabio.guerrero@correounivalle.edu.co">fabio.guerrero@correounivalle.edu.co</a>     <br> </p>  <hr size="1">      <p> <b>     ]]></body>
<body><![CDATA[<center> Abstract </center> </b> </p>      <p> A discussion on the entropy of the Spanish language by means of a practical method for calculating the entropy of a text by direct computer processing is presented. As an example of application, thirty samples of Spanish text are analyzed, totaling 22.8 million characters. Symbol lengths from n = 1 to 500 were considered for both words and characters. Both direct computer processing and the probability law of large numbers were employed for calculating the probability distribution of the symbols. An empirical relation on entropy involving the length of the text (in characters) and the number of different words in the text is presented. Statistical properties of the Spanish language when viewed as produced by a stochastic source, (such as origin shift invariance, ergodicity and asymptotic equipartition property) are also analyzed. </p>      <p> <b> Key words: </b> Law of large numbers, Shannon entropy, Stochastic process, Zipf's law. </p>  <hr size="1">      <p> <b>     <center> Resumen </center> </b> </p>      <p> Se presenta una discusi&oacute;n sobre la entrop&iacute;a de la lengua espa&ntilde;ola por medio de un m&eacute;todo pr&aacute;ctico para el c&aacute;lculo de la entrop&iacute;a de un texto mediante procesamiento inform&aacute;tico directo. Como un ejemplo de aplicaci&oacute;n, se analizan treinta muestras de texto espa&ntilde;ol, sumando un total de 22,8 millones de caracteres. Longitudes de s&iacute;mbolos desde n = 1 hasta 500 fueron consideradas tanto para palabras como caracteres. Para el c&aacute;lculo de la distribuci&oacute;n de probabilidad de los s&iacute;mbolos se emplearon procesamiento directo por computador y la ley de probabilidad de los grandes n&uacute;meros. Se presenta una relaci&oacute;n emp&iacute;rica de la entrop&iacute;a con la longitud del texto (en caracteres) y el n&uacute;mero de palabras diferentes en el texto. Se analizan tambi&eacute;n propiedades estad&iacute;sticas de la lengua espa&ntilde;ola cuando se considera como producida por una fuente estoc&aacute;stica, tales como la invarianza al desplazamiento del origen, ergodicidad y la propiedad de equipartici&oacute;n asint&oacute;tica. </p>      <p> <b> Palabras clave: </b> entrop&iacute;a de Shannon, ley de grandes n&uacute;meros, ley de Zipf, procesos estoc&aacute;sticos. </p>  <hr size="1">      <p> Texto completo disponible en <a href="pdf/rce/v35n3/v35n3a06.pdf">PDF</a> </p>  <hr size="1">      <p> <b> <font size="3"> References </font> </b> </p>       <!-- ref --><p> 1. Slepian, D. (1976), 'On bandwidth', <i>Proceedings of the IEEE</i> <b>34</b>(3).    &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scielo.php?script=sci_nlinks&ref=000022&pid=S0120-1751201200030000600001&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');">Links</a>&#160;]<!-- end-ref --> </p>  <hr size="1">      <center> <b>&#91;Recibido en noviembre de 2011. Aceptado en septiembre de 2012&#93;</b> </center> <hr size="1">      <p> Este art&iacute;culo se puede citar en <i>LaTeX</i> utilizando la siguiente referencia bibliogr&aacute;fica de <i>BibTeX</i>: </p> <code><font size="2">@ARTICLE{RCEv35n3a06,    <br>  &nbsp;&nbsp;&nbsp; AUTHOR &nbsp;= {Guerrero, Fabio G.},    <br>  &nbsp;&nbsp;&nbsp; TITLE &nbsp; = {{On the Entropy of Written Spanish}},    <br>  &nbsp;&nbsp;&nbsp; JOURNAL = {Revista Colombiana de Estad&iacute;stica},    <br> &nbsp;&nbsp;&nbsp; YEAR &nbsp;&nbsp; = {2012},    <br> &nbsp;&nbsp;&nbsp; volume &nbsp;= {35},    <br> &nbsp;&nbsp;&nbsp; number &nbsp;= {3},    <br> &nbsp;&nbsp;&nbsp; pages &nbsp; = {425-442}    ]]></body>
<body><![CDATA[<br> }</font></code>  <hr size="1"> </font>      ]]></body><back>
<ref-list>
<ref id="B1">
<label>1</label><nlm-citation citation-type="journal">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Slepian]]></surname>
<given-names><![CDATA[D.]]></given-names>
</name>
</person-group>
<article-title xml:lang="en"><![CDATA['On bandwidth']]></article-title>
<source><![CDATA[Proceedings of the IEEE]]></source>
<year>1976</year>
<volume>34</volume>
<numero>3</numero>
<issue>3</issue>
</nlm-citation>
</ref>
</ref-list>
</back>
</article>
