La Torre de Babel de las comunicaciones: UNICODE
Balal, que suena parecido a babel es un término hebreo que significa “confundir, mezclar o revolver”. Su Torre fue conocida cómo un lugar…
La Torre de Babel de las comunicaciones: UNICODE
Balal, que suena parecido a babel es un término hebreo que significa “confundir, mezclar o revolver”. Su Torre fue conocida cómo un lugar donde el Dios cristiano y/o judío creó los idiomas y, por tanto, mezcló a los habitantes del mundo.
A los largo de los siglos hemos visto crear, expandirse y morir a numerosas lenguas. Cada uno de ellas, tiene unas características especiales que encierra la forma de ver la vida de sus hablantes.
Así, los portugueses tienen una palabra específica para expresar echar de menos un lugar, una persona o un momento cuando aún lo tienes, pero sabes que lo vas a perder;
Los gallegos tienen una para referirse a echar de menos a la tierra de donde eres;
Los vietnamitas no tienen el condicional para arrepentirse de las decisiones que han tomado;
Y la gramática inglesa es como los anglosajones, simples y pragmáticos, capaces de simplificar hasta el concepto más complicado.
El origen y la simplicidad del ASCII
Los ingleses son simples, gente sencilla a los que les gusta la eficiencia.
Por eso, cuando decidieron cómo iban a interpretar su alfabeto en un ordenador, solo les hizo falta 7 bits (128 caracteres).
Para interpretar el alfabeto cogieron el primer bit a 1 y empezaron a sumar bits por cada letra que añadían.
La estructura va como sigue a continuación:
A= 1000001 -> El primer bit es 1, los que siguen suman 1
B= 1000010 -> El primer bit es 1, los que siguen suman 2
C = 1000011 -> El primer bit es 1, los que siguen suman 3
Y así sucesivamente.
Para las minúsculas, hicieron exactamente lo mismo, pero añadieron un 1 más.
a = 1100001 -> Los primeros bits son 11, los que siguen suman 1
b = 1100010 -> Los primeros bits son 11, los que siguen suman 2
c = 1100011 -> Los primeros bits son 11, los que siguen suman 3
y así sucesivamente.
Así, ser capaz de leer un texto en ASCII e interpretarlo no es una tarea extremadamente difícil, solo necesitas saber sumar y la posición de la letra en el alfabeto.
Simple, pero eficaz.
El nuevo mundo
Sin embargo, el ASCII te servía mayormente si querías comunicarte con los ingleses. Para el resto del mundo no era tan simple. La ñ no estaba, ni el abecedario ruso, ni el chino, ni los japoneses.
Cada uno creó su propia forma de interpretar su alfabeto.
Esto significaba que si tu tenías una A en inglés (1000001) y la enviabas a un ordenador en Japón, ese ordenador muy probablemente interpretase 1000001 como otra caracter concreto o incluso no tuviera representación.
Pero eso no representaba un problema, dado que estábamos en el origen de todo este mundo y era muy poco probable que un pakistaní necesitara comunicarse con un francés.
Hasta..
Hasta que Tim Berners-Lee y su equipo desarrollaron una versión inicial de HTML, HTTP, un servidor web y un navegador en 1989. En solo dos años, ya tenían 200 servidores en operación y la World Wide Web estaba creciendo en todo el mundo.
Ahora la publicación de contenido de una parte a otra del planeta era constante e, interpretar un fichero de texto de forma correcta se hacía cada vez más esencial.
De esta forma, los ingenieros construyeron su propia Torre de Babel: Unicode, para juntar todos los idiomas en un solo lugar.
Unicode
Unicode es un estándar que se creó para acoger a todos los caracteres de todos los idiomas del mundo. Cada carácter, ahora tenía su propia representación universal, daba igual que fuese en Francia o en Mongolia.
Un ordenador podría mostrar perfectamente sin confusión un texto chino, alemán o etíope.
Además es aquí donde se incluyen las creaciones de Shigetaka Kurita, el creador de los emojis.
Pero Unicode tenía un problema.
Si podías interpretar cualquier carácter (unos 100,000 concretamente) y además emojis, necesitabas muchos bits para transmitir el mensaje. Si necesitabas muchos bits para enviar una A que en ASCII solo son 7, estabas perdiendo demasiada eficiencia.
Y los ordenadores son como los ingleses, siempre buscan la eficiencia.
El A del ASCII original 1000001 pasaba a ser algo así como 00000000000000000000001000001. Muchos 0s inservibles que no aportaban nada y consumían espacio.
Así que decidieron crear un modelo más simple, el sistema UTF8.
Cómo funciona UTF-8
El sistema UTF-8 va de la siguiente forma.
Si es ASCII, se mantiene ASCII, pero con un 0 delante, es decir, un 0 y lo 7 bits de tu letra. La A se enviaba como 01000001.
Para todo lo demás, se desarrolla de la siguiente manera:
Si necesitas 2 bytes de información, entonces pones un 110 delante del primer byte y 10 delante del segundo. Así, por ejemplo, en el mensaje:
11000100 10010101
Lo que realmente quiere transmitir es 00100010101
Si necesitas 3 bytes, sería lo mismo, pero poniendo 1110 delante del primero y 10 delante del segundo y del tercero.
La conversión 01000001 o 00100010101 se traduciría entonces a Unicode, pero habrías transmitido mucha menos información.
메타데이터
- post_id
- ced82f4c7af1
- slug
- la-torre-de-babel-de-las-comunicaciones-unicode-ced82f4c7af1
- url
- https://medium.com/@larallr/la-torre-de-babel-de-las-comunicaciones-unicode-ced82f4c7af1
- canonical_url
- https://medium.com/@larallr/la-torre-de-babel-de-las-comunicaciones-unicode-ced82f4c7af1
- author_url
- https://medium.com/@larallr
- status
- ok
- fetched_at
- 2026-06-29 01:02:39