Юникод

Логотип Unicode Consortium

Юнико́д[1] (чаще всего) или Унико́д[2] (англ. Unicode) — стандарт кодирования символов, включающий в себя знаки почти всех письменных языков мира[3]. В настоящее время стандарт является доминирующим в Интернете.

Стандарт предложен в 1991 году некоммерческой организацией «Консорциум Юникода» (англ. Unicode Consortium, Unicode Inc.)[4][5]. Применение этого стандарта позволяет закодировать очень большое число символов из разных систем письменности: в документах, закодированных по стандарту Юникод, могут соседствовать китайские иероглифы, математические символы, буквы греческого алфавита, латиницы и кириллицы, символы музыкальной нотной нотации, при этом становится ненужным переключение кодовых страниц[6].

Стандарт состоит из двух основных частей: универсального набора символов (англ. Universal character set, UCS) и семейства кодировок (англ. Unicode transformation format, UTF). Универсальный набор символов перечисляет допустимые по стандарту Юникод символы и присваивает каждому символу код в виде неотрицательного целого числа, записываемого обычно в шестнадцатеричной форме с префиксом U+, например, U+040F. Семейство кодировок определяет способы преобразования кодов символов для передачи в потоке или в файле.

Коды в стандарте Юникод разделены на несколько областей. Область с кодами от U+0000 до U+007F содержит символы набора ASCII, и коды этих символов совпадают с их кодами в ASCII. Далее расположены области символов других систем письменности, знаки пунктуации и технические символы. Часть кодов зарезервирована для использования в будущем[7]. Под символы кириллицы выделены области знаков с кодами от U+0400 до U+052F, от U+2DE0 до U+2DFF, от U+A640 до U+A69F (см. Кириллица в Юникоде)[8].

  1. Unicode Transcriptions (англ.) (недоступная ссылка). Дата обращения 10 мая 2010. Архивировано 8 апреля 2006 года.
  2. Уникод в словаре Paratype
  3. The Unicode® Standard: A Technical Introduction (недоступная ссылка). Дата обращения 4 июля 2010. Архивировано 10 марта 2010 года.
  4. History of Unicode Release and Publication Dates (недоступная ссылка). Дата обращения 4 июля 2010. Архивировано 10 января 2010 года.
  5. The Unicode Consortium (недоступная ссылка). Дата обращения 4 июля 2010. Архивировано 27 июня 2010 года.
  6. Foreword (недоступная ссылка). Дата обращения 4 июля 2010. Архивировано 27 июня 2010 года.
  7. General Structure (недоступная ссылка). Дата обращения 5 июля 2010. Архивировано 27 июня 2010 года.
  8. European Alphabetic Scripts (недоступная ссылка). Дата обращения 4 июля 2010. Архивировано 27 июня 2010 года.