Материал связан с темами кодирования текста и японских языковых технологий.

В 1978 году японское Министерство экономики, торговли и промышленности утвердило кодировку, впоследствии известную как JIS X 0208 — она до сих пор служит важным ориентиром для всех японских кодировок. Однако вскоре после публикации стандарта обнаружилось нечто странное: у нескольких добавленных иероглифов не было очевидного источника, и никто не мог сказать, что они означают и как произносятся. Происхождение символов оставалось загадкой. Позже их назвали «призрачными иероглифами» (幽霊文字).

Будьте осторожны с тем, что пишете. Источник: Национальная парламентская библиотека Японии

Долгое время призрачные иероглифы оставались необъяснённым и почти забытым курьёзом, но в 1997 году стартовало расследование, призванное выяснить их происхождение. Формально у каждого символа в стандарте JIS должна была быть запись об источнике, однако даже там, где такая запись существовала, она была крайне неконкретной — обычно указывался лишь документ, из которого символ был взят.

Казалось бы, наличие указания на источник должно упрощать поиск происхождения символов, но здесь важно уточнить, что именно считалось «источником». Одним из самых частых источников для призрачных иероглифов служил справочник «Обзор национальных административных округов» (国土行政区画総覧) — исчерпывающий перечень географических названий Японии. Может показаться, что речь идёт о чём-то вроде атласа — крупноформатной книге на несколько сотен страниц. На деле последнее издание этого справочника представляет собой семитомник, где в каждом томе примерно девятьсот страниц. Найти единственный символ без указания страницы в таком массиве — задача не из простых.

Несмотря на сложность, расследование в итоге почти полностью восстановило происхождение призрачных иероглифов. Опросив каталогизаторов, участвовавших в создании стандарта, исследователи установили: часть символов возникла случайно — как ошибки в процессе каталогизации. Например, иероглиф 妛 появился как опечатка при попытке зафиксировать сочетание «山 над 女». Это сочетание встречается в одном из топонимов и потому подлежало включению в стандарт JIS, но поскольку напечатать его как единый символ тогда не могли, 山 и 女 напечатали отдельно, вырезали и наклеили на лист бумаги, после чего отсканировали. При просмотре копии линия стыка двух вырезанных кусочков бумаги была ошибочно принята за черту иероглифа и добавлена к символу. Оригинальный иероглиф (𡚴) был включён в JIS и Unicode гораздо позже и до сих пор не отображается на большинстве сайтов.

Основные призрачные иероглифы: 妛挧暃椦槞蟐袮閠駲墸壥彁

В итоге лишь у одного символа не нашлось ни ясного источника, ни исторического прецедента — 彁. Наиболее вероятное объяснение состоит в том, что он появился как неверное прочтение иероглифа 彊, однако конкретный случай, вызвавший ошибку, установить не удалось.

После повсеместного внедрения стандарта JIS все эти символы перекочевали в Unicode, где существует и собственный, отдельный набор призрачных иероглифов, возникший при унификации CJK.

Если подвести итог: в 1978 году серия мелких ошибок создала несколько символов буквально из ничего. Эти неточности оставались незамеченными ровно столько, сколько потребовалось, чтобы закрепиться в стандарте навсегда, — и теперь эти призраки, по крайней мере потенциально, присутствуют на каждом компьютере планеты, затаившись в тёмных углах таблиц символов.

Судя по всему, они останутся с человечеством навсегда. Ψ

Ссылки по теме: