Лекция: Кодирование текстовых и символьных данных

 

В двоичной системе счисления кодирование “внешних” символов основывается на сопоставлении каждому из них определенной группы двоичных знаков. Двоичное кодирование символьных данных производится заданием кодовых таблиц, а которых каждому символу ставится в соответствие одно – или двухбайтовый код. Восьми двоичных разрядов достаточно для кодирования 256 различных символов. Этого количества достаточно, чтобы выразить все символы английского и русского алфавита, а также знаки препинания, символы основных арифметических операций и некоторые специальные символы.

Наиболее популярная таблица ASCII (American Standart Code for Information Interchange – американский стандартный код информационного обмена) разработана институтом стандартизации США (ANSI – American National Standart Institute) в 1981 году (см. табл. 1.5).

 

Таблица 1.5. Базовая таблица кодировки ASCII

 

пробел @ P ` p
! A Q a q
B R b r
# C S c s
$ D T d t
% E U e u
& F V f v
G W g w
( H X h x
) I Y i y
* : J Z j z
+ ; K [ k {
, < L \ l |
= M ] m }
. > N ^ n ~
/ ? O _ o  

 

Коды с 0 до 127 составляют базовую (основную) таблицу, коды со 128 по 255 расширенную (дополнительную) таблицу. Дополнительная таблица отдана национальным алфавитам и символам псевдографики.

Аналогичные системы кодирования текстовых данных были разработаны и в других странах. Так в СССР действовала система кодирования КОИ – 8 (код информационного обмена восьмизначный). Компанией Microsoft была введена кодировка символов русского языка, известная как кодировка Windows – 1251.

Во многих азиатских странах 256 кодов не хватило. В 1991 году производители программных продуктов (Microsoft, IBM, Apple) выработали единый стандарт Unicode 3.0. Этот код построен по 31 – битной схеме. Все текстовые документы в этой кодировке вдвое длиннее, зато она содержит буквы латинского и многих национальных алфавитов, спецсимволы и т. п.

еще рефераты
Еще работы по информатике