首页 / 百科 / Unicode

Unicode

编码

统一字符编码标准

Unicode 是为全球所有文字系统分配唯一码位(Code Point)的国际标准,由 Unicode 联盟维护,自 1991 年 1.0 版起持续扩充,最新版本已收录 15 万以上字符。

它解决什么问题

在 Unicode 之前,各语言各有编码:中文 GB2312/GBK、日文 Shift_JIS、西文 ISO 8859-1,彼此不兼容,跨语言混排必然乱码。Unicode 给每个字符分配一个全局唯一编号(形如 U+4E2D 表示"中"),从根上统一了"字符是什么"的问题。

码位与平面

Unicode 码位空间共 17 个平面(Plane),每个平面 65536 个码位,总计可容纳超 110 万个。基本多文种平面(BMP,U+0000–U+FFFF)覆盖绝大多数常用文字;emoji、古文字等在增补平面(SMP),码位超过 U+FFFF——这正是 JavaScript 字符串处理 emoji 需要特别小心的原因(一个 emoji 长度为 2)。

Unicode 与 UTF-8 的关系

Unicode 只定义"编号",UTF-8、UTF-16、UTF-32 才定义编号如何落盘为字节。同一码位 U+4E2D 在 UTF-8 下是 E4 B8 AD 三个字节,在 UTF-16 下是 4E 2D。日常说"Unicode 编码"往往指 UTF-16(如 Windows 内部)或 UTF-8,要按上下文区分。

版本与发布

1.0 发布于 1991 年,此后每年左右更新一个大版本;截至 2024 年的 15.1 版收录约 15.4 万个字符,含汉字九万余个。版本号影响的是字符集内容,不影响已有码位的含义——已分配码位永不删除、永不改变,这是标准的稳定性承诺。

相关工具

相关词条