xref: /plan9-contrib/sys/src/cmd/aux/antiword/utf8.c (revision 25b329d522281a8cdd35da0dcc08c3fc621059a9)
1f5736e95SDavid du Colombier /*
2f5736e95SDavid du Colombier  * utf8.c
3*25b329d5SDavid du Colombier  * Copyright (C) 2001-2004 A.J. van Os; Released under GPL
4f5736e95SDavid du Colombier  *
5f5736e95SDavid du Colombier  *====================================================================
6f5736e95SDavid du Colombier  * This part of the software is based on:
7f5736e95SDavid du Colombier  * An implementation of wcwidth() as defined in
8f5736e95SDavid du Colombier  * "The Single UNIX Specification, Version 2, The Open Group, 1997"
9f5736e95SDavid du Colombier  * <http://www.UNIX-systems.org/online.html>
10f5736e95SDavid du Colombier  * Markus Kuhn -- 2001-01-12 -- public domain
11f5736e95SDavid du Colombier  *====================================================================
12f5736e95SDavid du Colombier  * The credit should go to him, but all the bugs are mine.
13f5736e95SDavid du Colombier  */
14f5736e95SDavid du Colombier 
15f5736e95SDavid du Colombier #include <stdlib.h>
16f5736e95SDavid du Colombier #include <string.h>
17f5736e95SDavid du Colombier #include "antiword.h"
18f5736e95SDavid du Colombier 
19f5736e95SDavid du Colombier struct interval {
20f5736e95SDavid du Colombier 	USHORT	first;
21f5736e95SDavid du Colombier 	USHORT	last;
22f5736e95SDavid du Colombier };
23f5736e95SDavid du Colombier /* Sorted list of non-overlapping intervals of non-spacing characters */
24f5736e95SDavid du Colombier static const struct interval combining[] = {
25f5736e95SDavid du Colombier 	{ 0x0300, 0x034E }, { 0x0360, 0x0362 }, { 0x0483, 0x0486 },
26f5736e95SDavid du Colombier 	{ 0x0488, 0x0489 }, { 0x0591, 0x05A1 }, { 0x05A3, 0x05B9 },
27f5736e95SDavid du Colombier 	{ 0x05BB, 0x05BD }, { 0x05BF, 0x05BF }, { 0x05C1, 0x05C2 },
28f5736e95SDavid du Colombier 	{ 0x05C4, 0x05C4 }, { 0x064B, 0x0655 }, { 0x0670, 0x0670 },
29f5736e95SDavid du Colombier 	{ 0x06D6, 0x06E4 }, { 0x06E7, 0x06E8 }, { 0x06EA, 0x06ED },
30f5736e95SDavid du Colombier 	{ 0x070F, 0x070F }, { 0x0711, 0x0711 }, { 0x0730, 0x074A },
31f5736e95SDavid du Colombier 	{ 0x07A6, 0x07B0 }, { 0x0901, 0x0902 }, { 0x093C, 0x093C },
32f5736e95SDavid du Colombier 	{ 0x0941, 0x0948 }, { 0x094D, 0x094D }, { 0x0951, 0x0954 },
33f5736e95SDavid du Colombier 	{ 0x0962, 0x0963 }, { 0x0981, 0x0981 }, { 0x09BC, 0x09BC },
34f5736e95SDavid du Colombier 	{ 0x09C1, 0x09C4 }, { 0x09CD, 0x09CD }, { 0x09E2, 0x09E3 },
35f5736e95SDavid du Colombier 	{ 0x0A02, 0x0A02 }, { 0x0A3C, 0x0A3C }, { 0x0A41, 0x0A42 },
36f5736e95SDavid du Colombier 	{ 0x0A47, 0x0A48 }, { 0x0A4B, 0x0A4D }, { 0x0A70, 0x0A71 },
37f5736e95SDavid du Colombier 	{ 0x0A81, 0x0A82 }, { 0x0ABC, 0x0ABC }, { 0x0AC1, 0x0AC5 },
38f5736e95SDavid du Colombier 	{ 0x0AC7, 0x0AC8 }, { 0x0ACD, 0x0ACD }, { 0x0B01, 0x0B01 },
39f5736e95SDavid du Colombier 	{ 0x0B3C, 0x0B3C }, { 0x0B3F, 0x0B3F }, { 0x0B41, 0x0B43 },
40f5736e95SDavid du Colombier 	{ 0x0B4D, 0x0B4D }, { 0x0B56, 0x0B56 }, { 0x0B82, 0x0B82 },
41f5736e95SDavid du Colombier 	{ 0x0BC0, 0x0BC0 }, { 0x0BCD, 0x0BCD }, { 0x0C3E, 0x0C40 },
42f5736e95SDavid du Colombier 	{ 0x0C46, 0x0C48 }, { 0x0C4A, 0x0C4D }, { 0x0C55, 0x0C56 },
43f5736e95SDavid du Colombier 	{ 0x0CBF, 0x0CBF }, { 0x0CC6, 0x0CC6 }, { 0x0CCC, 0x0CCD },
44f5736e95SDavid du Colombier 	{ 0x0D41, 0x0D43 }, { 0x0D4D, 0x0D4D }, { 0x0DCA, 0x0DCA },
45f5736e95SDavid du Colombier 	{ 0x0DD2, 0x0DD4 }, { 0x0DD6, 0x0DD6 }, { 0x0E31, 0x0E31 },
46f5736e95SDavid du Colombier 	{ 0x0E34, 0x0E3A }, { 0x0E47, 0x0E4E }, { 0x0EB1, 0x0EB1 },
47f5736e95SDavid du Colombier 	{ 0x0EB4, 0x0EB9 }, { 0x0EBB, 0x0EBC }, { 0x0EC8, 0x0ECD },
48f5736e95SDavid du Colombier 	{ 0x0F18, 0x0F19 }, { 0x0F35, 0x0F35 }, { 0x0F37, 0x0F37 },
49f5736e95SDavid du Colombier 	{ 0x0F39, 0x0F39 }, { 0x0F71, 0x0F7E }, { 0x0F80, 0x0F84 },
50f5736e95SDavid du Colombier 	{ 0x0F86, 0x0F87 }, { 0x0F90, 0x0F97 }, { 0x0F99, 0x0FBC },
51f5736e95SDavid du Colombier 	{ 0x0FC6, 0x0FC6 }, { 0x102D, 0x1030 }, { 0x1032, 0x1032 },
52f5736e95SDavid du Colombier 	{ 0x1036, 0x1037 }, { 0x1039, 0x1039 }, { 0x1058, 0x1059 },
53f5736e95SDavid du Colombier 	{ 0x1160, 0x11FF }, { 0x17B7, 0x17BD }, { 0x17C6, 0x17C6 },
54f5736e95SDavid du Colombier 	{ 0x17C9, 0x17D3 }, { 0x180B, 0x180E }, { 0x18A9, 0x18A9 },
55f5736e95SDavid du Colombier 	{ 0x200B, 0x200F }, { 0x202A, 0x202E }, { 0x206A, 0x206F },
56f5736e95SDavid du Colombier 	{ 0x20D0, 0x20E3 }, { 0x302A, 0x302F }, { 0x3099, 0x309A },
57f5736e95SDavid du Colombier 	{ 0xFB1E, 0xFB1E }, { 0xFE20, 0xFE23 }, { 0xFEFF, 0xFEFF },
58f5736e95SDavid du Colombier 	{ 0xFFF9, 0xFFFB }
59f5736e95SDavid du Colombier };
60f5736e95SDavid du Colombier 
61f5736e95SDavid du Colombier /* Auxiliary function for binary search in interval table */
62f5736e95SDavid du Colombier static BOOL
bIsZeroWidthChar(ULONG ucs)63f5736e95SDavid du Colombier bIsZeroWidthChar(ULONG ucs)
64f5736e95SDavid du Colombier {
65f5736e95SDavid du Colombier 	int low = 0;
66f5736e95SDavid du Colombier 	int high = elementsof(combining) - 1;
67f5736e95SDavid du Colombier 	int mid;
68f5736e95SDavid du Colombier 
69f5736e95SDavid du Colombier 	if (ucs < (ULONG)combining[low].first ||
70f5736e95SDavid du Colombier 	    ucs > (ULONG)combining[high].last) {
71f5736e95SDavid du Colombier 		return FALSE;
72f5736e95SDavid du Colombier 	}
73f5736e95SDavid du Colombier 
74f5736e95SDavid du Colombier 	while (high >= low) {
75f5736e95SDavid du Colombier 		mid = (low + high) / 2;
76f5736e95SDavid du Colombier 		if (ucs > (ULONG)combining[mid].last) {
77f5736e95SDavid du Colombier 			low = mid + 1;
78f5736e95SDavid du Colombier 		} else if (ucs < (ULONG)combining[mid].first) {
79f5736e95SDavid du Colombier 			high = mid - 1;
80f5736e95SDavid du Colombier 		} else {
81f5736e95SDavid du Colombier 			return TRUE;
82f5736e95SDavid du Colombier 		}
83f5736e95SDavid du Colombier 	}
84f5736e95SDavid du Colombier 	return FALSE;
85f5736e95SDavid du Colombier } /* end of bIsZeroWidthChar */
86f5736e95SDavid du Colombier 
87f5736e95SDavid du Colombier /* The following functions define the column width of an ISO 10646
88f5736e95SDavid du Colombier  * character as follows:
89f5736e95SDavid du Colombier  *
90f5736e95SDavid du Colombier  *    - The null character (U+0000) has a column width of 0.
91f5736e95SDavid du Colombier  *
92f5736e95SDavid du Colombier  *    - Other C0/C1 control characters and DEL will lead to a return
93f5736e95SDavid du Colombier  *      value of -1.
94f5736e95SDavid du Colombier  *
95f5736e95SDavid du Colombier  *    - Non-spacing and enclosing combining characters (general
96f5736e95SDavid du Colombier  *      category code Mn or Me in the Unicode database) have a
97f5736e95SDavid du Colombier  *      column width of 0.
98f5736e95SDavid du Colombier  *
99f5736e95SDavid du Colombier  *    - Other format characters (general category code Cf in the Unicode
100f5736e95SDavid du Colombier  *      database) and ZERO WIDTH SPACE (U+200B) have a column width of 0.
101f5736e95SDavid du Colombier  *
102f5736e95SDavid du Colombier  *    - Hangul Jamo medial vowels and final consonants (U+1160-U+11FF)
103f5736e95SDavid du Colombier  *      have a column width of 0.
104f5736e95SDavid du Colombier  *
105f5736e95SDavid du Colombier  *    - Spacing characters in the East Asian Wide (W) or East Asian
106f5736e95SDavid du Colombier  *      FullWidth (F) category as defined in Unicode Technical
107f5736e95SDavid du Colombier  *      Report #11 have a column width of 2.
108f5736e95SDavid du Colombier  *
109f5736e95SDavid du Colombier  *    - All remaining characters (including all printable
110f5736e95SDavid du Colombier  *      ISO 8859-1 and WGL4 characters, Unicode control characters,
111f5736e95SDavid du Colombier  *      etc.) have a column width of 1.
112f5736e95SDavid du Colombier  *
113f5736e95SDavid du Colombier  * This implementation assumes that all characters are encoded
114f5736e95SDavid du Colombier  * in ISO 10646.
115f5736e95SDavid du Colombier  *
116f5736e95SDavid du Colombier  * This function is not named wcwidth() to prevent name clashes
117f5736e95SDavid du Colombier  */
118f5736e95SDavid du Colombier static int
iWcWidth(ULONG ucs)119f5736e95SDavid du Colombier iWcWidth(ULONG ucs)
120f5736e95SDavid du Colombier {
121f5736e95SDavid du Colombier 	/* Test for 8-bit control characters */
122f5736e95SDavid du Colombier 	if (ucs == 0) {
123f5736e95SDavid du Colombier 		return 0;
124f5736e95SDavid du Colombier 	}
125f5736e95SDavid du Colombier 	if (ucs < 0x20 || (ucs >= 0x7f && ucs < 0xa0)) {
126f5736e95SDavid du Colombier 		NO_DBG_HEX(ucs);
127f5736e95SDavid du Colombier 		return -1;
128f5736e95SDavid du Colombier 	}
129f5736e95SDavid du Colombier 
130f5736e95SDavid du Colombier 	/* Binary search in table of non-spacing characters */
131f5736e95SDavid du Colombier 	if (bIsZeroWidthChar(ucs)) {
132f5736e95SDavid du Colombier 		return 0;
133f5736e95SDavid du Colombier 	}
134f5736e95SDavid du Colombier 
135f5736e95SDavid du Colombier 	/* Ucs is not a combining or C0/C1 control character */
136f5736e95SDavid du Colombier 
137f5736e95SDavid du Colombier 	return 1 +
138f5736e95SDavid du Colombier 	(ucs >= 0x1100 &&
139f5736e95SDavid du Colombier 	 (ucs <= 0x115f ||                    /* Hangul Jamo init. consonants */
140f5736e95SDavid du Colombier 	  (ucs >= 0x2e80 && ucs <= 0xa4cf && (ucs & ~0x0011) != 0x300a &&
141f5736e95SDavid du Colombier 	   ucs != 0x303f) ||                  /* CJK ... Yi */
142f5736e95SDavid du Colombier 	  (ucs >= 0xac00 && ucs <= 0xd7a3) || /* Hangul Syllables */
143f5736e95SDavid du Colombier 	  (ucs >= 0xf900 && ucs <= 0xfaff) || /* CJK Compatibility Ideographs */
144f5736e95SDavid du Colombier 	  (ucs >= 0xfe30 && ucs <= 0xfe6f) || /* CJK Compatibility Forms */
145f5736e95SDavid du Colombier 	  (ucs >= 0xff00 && ucs <= 0xff5f) || /* Fullwidth Forms */
146f5736e95SDavid du Colombier 	  (ucs >= 0xffe0 && ucs <= 0xffe6) ||
147f5736e95SDavid du Colombier 	  (ucs >= 0x20000 && ucs <= 0x2ffff)));
148f5736e95SDavid du Colombier } /* end of iWcWidth */
149f5736e95SDavid du Colombier 
150f5736e95SDavid du Colombier /*
151f5736e95SDavid du Colombier  * utf8_to_ucs - convert from UTF-8 to UCS
152f5736e95SDavid du Colombier  *
153f5736e95SDavid du Colombier  * Returns the UCS character,
154f5736e95SDavid du Colombier  * Fills in the number of bytes in the UTF-8 character
155f5736e95SDavid du Colombier  */
156f5736e95SDavid du Colombier static ULONG
utf8_to_ucs(const char * p,int iStrLen,int * piUtfLen)157*25b329d5SDavid du Colombier utf8_to_ucs(const char *p, int iStrLen, int *piUtfLen)
158f5736e95SDavid du Colombier {
159*25b329d5SDavid du Colombier 	ULONG	ulUcs;
160*25b329d5SDavid du Colombier 	int	iIndex, iCharLen;
161f5736e95SDavid du Colombier 
162*25b329d5SDavid du Colombier 	fail(p == NULL || piUtfLen == NULL);
163*25b329d5SDavid du Colombier 	fail(iStrLen < 1);
164f5736e95SDavid du Colombier 
165*25b329d5SDavid du Colombier 	ulUcs = (ULONG)(UCHAR)p[0];
166f5736e95SDavid du Colombier 
167*25b329d5SDavid du Colombier 	if (ulUcs < 0x80) {
168*25b329d5SDavid du Colombier 		*piUtfLen = 1;
169*25b329d5SDavid du Colombier 		return ulUcs;
170f5736e95SDavid du Colombier 	}
171f5736e95SDavid du Colombier 
172*25b329d5SDavid du Colombier 	if (ulUcs < 0xe0){
173*25b329d5SDavid du Colombier 		iCharLen = 2;
174*25b329d5SDavid du Colombier 		ulUcs &= 0x1f;
175*25b329d5SDavid du Colombier 	} else if (ulUcs < 0xf0){
176*25b329d5SDavid du Colombier 		iCharLen = 3;
177*25b329d5SDavid du Colombier 		ulUcs &= 0x0f;
178*25b329d5SDavid du Colombier 	} else if (ulUcs < 0xf8){
179*25b329d5SDavid du Colombier 		iCharLen = 4;
180*25b329d5SDavid du Colombier 		ulUcs &= 0x07;
181*25b329d5SDavid du Colombier 	} else if (ulUcs < 0xfc){
182*25b329d5SDavid du Colombier 		iCharLen = 5;
183*25b329d5SDavid du Colombier 		ulUcs &= 0x03;
184f5736e95SDavid du Colombier 	} else {
185*25b329d5SDavid du Colombier 		iCharLen = 6;
186*25b329d5SDavid du Colombier 		ulUcs &= 0x01;
187f5736e95SDavid du Colombier 	}
188*25b329d5SDavid du Colombier 	for (iIndex = 1; iIndex < iCharLen; iIndex++) {
189*25b329d5SDavid du Colombier 		ulUcs <<= 6;
190*25b329d5SDavid du Colombier 		if (iIndex < iStrLen) {
191*25b329d5SDavid du Colombier 			ulUcs |= (ULONG)(UCHAR)p[iIndex] & 0x3f;
192f5736e95SDavid du Colombier 		}
193*25b329d5SDavid du Colombier 	}
194*25b329d5SDavid du Colombier 	*piUtfLen = iCharLen;
195*25b329d5SDavid du Colombier 	return ulUcs;
196f5736e95SDavid du Colombier } /* end of utf8_to_ucs */
197f5736e95SDavid du Colombier 
198f5736e95SDavid du Colombier /*
199f5736e95SDavid du Colombier  * utf8_strwidth - compute the string width of an UTF-8 string
200f5736e95SDavid du Colombier  *
201f5736e95SDavid du Colombier  * Returns the string width in columns
202f5736e95SDavid du Colombier  */
203f5736e95SDavid du Colombier long
utf8_strwidth(const char * pcString,size_t tNumchars)204*25b329d5SDavid du Colombier utf8_strwidth(const char *pcString, size_t tNumchars)
205f5736e95SDavid du Colombier {
206*25b329d5SDavid du Colombier 	ULONG	ulUcs;
207*25b329d5SDavid du Colombier 	long	lTotal;
208*25b329d5SDavid du Colombier 	int	iToGo, iWidth, iUtflen;
209f5736e95SDavid du Colombier 
210*25b329d5SDavid du Colombier 	fail(pcString == NULL || tNumchars > (size_t)INT_MAX);
211f5736e95SDavid du Colombier 
212*25b329d5SDavid du Colombier 	lTotal = 0;
213*25b329d5SDavid du Colombier 	iToGo = (int)tNumchars;
214f5736e95SDavid du Colombier 
215*25b329d5SDavid du Colombier 	while (iToGo > 0 && *pcString != '\0') {
216*25b329d5SDavid du Colombier 		ulUcs = utf8_to_ucs(pcString, iToGo, &iUtflen);
217*25b329d5SDavid du Colombier 		iWidth = iWcWidth(ulUcs);
218*25b329d5SDavid du Colombier 		if (iWidth > 0) {
219*25b329d5SDavid du Colombier 			lTotal += iWidth;
220f5736e95SDavid du Colombier 		}
221*25b329d5SDavid du Colombier 		pcString += iUtflen;
222*25b329d5SDavid du Colombier 		iToGo -= iUtflen;
223f5736e95SDavid du Colombier 	}
224*25b329d5SDavid du Colombier 	NO_DBG_DEC(lTotal);
225*25b329d5SDavid du Colombier 	return lTotal;
226f5736e95SDavid du Colombier } /* end of utf8_strwidth */
227f5736e95SDavid du Colombier 
228f5736e95SDavid du Colombier /*
229f5736e95SDavid du Colombier  * utf8_chrlength - get the number of bytes in an UTF-8 character
230f5736e95SDavid du Colombier  *
231f5736e95SDavid du Colombier  * Returns the number of bytes
232f5736e95SDavid du Colombier  */
233f5736e95SDavid du Colombier int
utf8_chrlength(const char * p)234f5736e95SDavid du Colombier utf8_chrlength(const char *p)
235f5736e95SDavid du Colombier {
236*25b329d5SDavid du Colombier 	int	iUtflen;
237f5736e95SDavid du Colombier 
238f5736e95SDavid du Colombier 	fail(p == NULL);
239f5736e95SDavid du Colombier 
240*25b329d5SDavid du Colombier 	iUtflen = -1;		/* Just to make sure */
241*25b329d5SDavid du Colombier 	(void)utf8_to_ucs(p, INT_MAX, &iUtflen);
242*25b329d5SDavid du Colombier 	NO_DBG_DEC(iUtflen);
243*25b329d5SDavid du Colombier 	return iUtflen;
244f5736e95SDavid du Colombier } /* end of utf8_chrlength */
245f5736e95SDavid du Colombier 
246f5736e95SDavid du Colombier /*
247*25b329d5SDavid du Colombier  * is_locale_utf8 - return TRUE if the locale is UTF-8
248f5736e95SDavid du Colombier  */
249f5736e95SDavid du Colombier BOOL
is_locale_utf8(void)250f5736e95SDavid du Colombier is_locale_utf8(void)
251f5736e95SDavid du Colombier {
252*25b329d5SDavid du Colombier 	char	szCodeset[20];
253f5736e95SDavid du Colombier 
254*25b329d5SDavid du Colombier 	szCodeset[0] = '\0';
255*25b329d5SDavid du Colombier 	if (!bGetNormalizedCodeset(szCodeset, sizeof(szCodeset), NULL)) {
256f5736e95SDavid du Colombier 		return FALSE;
257f5736e95SDavid du Colombier 	}
258*25b329d5SDavid du Colombier 	DBG_MSG(szCodeset);
259*25b329d5SDavid du Colombier 	return STREQ(szCodeset, "utf8");
260f5736e95SDavid du Colombier } /* end of is_locale_utf8 */
261