테스트 사이트 - 개발 중인 베타 버전입니다

UTF-8 한글 TEST

$str = "한글 abc 123 사랑합니다.";

$str = preg_replace("#\r|\n#", " ", trim($str));
$len = strlen($str);

$i = 0;
$k = 0;
while ($i < $len) {
    if (preg_match('/^[\x20]/xs', $str)) {
        echo $str[0];
        $n = 1;
    }
    else if (preg_match('/^[\x30-\x39\x41-\x5a\x61-\x7a]/xs', $str)) {
        echo $str[0];
        $n = 1;
    }
    else if (preg_match('/^[\xc0-\\xdf][\x80-\xbf]/xs', $str)) {
        echo $str[0].$str[1];
        $n = 2;
    }
    else if (preg_match('/^[\xe0-\\xef][\x80-\xbf]{2}/xs', $str)) {
        echo $str[0].$str[1].$str[2];
        $n = 3;
    }
    else if (preg_match('/^[\xf0-\\xf7][\x80-\xbf]{3}/xs', $str)) {
        echo $str[0].$str[1].$str[2].$str[3];
        $n = 4;
    }
    else {
        $n = 1;
    }

    $str = substr($str, $n);
    $i += $n;

    //echo $i; echo "<br>";

    if ($k++ > 10000) break;
}

[이 게시물은 관리자님에 의해 2011-10-31 17:16:08 PHP & HTML에서 이동 됨]

댓글 작성

댓글을 작성하시려면 로그인이 필요합니다.

로그인하기

댓글 1개

http://kr.php.net/manual/en/function.utf8-encode.php

bytes bits representation
1 7 0bbbbbbb
2 11 110bbbbb 10bbbbbb
3 16 1110bbbb 10bbbbbb 10bbbbbb
4 21 11110bbb 10bbbbbb 10bbbbbb 10bbbbbb

예를 들어 3바이트(한글 포함) UTF-8 의 경우

E0-EF 에 포함되고 뒤 이은 2바이트가 80-BF 에 포함되면 UTF-8 한글임

게시글 목록

번호 제목
8265
20403
20402
20401
20400
8259
20399
20398
8255
8249
8246
8242
20396
8240
20395
20394
31033
28385
20393
28380
20392
28377
20391
20390
20389
20388
20387
20386
20385
20384
20383
20382
8238
20380
20379
28376
28372
20378
20377
8235
20375
20374
20373
20372
20371
20370
28370
20369
28366
20368
20367
20366
20365
20364
20363
20362
20361
20360
20359
8231
20358
20357
20356
20355
20354
20353
20352
20351
20350
20349
20348
20347
20346
20345
20344
20343
20342
20341
20340
20339
20338
20337
20336
20335
20334
20333
20332
20331
20330
20329
20328
20327
20326
20325
20324
20323
20322
20321
20320
20319