Как проверить кодировку строки?

Если вы не хотите использовать конкатенацию строк (, предложенную Sotirios ), вы можете использовать предварительную обработку выражения в ссылке URL :

13
задан ZA. 9 October 2009 в 09:49
поделиться

5 ответов

function is_utf8($string) {   
return preg_match('%^(?:  
[\x09\x0A\x0D\x20-\x7E] # ASCII  
| [\xC2-\xDF][\x80-\xBF] # non-overlong 2-byte  
| \xE0[\xA0-\xBF][\x80-\xBF] # excluding overlongs  
| [\xE1-\xEC\xEE\xEF][\x80-\xBF]{2} # straight 3-byte  
| \xED[\x80-\x9F][\x80-\xBF] # excluding surrogates  
| \xF0[\x90-\xBF][\x80-\xBF]{2} # planes 1-3  
| [\xF1-\xF3][\x80-\xBF]{3} # planes 4-15  
| \xF4[\x80-\x8F][\x80-\xBF]{2} # plane 16  
)*$%xs', $string);   

}

Я проверил. Эта функция эффективна.

7
ответ дан 1 December 2019 в 17:20
поделиться

Не изобретайте велосипед. Для этой задачи есть встроенная функция: mb_check_encoding () .

mb_check_encoding($string, 'UTF-8');
33
ответ дан 1 December 2019 в 17:20
поделиться

, если он отправлен вам с сервера

echo $_SERVER['HTTP_ACCEPT_CHARSET'];
0
ответ дан 1 December 2019 в 17:20
поделиться

Небольшое примечание:

Вы не можете определить, является ли данный строка закодирована в UTF-8. Вы можете только определить, является ли данная строка окончательно не закодированной в UTF-8. См. Соответствующий вопрос здесь :

Вы не можете определить, является ли данная строка (или байтовая последовательность) - это кодировка UTF-8 текст, например, каждый серия октетов UTF-8 также является допустимой (если бессмысленно) серия Latin-1 (или некоторая другая кодировка) октеты. тем не мение не каждая серия действительных Latin-1 октеты являются допустимыми сериями UTF-8.

15
ответ дан 1 December 2019 в 17:20
поделиться

А еще лучше использовать оба вышеуказанных решения.

function isUtf8($string) {
    if (function_exists("mb_check_encoding") && is_callable("mb_check_encoding")) {
        return mb_check_encoding($string, 'UTF8');
    }

    return preg_match('%^(?:
          [\x09\x0A\x0D\x20-\x7E]            # ASCII
        | [\xC2-\xDF][\x80-\xBF]             # non-overlong 2-byte
        |  \xE0[\xA0-\xBF][\x80-\xBF]        # excluding overlongs
        | [\xE1-\xEC\xEE\xEF][\x80-\xBF]{2}  # straight 3-byte
        |  \xED[\x80-\x9F][\x80-\xBF]        # excluding surrogates
        |  \xF0[\x90-\xBF][\x80-\xBF]{2}     # planes 1-3
        | [\xF1-\xF3][\x80-\xBF]{3}          # planes 4-15
        |  \xF4[\x80-\x8F][\x80-\xBF]{2}     # plane 16
    )*$%xs', $string);

} 
6
ответ дан 1 December 2019 в 17:20
поделиться
Другие вопросы по тегам:

Похожие вопросы: