Символы UTF-8 в preg_match_all (PHP)

Я имею preg_match_all('/[aäeëioöuáéíóú]/u', $in, $out, PREG_OFFSET_CAPTURE);

Если $in = 'hëllo' $out :

array(1) {
[0]=>
  array(2) {
  [0]=>
    array(2) {
      [0]=>
      string(2) "ë"
  [1]=>
  int(1)
}
[1]=>
array(2) {
  [0]=>
  string(1) "o"
  [1]=>
  int(5)
  }
}
}

Положение o должен быть 4. Я читал об этой проблеме онлайн ( ë считается как 2). Существует ли решение для этого? Я видел mb_substr и подобный, но там что-то вроде этого для preg_match_all?

Отчасти связанный: их эквивалент preg_match_all в Python? (Возврат массива соответствий с их положением в строке)

9
задан roflwaffle 2 February 2010 в 21:22
поделиться

2 ответа

PHP не очень хорошо поддерживает Unicode, поэтому множество строковых функций, включая PREG_ *, все еще подсчитывать байты вместо символов.

Я попробовал найти решение, кодируя и декодирующие строки, но в конечном итоге все пришли к функции preg_match_all.

О том, что Python Thinge: Python Regex MatchObject содержит позицию совпадения по умолчанию mo.cstart () и mo.end (). См.: http://docs.cython.org/library/re.html#finding-all-adverbs-and-their-positions

0
ответ дан 4 December 2019 в 21:49
поделиться

Это не ошибка, PREG_OFFSET_CAPTURE относится к байтовому смещению символа в строке.

mb_ereg_search_pos ведет себя так же. Одна из возможностей - изменить кодировку на UTF-32, а затем разделить позицию на 4 (потому что все кодовые единицы юникода представлены как 4-байтовые последовательности в UTF-32):

mb_regex_encoding("UTF-32");
$string = mb_convert_encoding('hëllo', "UTF-32", "UTF-8");
$regex =  mb_convert_encoding('[aäeëioöuáéíóú]', "UTF-32", "UTF-8");
mb_ereg_search_init ($string, $regex);
$positions = array();
while ($r = mb_ereg_search_pos()) {
    $positions[] = reset($r)/4;
}
print_r($positions);

дает:

Array
(
    [0] => 1
    [1] => 4
)

Можно также преобразовать двоичные позиции в позиции кодовых единиц. Для UTF-8 неоптимальная реализация выглядит так:

function utf8_byte_offset_to_unit($string, $boff) {
    $result = 0;
    for ($i = 0; $i < $boff; ) {
        $result++;
        $byte = $string[$i];
        $base2 = str_pad(
            base_convert((string) ord($byte), 10, 2), 8, "0", STR_PAD_LEFT);
        $p = strpos($base2, "0");
        if ($p == 0) { $i++; }
        elseif ($p <= 4) { $i += $p; }
        else  { return FALSE; }
    }
    return $result;
}
6
ответ дан 4 December 2019 в 21:49
поделиться
Другие вопросы по тегам:

Похожие вопросы: