Здесь нужны простые регулярные выражения

https://stackoverflow.com/questions/1005581

05-07-2019
|

Вопрос

Я наконец разбираю вики-текст Википедии.У меня есть следующий тип текста:

{{Airport-list|the Solomon Islands}}

* '''AGAF''' (AFT) &ndash; [[Afutara Airport]] &ndash; [[Afutara]]
* '''AGAR''' (RNA) &ndash; [[Ulawa Airport]] &ndash; [[Arona]], [[Ulawa Island]]
* '''AGAT''' (ATD) &ndash; [[Uru Harbour]] &ndash; [[Atoifi]], [[Malaita]]
* '''AGBA''' &ndash; [[Barakoma Airport]] &ndash; [[Barakoma]]

Мне нужно получить все строки в одном массиве, которые начинаются с шаблона

* '''

Я думаю, что здесь можно было бы вызвать регулярное выражение, но я действительно запутался в своей части регулярных выражений.

Плюс в другом примере у меня есть следующий текст:

{{otheruses}}
{{Infobox Settlement
|official_name          = Doha
|native_name        = {{rtl-lang|ar|الدوحة}} ''ad-Dawḥa''
|image_skyline          = Doha Sheraton.jpg
|imagesize              = 
|image_caption          = West Bay at night
|image_map              = QA-01.svg
|mapsize                = 100px
|map_caption            = Location of the municipality of Doha within [[Qatar]].
|pushpin_map            =
|pushpin_label_position = 
|pushpin_mapsize        = 
|subdivision_type       = [[Countries of the world|Country]]
|subdivision_name       = [[Qatar]]
|subdivision_type1      = [[Municipalities of Qatar|Municipality]]
|subdivision_name1      = [[Ad Dawhah]]
|established_title      = Established
|established_date       = 1850
|area_total_km2         = 132
|area_total_sq_mi       = 51
|area_land_km2          = 
|area_land_sq_mi        = 
|area_water_km2         = 
|area_water_sq_mi       = 
|area_water_percent     = 
|area_urban_km2         = 
|area_urban_sq_mi       =
|area_metro_km2         = 
|area_metro_sq_mi       = 
|population_as_of       = 2004
|population_note        = 
|population_footnotes = <ref name=poptotal>[http://www.planning.gov.qa/Qatar-Census-2004/Flash/introduction.html Qatar 2004 Census]</ref>
|population_total       = 339847
|population_metro       = 998651
|population_density_km2 = 2574
|population_density_sq_mi = 6690
|latd=25 |latm=17 | lats=12 |latNS=N 
|longd=51|longm=32 | longs=0| longEW=E 
|coordinates_display    = inline,title
|coordinates_type       = type:city_region:QA
|timezone               = [[Arab Standard Time|AST]]
|utc_offset             = +3
|website                = 
|footnotes              = 
}} <!-- Infobox ends -->
'''Doha''' ({{lang-ar|الدوحة}}, ''{{transl|ar|ad-Dawḥa}}'' or ''{{unicode|ad-Dōḥa}}'') is the [[capital city]] of [[Qatar]].  It has a population of 400,051 according to the 2005 census,<ref name="autogenerated1">[http://www.hotelrentalgroup.com/Qatar/Sheraton%20Doha%20Hotel%20&%20Resort.htm Sheraton Doha Hotel & Resort | Hotel discount bookings in Qatar<!-- Bot generated title -->]</ref> and is located in the [[Ad Dawhah]] municipality on the [[Persian Gulf]].  Doha is Qatar's largest city, with over 80% of the nation's population residing in Doha or its surrounding [[suburbs]], and is also the economic center of the country. 
It is also the seat of government of Qatar, which is ruled by [[Sheikh Hamad bin Khalifa Al Thani]]–the current ruling Emir of Qatar.

Мне нужно извлечь информационное окно здесь.Информационное поле включает в себя весь текст между первым появлением

{{Infobox Settlement

и заканчивается первым появлением

}} <!-- Infobox ends -->

Я совершенно растерялся, когда дело доходит до регулярных выражений, и мне здесь не помешала бы помощь.Я использую PHP.

РЕДАКТИРОВАТЬ!ПОМОЩЬ!

Я боролся уже 40 часов и не могу заставить это дурацкое регулярное выражение работать правильно :( пока у меня есть только это:

{{Информационный блок[^\b( | )}}( | )\b]*[\b( | )}}( | )( | )\b]

Но это не работает, я хочу, чтобы он прочитал все строковые данные между {{информационным полем и заканчивался }}

Я использую Php и не могу заставить это работать :( Он просто возвращает первое вхождение }}, игнорируя тот факт, что я хочу получить }} с предыдущим переводом строки.Помогите, пожалуйста, прежде чем я потрачу на это еще больше здравого смысла :'(

Решение

Мне нужно извлечь инфобокс...

Попробуйте это, на этот раз убедившись, что режим dotall включен. включено:

\{\{Infobox.*?(?=\}\} <!-- Infobox ends -->)

И снова объяснение этому:

(?xs)    # x=comment mode, s=dotall mode
\{\{     # two opening braces (special char, so needs escaping here.)
Infobox  # literal text
.*?      # any char (including newlines), non-greedily match zero or more times.
(?=      # begin positive lookahead
\}\}     # two closing braces
<!-- Infobox ends --> # literal text
)        # end positive lookahead

Это будет соответствовать (но исключая) конечное выражение - вы можете удалить сам просмотр вперед и включить только содержимое, чтобы оно включало окончание, если это необходимо.

Обновление на основе комментария для ответа:

\{\{Infobox.*?(?=\n\}\}\n)

То же, что и выше, но просмотр вперед ищет две скобки на отдельной строке.

Чтобы дополнительно разрешить комментарий, используйте:

\{\{Infobox.*?(?=\n\}\}(?: <!-- Infobox ends-->)?\n)

Другие советы

МедиаВики имеет открытый исходный код.Взгляните на их исходный код ... ;-)

Я думаю, что лучший способ — объединить все строки в одну, особенно для информационного окна.

Потом что-то вроде

$reg = " (\* '''[^ ]*)";

для первой части (все, что после новой строки начинается с * ''' и не является новой строкой).

Что касается второй части, я сейчас не совсем уверен, но это хорошее место, чтобы немного поиграть:http://www.solmetra.com/scripts/regex/index.php

Вот краткий справочник по синтаксису регулярных выражений:http://www.regular-expressions.info/reference.html

Мне нужно получить все строки в одном массиве, которые начинаются с шаблона * '''

Включите многострочный режим и убедитесь, что режим dotall неполноценный, и используйте это:

^\* '''.*$

Это выражение в разобранном виде:

(?xm-s) # Flags:
        # x enables comment mode (spaces ignore, hashes start comments)
        # m enables multiline mode (^$ match lines)
        # -s disables dotall (. matches newline)
^       # start of line
\*      # literal asterisk
[ ]     # literal space (needs braces in comment mode, but not otherwise)
'''     # three literal apostrophes
.*      # any character (excluding newline), greedily matched zero or many times.
$       # end of line

Лицензировано под: CC-BY-SA с атрибуция

Не связан с StackOverflow