为什么我不能使用重音符号的下一个字的边界？

https://stackoverflow.com/questions/2449779

20-09-2019
|

题

我在尝试做一个动态regex相匹配的个人的姓名。它的工作没有问题上的大多数名称，直到我遇到了重音符末的名称。

例如：一些奇特的Namé

Regex我迄今使用的是：

/\b(Fancy Namé|Namé)\b/i

使用这样的：

"Goal: Some Fancy Namé. Awesome.".replace(/\b(Fancy Namé|Namé)\b/i, '<a href="#">$1</a>');

这根本不会相匹配。如果我代替é与一个电子，这比赛只是罚款。如果我试着匹配的名称，如"一些花哨的Naméa"，它工作得很好。如果我删除该字的最后一个字的边界锚，它工作得很好。

为什么不这个词边界标志在这里工作？任何建议，我怎么会得到围绕这个问题？

我已经考虑采用这样的事情，但我不知道该怎么表现的惩罚将是，如：

"Some fancy namé. Allow me to ellaborate.".replace(/([\s.,!?])(fancy namé|namé)([\s.,!?]|$)/g, '$1<a href="#">$2</a>$3')

建议？想法？

解决方案

JavaScript的正则表达式实现不支持Unicode的。它仅知道在标准的低字节ASCII的“单词字符”，其不包括é或任何其他音符或非英文字母。

由于é不是字字符JS，é后跟一个空格不能被认为是一个字边界。（如果在一个字的中间使用时，像\b它将匹配Namés。）

/([\s.,!?])(fancy namé|namé)([\s.,!?]|$)/

对，那将是JS通常的解决方法（虽然可能有更多的标点字符）。对于其他语言你一般使用前瞻/回顾后，以避免匹配前置和后置边界的人物，但这些不良支持JS /车所以最好避免。

其他提示

罗布是正确的。从ECMAScript的第三版引述：

15.10.2.6断言：

在生产断言 \b由...评估

<强> 2 拨打 IsWordChar（E-1）和让一是布尔值结果，点击   第3 拨打 IsWordChar（e）中和让 B'/ em>的是布尔值结果

和

在内部辅助函数的 IsWordChar ...执行以下操作：

第3 如果 C 的是在表中的63个字符中的一个的下方，返回的真

a b c d e f g h i j k l m n o p q r s t u v w x y z A B C D E F G H I J K L M N O P Q R S T U V W X Y Z 0 1 2 3 4 5 6 7 8 9 _

由于é不是这些63个字符中的一个，和é之间a的位置将被认为是一个字边界。

如果您知道类的人物，您可以使用负前瞻断言，e.g。

/(^|[^\wÀ-ÖØ-öø-ſ])(Fancy Namé|Namé)(?![\wÀ-ÖØ-öø-ſ])/

知道你的界限

不幸的是，即使当Javascript应该哪天来到已经充分和适当的支持Unicode，你会仍然必须精心小心用词的界限。这很容易误解了什么 \b 真的不会。

这里是Perl代码的解释什么 \b 是真的这样做，这是真正的无论是模式发动机已经被国行升级尚未：

# if next is word char: # then last isn't word # else last isn't nonword $word_boundary_before = qr{ (?(?= \w ) (?<! \w ) | (?<! \W ) ) }x; # if last is word: # then next isn't word # else next isn't nonword $word_boundary_after = qr{ (?(?<= \w ) (?! \w ) | (?! \W ) ) }x;

第一就像是一个 \b 东西之前，第二个是一样 \b 之后。该构造中使用的是regex"如果-那=别"有条件的，这一般形式 (?(COND)THEN|ELSE).我在这里使用冷的测试的一个预期在第一种情况下，但预期在第二个。的然后和别条款在这两种情况都是否定lookarounds，以便他们采取的边缘串入帐户。

我的解释更多的关于处理边界以及Unicode的经常表达式在这里，.

Unicode的财产的支持

的目前的事态Javascript的治疗Unicode 似乎是这样Java,Javascript的定义 \w 和这些都是仍然 残废的通过被卡早在1960年代 世界ASCII。这只是一个悲惨的情况下，我承认。甚至蟒蛇，这是非常保守，因为这些事情(例如，它甚至不支持递归regex), 做允许其定义 \w 和 \s 工作Unicode正确。这是最起码水平的功能，真的。

它既是更好和更糟糕的是在Javasscript.这是bcecause你可以使用的一些最基本的Unicode properties在Javascript(或Java)。它看起来像你应该能够使用的一个和两个字"的一般类别"Unicode的性质。这意味着你应该能够使用的简称版本从第一栏如下：

Short Name Long Name ¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯ \pL \p{Letter} \p{Lu} \p{Uppercase_Letter} \p{Ll} \p{Lowercase_Letter} \p{Lt} \p{Titlecase_Letter} \p{Lm} \p{Modifier_Letter} \p{Lo} \p{Other_Letter} Short Name Long Name ¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯ \pM \p{Mark} \p{Mn} \p{Nonspacing_Mark} \p{Mc} \p{Spacing_Mark} \p{Me} \p{Enclosing_Mark} Short Name Long Name ¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯ \pN \p{Number} \p{Nd} \p{Decimal_Number},\p{Digit} \p{Nl} \p{Letter_Number} \p{No} \p{Other_Number} Short Name Long Name ¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯ \pP \p{Punctuation}, \p{Punct}) \p{Pc} \p{Connector_Punctuation} \p{Pd} \p{Dash_Punctuation} \p{Ps} \p{Open_Punctuation} \p{Pe} \p{Close_Punctuation} \p{Pi} \p{Initial_Punctuation} \p{Pf} \p{Final_Punctuation} \p{Po} \p{Other_Punctuation} Short Name Long Name ¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯ \pS \p{Symbol} \p{Sm} \p{Math_Symbol} \p{Sc} \p{Currency_Symbol} \p{Sk} \p{Modifier_Symbol} \p{So} \p{Other_Symbol} Short Name Long Name ¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯ \pZ \p{Separator} \p{Zs} \p{Space_Separator} \p{Zl} \p{Line_Separator} \p{Zp} \p{Paragraph_Separator} Short Name Long Name ¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯ \pC \p{Other} \p{Cc} \p{Control}, \p{Cntrl} \p{Cf} \p{Format} \p{Cs} \p{Surrogate} \p{Co} \p{Private_Use} \p{Cn} \p{Unassigned}

你必须使用短名称，只有在爪哇和Javascript，但Perl可以让你用的很长的名字，这有助于legibilityl的5.12释放Perl支持约3,000Unicode的性质。蟒蛇仍然没有任何Unicode财产的支持值得一提的是，红宝石是刚刚开始得到它的1.9释放。PCRE有一些有限的支持，主要是喜欢Java1.7。

Java6支持Unicode块的性质，喜欢 \p{InGeneralPunctuation} 或 \p{Block=GeneralPunctuation}, 和Java7支持Unicode脚本性质，喜欢 \p{IsHiragana} 或 \p{Script=Hiragana}.

然而，它仍然不能支持任何东西甚至靠近全套Unicode properties, 包括近关键的喜欢 \p⁠{WhiteSpace}, \p{Dash}, ， \p{Quotation_Mark}, 让单独的其他两个伙伴喜欢 \p⁠{Line_Break=Alphabetic}, \p⁠{East_Asian_Width:Narrow}, \p⁠{Numeric_Value=1000}, 或 \p⁠⁠{Age:5.2}.

前者设定是非常不可或缺的 尤其是 由于缺乏支持 \s 工作的权利和对后者的设定是非常有用的时候。

别的东西爪哇和Javascript尚不支持用户限定的性角色.我使用这些相当多的。这样你可以定义的东西喜欢 \p⁠{English::Vowel} 或 \p⁠{English::Consonant}, ，这是很方便。

如果你有兴趣在Unicode properties为regex工作，使用条款可能想要抓住的 unitrio 套程序： uniprops, unichars, ， uninames.这里的一个演示的每个有三个：

$ uninames face ፦ 4966 1366 ETHIOPIC PREFACE COLON ⁙ 8281 2059 FIVE DOT PUNCTUATION = Greek pentonkion = quincunx x (die face-5 - 2684) ∯ 8751 222F SURFACE INTEGRAL # 222E 222E ☹ 9785 2639 WHITE FROWNING FACE ☺ 9786 263A WHITE SMILING FACE = have a nice day! ☻ 9787 263B BLACK SMILING FACE ⚀ 9856 2680 DIE FACE-1 ⚁ 9857 2681 DIE FACE-2 ⚂ 9858 2682 DIE FACE-3 ⚃ 9859 2683 DIE FACE-4 ⚄ 9860 2684 DIE FACE-5 ⚅ 9861 2685 DIE FACE-6 ⾯ 12207 2FAF KANGXI RADICAL FACE # 9762 〠 12320 3020 POSTAL MARK FACE 龜 64206 FACE CJK COMPATIBILITY IDEOGRAPH-FACE : 9F9C

FMTEYEWTK约Unicode properties:

$ uniprops -va LF 85 Greek:Sigma INFINITY BOM U+3000 U+12345 U+000A ‹U+000A› \N{ LINE FEED (LF) }: \s \v \R \pC \p{Cc} \p{All} \p{Any} \p{ASCII} \p{Assigned} \p{C} \p{Other} \p{Cc} \p{Cntrl} \p{Common} \p{Zyyy} \p{Control} \p{Pat_WS} \p{Pattern_White_Space} \p{PatWS} \p{PerlSpace} \p{PosixCntrl} \p{PosixSpace} \p{Space} \p{SpacePerl} \p{VertSpace} \p{White_Space} \p{WSpace} \p{Age:1.1} \p{Block=Basic_Latin} \p{Bidi_Class:B} \p{Bidi_Class=Paragraph_Separator} \p{Bidi_Class:Paragraph_Separator} \p{Bc=B} \p{Block:ASCII} \p{Block:Basic_Latin} \p{Blk=ASCII} \p{Canonical_Combining_Class:0} \p{Canonical_Combining_Class=Not_Reordered} \p{Canonical_Combining_Class:Not_Reordered} \p{Ccc=NR} \p{Canonical_Combining_Class:NR} \p{Script=Common} \p{Decomposition_Type:None} \p{Dt=None} \p{East_Asian_Width=Neutral} \p{East_Asian_Width:Neutral} \p{Grapheme_Cluster_Break:LF} \p{GCB=LF} \p{Hangul_Syllable_Type:NA} \p{Hangul_Syllable_Type=Not_Applicable} \p{Hangul_Syllable_Type:Not_Applicable} \p{Hst=NA} \p{Joining_Group:No_Joining_Group} \p{Jg=NoJoiningGroup} \p{Joining_Type:Non_Joining} \p{Jt=U} \p{Joining_Type:U} \p{Joining_Type=Non_Joining} \p{Line_Break:LF} \p{Line_Break=Line_Feed} \p{Line_Break:Line_Feed} \p{Lb=LF} \p{Numeric_Type:None} \p{Nt=None} \p{Numeric_Value:NaN} \p{Nv=NaN} \p{Present_In:1.1} \p{Age=1.1} \p{In=1.1} \p{Present_In:2.0} \p{In=2.0} \p{Present_In:2.1} \p{In=2.1} \p{Present_In:3.0} \p{In=3.0} \p{Present_In:3.1} \p{In=3.1} \p{Present_In:3.2} \p{In=3.2} \p{Present_In:4.0} \p{In=4.0} \p{Present_In:4.1} \p{In=4.1} \p{Present_In:5.0} \p{In=5.0} \p{Present_In:5.1} \p{In=5.1} \p{Present_In:5.2} \p{In=5.2} \p{Script:Common} \p{Sc=Zyyy} \p{Script:Zyyy} \p{Sentence_Break:LF} \p{SB=LF} \p{Word_Break:LF} \p{WB=LF} U+0085 ‹U+0085› \N{ NEXT LINE (NEL) }: \s \v \R \pC \p{Cc} \p{All} \p{Any} \p{Assigned} \p{InLatin1} \p{C} \p{Other} \p{Cc} \p{Cntrl} \p{Common} \p{Zyyy} \p{Control} \p{Pat_WS} \p{Pattern_White_Space} \p{PatWS} \p{Space} \p{SpacePerl} \p{VertSpace} \p{White_Space} \p{WSpace} \p{Age:1.1} \p{Bidi_Class:B} \p{Bidi_Class=Paragraph_Separator} \p{Bidi_Class:Paragraph_Separator} \p{Bc=B} \p{Block:Latin_1} \p{Block=Latin_1_Supplement} \p{Block:Latin_1_Supplement} \p{Blk=Latin1} \p{Canonical_Combining_Class:0} \p{Canonical_Combining_Class=Not_Reordered} \p{Canonical_Combining_Class:Not_Reordered} \p{Ccc=NR} \p{Canonical_Combining_Class:NR} \p{Script=Common} \p{Decomposition_Type:None} \p{Dt=None} \p{East_Asian_Width=Neutral} \p{East_Asian_Width:Neutral} \p{Grapheme_Cluster_Break:CN} \p{Grapheme_Cluster_Break=Control} \p{Grapheme_Cluster_Break:Control} \p{GCB=CN} \p{Hangul_Syllable_Type:NA} \p{Hangul_Syllable_Type=Not_Applicable} \p{Hangul_Syllable_Type:Not_Applicable} \p{Hst=NA} \p{Joining_Group:No_Joining_Group} \p{Jg=NoJoiningGroup} \p{Joining_Type:Non_Joining} \p{Jt=U} \p{Joining_Type:U} \p{Joining_Type=Non_Joining} \p{Line_Break:Next_Line} \p{Lb=NL} \p{Line_Break:NL} \p{Line_Break=Next_Line} \p{Numeric_Type:None} \p{Nt=None} \p{Numeric_Value:NaN} \p{Nv=NaN} \p{Present_In:1.1} \p{Age=1.1} \p{In=1.1} \p{Present_In:2.0} \p{In=2.0} \p{Present_In:2.1} \p{In=2.1} \p{Present_In:3.0} \p{In=3.0} \p{Present_In:3.1} \p{In=3.1} \p{Present_In:3.2} \p{In=3.2} \p{Present_In:4.0} \p{In=4.0} \p{Present_In:4.1} \p{In=4.1} \p{Present_In:5.0} \p{In=5.0} \p{Present_In:5.1} \p{In=5.1} \p{Present_In:5.2} \p{In=5.2} \p{Script:Common} \p{Sc=Zyyy} \p{Script:Zyyy} \p{Sentence_Break:SE} \p{Sentence_Break=Sep} \p{Sentence_Break:Sep} \p{SB=SE} \p{Word_Break:Newline} \p{WB=NL} \p{Word_Break:NL} \p{Word_Break=Newline} U+03A3 ‹Σ› \N{ GREEK CAPITAL LETTER SIGMA }: \w \pL} \p{LC} \p{L_} \p{L&} \p{Lu} \p{All} \p{Any} \p{Alnum} \p{Alpha} \p{Alphabetic} \p{Assigned} \p{Greek} \p{Is_Greek} \p{InGreek} \p{Cased} \p{Cased_Letter} \p{LC} \p{Changes_When_Casefolded} \p{CWCF} \p{Changes_When_Casemapped} \p{CWCM} \p{Changes_When_Lowercased} \p{CWL} \p{Changes_When_NFKC_Casefolded} \p{CWKCF} \p{Lu} \p{L} \p{Gr_Base} \p{Grapheme_Base} \p{Graph} \p{GrBase} \p{Grek} \p{Greek_And_Coptic} \p{ID_Continue} \p{IDC} \p{ID_Start} \p{IDS} \p{Letter} \p{L_} \p{Uppercase_Letter} \p{Print} \p{Upper} \p{Uppercase} \p{Word} \p{XID_Continue} \p{XIDC} \p{XID_Start} \p{XIDS} \p{Age:1.1} \p{Bidi_Class:L} \p{Bidi_Class=Left_To_Right} \p{Bidi_Class:Left_To_Right} \p{Bc=L} \p{Block:Greek} \p{Block=Greek_And_Coptic} \p{Block:Greek_And_Coptic} \p{Blk=Greek} \p{Canonical_Combining_Class:0} \p{Canonical_Combining_Class=Not_Reordered} \p{Canonical_Combining_Class:Not_Reordered} \p{Ccc=NR} \p{Canonical_Combining_Class:NR} \p{Decomposition_Type:None} \p{Dt=None} \p{East_Asian_Width:A} \p{East_Asian_Width=Ambiguous} \p{East_Asian_Width:Ambiguous} \p{Ea=A} \p{Grapheme_Cluster_Break:Other} \p{GCB=XX} \p{Grapheme_Cluster_Break:XX} \p{Grapheme_Cluster_Break=Other} \p{Script=Greek} \p{Hangul_Syllable_Type:NA} \p{Hangul_Syllable_Type=Not_Applicable} \p{Hangul_Syllable_Type:Not_Applicable} \p{Hst=NA} \p{Joining_Group:No_Joining_Group} \p{Jg=NoJoiningGroup} \p{Joining_Type:Non_Joining} \p{Jt=U} \p{Joining_Type:U} \p{Joining_Type=Non_Joining} \p{Line_Break:AL} \p{Line_Break=Alphabetic} \p{Line_Break:Alphabetic} \p{Lb=AL} \p{Numeric_Type:None} \p{Nt=None} \p{Numeric_Value:NaN} \p{Nv=NaN} \p{Present_In:1.1} \p{Age=1.1} \p{In=1.1} \p{Present_In:2.0} \p{In=2.0} \p{Present_In:2.1} \p{In=2.1} \p{Present_In:3.0} \p{In=3.0} \p{Present_In:3.1} \p{In=3.1} \p{Present_In:3.2} \p{In=3.2} \p{Present_In:4.0} \p{In=4.0} \p{Present_In:4.1} \p{In=4.1} \p{Present_In:5.0} \p{In=5.0} \p{Present_In:5.1} \p{In=5.1} \p{Present_In:5.2} \p{In=5.2} \p{Script:Greek} \p{Sc=Grek} \p{Script:Grek} \p{Sentence_Break:UP} \p{Sentence_Break=Upper} \p{Sentence_Break:Upper} \p{SB=UP} \p{Word_Break:ALetter} \p{WB=LE} \p{Word_Break:LE} \p{Word_Break=ALetter} U+221E ‹∞› \N{ INFINITY }: \pS \p{Sm} \p{All} \p{Any} \p{Assigned} \p{InMathematicalOperators} \p{Common} \p{Zyyy} \p{Sm} \p{S} \p{Gr_Base} \p{Grapheme_Base} \p{Graph} \p{GrBase} \p{Math} \p{Math_Symbol} \p{Pat_Syn} \p{Pattern_Syntax} \p{PatSyn} \p{Print} \p{Symbol} \p{Age:1.1} \p{Bidi_Class:ON} \p{Bidi_Class=Other_Neutral} \p{Bidi_Class:Other_Neutral} \p{Bc=ON} \p{Block:Mathematical_Operators} \p{Canonical_Combining_Class:0} \p{Canonical_Combining_Class=Not_Reordered} \p{Canonical_Combining_Class:Not_Reordered} \p{Ccc=NR} \p{Canonical_Combining_Class:NR} \p{Script=Common} \p{Decomposition_Type:None} \p{Dt=None} \p{East_Asian_Width:A} \p{East_Asian_Width=Ambiguous} \p{East_Asian_Width:Ambiguous} \p{Ea=A} \p{Grapheme_Cluster_Break:Other} \p{GCB=XX} \p{Grapheme_Cluster_Break:XX} \p{Grapheme_Cluster_Break=Other} \p{Hangul_Syllable_Type:NA} \p{Hangul_Syllable_Type=Not_Applicable} \p{Hangul_Syllable_Type:Not_Applicable} \p{Hst=NA} \p{Joining_Group:No_Joining_Group} \p{Jg=NoJoiningGroup} \p{Joining_Type:Non_Joining} \p{Jt=U} \p{Joining_Type:U} \p{Joining_Type=Non_Joining} \p{Line_Break:AI} \p{Line_Break=Ambiguous} \p{Line_Break:Ambiguous} \p{Lb=AI} \p{Numeric_Type:None} \p{Nt=None} \p{Numeric_Value:NaN} \p{Nv=NaN} \p{Present_In:1.1} \p{Age=1.1} \p{In=1.1} \p{Present_In:2.0} \p{In=2.0} \p{Present_In:2.1} \p{In=2.1} \p{Present_In:3.0} \p{In=3.0} \p{Present_In:3.1} \p{In=3.1} \p{Present_In:3.2} \p{In=3.2} \p{Present_In:4.0} \p{In=4.0} \p{Present_In:4.1} \p{In=4.1} \p{Present_In:5.0} \p{In=5.0} \p{Present_In:5.1} \p{In=5.1} \p{Present_In:5.2} \p{In=5.2} \p{Script:Common} \p{Sc=Zyyy} \p{Script:Zyyy} \p{Sentence_Break:Other} \p{SB=XX} \p{Sentence_Break:XX} \p{Sentence_Break=Other} \p{Word_Break:Other} \p{WB=XX} \p{Word_Break:XX} \p{Word_Break=Other} U+FEFF ‹U+FEFF› \N{ ZERO WIDTH NO-BREAK SPACE }: \pC \p{Cf} \p{All} \p{Any} \p{Assigned} \p{InArabicPresentationFormsB} \p{C} \p{Other} \p{Case_Ignorable} \p{CI} \p{Cf} \p{Format} \p{Changes_When_NFKC_Casefolded} \p{CWKCF} \p{Common} \p{Zyyy} \p{Default_Ignorable_Code_Point} \p{DI} \p{Graph} \p{Print} \p{Age:1.1} \p{Bidi_Class:BN} \p{Bidi_Class=Boundary_Neutral} \p{Bidi_Class:Boundary_Neutral} \p{Bc=BN} \p{Block:Arabic_Presentation_Forms_B} \p{Canonical_Combining_Class:0} \p{Canonical_Combining_Class=Not_Reordered} \p{Canonical_Combining_Class:Not_Reordered} \p{Ccc=NR} \p{Canonical_Combining_Class:NR} \p{Script=Common} \p{Decomposition_Type:None} \p{Dt=None} \p{East_Asian_Width=Neutral} \p{East_Asian_Width:Neutral} \p{Grapheme_Cluster_Break:CN} \p{Grapheme_Cluster_Break=Control} \p{Grapheme_Cluster_Break:Control} \p{GCB=CN} \p{Hangul_Syllable_Type:NA} \p{Hangul_Syllable_Type=Not_Applicable} \p{Hangul_Syllable_Type:Not_Applicable} \p{Hst=NA} \p{Joining_Group:No_Joining_Group} \p{Jg=NoJoiningGroup} \p{Joining_Type:T} \p{Joining_Type=Transparent} \p{Joining_Type:Transparent} \p{Jt=T} \p{Line_Break:WJ} \p{Line_Break=Word_Joiner} \p{Line_Break:Word_Joiner} \p{Lb=WJ} \p{Numeric_Type:None} \p{Nt=None} \p{Numeric_Value:NaN} \p{Nv=NaN} \p{Present_In:1.1} \p{Age=1.1} \p{In=1.1} \p{Present_In:2.0} \p{In=2.0} \p{Present_In:2.1} \p{In=2.1} \p{Present_In:3.0} \p{In=3.0} \p{Present_In:3.1} \p{In=3.1} \p{Present_In:3.2} \p{In=3.2} \p{Present_In:4.0} \p{In=4.0} \p{Present_In:4.1} \p{In=4.1} \p{Present_In:5.0} \p{In=5.0} \p{Present_In:5.1} \p{In=5.1} \p{Present_In:5.2} \p{In=5.2} \p{Script:Common} \p{Sc=Zyyy} \p{Script:Zyyy} \p{Sentence_Break:FO} \p{Sentence_Break=Format} \p{Sentence_Break:Format} \p{SB=FO} \p{Word_Break:FO} \p{Word_Break=Format} \p{Word_Break:Format} \p{WB=FO} U+3000 ‹U+3000› \N{ IDEOGRAPHIC SPACE }: \s \h \pZ \p{Zs} \p{All} \p{Any} \p{Assigned} \p{Blank} \p{InCJKSymbolsAndPunctuation} \p{Changes_When_NFKC_Casefolded} \p{CWKCF} \p{Common} \p{Zyyy} \p{Z} \p{Zs} \p{Gr_Base} \p{Grapheme_Base} \p{GrBase} \p{HorizSpace} \p{Print} \p{Separator} \p{Space} \p{Space_Separator} \p{SpacePerl} \p{White_Space} \p{WSpace} \p{Age:1.1} \p{Bidi_Class:White_Space} \p{Bc=WS} \p{Bidi_Class:WS} \p{Bidi_Class=White_Space} \p{Block:CJK_Symbols_And_Punctuation} \p{Canonical_Combining_Class:0} \p{Canonical_Combining_Class=Not_Reordered} \p{Canonical_Combining_Class:Not_Reordered} \p{Ccc=NR} \p{Canonical_Combining_Class:NR} \p{Script=Common} \p{Decomposition_Type:Non_Canon} \p{Decomposition_Type=Non_Canonical} \p{Decomposition_Type:Non_Canonical} \p{Dt=NonCanon} \p{Decomposition_Type:Wide} \p{Dt=Wide} \p{East_Asian_Width:F} \p{East_Asian_Width=Fullwidth} \p{East_Asian_Width:Fullwidth} \p{Ea=F} \p{Grapheme_Cluster_Break:Other} \p{GCB=XX} \p{Grapheme_Cluster_Break:XX} \p{Grapheme_Cluster_Break=Other} \p{Hangul_Syllable_Type:NA} \p{Hangul_Syllable_Type=Not_Applicable} \p{Hangul_Syllable_Type:Not_Applicable} \p{Hst=NA} \p{Joining_Group:No_Joining_Group} \p{Jg=NoJoiningGroup} \p{Joining_Type:Non_Joining} \p{Jt=U} \p{Joining_Type:U} \p{Joining_Type=Non_Joining} \p{Line_Break:ID} \p{Line_Break=Ideographic} \p{Line_Break:Ideographic} \p{Lb=ID} \p{Numeric_Type:None} \p{Nt=None} \p{Numeric_Value:NaN} \p{Nv=NaN} \p{Present_In:1.1} \p{Age=1.1} \p{In=1.1} \p{Present_In:2.0} \p{In=2.0} \p{Present_In:2.1} \p{In=2.1} \p{Present_In:3.0} \p{In=3.0} \p{Present_In:3.1} \p{In=3.1} \p{Present_In:3.2} \p{In=3.2} \p{Present_In:4.0} \p{In=4.0} \p{Present_In:4.1} \p{In=4.1} \p{Present_In:5.0} \p{In=5.0} \p{Present_In:5.1} \p{In=5.1} \p{Present_In:5.2} \p{In=5.2} \p{Script:Common} \p{Sc=Zyyy} \p{Script:Zyyy} \p{Sentence_Break:Sp} \p{SB=Sp} \p{Word_Break:Other} \p{WB=XX} \p{Word_Break:XX} \p{Word_Break=Other} U+12345 ‹𒍅› \N{ CUNEIFORM SIGN URU TIMES KI }: \w} \p{\pL} \p{L_} \p{Lo} \p{All} \p{Any} \p{Alnum} \p{Alpha} \p{Alphabetic} \p{Assigned} \p{InCuneiform} \p{Cuneiform} \p{Is_Cuneiform} \p{Xsux} \p{L} \p{Lo} \p{Gr_Base} \p{Grapheme_Base} \p{Graph} \p{GrBase} \p{ID_Continue} \p{IDC} \p{ID_Start} \p{IDS} \p{Letter} \p{L_} \p{Other_Letter} \p{Print} \p{Word} \p{XID_Continue} \p{XIDC} \p{XID_Start} \p{XIDS} \p{Age:5.0} \p{Bidi_Class:L} \p{Bidi_Class=Left_To_Right} \p{Bidi_Class:Left_To_Right} \p{Bc=L} \p{Block:Cuneiform} \p{Canonical_Combining_Class:0} \p{Canonical_Combining_Class=Not_Reordered} \p{Canonical_Combining_Class:Not_Reordered} \p{Ccc=NR} \p{Canonical_Combining_Class:NR} \p{Script=Cuneiform} \p{Block=Cuneiform} \p{Decomposition_Type:None} \p{Dt=None} \p{East_Asian_Width=Neutral} \p{East_Asian_Width:Neutral} \p{Grapheme_Cluster_Break:Other} \p{GCB=XX} \p{Grapheme_Cluster_Break:XX} \p{Grapheme_Cluster_Break=Other} \p{Hangul_Syllable_Type:NA} \p{Hangul_Syllable_Type=Not_Applicable} \p{Hangul_Syllable_Type:Not_Applicable} \p{Hst=NA} \p{Joining_Group:No_Joining_Group} \p{Jg=NoJoiningGroup} \p{Joining_Type:Non_Joining} \p{Jt=U} \p{Joining_Type:U} \p{Joining_Type=Non_Joining} \p{Line_Break:AL} \p{Line_Break=Alphabetic} \p{Line_Break:Alphabetic} \p{Lb=AL} \p{Numeric_Type:None} \p{Nt=None} \p{Numeric_Value:NaN} \p{Nv=NaN} \p{Present_In:5.0} \p{In=5.0} \p{Present_In:5.1} \p{In=5.1} \p{Present_In:5.2} \p{In=5.2} \p{Script:Cuneiform} \p{Sc=Xsux} \p{Script:Xsux} \p{Sentence_Break:LE} \p{Sentence_Break=OLetter} \p{Sentence_Break:OLetter} \p{SB=LE} \p{Word_Break:ALetter} \p{WB=LE} \p{Word_Break:LE} \p{Word_Break=ALetter}

或者去其他的办法：

$ unichars '\pN' '\D' '\p{Latin}' Ⅰ 8544 02160 ROMAN NUMERAL ONE Ⅱ 8545 02161 ROMAN NUMERAL TWO Ⅲ 8546 02162 ROMAN NUMERAL THREE Ⅳ 8547 02163 ROMAN NUMERAL FOUR Ⅴ 8548 02164 ROMAN NUMERAL FIVE Ⅵ 8549 02165 ROMAN NUMERAL SIX Ⅶ 8550 02166 ROMAN NUMERAL SEVEN Ⅷ 8551 02167 ROMAN NUMERAL EIGHT (etc) $ unichars -a '\pL' '\p{Greek}' 'NFD ne NFKD' 'NAME =~ /SYMBOL/' ϐ 976 3D0 GREEK BETA SYMBOL ϑ 977 3D1 GREEK THETA SYMBOL ϒ 978 3D2 GREEK UPSILON WITH HOOK SYMBOL ϓ 979 3D3 GREEK UPSILON WITH ACUTE AND HOOK SYMBOL ϔ 980 3D4 GREEK UPSILON WITH DIAERESIS AND HOOK SYMBOL ϕ 981 3D5 GREEK PHI SYMBOL ϖ 982 3D6 GREEK PI SYMBOL ϰ 1008 3F0 GREEK KAPPA SYMBOL ϱ 1009 3F1 GREEK RHO SYMBOL ϲ 1010 3F2 GREEK LUNATE SIGMA SYMBOL ϴ 1012 3F4 GREEK CAPITAL THETA SYMBOL ϵ 1013 3F5 GREEK LUNATE EPSILON SYMBOL Ϲ 1017 3F9 GREEK CAPITAL LUNATE SIGMA SYMBOL

哦， BNM 装置 "勇敢的新千年", ，参照我们的现代化，后ASCII世界其符超过只有七位微不足道的宽。免费得到它了

与string.replace（）接受回调函数作为它的第二个参数。（不知道为什么这么多的JS教程省略这个实用的功能。）因此，我们可以写我们自己的测试word边界。

其他地方提出的，与正则表达式/(\W|^)(fancy namé|namé)(\W|$)/ig的溶液，给出文本的情况下，假阳性，如“naméé”。

String.prototype.isWordCharAt = function(i) { // should work for European languages and Unicode return (this.charAt(i) >= 'A' && this.charAt(i) <= 'Z') || (this.charAt(i) >= 'a' && this.charAt(i) <= 'z') || (this.charCodeAt(i) >= 0xC0 && this.charCodeAt(i) < 0x2000) ; }; "Namé. Goal: Some Fancy Namé. Namé. Nénamé. Namée. Nénamée. Namé" .replace(/(Namé|Fancy Namé)/ig, function( match, part1, /* part2, part3, ... */ offset, fullText) { // Keep in mind that the number of arguments changes // if the number of capturing parenthesis in regexp changes. // We could use 'arguments' pseudo-array instead. var len1 = part1.length; var leftWordBoundary; var rightWordBoundary; if (offset === 0) { leftWordBoundary = fullText.isWordCharAt(offset); } else { leftWordBoundary = (fullText.isWordCharAt(offset - 1) != fullText.isWordCharAt(offset)); } if (offset + len1 == fullText.length) { rightWordBoundary = fullText.isWordCharAt(offset + len1 - 1); } else { rightWordBoundary = (fullText.isWordCharAt(offset + len1 - 1) != fullText.isWordCharAt(offset + len1)); } if (leftWordBoundary && rightWordBoundary) { return '<a href="#">' + part1 + '</a>'; } else { return part1; } });

也许尝试使用您正则表达式时，使用\o或\x标志。

Javascript的正则表达式可能帮助这个参考结束你出去。

至于什么实际的八进制/十六进制值é相关联，我不知道。

许可以下： CC-BY-SA 和归因

不隶属于 StackOverflow