Vous n'êtes pas identifié(e).
L'icône rouge permet de télécharger chaque page du wiki visitée au format
PDF et la grise au format ODT →
Ci-dessous, les différences entre deux révisions de la page.
Les deux révisions précédentes Révision précédente Prochaine révision | Révision précédente Prochaine révision Les deux révisions suivantes | ||
utilisateurs:hypathie:tutos:accueil [19/07/2014 19:34] Hypathie [Contexte d'utilisation des ER] |
utilisateurs:hypathie:tutos:accueil [20/07/2014 13:31] Hypathie [Contexte d'utilisation des ER] |
||
---|---|---|---|
Ligne 24: | Ligne 24: | ||
</code> | </code> | ||
<note> | <note> | ||
- | Sed utilise une version particulière des expressions régulières. | + | **Sed utilise une version particulière des expressions régulières.** |
* **Sans l'option ''-r'' :** | * **Sans l'option ''-r'' :** | ||
- | -> __utilisation des expressions régulières de basiques__, c'est-à-dire, celles qui utilisent les métacaractères simples (POSIX) qui sont en communs à tous les programmes utilisant les expressions régulières.\\ En voici un rappel : | + | -> __**utilisation des expressions régulières de basiques**__,\\ c'est-à-dire, celles qui utilisent les métacaractères simples (POSIX) qui sont en communs à tous les programmes utilisant les expressions régulières.\\ En voici un rappel : |
- | ''*'', ''^'', ''$'', ''[ ]''\\ | + | **''.''** ; **''*''**, **''^''**, **''$''**, **''[ ]''**\\ |
- | -> __utilisation des classes__ : | + | __Attention au caractère ''*''__:\\ |
+ | - comme métacaractère :\\ ''*'' -> zéro ou plus occurrences de n'importe quel caractère | ||
+ | - pour une ER du shell :\\ ''*'' -> zéro ou plusieurs fois l'élément précédent (ab*c -> abbc, abbbc, etc. | ||
+ | - expression régulière :\\ ''x*'' -> zéro occurrence ou plus de "x" | ||
+ | - expression régulière :\\ ''.*'' -> zéro ou plus occurrences de n'importe quel caractère | ||
+ | |||
+ | -> **Il s'y ajoute pour sed __le caractère__ ''&'' :**\\ | ||
+ | - **''&''** : Représente la chaîne à remplacer((ce qu'on ajoute autour de ''&'' est ajouté à la chaîne remplacée)). | ||
+ | |||
+ | -> __**utilisation des classes**__ : | ||
+ | |||
+ | > Attention il y a une petite ambiguïté !\\ Les classes peuvent effectivement être utilisées avec sed sans l'option ''-r'' bien que la documentation de sed renvoie à celle grep -E (ou egrep) où elles font partie des regexp étendues. | ||
^ ^ ^ | ^ ^ ^ | ||
Ligne 48: | Ligne 59: | ||
|''<nowiki>[[:xdigit:]]</nowiki>'' | Chiffres hexadécimaux [0-9 a-f A-F] | | |''<nowiki>[[:xdigit:]]</nowiki>'' | Chiffres hexadécimaux [0-9 a-f A-F] | | ||
- | -> Il s'y ajoute __le caractère ''&''__ : La chaîne à remplacer dans la chaîne de remplacement. | + | * **Avec ''-r'' :** |
+ | |||
+ | -> **On peut utiliser tous les __caractères vus précédemment__ avec sed sans l'option -r.**\\ | ||
+ | L'ajout de l'option -r ne change pas leur signification. | ||
+ | |||
+ | -> **On peut utiliser __les caractères POSIX étendus__ :**\\ | ||
+ | |||
+ | **''|''** ; **''+''** ; **''?''** ; **''( )''** ;**''{ }''** ; **''<nowiki>[ - ]</nowiki>''** | ||
- | * **avec ''-r'' :** | + | Auxquels il s'ajoute les caractères non-portables : ''\<'' et ''\>''\\ |
+ | -''\<'' : cible le début d'un mot((Attention : Un mot est une chaîne de caractères faite de chiffres, lettres ou de ''_'' et séparée par tout autre caractère qu'un chiffre, une lettre ou le ''_''.)) : ''\<'' doit figurer devant la sous-chaîne désirée\\ | ||
+ | -''\>'' : cible la fin d'un mot : ''\>'' doit figurer en fin de la sous-chaîne désirée | ||
- | -> On peut utiliser __les caractères POSIX étendus__ (ceux communs à 'egrep'):\\ | ||
- | ''|'' ; ''^'' ; ''$'' ; ''.'' ; ''*'' ; ''+'' ; ''?'' ; ''( )'' ; ''['' ; ''{ }''\\ | ||
- | -> Il s'y ajoute enfin __les raccourcis ci-desous__. C'est là l'extension GNU qui n'est pas portable :\\ | + | >Voici la liste complète et testée des caractères nécessitant l'option ''-r'' de sed :\\ |
+ | >**''|''** ; **''+''** ; **''?''** ; **''( )''** ;**''{ }''** ; **''<nowiki>[ - ]</nowiki>''** ; **''\<''** ; **''\>''**\\ | ||
- | ''f'' : Produit ou correspond à un saut\\ | + | -> **Il s'y ajoute quelqu'uns __des raccourcis ci-dessous__.**\\ |
- | ''\n'' : Produit ou correspond à un retour à la ligne \\ | + | Il s'agit là de quelques unes des extensions GNU(([[https://www.gnu.org/software/sed/manual/html_node/Escapes.html#Escapes|Escapes]])) qui sont pas portables, mais qui fonctionnent avec sed ''-r'' :\\ |
- | ''\r'' : Produit ou correspond à un retour chariot\\ | + | |
- | ''\t'' : Produit ou correspond à un onglet horizontal\\ | + | |
- | ''\v'' : Produit ou correspond à une tabulation verticale\\ | + | |
- | ''\w'' : Correspond à n'importe quel caractère "mot". Un caractère "mot" sera une lettre, un chiffre ou le caractère de soulignement.\\ | + | |
- | ''\W'' : Correspond à tout caractère «non-mot».\\ | + | |
- | ''\b'' : Correspond à une limite de mot.\\ | + | |
- | ''\B'' : Matches partout mais sur une limite de mot.\\ | + | |
- | ''\a'' : caractère alerte'' | + | |
- | \\dxxx'' : Produit ou correspond à un caractère dont la valeur ascii décimal est xxx\\ ''\cx'' : Control-x \\ | + | |
- | ''\OXXX'' : caractère par valeur aSCII octal\\ | + | |
- | ''\xhh'' : caractère par valeur aSCII hexadécimal. | + | |
+ | **''\f''** : Produit ou correspond à un saut\\ | ||
+ | **''\n''** : Produit ou correspond à un retour à la ligne \\ | ||
+ | **''\t''** : Produit ou correspond à un onglet horizontal\\ | ||
+ | **''\v''** : Produit ou correspond à une tabulation verticale\\ | ||
+ | **''\w''** : Synonyme de ''<nowiki>[[:alnum:]]</nowiki>'' -> correspond à un mot.\\ | ||
+ | **''\W''** : Synonyme de ''<nowiki>[^[:alnum]]</nowiki>'' -> ce qui autre qu'un mot.\\ | ||
+ | **''\b''** : Correspond à une chaîne vide (blanc) à l'extrémité d'un mot((''info\b'' ->"info pour tous" et ''\binfo'' -> "informatique"))\\ | ||
- | Référence : [[http://www.gnu.org/software/sed/manual/sed.html#Regular-Expressions|sed, a stream editor, "Overview of Regular Expression Syntax"]] | + | Référence : [[http://sunsite.ualberta.ca/Documentation/Gnu/sed-3.02/html_chapter/sed_3.html]] |
</note> | </note> | ||
Pour utiliser les REGEXP, il faut avant tout maîtriser les syntaxes de substitution, et l'adressage. | Pour utiliser les REGEXP, il faut avant tout maîtriser les syntaxes de substitution, et l'adressage. | ||
- | ====La substitution ==== | + | =====La substitution===== |
===Syntaxes de substitution=== | ===Syntaxes de substitution=== | ||
<code> | <code> | ||
Ligne 95: | Ligne 110: | ||
>Pour REGEXP, on peut utiliser la syntaxe habituelle, ou la syntaxe étendue avec l'option ''-r''. | >Pour REGEXP, on peut utiliser la syntaxe habituelle, ou la syntaxe étendue avec l'option ''-r''. | ||
- | ====L'adressage ==== | + | =====L'adressage ===== |
===Préparation=== | ===Préparation=== | ||
<code user> | <code user> | ||
Ligne 273: | Ligne 288: | ||
</code> | </code> | ||
- | ====GO ! Sed et les regexp simples ==== | + | =====Exercices : Sed et les regexp simples ===== |
- | Exercices | + | |
=== le point (.)=== | === le point (.)=== | ||
<code user> | <code user> | ||
Ligne 479: | Ligne 494: | ||
</code> | </code> | ||
- | ====Sed -r : les caractères posix étendues ==== | + | ====Sed -r : les caractères étendues ==== |
===Rappel=== | ===Rappel=== | ||
''|'' ; ''^'' ; ''$'' ; ''.'' ; ''*'' ; ''+'' ; ''?'' ; ''( )'' ; ''['' ; ''{ }'' | ''|'' ; ''^'' ; ''$'' ; ''.'' ; ''*'' ; ''+'' ; ''?'' ; ''( )'' ; ''['' ; ''{ }'' | ||
Ligne 587: | Ligne 602: | ||
</code> | </code> | ||
- | =====Sed regexp étendues ===== | + | =====Sed et les expressions rationnelles étendues ===== |
=== le "ou" (|)=== | === le "ou" (|)=== | ||
<code user> | <code user> |