Sed — различия между версиями
Vaal (обсуждение | вклад) (Добавлен раздел sed) |
Vaal (обсуждение | вклад) (Полностью отредактировал статью) |
||
(не показаны 2 промежуточные версии этого же участника) | |||
Строка 1: | Строка 1: | ||
== Введение == | == Введение == | ||
− | Команда [[sed]] - это редактор потока данных ( | + | Команда [[sed]] - это редактор потока данных ('''S'''tream '''ED'''itor) для автоматического редактирования текстов. "''Редактор потока''" — в том смысле, что может редактировать входящий поток данных непрерывно, скажем, в составе программного канала (''pipe''). ''Автоматически'' — это значит, что, как только вы зададите правила редактирования, дальнейшее происходит без вашего утомительного участия. Другими словами, редактор [[sed]] не является ''интерактивным''. |
− | Программа sed сложнее, чем те команды, что мы уже успели рассмотреть в предыдущих статьях | + | Программа [[sed]] сложнее, чем те команды, что мы уже успели рассмотреть в предыдущих статьях. В её составе арсенал собственных команд, поэтому, чтобы избежать тавтологии и путаницы, в этой статье команда [[sed]] впредь будет именоваться "''программой''" или "''редактором''", а команды редактора [[sed]] — просто ''командами''.<br /> |
+ | Программа [[sed]] способна выполнять сложные задания, и нужно потратить время, чтобы научиться эти задания формулировать. Но наряду со сложными действиями, у команды [[sed]] есть простые, но весьма полезные возможности, освоить которые не труднее, чем прочие команды UNIX. Не позволяйте себе из-за сложности освоения всей программы, отказываться от её простых аспектов. Мы начнем от простого к сложному, так что вы всегда сможете понять, где следует остановиться. | ||
− | + | === Команда s — substitution (замена) === | |
− | + | Программа [[sed]] имеет множество собственных ''команд''. Большинство пользователей знают только команду '''s''', и этого вполне хватает, чтобы работать с редактором [[sed]].<br /> Команда '''s''' заменяет <span style="color:red"><u>''ОБРАЗЕЦ''</u></span> на <span style="color:green"><u>''ЗАМЕНУ''</u></span>: | |
− | + | ||
− | + | ||
− | + | ||
− | + | ||
− | + | ||
− | Программа [[sed]] имеет множество собственных команд. Большинство пользователей знают только команду s, и этого вполне хватает, чтобы работать с редактором [[sed]]. Команда s заменяет | + | |
− | + | ||
− | + | ||
− | + | ||
− | + | ||
− | + | ||
− | + | ||
− | + | ||
+ | <source lang="bash">sed s/ОБРАЗЕЦ/ЗАМЕНА/</source><br /> | ||
+ | <source lang="bash"> | ||
+ | $ echo день | sed s/день/ночь/ | ||
+ | ночь | ||
+ | </source> | ||
+ | Проще не бывает. А вот пример с вводом из файла <u>zar.txt</u>: | ||
По утрам он делал зарядку. | По утрам он делал зарядку. | ||
− | Молния | + | Молния — электрический заряд. |
+ | <source lang="bash"> | ||
+ | $ sed s/заряд/разряд/ zar.txt | ||
+ | По утрам он делал разрядку. | ||
+ | Молния — электрический разряд. | ||
+ | </source> | ||
− | + | Я не брал выражение ''s/ОБРАЗЕЦ/ЗАМЕНА/'' в кавычки, так как данный пример не нуждается в кавычках, но если бы в нём ''присутствовали метасимволы'', то кавычки были бы '''обязательны'''. Чтобы не ломать себе каждый раз голову, и не ошибиться ненароком, всегда ставьте кавычки, лучше более "''сильные''" одинарные(' '), это хорошая привычка. Кашу маслом не испортишь. Я тоже во всех последующих примерах не буду манкировать кавычками. | |
− | + | ||
− | + | ||
− | + | Как мы видим, заменяющая команда '''s''' имеет четыре составляющих: | |
− | + | '''''s''''' — сама команда | |
+ | '''''/.../.../''''' — разделитель | ||
+ | '''''ОБРАЗЕЦ''''' — образец для поиска и последующей замены | ||
+ | '''''ЗАМЕНА''''' — выражение, которое заменит собой ''ОБРАЗЕЦ'', если таковой будет найден! | ||
− | + | '''Прямой слэш''' ('''/''') используется в качестве разделителя по традиции, так как предок программы [[sed]] — редактор '''ed''' использует их (как и редактор [[Vim|vi]]). В некоторых случаях такой разделитель весьма неудобен, например, когда надо менять пути (''path'') к директориям, которые тоже содержат '''прямой слэш''' ('''/'''usr'''/'''local'''/'''bin). В этом случае приходится разделять прямые слэши обратными: | |
− | + | <source lang="bash"> | |
− | + | sed 's/\/usr\/local\/bin/\/common\/bin/' | |
− | + | </source> | |
− | + | Это называется "'''частокол'''" и выглядит весьма уродливо, а главное, непонятно.<br /> | |
− | Прямой слэш (/) используется в качестве разделителя по традиции, так как предок программы [[sed]] | + | Уникальность программы [[sed]] в том, что она позволяет использовать любой разделитель, например знак <u>'''подчёркивания'''</u>: |
− | + | <source lang="bash"> | |
− | + | $ echo день | sed s_день_ночь_ | |
− | + | ночь | |
− | Это называется "частокол" и выглядит весьма уродливо, а главное, непонятно. | + | </source> |
− | + | или <u>'''двоеточие'''</u>: | |
− | Уникальность программы [[sed]] в том, что она позволяет использовать любой разделитель, например знак | + | <source lang="bash"> |
− | + | $ echo день | sed s:день:ночь: | |
− | + | ночь | |
− | + | </source> | |
− | + | Если в поисках разделителя, который вам нравится, вы получаете сообщение "'''''незавершённая команда `s' '''''", значит этот ''символ'' <u>не годится в качестве разделителя</u>, или вы просто <u>забыли поставить один-два разделителя</u>. | |
− | или двоеточие: | + | В этой статье я вынужден использовать традиционный разделитель ('''/''') чтобы не сбивать читателя с толку, но в случае необходимости стану использовать в качестве разделителя '''тильду''' ('''~'''). |
− | + | ||
− | + | ||
− | + | ||
− | + | ||
− | Если в поисках разделителя, который вам нравится, вы получаете сообщение " | + | |
− | + | ||
− | В этой статье я вынужден использовать традиционный разделитель (/) чтобы не сбивать читателя с толку, но в случае необходимости стану использовать в качестве разделителя тильду (~). | + | |
=== Регулярные выражения (РВ) === | === Регулярные выражения (РВ) === | ||
− | (Regular expressions, regexp, RE) | + | ('''Regular expressions''', '''regexp''', '''RE''') |
− | Тема регулярных выражений настолько обширна, что ей посвящены целые книги (смотри ссылки в конце статьи). Тем не менее, говорить | + | Тема регулярных выражений настолько обширна, что ей посвящены целые книги (смотри ссылки в конце статьи). Тем не менее, говорить всерьёз о редакторе [[sed]], не применяя регулярных выражений, также непродуктивно, как разговаривать о тригонометрии при помощи счётных палочек. Поэтому необходимо рассказать хотя бы о тех регулярных выражениях, которые часто используются с программой [[sed]]. |
− | '''с''' | + | '''с''' — или любая другая буква. Большинство букв, цифр и прочих неспециальных символов считаются регулярными выражениями, представляющими сами себя. |
− | '''*''' Астериск, следующий за каким-либо символом или регулярным выражением, означает любое число (в том числе и нулевое) повторов этого символа или регулярного выражения. | + | '''*''' — Астериск, следующий за каким-либо символом или регулярным выражением, означает любое число (в том числе и нулевое) повторов этого символа или регулярного выражения. |
− | '''\+''' Означает один или более повтор символа или регулярного выражения. | + | '''\+''' — Означает один или более повтор символа или регулярного выражения. |
− | '''\?''' Означает ни одного или один повтор. | + | '''\?''' — Означает ни одного или один повтор. |
− | '''\{i\}''' Означает ровно i повторов. | + | '''\{i\}''' — Означает ровно '''i''' повторов. |
− | '''\{i,j\}''' Число повторов находится в интервале от i до j включительно. | + | '''\{i,j\}''' — Число повторов находится в интервале от '''i''' до '''j''' включительно. |
− | '''\{i,\}''' Число повторов больше или равно i. | + | '''\{i,\}''' — Число повторов больше или равно '''i'''. |
− | '''\{,j\'''} Число повторов меньше или равно j. | + | '''\{,j\'''} — Число повторов меньше или равно '''j'''. |
− | '''\(RE\''') Запомнить регулярное выражение или его часть с целью дальнейшего использования как единое целое. Например, \(а-я\)* будет искать любое сочетание любого количества (в том числе и нулевого) строчных букв. | + | '''\(RE\''') — Запомнить регулярное выражение или его часть с целью дальнейшего использования как единое целое. Например, '''\(а-я\)*''' будет искать любое сочетание любого количества (в том числе и нулевого) строчных букв. |
− | '''.''' Означает любой символ, в том числе символ новой строки. | + | '''.''' — Означает любой символ, в том числе символ новой строки. |
− | '''^''' Означает нулевое выражение в начале строки. Другими словами, то, перед чем стоит этот знак, должно появляться в начале строки. Например, ^#include будет искать строки, начинающиеся с #include. | + | '''^''' — Означает нулевое выражение в начале строки. Другими словами, то, перед чем стоит этот знак, должно появляться в начале строки. Например, '''^#include''' будет искать строки, начинающиеся с #include. |
− | '''$''' То же, что и предыдущее, только относится к концу строки. | + | '''$''' — То же, что и предыдущее, только относится к концу строки. |
− | '''[СПИСОК]''' Означает любой символ из СПИСКА. Например, [aeiou] будет искать любую английскую гласную букву. | + | '''[СПИСОК]''' — Означает любой символ из ''СПИСКА''. Например, '''[aeiou]''' будет искать любую <u>английскую гласную букву</u>. |
− | '''[^СПИСОК]''' Означает любой символ, кроме тех, что в списке. Например, [^aeiou] будет искать любую согласную. Примечание: СПИСОК может быть интервалом, например [а-я], что будет означать любую строчную букву. Если нужно включить в СПИСОК ] (квадратную скобку) укажите | + | '''[^СПИСОК]''' — Означает любой символ, кроме тех, что в списке. Например, '''[^aeiou]''' будет искать <u>любую английскую согласную</u>. Примечание: ''СПИСОК'' может быть <u>'''интервалом'''</u>, например '''[а-я]''', что будет означать любую строчную букву. Если нужно включить в ''СПИСОК'' ''']''' (''квадратную скобку'') укажите её в списке <u>первой</u>; если нужно включить в ''СПИСОК'' '''-''' (''дефис''), то укажите его в списке <u>первым</u> или <u>последним</u>. |
− | '''RE1\|RE2''' Означает РВ1 или РВ2. | + | '''RE1\|RE2''' — Означает '''РВ1''' или '''РВ2'''. |
− | '''RE1RE2''' Означает объединение регулярных выражений РВ1 и РВ2. | + | '''RE1RE2''' — Означает объединение регулярных выражений '''РВ1''' и '''РВ2'''. |
− | '''\n''' Означает символ новой строки. | + | '''\n''' — Означает символ <u>новой строки</u>. |
− | '''\$; \*; \.; \[; \\; \^''' Означают соответственно: ''$; *; .; [; \; ^'' | + | '''\$; \*; \.; \[; \\; \^''' — Означают соответственно: ''$; *; .; [; \; ^'' |
− | '''''Внимание:''''' Остальные условные обозначения на основе обратного слэша (\), принятые в языке С, не поддерживаются программой [[sed]]. | + | '''''Внимание:''''' <u>Остальные условные обозначения на основе '''обратного слэша''' ('''\'''), принятые в языке '''С''', не поддерживаются программой [[sed]]</u>. |
− | '''\1 \2 \3 \4 \5 \6 \7 \8 \9''' Означает соответствующую по | + | '''\1 \2 \3 \4 \5 \6 \7 \8 \9''' — Означает соответствующую по счёту часть регулярного выражения, запомненную при помощи знаков '''\(''' и '''\)'''. |
'''''Несколько примеров:''''' | '''''Несколько примеров:''''' | ||
− | '''abcdef''' Означает abcdef | + | '''abcdef''' — Означает '''abcdef''' |
− | '''a*b''' Означает ноль или любое количество букв а и одна буква b. Например, aaaaaab; ab; или b. | + | '''a*b''' — Означает ноль или любое количество букв ''''''а и одна буква '''b'''. Например, '''aaaaaab'''; '''ab'''; или '''b'''. |
− | '''a\?b''' Означает b или ab | + | '''a\?b''' — Означает '''b''' или '''ab''' |
− | '''a\+b\+''' Означает одну или больше букв а и одну или больше букв b. Например: ab; aaaab; abbbbb; или aaaaaabbbbbbb. | + | '''a\+b\+''' — Означает одну или больше букв '''а''' и одну или больше букв '''b'''. Например: '''ab'''; '''aaaab'''; '''abbbbb'''; или '''aaaaaabbbbbbb'''. |
− | '''.*''' Означает все символы на строке, на всех строках, включая пустые. | + | '''.*''' — Означает '''все символы на строке''', на '''всех строках''', ''включая пустые''. |
− | '''.\+''' Означает все символы на строке, но только на строках, содержащих хотя бы один символ. Пустые строки не соответствуют данному регулярному выражению. | + | '''.\+''' — Означает '''все символы на строке''', но '''только на строках''', ''содержащих'' хотя бы ''один символ'''. '''Пустые строки''' ''не соответствуют'' данному регулярному выражению. |
− | '''^main.*(.*)''' Будет искать строки, начинающиеся со слова main, а также имеющие в | + | '''^main.*(.*)''' — Будет искать строки, начинающиеся со слова '''main''', а также имеющие в своём составе '''открывающую и закрывающие скобки''', причём ''перед и после открывающей скобки'' может находиться любое количество символов (<u>а может и не находиться</u>). |
− | '''^#''' Будет искать строки, начинающиеся со знака # (например комментарии). | + | '''^#''' — Будет искать строки, начинающиеся со знака '''#''' (например ''комментарии''). |
− | '''\\$''' Будет искать строки, заканчивающиеся обратным слэшем (\). | + | '''\\$''' — Будет искать строки, заканчивающиеся '''обратным слэшем''' ('''\'''). |
− | '''[a-zA-Z_]''' Любые буквы или цифры | + | '''[a-zA-Z_]''' — Любые '''буквы''' или '''цифры''' |
− | '''[^ ]\+''' | + | '''[^ ]\+''' — Означает '''один''' или '''любое''' количество '''любых символов''', кроме '''пробела''' и '''табуляции'''. Обычно имеется в виду '''слово'''(В квадратной скобке, кроме символа '''^''', содержится ещё '''пробел''' и '''табуляция'''). |
− | '''^.*A.*$''' | + | '''^.*A.*$''' — Означает заглавную букву '''А''' точно в ''середине строки''. |
− | '''A.\{9\}$''' Означает заглавную букву А, точно десятую по | + | '''A.\{9\}$''' — Означает заглавную букву '''А''', точно '''десятую по счёту от конца строки'''. |
− | '''^.\{,15\}A''' Означает заглавную букву А, точно шестнадцатую по | + | '''^.\{,15\}A''' — Означает заглавную букву '''А''', точно '''шестнадцатую по счёту от начала строки'''. |
− | Теперь, когда мы познакомились с некоторыми регулярными выражениями, вернемся к команде s редактора [[sed]]. | + | Теперь, когда мы познакомились с некоторыми регулярными выражениями, вернемся к команде '''s''' редактора [[sed]]. |
− | Использование символа & когда ОБРАЗЕЦ неизвестен | + | Использование символа '''&''', когда <span style="color:red"><u>''ОБРАЗЕЦ''</u></span> неизвестен |
− | "Как это неизвестен?", | + | "Как это неизвестен?", — спросите вы — "Ты разве не знаешь, что хочешь заменить?" Отвечу: я хочу взять в скобки любые цифры, найденные в тексте. Как это сделать? Ответ: применить символ '''&'''. |
− | Символ & (амперсанд), будучи | + | Символ '''&''' ('''амперсанд'''), будучи помещён в состав <span style="color:green"><u>''ЗАМЕНЫ''</u></span>, означает '''любой найденный в тексте''' <span style="color:red"><u>''ОБРАЗЦЕ''</u></span>. Например: |
− | + | <source lang="bash"> | |
− | + | $ echo 1234 | sed 's/[0-9]*/(&)/' | |
− | + | (1234) | |
− | + | </source> | |
− | + | Звёздочка ('''астериск''') после интервала '''[0-9]''' нужна чтобы заменены были все цифры, встретившиеся в <span style="color:red"><u>''ОБРАЗЦЕ''</u></span>. Без неё получилось бы: | |
+ | <source lang="bash"> | ||
+ | $ echo 1234 | sed 's/[0-9]/(&)/' | ||
+ | (1)234 | ||
+ | </source> | ||
+ | То есть в качестве <span style="color:red"><u>''ОБРАЗЦА''</u></span> взята была первая же найденная цифра. | ||
− | + | Вот пример со вполне осмысленной нагрузкой: составим файл <u>formula.txt</u>: | |
− | + | ||
− | + | ||
− | + | ||
− | + | ||
− | Вот пример со вполне осмысленной нагрузкой: составим файл formula.txt: | + | |
a+432-10=n | a+432-10=n | ||
и применим к нему команду: | и применим к нему команду: | ||
− | + | <source lang="bash"> | |
− | + | $ sed 's/[0-9]*-[0-9]*/(&)/' formula.txt | |
− | + | a+(432-10)=n | |
− | + | </source> | |
Математическая формула приобрела однозначный смысл. | Математическая формула приобрела однозначный смысл. | ||
− | + | Ещё символ '''амперсанда''' ('''&''') можно использовать для удвоения <span style="color:red"><u>''ОБРАЗЦА''</u></span>: | |
− | + | <source lang="bash"> | |
− | + | $ echo 123 | sed "s/[0-9]*/& &/" | |
− | + | 123 123 | |
− | + | </source> | |
− | Тут есть одна тонкость. Если мы чуть усложним пример: | + | <u>Тут есть одна тонкость</u>. Если мы чуть усложним пример: |
− | + | <source lang="bash"> | |
− | + | $ echo "123 abc" | sed "s/[0-9]*/& &/" | |
− | + | 123 123 abc | |
− | + | </source> | |
− | как и следовало ожидать, удваиваются только цифры, так как в ОБРАЗЦЕ нет букв. Но если мы поменяем части текста местами: | + | как и следовало ожидать, удваиваются только цифры, так как в <span style="color:red"><u>''ОБРАЗЦЕ''</u></span> нет букв. Но если мы поменяем части текста местами: |
− | + | <source lang="bash"> | |
− | + | $ echo "abc 123" | sed "s/[0-9]*/& &/" | |
− | + | abc 123 | |
− | + | </source> | |
− | то никакого удвоения цифр не получится. Это особенность регулярного выражения [0-9]* | + | то никакого удвоения цифр не получится. Это особенность регулярного выражения '''[0-9]*''' — оно ищет соответствия только в первом символе строки. Если мы хотим удвоения цифр, где бы они ни находились, нужно доработать регулярное выражение в <span style="color:green"><u>''ЗАМЕНЕ''</u></span>: |
− | + | <source lang="bash"> | |
− | + | $ echo "abc defg 123" | sed "s/[0-9][0-9]*/& &/" | |
− | + | abc defg 123 123 | |
− | + | </source> | |
тогда цифры будут удваиваться, независимо от количества предшествующих "слов". | тогда цифры будут удваиваться, независимо от количества предшествующих "слов". | ||
− | Использование условных знаков \(, \) и \1 для обработки части ОБРАЗЦА | + | Использование условных знаков '''\(''', '''\)''' и '''\1''' для обработки части <span style="color:red"><u>''ОБРАЗЦА''</u></span>. |
− | Условные знаки \( и \) (escaped parentheses) применяются для запоминания части регулярного выражения. | + | Условные знаки '''\(''' и '''\)''' (''escaped parentheses'') применяются для запоминания части регулярного выражения. |
− | Условный знак \1 означает первую запомненную часть, \2 | + | Условный знак '''\1''' означает первую запомненную часть, '''\2''' — вторую, и так далее, вплоть до девяти запомненных частей (больше программа не поддерживает). Разберём пример: |
+ | <source lang="bash"> | ||
+ | $ echo abcd123 | sed 's/\([a-z]*\).*/\1/' | ||
+ | abcd | ||
+ | </source> | ||
+ | Здесь '''\([a-z]*\)''' означает, что программа должна запомнить все буквенные символы в любом количестве; '''.*''' означает любое количество символов после первой запомненной части; а '''\1''' означает , что мы хотим видеть только первую запомненную часть. Так и есть: в выводе программы мы видим только буквы и никаких цифр. | ||
− | + | Для того, чтобы ''поменять'' <u>слова местами</u>, нужно ''запомнить'' два суб-<span style="color:red"><u>''ОБРАЗЦА''</u></span>, а потом поменять их местами: | |
− | + | <source lang="bash"> | |
− | + | $ echo глупый пингвин |sed 's/\([а-я]*\) \([а-я]*\)/\2 \1/' | |
− | Здесь \([ | + | пингвин глупый |
− | + | </source> | |
− | + | Здесь '''\2''' означает второй суб-<span style="color:red"><u>''ОБРАЗЕЦ''</u></span>, а '''\1''' — первый. Обратите внимание на интервал между первым выражением '''\([а-я]*\)''' и вторым выражением '''\([а-я]*\)'''. Он необходим, чтобы были найдены <u>два слова</u>. | |
− | + | Знак '''\1''' вовсе не обязан быть только в <span style="color:green"><u>''ЗАМЕНЕ''</u></span>, он может присутствовать также и в <span style="color:red"><u>''ОБРАЗЦЕ''</u></span>, например, когда мы хотим '''удалить''' ''дубликаты слов'': | |
− | + | <source lang="bash"> | |
− | + | $ echo пингвин пингвин | sed 's/\([а-я]*\) \1/\1/' | |
− | + | пингвин | |
− | + | </source> | |
− | + | ||
− | + | ||
− | + | ||
− | + | ||
=== Модификаторы замены команды s === | === Модификаторы замены команды s === | ||
− | Модификаторы замены ставятся после последнего разделителя. Эти модификаторы определяют действия программы в случае, если в строке нашлось более одного совпадения с ОБРАЗЦОМ, и каким образом производить замену. | + | Модификаторы замены ставятся после последнего разделителя. Эти модификаторы определяют действия программы в случае, если в строке нашлось более одного совпадения с <span style="color:red"><u>''ОБРАЗЦОМ''</u></span>, и каким образом производить замену. |
'''Модификатор /g''' | '''Модификатор /g''' | ||
− | + | <span style="color:darkblue">Глобальная замена (Global replacement)</span> | |
− | Программа [[sed]], как и большинство утилит | + | Программа [[sed]], как и большинство утилит UNIX, при работе с файлами считывают по одной строке. Если мы приказываем заменить слово, программа заменит только первое совпавшее с <span style="color:red"><u>''ОБРАЗЦОМ''</u></span> слово на данной строке. Если мы хотим изменить каждое слово, совпавшее с <span style="color:red"><u>''ОБРАЗЦОМ''</u></span>, то следует ввести модификатор '''/g'''. |
− | + | ||
− | + | ||
− | + | ||
− | + | ||
− | + | ||
+ | Без модификатора '''/g''': | ||
+ | <source lang="bash"> | ||
+ | $ echo кот этот, был самый обычный кот | sed 's/кот/котёнок/' | ||
+ | котёнок этот, был самый обычный кот | ||
+ | </source> | ||
Редактор заменил только первое совпавшее слово. | Редактор заменил только первое совпавшее слово. | ||
А теперь с модификатором глобальной замены: | А теперь с модификатором глобальной замены: | ||
+ | <source lang="bash"> | ||
+ | $ echo кот этот, был самый обычный кот | sed 's/кот/котёнок/g' | ||
+ | котёнок этот, был самый обычный котёнок | ||
+ | </source> | ||
− | + | '''Все''' совпадения в данной строке были заменены. | |
− | + | ||
− | + | А если нужно изменить '''все слова''', скажем взять их в скобки? Тогда на помощь снова придут регулярные выражения. Чтобы выбрать все буквенные символы, как верхнего, так и нижнего регистра, можно воспользоваться конструкцией '''[А-Яа-я]''', но в неё не попадут такие слова как "что-то" или "с'езд". Гораздо удобнее конструкция '''[^ ]*''', которая соответствует всем символам, кроме '''пробела'''. Итак: | |
− | + | <source lang="bash"> | |
− | А если нужно изменить все слова, скажем взять их в скобки? Тогда на помощь снова придут регулярные выражения. Чтобы выбрать все буквенные символы, как верхнего, так и нижнего регистра, можно воспользоваться конструкцией [А-Яа-я], но в | + | $ echo глупый пингвин робко прячет | sed 's/[^ ]*/(&)/g' |
− | + | (глупый) (пингвин) (робко) (прячет) | |
− | + | </source> | |
− | + | ||
'''Как выбрать нужное совпадение из нескольких''' | '''Как выбрать нужное совпадение из нескольких''' | ||
− | Если не применять модификаторов, то программа [[sed]] заменит только первое совпавшее с ОБРАЗЦОМ слово. Если применить модификатор /g, то программа заменит каждое совпавшее слово. А как можно выбрать одно из совпадений, если их несколько на строке? | + | Если не применять модификаторов, то программа [[sed]] заменит только первое совпавшее с <span style="color:red"><u>''ОБРАЗЦОМ''</u></span> слово. Если применить модификатор ''/g'', то программа заменит ''каждое совпавшее слово''.<br /> |
− | + | <u>А как можно выбрать одно из совпадений, если их несколько на строке?</u> — При помощи уже знакомых нам условных знаков '''\(''' и '''\)''' запомнить суб-<span style="color:red"><u>''ОБРАЗЦЫ''</u></span> и выбрать нужный при помощи знаков '''\1''' - '''\9'''. | |
− | + | <source lang="bash"> | |
− | + | $ echo глупый пингвин | sed 's/\([а-я]*\) \([а-я]*\)/\2 /' | |
− | + | пингвин | |
− | В этом примере мы запомнили оба слова, и, поставив второе (пингвин) на первое место, первое (глупый) удалили, поставив в секции ЗАМЕНЫ вместо него пробел. Если мы поставим вместо пробела какое-либо слово, то оно заменит первое (глупый): | + | </source> |
− | + | В этом примере мы запомнили оба слова, и, поставив второе (пингвин) на первое место, первое (глупый) удалили, поставив в секции <span style="color:green"><u>''ЗАМЕНЫ''</u></span> вместо него '''пробел'''. Если мы поставим вместо '''пробела''' какое-либо слово, то оно заменит первое (глупый): | |
− | + | <source lang="bash"> | |
− | + | $ echo глупый пингвин | sed 's/\([а-я]*\) \([а-я]*\)/\2 умный /' | |
+ | пингвин умный | ||
+ | </source> | ||
'''Числовой модификатор''' | '''Числовой модификатор''' | ||
− | Это одно/двух/ | + | <span style="color:darkblue">Это одно/двух/трёх-значное число, которое ставится после последнего разделителя и указывает, какое по счёту совпадение подлежит замене</span>. |
+ | <source lang="bash"> | ||
+ | $ echo очень глупый пингвин | sed 's/[а-я]*/хороший/2' | ||
+ | очень хороший пингвин | ||
+ | </source> | ||
− | + | В этом примере каждое слово является совпадением, и мы указали редактору, какое по счёту слово мы хотим заменить, поставив модификатор 2 после секции <span style="color:green"><u>''ЗАМЕНЫ''</u></span>. | |
− | + | ||
− | + | Можно комбинировать цифровой модификатор с модификатором '''/g'''. Если нужно оставить неизменным первое слово, а второе и последующие заменить на слово "(удалено)", то команда будет такая: | |
+ | <source lang="bash"> | ||
+ | $ echo очень глупый пингвин | sed 's/[а-я]*/(удалено)/2g' | ||
+ | очень (удалено) (удалено) | ||
+ | </source> | ||
− | + | Если нужно действительно удалить все последующие совпадения, кроме первого, то в секции <span style="color:green"><u>''ЗАМЕНЫ''</u></span> следует поставить '''пробел''': | |
− | + | <source lang="bash"> | |
− | + | $ echo очень глупый пингвин | sed 's/[а-я]*/ /2g' | |
− | + | очень | |
− | + | </source> | |
− | Если нужно действительно удалить все последующие совпадения, кроме первого, то в секции ЗАМЕНЫ следует поставить пробел: | + | |
− | + | ||
− | + | ||
− | + | ||
Или вовсе ничего не ставить: | Или вовсе ничего не ставить: | ||
+ | <source lang="bash"> | ||
+ | $ echo очень глупый пингвин | sed 's/[^ ]*//2g' | ||
+ | очень | ||
+ | </source> | ||
− | + | Числовой модификатор может быть любым целым числом от '''1''' до '''512'''. Например, если нужно поставить '''двоеточие''' ''после'' '''80''' символа ''каждой строки'', то поможет команда: | |
− | + | <source lang="bash"> | |
− | + | $ sed 's/./&:/80' имя_файла | |
− | Числовой модификатор может быть любым целым числом от 1 до 512. Например, если нужно поставить двоеточие после 80 символа каждой строки, то поможет команда: | + | </source> |
− | + | ||
− | $ | + | |
'''Модификатор /p - выдавать на стандартный выход (печатать - print)''' | '''Модификатор /p - выдавать на стандартный выход (печатать - print)''' | ||
− | Программа [[sed]] и так по умолчанию | + | <span style="color:darkblue">Программа [[sed]] и так по умолчанию выдаёт результат на стандартный выход (например экран монитора). Этот модификатор применяется только с опцией '''sed -n''', которая как раз блокирует вывод результата на экран</span>. |
'''Модификатор /w''' | '''Модификатор /w''' | ||
− | Позволяет записывать результаты обработки текста в указанный файл: | + | <span style="color:darkblue">Позволяет записывать результаты обработки текста в указанный файл</span>: |
− | + | <source lang="bash"> | |
− | + | $ sed 's/ОБРАЗЕЦ/ЗАМЕНА/w имя_файла | |
+ | </source> | ||
'''Модификатор /e (расширение GNU)''' | '''Модификатор /e (расширение GNU)''' | ||
− | Позволяет указать команду шелла (не программы | + | <span style="color:darkblue">Позволяет указать команду шелла (не программы sed) в качестве</span> <span style="color:green"><u>''ЗАМЕНЫ''</u></span>. Если соответствие <span style="color:red"><u>''ОБРАЗЦУ''</u></span> будет найдено, то оно будет заменено на вывод указанной в секции <span style="color:green"><u>''ЗАМЕНЫ''</u></span> команды. Пример: |
− | + | <source lang="bash"> | |
− | + | $ echo ночь | sed 's/ночь/echo день/e' | |
− | + | день | |
+ | </source> | ||
'''Модификаторы /I и /i (расширение GNU)''' | '''Модификаторы /I и /i (расширение GNU)''' | ||
− | Делают процесс замены нечувствительным к регистру символов. | + | <span style="color:darkblue">Делают процесс замены нечувствительным к регистру символов</span>. |
− | + | <source lang="bash"> | |
− | + | $ echo Night | sed 's/night/day/i' | |
− | + | day | |
+ | </source> | ||
'''Комбинации модификаторов''' | '''Комбинации модификаторов''' | ||
− | Модификаторы можно комбинировать, когда это имеет смысл. При этом следует ставить модификатор w последним. | + | <span style="color:darkblue">Модификаторы можно комбинировать, когда это имеет смысл. При этом следует ставить модификатор w последним</span>. |
''Условные обозначения (расширение GNU'') | ''Условные обозначения (расширение GNU'') | ||
Их всего пять: | Их всего пять: | ||
− | '''\L''' переводит символы ЗАМЕНЫ в нижний регистр | + | '''\L''' — переводит символы <span style="color:green"><u>''ЗАМЕНЫ''</u></span> в нижний регистр |
− | '''\l''' переводит следующий символ ЗАМЕНЫ в нижний регистр | + | '''\l''' — переводит следующий символ <span style="color:green"><u>''ЗАМЕНЫ''</u></span> в нижний регистр |
− | '''\U''' переводит символы ЗАМЕНЫ в верхний регистр | + | '''\U''' — переводит символы <span style="color:green"><u>''ЗАМЕНЫ''</u></span> в верхний регистр |
− | '''\u''' переводит следующий символ ЗАМЕНЫ в верхний регистр | + | '''\u''' — переводит следующий символ <span style="color:green"><u>''ЗАМЕНЫ''</u></span> в верхний регистр |
− | '''\E''' отменяет перевод, начатый \L или \U | + | '''\E''' — отменяет перевод, начатый '''\L''' или '''\U''' |
По очевидным причинам эти условные обозначения применяются по одиночке. Например: | По очевидным причинам эти условные обозначения применяются по одиночке. Например: | ||
− | + | <source lang="bash"> | |
− | + | $ echo глупый пингвин | sed 's/глупый/\u&/' | |
− | + | Глупый пингвин | |
+ | </source> | ||
или: | или: | ||
+ | <source lang="bash"> | ||
+ | $ echo маленький щенок | sed 's/[а-я]*/\u&/2' | ||
+ | маленький Щенок | ||
+ | </source> | ||
− | + | Мы рассмотрели почти все аспекты команды '''s''' редактора [[sed]]]. Теперь настала очередь рассмотреть опции этой программы. | |
− | + | ||
− | + | ||
− | Мы рассмотрели почти все аспекты команды s редактора [[sed]]. Теперь настала очередь рассмотреть опции этой программы. | + | |
− | == Опции программы | + | == Опции программы sed == |
− | Программа имеет на удивление мало опций. (Что несколько компенсирует избыток команд, модификаторов и прочих функций). Кроме общеизвестных опций --help (-h) и --version (-V), которые мы рассматривать не будем, их всего три: | + | Программа имеет на удивление мало опций. (Что несколько компенсирует избыток команд, модификаторов и прочих функций). Кроме общеизвестных опций '''--help''' ('''-h''') и '''--version''' ('''-V'''), которые мы рассматривать не будем, их всего три: |
'''Опция -e''' | '''Опция -e''' | ||
− | --expression=набор_команд | + | ''--expression=набор_команд'' |
− | Один из способов выполнения нескольких команд - применение опции -e. Например: | + | Один из способов выполнения нескольких команд - применение опции ''-e''. Например: |
− | + | <source lang="bash"> | |
− | + | sed -e 's/a/A/' -e 's/b/B/' имя_файла | |
− | + | </source> | |
− | Все предыдущие примеры в этой статье не требовали применения опции -e только потому, что содержали одну команду. Мы могли поставить в примерах опцию -e, это ничего бы не изменило. | + | Все предыдущие примеры в этой статье не требовали применения опции '''-e''' только потому, что содержали одну команду. Мы могли поставить в примерах опцию '''-e''', это ничего бы не изменило. |
'''Опция -f''' | '''Опция -f''' | ||
− | Если требуется выполнить большое количество команд, то удобнее записать их в файл и применить опцию -f: | + | Если требуется выполнить большое количество команд, то удобнее записать их в файл и применить опцию '''-f''': |
− | + | <source lang="bash"> | |
− | + | sed -f sedscript имя-файла | |
+ | </source> | ||
− | + | '''Sedscript''' здесь — имя файла, содержащего команды. Этот файл называется скриптом программы [[sed]] (далее просто скрипт). Каждая команда скрипта должна занимать отдельную строку. Например: | |
− | # комментарий | + | # комментарий — Этот скрипт изменит все строчные гласные буквы на заглавные |
s/a/A/g | s/a/A/g | ||
s/e/E/g | s/e/E/g | ||
Строка 349: | Строка 358: | ||
s/u/U/g | s/u/U/g | ||
− | Назвать скрипт можно как угодно, важно не путать файл скрипта с обрабатываемым файлом. | + | <u>Назвать скрипт можно как угодно, важно не путать файл скрипта с обрабатываемым файлом</u>. |
'''Опция -n''' | '''Опция -n''' | ||
− | Программа | + | Программа '''sed -n''' не выводит ничего на стандартный выход. Чтобы получить вывод нужно специальное указание. Мы уже познакомились с модификатором '''/p''', при помощи которого можно дать такое указание. Вспомним файл zar.txt: |
− | + | <source lang="bash"> | |
− | + | $ sed 's/1-9/&/p' zar.txt | |
− | + | По утрам он делал зарядку. | |
− | + | Молния - электрический заряд. | |
− | + | </source> | |
− | + | ||
− | + | Так как совпадений с <span style="color:red"><u>''ОБРАЗЦОМ''</u></span> не найдено (в файле нет цифр), то команда '''s''' с модификатором '''/p''' и знаком '''&''' в качестве <span style="color:green"><u>''ЗАМЕНЫ''</u></span> (напомню, что '''амперсанд''' означает сам <span style="color:red"><u>''ОБРАЗЕЦ''</u></span>), работает как команда [[cat]]. | |
− | + | Если <span style="color:red"><u>''ОБРАЗЕЦ''</u></span> будет найден в файле, то строки, содержащие <span style="color:red"><u>''ОБРАЗЕЦ''</u></span>, будут удвоены: | |
− | + | <source lang="bash"> | |
− | + | $ sed 's/зарядку/&/p' zar.txt | |
− | + | По утрам он делал зарядку. | |
− | + | По утрам он делал зарядку. | |
− | Теперь добавим опцию -n: | + | Молния - электрический заряд. |
− | + | </source> | |
− | + | Теперь добавим опцию '''-n''': | |
− | + | <source lang="bash"> | |
− | + | $ sed -n 's/зарядк/&/p' zar.txt | |
− | Теперь наша программа работает как команда grep | + | По утрам он делал зарядку. |
+ | </source> | ||
+ | Теперь наша программа работает, как команда [[grep]] — возвращает только строки, содержащие <span style="color:red"><u>''ОБРАЗЕЦ''</u></span>. | ||
== Выбор нужных элементов редактируемого текста == | == Выбор нужных элементов редактируемого текста == | ||
− | Используя лишь одну команду s, мы убедились в необыкновенно широких возможностях редактора [[sed]]. А ведь | + | Используя лишь одну команду '''s''', мы убедились в необыкновенно широких возможностях редактора [[sed]]. А ведь всё, что он делает, сводится к поиску и замене. Причём в процессе работы [[sed]] редактирует каждую строку поодиночке, не обращая внимания на другие. Было бы удобно ограничить круг строк, подлежащих изменению, например: |
* Выбирать строки по номерам | * Выбирать строки по номерам | ||
* Выбирать строки в некотором диапазоне номеров | * Выбирать строки в некотором диапазоне номеров | ||
Строка 384: | Строка 394: | ||
* Выбирать только строки от некоторого выражения и до конца файла | * Выбирать только строки от некоторого выражения и до конца файла | ||
− | Программа [[sed]] умеет | + | Программа [[sed]] умеет всё это и даже больше. Любая команда редактора [[sed]] может применяться адресно, в некотором диапазоне адресов, или с вышеперечисленными ограничениями круга строк. Адрес или ограничение должны непосредственно предшествовать команде: |
− | + | <source lang="bash"> | |
− | + | sed 'адрес/ограничение команда' | |
+ | </source> | ||
'''Выбор строк по номерам''' | '''Выбор строк по номерам''' | ||
Это самый простой случай. Просто указываем номер нужной строки перед командой: | Это самый простой случай. Просто указываем номер нужной строки перед командой: | ||
− | + | <source lang="bash"> | |
− | + | $ sed '4 s/[а-я]*//i' gumilev.txt | |
− | + | Какая странная нега | |
− | + | В ранних сумерках утра, | |
− | + | В таянии вешнего снега, | |
− | + | всём, что гибнет и мудро. | |
+ | </source> | ||
Или: | Или: | ||
− | + | <source lang="bash"> | |
− | + | $ sed '3 s/В/(В)/' gumilev.txt | |
− | + | Какая странная нега | |
− | + | В ранних сумерках утра, | |
− | + | (В) таянии вешнего снега, | |
− | + | Во всём, что гибнет и мудро. | |
+ | </source> | ||
'''Выбор строк в диапазоне номеров''' | '''Выбор строк в диапазоне номеров''' | ||
Диапазон указывается, как не удивительно, через запятую: | Диапазон указывается, как не удивительно, через запятую: | ||
+ | <source lang="bash"> | ||
+ | $ sed '2,3 s/В/(В)/' gumilev.txt | ||
+ | Какая странная нега | ||
+ | (В) ранних сумерках утра, | ||
+ | (В) таянии вешнего снега, | ||
+ | Во всём, что гибнет и мудро. | ||
+ | </source> | ||
− | + | Если нужно указать диапазон до последней строки файла, а вы не знаете, сколько в нём строк, то воспользуйтесь знаком '''$''': | |
− | + | <source lang="bash"> | |
− | + | $ sed '2,$ s/в/(в)/i' gumilev.txt | |
− | + | Какая странная нега | |
− | + | (в) ранних сумерках утра, | |
− | + | (в) таянии вешнего снега, | |
− | Если нужно указать диапазон до последней строки файла, а вы не знаете, сколько в | + | (в)о всём, что гибнет и мудро. |
− | + | </source> | |
− | + | ||
− | + | ||
− | + | ||
− | + | ||
− | + | ||
'''Выбор строк, содержащих некое выражение''' | '''Выбор строк, содержащих некое выражение''' | ||
− | Искомое выражение заключается в прямые слэши (/) и ставится перед командой: | + | Искомое выражение заключается в прямые слэши ('''/''') и ставится перед командой: |
− | + | <source lang="bash"> | |
− | + | $ sed '/утра/ s/в/(в)/i' gumilev.txt | |
− | + | Какая странная нега | |
− | + | (в) ранних сумерках утра, | |
− | + | В таянии вешнего снега, | |
− | + | Во всём, что гибнет и мудро. | |
+ | </source> | ||
'''Выбор строк в диапазоне между двумя выражениями''' | '''Выбор строк в диапазоне между двумя выражениями''' | ||
Также как и в случае с номерами строк, диапазон задается через запятую: | Также как и в случае с номерами строк, диапазон задается через запятую: | ||
− | + | <source lang="bash"> | |
− | + | $ sed '/утра/,/мудро/ s/в/(в)/i' gumilev.txt | |
− | + | Какая странная нега | |
− | + | (в) ранних сумерках утра, | |
− | + | (в) таянии вешнего снега, | |
− | + | (в)о всём, что гибнет и мудро. | |
+ | </source> | ||
'''Выбор строк от начала файла и до некоего выражения''' | '''Выбор строк от начала файла и до некоего выражения''' | ||
− | + | <source lang="bash"> | |
− | + | $ sed '1,/снега/ s/в/(в)/i' gumilev.txt | |
− | + | Какая странная нега | |
− | + | (в) ранних сумерках утра, | |
− | + | (в) таянии вешнего снега, | |
− | + | Во всём, что гибнет и мудро. | |
+ | </source> | ||
'''Выбор строк от некоего выражения и до конца файла''' | '''Выбор строк от некоего выражения и до конца файла''' | ||
+ | <source lang="bash"> | ||
+ | $ sed '/снега/,$ s/в/(в)/i' gumilev.txt | ||
+ | Какая странная нега | ||
+ | В ранних сумерках утра, | ||
+ | (в) таянии вешнего снега, | ||
+ | (в)о всем, что гибнет и мудро. | ||
+ | </source> | ||
− | + | == Другие команды редактора sed == | |
− | + | ||
− | + | ||
− | + | ||
− | + | ||
− | + | ||
− | == Другие команды редактора | + | |
'''Команда d (delete)''' | '''Команда d (delete)''' | ||
Удаляет из стандартного вывода указанные строки: | Удаляет из стандартного вывода указанные строки: | ||
+ | <source lang="bash"> | ||
+ | $ sed '2 d' gumilev.txt | ||
+ | Какая странная нега | ||
+ | В таянии вешнего снега, | ||
+ | Во всем, что гибнет и мудро. | ||
+ | </source> | ||
− | + | Причём чаще пишут проще (без пробела): | |
− | + | <source lang="bash"> | |
− | + | sed '2d' gumilev.txt | |
− | + | </source> | |
− | + | Все, что было сказано в предыдущем разделе о адресации строк, справедливо и для команды '''d''' (как и для почти всех команд редактора [[sed]]). | |
− | + | ||
− | + | ||
− | + | ||
− | + | ||
− | Все, что было сказано в предыдущем разделе о адресации строк, справедливо и для команды d (как и для почти всех команд редактора [[sed]]). | + | |
− | + | ||
− | + | ||
− | + | ||
− | + | ||
+ | При помощи команды '''d''' удобно выбросить ненужную "шапку" какого-нибудь почтового сообщения: | ||
+ | <source lang="bash"> | ||
+ | $ sed '1,/^$/ d' имя_файла | ||
+ | </source> | ||
(Удалить строки с первой и до первой пустой строки). | (Удалить строки с первой и до первой пустой строки). | ||
Избавится от комментариев в конфигурационном файле: | Избавится от комментариев в конфигурационном файле: | ||
− | + | <source lang="bash"> | |
− | $ | + | $ sed '/^#/ d' /boot/grub/menu.lst |
+ | </source> | ||
И мало ли, где нужно удалить лишние строчки! | И мало ли, где нужно удалить лишние строчки! | ||
Строка 491: | Строка 512: | ||
'''Команда p (print)''' | '''Команда p (print)''' | ||
− | Английское слово "print" переводится как "печатать", что в русском языке ассоциируется с принтером, или, по крайней мере, с клавиатурой. На самом же деле, слово это в английском контексте зачастую означает просто вывод на экран монитора. Так что команда p ничего не печатает, а просто выводит на экран указанные строки. | + | Английское слово "print" переводится как "печатать", что в русском языке ассоциируется с принтером, или, по крайней мере, с клавиатурой. На самом же деле, слово это в английском контексте зачастую означает просто вывод на экран монитора. Так что команда '''p''' ничего не печатает, а просто выводит на экран указанные строки. |
− | Будучи | + | Будучи применённой сама по себе, команда '''p''' удваивает строки в выводе (ведь программа [[sed]] по умолчанию выводит строку на экран, а команда '''p''' выводит ту же строку вторично). |
− | + | <source lang="bash"> | |
− | + | $ echo у меня есть кот | sed 'p' | |
− | + | у меня есть кот | |
− | + | у меня есть кот | |
+ | </source> | ||
Этому свойству находится применение, например удвоить пустые строки для улучшения вида текста: | Этому свойству находится применение, например удвоить пустые строки для улучшения вида текста: | ||
+ | <source lang="bash"> | ||
+ | $ sed '/^$/ p имя_файла | ||
+ | </source> | ||
− | + | Но истинное своё лицо команда '''p''' раскрывает в сочетании с опцией '''-n''', которая, как вы помните, запрещает вывод строк на экран. Комбинируя опцию '''-n''' с командой '''p''', можно получить в выводе только нужные строки. | |
− | + | ||
− | Но истинное | + | |
Например, просмотреть строки с первой по десятую: | Например, просмотреть строки с первой по десятую: | ||
− | + | <source lang="bash"> | |
− | + | $ sed -n '1,10 p' имя_файла | |
+ | </source> | ||
Или только комментарии: | Или только комментарии: | ||
− | + | <source lang="bash"> | |
− | + | $ sed -n '/^#/ p' /boot/grub/menu.lst | |
− | + | # GRUB configuration file '/boot/grub/menu.lst'. | |
− | + | # generated by 'grubconfig'. Вск 23 Мар 2008 21:45:41 | |
− | + | # | |
− | + | # Start GRUB global section | |
− | + | # End GRUB global section | |
− | + | # Linux bootable partition config begins | |
− | + | # Linux bootable partition config ends | |
− | + | # Linux bootable partition config begins | |
− | + | # Linux bootable partition config ends | |
− | + | </source> | |
− | Что весьма напоминает работу программы grep, с чем мы уже сталкивались, когда говорили об опции -n с модификатором /p. Но, в отличие от команды grep, редактор [[sed]] | + | |
− | + | Что весьма напоминает работу программы [[grep]], с чем мы уже сталкивались, когда говорили об опции '''-n''' с модификатором '''/p'''. Но, в отличие от команды [[grep]], редактор [[sed]] даёт возможность не только найти эти строки, но и изменить их, заменив, например, везде Linux на Unix: | |
− | + | <source lang="bash"> | |
− | + | $ sed -n '/^#/ p' /boot/grub/menu.lst | sed 's/Linux/Unix/' | |
− | + | # GRUB configuration file '/boot/grub/menu.lst'. | |
− | + | # generated by 'grubconfig'. Вск 23 Мар 2008 21:45:41 | |
− | + | # | |
− | + | # Start GRUB global section | |
− | + | # End GRUB global section | |
− | + | # Unix bootable partition config begins | |
− | + | # Unix bootable partition config ends | |
− | + | # Unix bootable partition config begins | |
+ | # Unix bootable partition config ends | ||
+ | </source> | ||
'''Команда !''' | '''Команда !''' | ||
− | Иногда нужно бывает редактировать все строки, кроме тех, что соответствуют ОБРАЗЦУ, либо выбору. Символ восклицательного знака (!) инвертирует выбор. Например удалим все строки, кроме второй из четверостишия Гумилева: | + | Иногда нужно бывает редактировать все строки, кроме тех, что соответствуют <span style="color:red"><u>''ОБРАЗЦУ''</u></span>, либо выбору. Символ восклицательного знака ('''!''') инвертирует выбор. Например удалим все строки, кроме второй из четверостишия Гумилева: |
− | + | <source lang="bash"> | |
− | + | $ sed '2 !d' gumilev.txt | |
− | + | В ранних сумерках утра, | |
+ | </source> | ||
Или выберем все строки, кроме комментариев, из файла /boot/grub/menu.lst: | Или выберем все строки, кроме комментариев, из файла /boot/grub/menu.lst: | ||
− | + | <source lang="bash"> | |
− | + | $ sed -n '/^#/ !p' /boot/grub/menu.lst | |
− | + | default 1 | |
− | + | timeout 20 | |
− | + | gfxmenu (hd0,3)/boot/message | |
− | + | title SuSe on (/dev/hda3) | |
− | + | root (hd0,2) | |
− | + | kernel /boot/vmlinuz root=/dev/hda3 ro vga=773 acpi=off | |
− | + | title Linux on (/dev/hda4) | |
− | + | root (hd0,3) | |
− | + | kernel /boot/vmlinuz root=/dev/hda4 ro vga=0x317 | |
+ | </source> | ||
'''Команда q (quit)''' | '''Команда q (quit)''' | ||
− | Команда q прекращает работу программы [[sed]] после указанной строки. Это удобно, если нужно прекратить редактирование после достижения определенного места в тексте: | + | Команда '''q''' прекращает работу программы [[sed]] после указанной строки. Это удобно, если нужно прекратить редактирование после достижения определенного места в тексте: |
− | + | <source lang="bash"> | |
− | + | $ sed '11 q' имя_файла | |
+ | </source> | ||
Эта команда закончит работу по достижению 11-й строки. | Эта команда закончит работу по достижению 11-й строки. | ||
− | Команда q | + | Команда '''q''' — одна из немногих команд [[sed]], не принимающих диапазонов строк. Не может же команда прекратить работу 10 раз подряд, если мы введём: |
− | + | <source lang="bash"> | |
− | + | sed '1,10 q' | |
− | + | </source> | |
+ | Абсурд! | ||
'''Команда w (write)''' | '''Команда w (write)''' | ||
− | Подобно модификатору w команды s, эта команда позволяет записать вывод программы в файл: | + | Подобно модификатору '''w''' команды '''s''', эта команда позволяет записать вывод программы в файл: |
− | + | <source lang="bash"> | |
− | + | $ sed -n '3,$ w gum.txt' gumilev.txt | |
+ | </source> | ||
− | Мы получим файл gum.txt, содержащий две последние строки четверостишия | + | Мы получим файл gum.txt, содержащий две последние строки четверостишия Гумилёва из файла gumilev.txt. Причём, если такой файл уже существует, то будет перезаписан. Если не ввести опцию '''-n''', то программа, кроме создания файла gum.txt, еще и выведет на экран все содержание файла gumilev.txt. |
− | Для работы в командной строке, удобнее пользоваться обычным перенаправлением вывода (> или >>), но в [[sed]] скриптах, вероятно, команда w | + | Для работы в командной строке, удобнее пользоваться обычным перенаправлением вывода ('''>''' или '''>>'''), но в [[sed]] скриптах, вероятно, команда '''w''' найдёт своё применение. |
'''Команда r (read)''' | '''Команда r (read)''' | ||
− | Эта команда не только | + | Эта команда не только прочтёт указанный файл, но и вставит его содержимое в нужное место редактируемого файла. Для выбора "нужного места" используется уже знакомая нам адресация (по номерам строк, по выражениям, и проч.). Пример: |
− | + | <source lang="bash"> | |
− | + | $ echo Из стихотворения Гумилева: | sed 'r gumilev.txt' | |
− | + | ||
Из стихотворения Гумилева: | Из стихотворения Гумилева: | ||
− | + | Какая странная нега | |
− | + | В ранних сумерках утра, | |
− | + | В таянии вешнего снега, | |
− | + | Во всем, что гибнет и мудро. | |
− | + | </source> | |
'''Команда =''' | '''Команда =''' | ||
Выдаст номер указанной строки: | Выдаст номер указанной строки: | ||
− | + | <source lang="bash"> | |
− | + | $ sed '/снега/=' gumilev.txt | |
− | + | Какая странная нега | |
− | + | В ранних сумерках утра, | |
− | + | 3 | |
− | + | В таянии вешнего снега, | |
− | + | Во всём, что гибнет и мудро. | |
+ | </source> | ||
Или: | Или: | ||
− | + | <source lang="bash"> | |
− | + | $ sed -n '/снега/=' gumilev.txt | |
− | + | 3 | |
+ | </source> | ||
Команда принимает только один адрес, не принимает интервалов. | Команда принимает только один адрес, не принимает интервалов. | ||
Строка 611: | Строка 643: | ||
'''Команда y''' | '''Команда y''' | ||
− | Эта команда заменяет символы из секции ОБРАЗЕЦ символами секции ЗАМЕНА, работая как программа ''tr''. | + | Эта команда заменяет символы из секции <span style="color:red"><u>''ОБРАЗЕЦ''</u></span> символами секции <span style="color:green"><u>''ЗАМЕНА''</u></span>, работая как программа ''tr''. |
− | + | <source lang="bash"> | |
− | + | $ echo Автомобиль — наследие прошлого | sed 'y/Авто/Паро/' | |
− | + | Паромобиль — наследие прошлого | |
− | + | </source> | |
− | Команда ''y'' работает, только если количество символов в ОБРАЗЦЕ равно количеству символов в ЗАМЕНЕ. | + | Команда '''y''' работает, только если количество символов в <span style="color:red"><u>''ОБРАЗЦЕ''</u></span> равно количеству символов в <span style="color:green"><u>''ЗАМЕНЕ''</u></span>. |
− | == Скрипты программы | + | == Скрипты программы sed == |
Для того, чтобы пользоваться редактором [[sed]] как полноценным текстовым редактором, необходимо освоить составление скриптов [[sed]]. Программа [[sed]] имеет собственный несложный язык программирования, позволяющий составлять скрипты, способные творить чудеса. | Для того, чтобы пользоваться редактором [[sed]] как полноценным текстовым редактором, необходимо освоить составление скриптов [[sed]]. Программа [[sed]] имеет собственный несложный язык программирования, позволяющий составлять скрипты, способные творить чудеса. | ||
− | Эта статья не может вместить описания скриптов [[sed]], как и | + | Эта статья не может вместить описания скриптов [[sed]], как и её автор не ставит себе задачу освоение языка программирования [[sed]]. В этой статье я делал акцент на использование редактора [[sed]] в командной строке, имея прицел на использование его в качестве фильтра в программных каналах (''pipes''). По этой причине я опустил многочисленные команды [[sed]], применяющиеся только в его скриптах. |
Существует множество любителей редактора [[sed]], и множество статей на тему скриптописания, в том числе и в Рунете. Так что для заинтересовавшихся этой замечательной программой не составит труда пополнить свои знания. | Существует множество любителей редактора [[sed]], и множество статей на тему скриптописания, в том числе и в Рунете. Так что для заинтересовавшихся этой замечательной программой не составит труда пополнить свои знания. | ||
− | === Программа | + | === Программа sed и символы кириллицы === |
Как видно из примеров в этой статье, программа [[sed]] на правильно русифицированной системе свободно владеет "великим и могучим" языком. | Как видно из примеров в этой статье, программа [[sed]] на правильно русифицированной системе свободно владеет "великим и могучим" языком. | ||
− | == Резюме программы | + | == Резюме программы sed == |
− | Программа [[sed]] | + | Программа [[sed]] — это многофункциональный редактор потока данных, незаменимый для: |
* Редактирования больших текстовых массивов | * Редактирования больших текстовых массивов | ||
* Редактирования файлов любой величины, когда последовательность редактирующих действий слишком сложна | * Редактирования файлов любой величины, когда последовательность редактирующих действий слишком сложна | ||
− | * Редактирования данных по мере их поступления, в том числе в режиме реального времени | + | * Редактирования данных по мере их поступления, в том числе в режиме реального времени — то есть в случаях, когда затруднительно или вовсе невозможно использовать интерактивные текстовые редакторы. |
− | Для освоения программы [[sed]] в полном | + | Для освоения программы [[sed]] в полном объёме потребуются недели или даже месяцы работы, так как для этого необходимо: |
* Изучить регулярные выражения | * Изучить регулярные выражения | ||
* Научиться писать скрипты [[sed]], освоив несложный язык программирования, применяющийся в этих скриптах | * Научиться писать скрипты [[sed]], освоив несложный язык программирования, применяющийся в этих скриптах | ||
− | С другой стороны, освоить несколько наиболее употребительных команд редактора [[sed]] не сложнее, чем любую команду | + | С другой стороны, освоить несколько наиболее употребительных команд редактора [[sed]] не сложнее, чем любую команду UNIX; надеюсь, данная статья поможет вам в этом. |
== Таблица соответствия спецсимволов == | == Таблица соответствия спецсимволов == | ||
− | Использование HEX-16 позволяет вставлять спецсимволы | + | Использование '''HEX-16''' позволяет вставлять спецсимволы |
{| class="wikitable" | {| class="wikitable" | ||
|- | |- | ||
! <span style="color:red">'''Символ в ASCII'''</span> !! <span style="color:green">'''Соответствие в HEX-16'''</span> !! <span style="color:red">'''Символ в ASCII'''</span> !! <span style="color:green">'''Соответствие в HEX-16'''</span> | ! <span style="color:red">'''Символ в ASCII'''</span> !! <span style="color:green">'''Соответствие в HEX-16'''</span> !! <span style="color:red">'''Символ в ASCII'''</span> !! <span style="color:green">'''Соответствие в HEX-16'''</span> | ||
|- | |- | ||
− | | style="text-align:center;" | ! || style="text-align:center;" | \x21 || style="text-align:center;" | " || style="text-align:center;" | \x22 | + | | style="text-align:center;" | '''!''' || style="text-align:center;" | \x21 || style="text-align:center;" | '''"''' || style="text-align:center;" | \x22 |
|- | |- | ||
− | | style="text-align:center;" | # || style="text-align:center;" | \x23 || style="text-align:center;" | $ || style="text-align:center;" | \x24 | + | | style="text-align:center;" | '''#''' || style="text-align:center;" | \x23 || style="text-align:center;" | '''$''' || style="text-align:center;" | \x24 |
|- | |- | ||
− | | style="text-align:center;" | % || style="text-align:center;" | \x25 || style="text-align:center;" | & || style="text-align:center;" | \x26 | + | | style="text-align:center;" | '''%''' || style="text-align:center;" | \x25 || style="text-align:center;" | '''&''' || style="text-align:center;" | \x26 |
|- | |- | ||
− | | style="text-align:center;" | ' || style="text-align:center;" | \x27 || style="text-align:center;" | ( || style="text-align:center;" | \x28 | + | | style="text-align:center;" | ''' ' ''' || style="text-align:center;" | \x27 || style="text-align:center;" | '''(''' || style="text-align:center;" | \x28 |
|- | |- | ||
− | | style="text-align:center;" | ) || style="text-align:center;" | \x29 || style="text-align:center;" |* || style="text-align:center;" |\x2A | + | | style="text-align:center;" | ''')''' || style="text-align:center;" | \x29 || style="text-align:center;" | '''*''' || style="text-align:center;" |\x2A |
|- | |- | ||
− | | style="text-align:center;" | + || style="text-align:center;" | \x2B || style="text-align:center;" | , || style="text-align:center;" | \x2C | + | | style="text-align:center;" | '''+''' || style="text-align:center;" | \x2B || style="text-align:center;" | ''',''' || style="text-align:center;" | \x2C |
|- | |- | ||
− | | style="text-align:center;" | - || style="text-align:center;" | \x2D || style="text-align:center;" | . || style="text-align:center;" | \x2E | + | | style="text-align:center;" | '''-''' || style="text-align:center;" | \x2D || style="text-align:center;" | '''.''' || style="text-align:center;" | \x2E |
|- | |- | ||
− | | style="text-align:center;" | / || style="text-align:center;" | \x2F || style="text-align:center;" | 0 || style="text-align:center;" | \x30 | + | | style="text-align:center;" | '''/''' || style="text-align:center;" | \x2F || style="text-align:center;" | '''0''' || style="text-align:center;" | \x30 |
|- | |- | ||
− | | style="text-align:center;" | 1 || style="text-align:center;" | \x31 || style="text-align:center;" | 2 || style="text-align:center;" | \x32 | + | | style="text-align:center;" | '''1''' || style="text-align:center;" | \x31 || style="text-align:center;" | '''2''' || style="text-align:center;" | \x32 |
|- | |- | ||
− | | style="text-align:center;" | 3 || style="text-align:center;" | \x33 || style="text-align:center;" | 4 || style="text-align:center;" | \x34 | + | | style="text-align:center;" | '''3''' || style="text-align:center;" | \x33 || style="text-align:center;" | '''4''' || style="text-align:center;" | \x34 |
|- | |- | ||
− | | style="text-align:center;" | 5 || style="text-align:center;" | \x35 || style="text-align:center;" | 6 || style="text-align:center;" | \x36 | + | | style="text-align:center;" | '''5''' || style="text-align:center;" | \x35 || style="text-align:center;" | '''6''' || style="text-align:center;" | \x36 |
|- | |- | ||
− | | style="text-align:center;" | 7 || style="text-align:center;" | \x37 || style="text-align:center;" | 8 || style="text-align:center;" | \x38 | + | | style="text-align:center;" | '''7''' || style="text-align:center;" | \x37 || style="text-align:center;" | '''8''' || style="text-align:center;" | \x38 |
|- | |- | ||
− | | style="text-align:center;" | 9 || style="text-align:center;" | \x39 || style="text-align:center;" | : || style="text-align:center;" | \x3A | + | | style="text-align:center;" | '''9''' || style="text-align:center;" | \x39 || style="text-align:center;" | ''':''' || style="text-align:center;" | \x3A |
|- | |- | ||
− | | style="text-align:center;" | ; || style="text-align:center;" | \x3B || style="text-align:center;" | < || style="text-align:center;" | \x3C | + | | style="text-align:center;" | ''';''' || style="text-align:center;" | \x3B || style="text-align:center;" | '''<''' || style="text-align:center;" | \x3C |
|- | |- | ||
− | | style="text-align:center;" | = || style="text-align:center;" | \x3D || style="text-align:center;" | > || style="text-align:center;" | \x3E | + | | style="text-align:center;" | '''=''' || style="text-align:center;" | \x3D || style="text-align:center;" | '''>''' || style="text-align:center;" | \x3E |
|- | |- | ||
− | | style="text-align:center;" | ? || style="text-align:center;" | \x3F || style="text-align:center;" | @ || style="text-align:center;" | \x40 | + | | style="text-align:center;" | '''?''' || style="text-align:center;" | \x3F || style="text-align:center;" | '''@''' || style="text-align:center;" | \x40 |
|- | |- | ||
− | | style="text-align:center;" | A || style="text-align:center;" | \x41 || style="text-align:center;" | B || style="text-align:center;" | \x42 | + | | style="text-align:center;" | '''A''' || style="text-align:center;" | \x41 || style="text-align:center;" | '''B''' || style="text-align:center;" | \x42 |
|- | |- | ||
− | | style="text-align:center;" | C || style="text-align:center;" | \x43 || style="text-align:center;" | D || style="text-align:center;" | \x44 | + | | style="text-align:center;" | '''C''' || style="text-align:center;" | \x43 || style="text-align:center;" | '''D''' || style="text-align:center;" | \x44 |
|- | |- | ||
− | | style="text-align:center;" | E || style="text-align:center;" | \x45 || style="text-align:center;" | F || style="text-align:center;" | \x46 | + | | style="text-align:center;" | '''E''' || style="text-align:center;" | \x45 || style="text-align:center;" | '''F''' || style="text-align:center;" | \x46 |
|- | |- | ||
− | | style="text-align:center;" | G || style="text-align:center;" | \x47 || style="text-align:center;" | H || style="text-align:center;" | \x48 | + | | style="text-align:center;" | '''G''' || style="text-align:center;" | \x47 || style="text-align:center;" | '''H''' || style="text-align:center;" | \x48 |
|- | |- | ||
− | | style="text-align:center;" | I || style="text-align:center;" | \x49 || style="text-align:center;" | J || style="text-align:center;" | \x4A | + | | style="text-align:center;" | '''I''' || style="text-align:center;" | \x49 || style="text-align:center;" | '''J''' || style="text-align:center;" | \x4A |
|- | |- | ||
− | | style="text-align:center;" | K || style="text-align:center;" | \x4B || style="text-align:center;" | L || style="text-align:center;" | \x4C | + | | style="text-align:center;" | '''K''' || style="text-align:center;" | \x4B || style="text-align:center;" | '''L''' || style="text-align:center;" | \x4C |
|- | |- | ||
− | | style="text-align:center;" | M || style="text-align:center;" | \x4D || style="text-align:center;" | N || style="text-align:center;" | \x4E | + | | style="text-align:center;" | '''M''' || style="text-align:center;" | \x4D || style="text-align:center;" | '''N''' || style="text-align:center;" | \x4E |
|- | |- | ||
− | | style="text-align:center;" | O || style="text-align:center;" | \x4F || style="text-align:center;" | P || style="text-align:center;" | \x50 | + | | style="text-align:center;" | '''O''' || style="text-align:center;" | \x4F || style="text-align:center;" | '''P''' || style="text-align:center;" | \x50 |
|- | |- | ||
− | | style="text-align:center;" | Q || style="text-align:center;" | \x51 || style="text-align:center;" | R || style="text-align:center;" | \x52 | + | | style="text-align:center;" | '''Q''' || style="text-align:center;" | \x51 || style="text-align:center;" | '''R''' || style="text-align:center;" | \x52 |
|- | |- | ||
− | | style="text-align:center;" | S || style="text-align:center;" | \x53 || style="text-align:center;" | T || style="text-align:center;" | \x54 | + | | style="text-align:center;" | '''S''' || style="text-align:center;" | \x53 || style="text-align:center;" | '''T''' || style="text-align:center;" | \x54 |
|- | |- | ||
− | | style="text-align:center;" | U || style="text-align:center;" | \x55 || style="text-align:center;" | V || style="text-align:center;" | \x56 | + | | style="text-align:center;" | '''U''' || style="text-align:center;" | \x55 || style="text-align:center;" | '''V''' || style="text-align:center;" | \x56 |
|- | |- | ||
− | | style="text-align:center;" | W || style="text-align:center;" | \x57 || style="text-align:center;" | X || style="text-align:center;" | \x58 | + | | style="text-align:center;" | '''W''' || style="text-align:center;" | \x57 || style="text-align:center;" | '''X''' || style="text-align:center;" | \x58 |
|- | |- | ||
− | | style="text-align:center;" | Y || style="text-align:center;" | \x59 || style="text-align:center;" | Z || style="text-align:center;" | \x5A | + | | style="text-align:center;" | '''Y''' || style="text-align:center;" | \x59 || style="text-align:center;" | '''Z''' || style="text-align:center;" | \x5A |
|- | |- | ||
− | | style="text-align:center;" | [ || style="text-align:center;" | \x5B || style="text-align:center;" | \ || style="text-align:center;" | \x5C | + | | style="text-align:center;" | '''[''' || style="text-align:center;" | \x5B || style="text-align:center;" | '''\''' || style="text-align:center;" | \x5C |
|- | |- | ||
− | | style="text-align:center;" | ] || style="text-align:center;" | \x5D || style="text-align:center;" | ^ || style="text-align:center;" | \x5E | + | | style="text-align:center;" | ''']''' || style="text-align:center;" | \x5D || style="text-align:center;" | '''^''' || style="text-align:center;" | \x5E |
|- | |- | ||
− | | style="text-align:center;" | _ || style="text-align:center;" | \x5F || style="text-align:center;" | ` || style="text-align:center;" | \x60 | + | | style="text-align:center;" | '''_''' || style="text-align:center;" | \x5F || style="text-align:center;" | '''`''' || style="text-align:center;" | \x60 |
|- | |- | ||
− | | style="text-align:center;" | a || style="text-align:center;" | \x61 || style="text-align:center;" | b || style="text-align:center;" | \x62 | + | | style="text-align:center;" | '''a''' || style="text-align:center;" | \x61 || style="text-align:center;" | '''b''' || style="text-align:center;" | \x62 |
|- | |- | ||
− | | style="text-align:center;" | c || style="text-align:center;" | \x63 || style="text-align:center;" | d || style="text-align:center;" | \x64 | + | | style="text-align:center;" | '''c''' || style="text-align:center;" | \x63 || style="text-align:center;" | '''d''' || style="text-align:center;" | \x64 |
|- | |- | ||
− | | style="text-align:center;" | e || style="text-align:center;" | \x65 || style="text-align:center;" | f || style="text-align:center;" | \x66 | + | | style="text-align:center;" | '''e''' || style="text-align:center;" | \x65 || style="text-align:center;" | '''f''' || style="text-align:center;" | \x66 |
|- | |- | ||
− | | style="text-align:center;" | g || style="text-align:center;" | \x67 || style="text-align:center;" | h || style="text-align:center;" | \x68 | + | | style="text-align:center;" | '''g''' || style="text-align:center;" | \x67 || style="text-align:center;" | '''h''' || style="text-align:center;" | \x68 |
|- | |- | ||
− | | style="text-align:center;" | i || style="text-align:center;" | \x69 || style="text-align:center;" | j || style="text-align:center;" | \x6A | + | | style="text-align:center;" | '''i''' || style="text-align:center;" | \x69 || style="text-align:center;" | '''j''' || style="text-align:center;" | \x6A |
|- | |- | ||
− | | style="text-align:center;" | k || style="text-align:center;" | \x6B || style="text-align:center;" | l || style="text-align:center;" | \x6C | + | | style="text-align:center;" | '''k''' || style="text-align:center;" | \x6B || style="text-align:center;" | '''l''' || style="text-align:center;" | \x6C |
|- | |- | ||
− | | style="text-align:center;" | | + | | style="text-align:center;" | '''m''' || style="text-align:center;" | \x6D || style="text-align:center;" | '''n''' || style="text-align:center;" | \x6E |
|- | |- | ||
− | | style="text-align:center;" | | + | | style="text-align:center;" | '''o''' || style="text-align:center;" | \x6F || style="text-align:center;" | '''p''' || style="text-align:center;" | \x70 |
|- | |- | ||
− | | style="text-align:center;" | | + | | style="text-align:center;" | '''q''' || style="text-align:center;" | \x71 || style="text-align:center;" | '''r''' || style="text-align:center;" | \x72 |
|- | |- | ||
− | | style="text-align:center;" | | + | | style="text-align:center;" | '''s''' || style="text-align:center;" | \x73 || style="text-align:center;" | '''t''' || style="text-align:center;" | \x74 |
|- | |- | ||
− | | style="text-align:center;" | | + | | style="text-align:center;" | '''u''' || style="text-align:center;" | \x75 || style="text-align:center;" | '''v''' || style="text-align:center;" | \x76 |
|- | |- | ||
− | | style="text-align:center;" | | + | | style="text-align:center;" | '''w''' || style="text-align:center;" | \x77 || style="text-align:center;" | '''x''' || style="text-align:center;" | \x78 |
|- | |- | ||
− | | style="text-align:center;" | | + | | style="text-align:center;" | '''y''' || style="text-align:center;" | \x79 || style="text-align:center;" | '''z''' || style="text-align:center;" | \x7A |
|- | |- | ||
− | | style="text-align:center;" | | + | | style="text-align:center;" | '''{''' || style="text-align:center;" | \x7B || style="text-align:center;" | '''<nowiki>|</nowiki>''' || style="text-align:center;" | \x7C |
|- | |- | ||
− | | style="text-align:center;" | | + | | style="text-align:center;" | '''}''' || style="text-align:center;" | \x7D || style="text-align:center;" | '''~''' || style="text-align:center;" | \x7E |
|- | |- | ||
− | | style="text-align:center;" | | + | | style="text-align:center;" | '''DEL''' || style="text-align:center;" | \x7F || || |
− | + | ||
− | + | ||
|} | |} | ||
Пример использования:<br /> | Пример использования:<br /> | ||
Требуется: заменить '''"hello",''' на '''"hello world",''' | Требуется: заменить '''"hello",''' на '''"hello world",''' | ||
<source lang="bash"> | <source lang="bash"> | ||
− | + | sed 's/\x22hello\x22\x2C/\x22hello world\x22\x2C/g' | |
</source> | </source> | ||
− | == | + | == Ссылки == |
− | + | За основу статьи взята информация с [http://open-club.ru/main/reading/HuMan_sed open-club.ru]<br /> | |
− | + | Таблица символов [http://defindit.com/ascii.html ASCII]<br /> | |
− | + | [https://habrahabr.ru/company/ruvds/blog/327530/ Bash-скрипты, часть 7: sed и обработка текстов]<br /> | |
− | + | [http://rus-linux.net/MyLDP/consol/sed.html Изучаем команды Linux: sed]<br /> | |
− | + | ||
− | + | ||
− | + | ||
− | + | ||
− | Таблица символов [http://defindit.com/ascii.html ASCII] | + |
Текущая версия на 10:34, 3 ноября 2017
Содержание
Введение
Команда sed - это редактор потока данных (Stream EDitor) для автоматического редактирования текстов. "Редактор потока" — в том смысле, что может редактировать входящий поток данных непрерывно, скажем, в составе программного канала (pipe). Автоматически — это значит, что, как только вы зададите правила редактирования, дальнейшее происходит без вашего утомительного участия. Другими словами, редактор sed не является интерактивным.
Программа sed сложнее, чем те команды, что мы уже успели рассмотреть в предыдущих статьях. В её составе арсенал собственных команд, поэтому, чтобы избежать тавтологии и путаницы, в этой статье команда sed впредь будет именоваться "программой" или "редактором", а команды редактора sed — просто командами.
Программа sed способна выполнять сложные задания, и нужно потратить время, чтобы научиться эти задания формулировать. Но наряду со сложными действиями, у команды sed есть простые, но весьма полезные возможности, освоить которые не труднее, чем прочие команды UNIX. Не позволяйте себе из-за сложности освоения всей программы, отказываться от её простых аспектов. Мы начнем от простого к сложному, так что вы всегда сможете понять, где следует остановиться.
Команда s — substitution (замена)
Программа sed имеет множество собственных команд. Большинство пользователей знают только команду s, и этого вполне хватает, чтобы работать с редактором sed.
Команда s заменяет ОБРАЗЕЦ на ЗАМЕНУ:
sed s/ОБРАЗЕЦ/ЗАМЕНА/
$ echo день | sed s/день/ночь/ ночь
Проще не бывает. А вот пример с вводом из файла zar.txt:
По утрам он делал зарядку. Молния — электрический заряд.
$ sed s/заряд/разряд/ zar.txt По утрам он делал разрядку. Молния — электрический разряд.
Я не брал выражение s/ОБРАЗЕЦ/ЗАМЕНА/ в кавычки, так как данный пример не нуждается в кавычках, но если бы в нём присутствовали метасимволы, то кавычки были бы обязательны. Чтобы не ломать себе каждый раз голову, и не ошибиться ненароком, всегда ставьте кавычки, лучше более "сильные" одинарные(' '), это хорошая привычка. Кашу маслом не испортишь. Я тоже во всех последующих примерах не буду манкировать кавычками.
Как мы видим, заменяющая команда s имеет четыре составляющих:
s — сама команда /.../.../ — разделитель ОБРАЗЕЦ — образец для поиска и последующей замены ЗАМЕНА — выражение, которое заменит собой ОБРАЗЕЦ, если таковой будет найден!
Прямой слэш (/) используется в качестве разделителя по традиции, так как предок программы sed — редактор ed использует их (как и редактор vi). В некоторых случаях такой разделитель весьма неудобен, например, когда надо менять пути (path) к директориям, которые тоже содержат прямой слэш (/usr/local/bin). В этом случае приходится разделять прямые слэши обратными:
sed 's/\/usr\/local\/bin/\/common\/bin/'
Это называется "частокол" и выглядит весьма уродливо, а главное, непонятно.
Уникальность программы sed в том, что она позволяет использовать любой разделитель, например знак подчёркивания:
$ echo день | sed s_день_ночь_ ночь
или двоеточие:
$ echo день | sed s:день:ночь: ночь
Если в поисках разделителя, который вам нравится, вы получаете сообщение "незавершённая команда `s' ", значит этот символ не годится в качестве разделителя, или вы просто забыли поставить один-два разделителя. В этой статье я вынужден использовать традиционный разделитель (/) чтобы не сбивать читателя с толку, но в случае необходимости стану использовать в качестве разделителя тильду (~).
Регулярные выражения (РВ)
(Regular expressions, regexp, RE)
Тема регулярных выражений настолько обширна, что ей посвящены целые книги (смотри ссылки в конце статьи). Тем не менее, говорить всерьёз о редакторе sed, не применяя регулярных выражений, также непродуктивно, как разговаривать о тригонометрии при помощи счётных палочек. Поэтому необходимо рассказать хотя бы о тех регулярных выражениях, которые часто используются с программой sed.
с — или любая другая буква. Большинство букв, цифр и прочих неспециальных символов считаются регулярными выражениями, представляющими сами себя.
* — Астериск, следующий за каким-либо символом или регулярным выражением, означает любое число (в том числе и нулевое) повторов этого символа или регулярного выражения.
\+ — Означает один или более повтор символа или регулярного выражения.
\? — Означает ни одного или один повтор.
\{i\} — Означает ровно i повторов.
\{i,j\} — Число повторов находится в интервале от i до j включительно.
\{i,\} — Число повторов больше или равно i.
\{,j\} — Число повторов меньше или равно j.
\(RE\) — Запомнить регулярное выражение или его часть с целью дальнейшего использования как единое целое. Например, \(а-я\)* будет искать любое сочетание любого количества (в том числе и нулевого) строчных букв.
. — Означает любой символ, в том числе символ новой строки.
^ — Означает нулевое выражение в начале строки. Другими словами, то, перед чем стоит этот знак, должно появляться в начале строки. Например, ^#include будет искать строки, начинающиеся с #include.
$ — То же, что и предыдущее, только относится к концу строки.
[СПИСОК] — Означает любой символ из СПИСКА. Например, [aeiou] будет искать любую английскую гласную букву.
[^СПИСОК] — Означает любой символ, кроме тех, что в списке. Например, [^aeiou] будет искать любую английскую согласную. Примечание: СПИСОК может быть интервалом, например [а-я], что будет означать любую строчную букву. Если нужно включить в СПИСОК ] (квадратную скобку) укажите её в списке первой; если нужно включить в СПИСОК - (дефис), то укажите его в списке первым или последним.
RE1\|RE2 — Означает РВ1 или РВ2.
RE1RE2 — Означает объединение регулярных выражений РВ1 и РВ2.
\n — Означает символ новой строки.
\$; \*; \.; \[; \\; \^ — Означают соответственно: $; *; .; [; \; ^
Внимание: Остальные условные обозначения на основе обратного слэша (\), принятые в языке С, не поддерживаются программой sed.
\1 \2 \3 \4 \5 \6 \7 \8 \9 — Означает соответствующую по счёту часть регулярного выражения, запомненную при помощи знаков \( и \).
Несколько примеров:
abcdef — Означает abcdef
'a*b — Означает ноль или любое количество букв 'а и одна буква b. Например, aaaaaab; ab; или b.
a\?b — Означает b или ab
a\+b\+ — Означает одну или больше букв а и одну или больше букв b. Например: ab; aaaab; abbbbb; или aaaaaabbbbbbb.
.* — Означает все символы на строке, на всех строках, включая пустые.
'.\+ — Означает все символы на строке, но только на строках, содержащих хотя бы один символ. Пустые строки не соответствуют данному регулярному выражению.
^main.*(.*) — Будет искать строки, начинающиеся со слова main, а также имеющие в своём составе открывающую и закрывающие скобки, причём перед и после открывающей скобки может находиться любое количество символов (а может и не находиться).
^# — Будет искать строки, начинающиеся со знака # (например комментарии).
\\$ — Будет искать строки, заканчивающиеся обратным слэшем (\).
[a-zA-Z_] — Любые буквы или цифры
[^ ]\+ — Означает один или любое количество любых символов, кроме пробела и табуляции. Обычно имеется в виду слово(В квадратной скобке, кроме символа ^, содержится ещё пробел и табуляция).
^.*A.*$ — Означает заглавную букву А точно в середине строки.
A.\{9\}$ — Означает заглавную букву А, точно десятую по счёту от конца строки.
^.\{,15\}A — Означает заглавную букву А, точно шестнадцатую по счёту от начала строки.
Теперь, когда мы познакомились с некоторыми регулярными выражениями, вернемся к команде s редактора sed.
Использование символа &, когда ОБРАЗЕЦ неизвестен "Как это неизвестен?", — спросите вы — "Ты разве не знаешь, что хочешь заменить?" Отвечу: я хочу взять в скобки любые цифры, найденные в тексте. Как это сделать? Ответ: применить символ &.
Символ & (амперсанд), будучи помещён в состав ЗАМЕНЫ, означает любой найденный в тексте ОБРАЗЦЕ. Например:
$ echo 1234 | sed 's/[0-9]*/(&)/' (1234)
Звёздочка (астериск) после интервала [0-9] нужна чтобы заменены были все цифры, встретившиеся в ОБРАЗЦЕ. Без неё получилось бы:
$ echo 1234 | sed 's/[0-9]/(&)/' (1)234
То есть в качестве ОБРАЗЦА взята была первая же найденная цифра.
Вот пример со вполне осмысленной нагрузкой: составим файл formula.txt:
a+432-10=n
и применим к нему команду:
$ sed 's/[0-9]*-[0-9]*/(&)/' formula.txt a+(432-10)=n
Математическая формула приобрела однозначный смысл.
Ещё символ амперсанда (&) можно использовать для удвоения ОБРАЗЦА:
$ echo 123 | sed "s/[0-9]*/& &/" 123 123
Тут есть одна тонкость. Если мы чуть усложним пример:
$ echo "123 abc" | sed "s/[0-9]*/& &/" 123 123 abc
как и следовало ожидать, удваиваются только цифры, так как в ОБРАЗЦЕ нет букв. Но если мы поменяем части текста местами:
$ echo "abc 123" | sed "s/[0-9]*/& &/" abc 123
то никакого удвоения цифр не получится. Это особенность регулярного выражения [0-9]* — оно ищет соответствия только в первом символе строки. Если мы хотим удвоения цифр, где бы они ни находились, нужно доработать регулярное выражение в ЗАМЕНЕ:
$ echo "abc defg 123" | sed "s/[0-9][0-9]*/& &/" abc defg 123 123
тогда цифры будут удваиваться, независимо от количества предшествующих "слов".
Использование условных знаков \(, \) и \1 для обработки части ОБРАЗЦА. Условные знаки \( и \) (escaped parentheses) применяются для запоминания части регулярного выражения.
Условный знак \1 означает первую запомненную часть, \2 — вторую, и так далее, вплоть до девяти запомненных частей (больше программа не поддерживает). Разберём пример:
$ echo abcd123 | sed 's/\([a-z]*\).*/\1/' abcd
Здесь \([a-z]*\) означает, что программа должна запомнить все буквенные символы в любом количестве; .* означает любое количество символов после первой запомненной части; а \1 означает , что мы хотим видеть только первую запомненную часть. Так и есть: в выводе программы мы видим только буквы и никаких цифр.
Для того, чтобы поменять слова местами, нужно запомнить два суб-ОБРАЗЦА, а потом поменять их местами:
$ echo глупый пингвин |sed 's/\([а-я]*\) \([а-я]*\)/\2 \1/' пингвин глупый
Здесь \2 означает второй суб-ОБРАЗЕЦ, а \1 — первый. Обратите внимание на интервал между первым выражением \([а-я]*\) и вторым выражением \([а-я]*\). Он необходим, чтобы были найдены два слова.
Знак \1 вовсе не обязан быть только в ЗАМЕНЕ, он может присутствовать также и в ОБРАЗЦЕ, например, когда мы хотим удалить дубликаты слов:
$ echo пингвин пингвин | sed 's/\([а-я]*\) \1/\1/' пингвин
Модификаторы замены команды s
Модификаторы замены ставятся после последнего разделителя. Эти модификаторы определяют действия программы в случае, если в строке нашлось более одного совпадения с ОБРАЗЦОМ, и каким образом производить замену.
Модификатор /g
Глобальная замена (Global replacement)
Программа sed, как и большинство утилит UNIX, при работе с файлами считывают по одной строке. Если мы приказываем заменить слово, программа заменит только первое совпавшее с ОБРАЗЦОМ слово на данной строке. Если мы хотим изменить каждое слово, совпавшее с ОБРАЗЦОМ, то следует ввести модификатор /g.
Без модификатора /g:
$ echo кот этот, был самый обычный кот | sed 's/кот/котёнок/' котёнок этот, был самый обычный кот
Редактор заменил только первое совпавшее слово.
А теперь с модификатором глобальной замены:
$ echo кот этот, был самый обычный кот | sed 's/кот/котёнок/g' котёнок этот, был самый обычный котёнок
Все совпадения в данной строке были заменены.
А если нужно изменить все слова, скажем взять их в скобки? Тогда на помощь снова придут регулярные выражения. Чтобы выбрать все буквенные символы, как верхнего, так и нижнего регистра, можно воспользоваться конструкцией [А-Яа-я], но в неё не попадут такие слова как "что-то" или "с'езд". Гораздо удобнее конструкция [^ ]*, которая соответствует всем символам, кроме пробела. Итак:
$ echo глупый пингвин робко прячет | sed 's/[^ ]*/(&)/g' (глупый) (пингвин) (робко) (прячет)
Как выбрать нужное совпадение из нескольких
Если не применять модификаторов, то программа sed заменит только первое совпавшее с ОБРАЗЦОМ слово. Если применить модификатор /g, то программа заменит каждое совпавшее слово.
А как можно выбрать одно из совпадений, если их несколько на строке? — При помощи уже знакомых нам условных знаков \( и \) запомнить суб-ОБРАЗЦЫ и выбрать нужный при помощи знаков \1 - \9.
$ echo глупый пингвин | sed 's/\([а-я]*\) \([а-я]*\)/\2 /' пингвин
В этом примере мы запомнили оба слова, и, поставив второе (пингвин) на первое место, первое (глупый) удалили, поставив в секции ЗАМЕНЫ вместо него пробел. Если мы поставим вместо пробела какое-либо слово, то оно заменит первое (глупый):
$ echo глупый пингвин | sed 's/\([а-я]*\) \([а-я]*\)/\2 умный /' пингвин умный
Числовой модификатор
Это одно/двух/трёх-значное число, которое ставится после последнего разделителя и указывает, какое по счёту совпадение подлежит замене.
$ echo очень глупый пингвин | sed 's/[а-я]*/хороший/2' очень хороший пингвин
В этом примере каждое слово является совпадением, и мы указали редактору, какое по счёту слово мы хотим заменить, поставив модификатор 2 после секции ЗАМЕНЫ.
Можно комбинировать цифровой модификатор с модификатором /g. Если нужно оставить неизменным первое слово, а второе и последующие заменить на слово "(удалено)", то команда будет такая:
$ echo очень глупый пингвин | sed 's/[а-я]*/(удалено)/2g' очень (удалено) (удалено)
Если нужно действительно удалить все последующие совпадения, кроме первого, то в секции ЗАМЕНЫ следует поставить пробел:
$ echo очень глупый пингвин | sed 's/[а-я]*/ /2g' очень
Или вовсе ничего не ставить:
$ echo очень глупый пингвин | sed 's/[^ ]*//2g' очень
Числовой модификатор может быть любым целым числом от 1 до 512. Например, если нужно поставить двоеточие после 80 символа каждой строки, то поможет команда:
$ sed 's/./&:/80' имя_файла
Модификатор /p - выдавать на стандартный выход (печатать - print)
Программа sed и так по умолчанию выдаёт результат на стандартный выход (например экран монитора). Этот модификатор применяется только с опцией sed -n, которая как раз блокирует вывод результата на экран.
Модификатор /w
Позволяет записывать результаты обработки текста в указанный файл:
$ sed 's/ОБРАЗЕЦ/ЗАМЕНА/w имя_файла
Модификатор /e (расширение GNU)
Позволяет указать команду шелла (не программы sed) в качестве ЗАМЕНЫ. Если соответствие ОБРАЗЦУ будет найдено, то оно будет заменено на вывод указанной в секции ЗАМЕНЫ команды. Пример:
$ echo ночь | sed 's/ночь/echo день/e' день
Модификаторы /I и /i (расширение GNU)
Делают процесс замены нечувствительным к регистру символов.
$ echo Night | sed 's/night/day/i' day
Комбинации модификаторов
Модификаторы можно комбинировать, когда это имеет смысл. При этом следует ставить модификатор w последним.
Условные обозначения (расширение GNU) Их всего пять:
\L — переводит символы ЗАМЕНЫ в нижний регистр \l — переводит следующий символ ЗАМЕНЫ в нижний регистр \U — переводит символы ЗАМЕНЫ в верхний регистр \u — переводит следующий символ ЗАМЕНЫ в верхний регистр \E — отменяет перевод, начатый \L или \U По очевидным причинам эти условные обозначения применяются по одиночке. Например:
$ echo глупый пингвин | sed 's/глупый/\u&/' Глупый пингвин
или:
$ echo маленький щенок | sed 's/[а-я]*/\u&/2' маленький Щенок
Мы рассмотрели почти все аспекты команды s редактора sed]. Теперь настала очередь рассмотреть опции этой программы.
Опции программы sed
Программа имеет на удивление мало опций. (Что несколько компенсирует избыток команд, модификаторов и прочих функций). Кроме общеизвестных опций --help (-h) и --version (-V), которые мы рассматривать не будем, их всего три:
Опция -e --expression=набор_команд
Один из способов выполнения нескольких команд - применение опции -e. Например:
sed -e 's/a/A/' -e 's/b/B/' имя_файла
Все предыдущие примеры в этой статье не требовали применения опции -e только потому, что содержали одну команду. Мы могли поставить в примерах опцию -e, это ничего бы не изменило.
Опция -f Если требуется выполнить большое количество команд, то удобнее записать их в файл и применить опцию -f:
sed -f sedscript имя-файла
Sedscript здесь — имя файла, содержащего команды. Этот файл называется скриптом программы sed (далее просто скрипт). Каждая команда скрипта должна занимать отдельную строку. Например:
# комментарий — Этот скрипт изменит все строчные гласные буквы на заглавные s/a/A/g s/e/E/g s/i/I/g s/o/O/g s/u/U/g
Назвать скрипт можно как угодно, важно не путать файл скрипта с обрабатываемым файлом.
Опция -n Программа sed -n не выводит ничего на стандартный выход. Чтобы получить вывод нужно специальное указание. Мы уже познакомились с модификатором /p, при помощи которого можно дать такое указание. Вспомним файл zar.txt:
$ sed 's/1-9/&/p' zar.txt По утрам он делал зарядку. Молния - электрический заряд.
Так как совпадений с ОБРАЗЦОМ не найдено (в файле нет цифр), то команда s с модификатором /p и знаком & в качестве ЗАМЕНЫ (напомню, что амперсанд означает сам ОБРАЗЕЦ), работает как команда cat.
Если ОБРАЗЕЦ будет найден в файле, то строки, содержащие ОБРАЗЕЦ, будут удвоены:
$ sed 's/зарядку/&/p' zar.txt По утрам он делал зарядку. По утрам он делал зарядку. Молния - электрический заряд.
Теперь добавим опцию -n:
$ sed -n 's/зарядк/&/p' zar.txt По утрам он делал зарядку.
Теперь наша программа работает, как команда grep — возвращает только строки, содержащие ОБРАЗЕЦ.
Выбор нужных элементов редактируемого текста
Используя лишь одну команду s, мы убедились в необыкновенно широких возможностях редактора sed. А ведь всё, что он делает, сводится к поиску и замене. Причём в процессе работы sed редактирует каждую строку поодиночке, не обращая внимания на другие. Было бы удобно ограничить круг строк, подлежащих изменению, например:
- Выбирать строки по номерам
- Выбирать строки в некотором диапазоне номеров
- Выбирать только строки, содержащие некое выражение
- Выбирать только строки между некоторыми выражениями
- Выбирать только строки от начала файла и до некоторого выражения
- Выбирать только строки от некоторого выражения и до конца файла
Программа sed умеет всё это и даже больше. Любая команда редактора sed может применяться адресно, в некотором диапазоне адресов, или с вышеперечисленными ограничениями круга строк. Адрес или ограничение должны непосредственно предшествовать команде:
sed 'адрес/ограничение команда'
Выбор строк по номерам
Это самый простой случай. Просто указываем номер нужной строки перед командой:
$ sed '4 s/[а-я]*//i' gumilev.txt Какая странная нега В ранних сумерках утра, В таянии вешнего снега, всём, что гибнет и мудро.
Или:
$ sed '3 s/В/(В)/' gumilev.txt Какая странная нега В ранних сумерках утра, (В) таянии вешнего снега, Во всём, что гибнет и мудро.
Выбор строк в диапазоне номеров
Диапазон указывается, как не удивительно, через запятую:
$ sed '2,3 s/В/(В)/' gumilev.txt Какая странная нега (В) ранних сумерках утра, (В) таянии вешнего снега, Во всём, что гибнет и мудро.
Если нужно указать диапазон до последней строки файла, а вы не знаете, сколько в нём строк, то воспользуйтесь знаком $:
$ sed '2,$ s/в/(в)/i' gumilev.txt Какая странная нега (в) ранних сумерках утра, (в) таянии вешнего снега, (в)о всём, что гибнет и мудро.
Выбор строк, содержащих некое выражение
Искомое выражение заключается в прямые слэши (/) и ставится перед командой:
$ sed '/утра/ s/в/(в)/i' gumilev.txt Какая странная нега (в) ранних сумерках утра, В таянии вешнего снега, Во всём, что гибнет и мудро.
Выбор строк в диапазоне между двумя выражениями
Также как и в случае с номерами строк, диапазон задается через запятую:
$ sed '/утра/,/мудро/ s/в/(в)/i' gumilev.txt Какая странная нега (в) ранних сумерках утра, (в) таянии вешнего снега, (в)о всём, что гибнет и мудро.
Выбор строк от начала файла и до некоего выражения
$ sed '1,/снега/ s/в/(в)/i' gumilev.txt Какая странная нега (в) ранних сумерках утра, (в) таянии вешнего снега, Во всём, что гибнет и мудро.
Выбор строк от некоего выражения и до конца файла
$ sed '/снега/,$ s/в/(в)/i' gumilev.txt Какая странная нега В ранних сумерках утра, (в) таянии вешнего снега, (в)о всем, что гибнет и мудро.
Другие команды редактора sed
Команда d (delete)
Удаляет из стандартного вывода указанные строки:
$ sed '2 d' gumilev.txt Какая странная нега В таянии вешнего снега, Во всем, что гибнет и мудро.
Причём чаще пишут проще (без пробела):
sed '2d' gumilev.txt
Все, что было сказано в предыдущем разделе о адресации строк, справедливо и для команды d (как и для почти всех команд редактора sed).
При помощи команды d удобно выбросить ненужную "шапку" какого-нибудь почтового сообщения:
$ sed '1,/^$/ d' имя_файла
(Удалить строки с первой и до первой пустой строки).
Избавится от комментариев в конфигурационном файле:
$ sed '/^#/ d' /boot/grub/menu.lst
И мало ли, где нужно удалить лишние строчки!
Команда p (print)
Английское слово "print" переводится как "печатать", что в русском языке ассоциируется с принтером, или, по крайней мере, с клавиатурой. На самом же деле, слово это в английском контексте зачастую означает просто вывод на экран монитора. Так что команда p ничего не печатает, а просто выводит на экран указанные строки.
Будучи применённой сама по себе, команда p удваивает строки в выводе (ведь программа sed по умолчанию выводит строку на экран, а команда p выводит ту же строку вторично).
$ echo у меня есть кот | sed 'p' у меня есть кот у меня есть кот
Этому свойству находится применение, например удвоить пустые строки для улучшения вида текста:
$ sed '/^$/ p имя_файла
Но истинное своё лицо команда p раскрывает в сочетании с опцией -n, которая, как вы помните, запрещает вывод строк на экран. Комбинируя опцию -n с командой p, можно получить в выводе только нужные строки.
Например, просмотреть строки с первой по десятую:
$ sed -n '1,10 p' имя_файла
Или только комментарии:
$ sed -n '/^#/ p' /boot/grub/menu.lst # GRUB configuration file '/boot/grub/menu.lst'. # generated by 'grubconfig'. Вск 23 Мар 2008 21:45:41 # # Start GRUB global section # End GRUB global section # Linux bootable partition config begins # Linux bootable partition config ends # Linux bootable partition config begins # Linux bootable partition config ends
Что весьма напоминает работу программы grep, с чем мы уже сталкивались, когда говорили об опции -n с модификатором /p. Но, в отличие от команды grep, редактор sed даёт возможность не только найти эти строки, но и изменить их, заменив, например, везде Linux на Unix:
$ sed -n '/^#/ p' /boot/grub/menu.lst | sed 's/Linux/Unix/' # GRUB configuration file '/boot/grub/menu.lst'. # generated by 'grubconfig'. Вск 23 Мар 2008 21:45:41 # # Start GRUB global section # End GRUB global section # Unix bootable partition config begins # Unix bootable partition config ends # Unix bootable partition config begins # Unix bootable partition config ends
Команда !
Иногда нужно бывает редактировать все строки, кроме тех, что соответствуют ОБРАЗЦУ, либо выбору. Символ восклицательного знака (!) инвертирует выбор. Например удалим все строки, кроме второй из четверостишия Гумилева:
$ sed '2 !d' gumilev.txt В ранних сумерках утра,
Или выберем все строки, кроме комментариев, из файла /boot/grub/menu.lst:
$ sed -n '/^#/ !p' /boot/grub/menu.lst default 1 timeout 20 gfxmenu (hd0,3)/boot/message title SuSe on (/dev/hda3) root (hd0,2) kernel /boot/vmlinuz root=/dev/hda3 ro vga=773 acpi=off title Linux on (/dev/hda4) root (hd0,3) kernel /boot/vmlinuz root=/dev/hda4 ro vga=0x317
Команда q (quit)
Команда q прекращает работу программы sed после указанной строки. Это удобно, если нужно прекратить редактирование после достижения определенного места в тексте:
$ sed '11 q' имя_файла
Эта команда закончит работу по достижению 11-й строки.
Команда q — одна из немногих команд sed, не принимающих диапазонов строк. Не может же команда прекратить работу 10 раз подряд, если мы введём:
sed '1,10 q'
Абсурд!
Команда w (write)
Подобно модификатору w команды s, эта команда позволяет записать вывод программы в файл:
$ sed -n '3,$ w gum.txt' gumilev.txt
Мы получим файл gum.txt, содержащий две последние строки четверостишия Гумилёва из файла gumilev.txt. Причём, если такой файл уже существует, то будет перезаписан. Если не ввести опцию -n, то программа, кроме создания файла gum.txt, еще и выведет на экран все содержание файла gumilev.txt.
Для работы в командной строке, удобнее пользоваться обычным перенаправлением вывода (> или >>), но в sed скриптах, вероятно, команда w найдёт своё применение.
Команда r (read)
Эта команда не только прочтёт указанный файл, но и вставит его содержимое в нужное место редактируемого файла. Для выбора "нужного места" используется уже знакомая нам адресация (по номерам строк, по выражениям, и проч.). Пример:
$ echo Из стихотворения Гумилева: | sed 'r gumilev.txt' Из стихотворения Гумилева: Какая странная нега В ранних сумерках утра, В таянии вешнего снега, Во всем, что гибнет и мудро.
Команда =
Выдаст номер указанной строки:
$ sed '/снега/=' gumilev.txt Какая странная нега В ранних сумерках утра, 3 В таянии вешнего снега, Во всём, что гибнет и мудро.
Или:
$ sed -n '/снега/=' gumilev.txt 3
Команда принимает только один адрес, не принимает интервалов.
Команда y
Эта команда заменяет символы из секции ОБРАЗЕЦ символами секции ЗАМЕНА, работая как программа tr.
$ echo Автомобиль — наследие прошлого | sed 'y/Авто/Паро/' Паромобиль — наследие прошлого
Команда y работает, только если количество символов в ОБРАЗЦЕ равно количеству символов в ЗАМЕНЕ.
Скрипты программы sed
Для того, чтобы пользоваться редактором sed как полноценным текстовым редактором, необходимо освоить составление скриптов sed. Программа sed имеет собственный несложный язык программирования, позволяющий составлять скрипты, способные творить чудеса.
Эта статья не может вместить описания скриптов sed, как и её автор не ставит себе задачу освоение языка программирования sed. В этой статье я делал акцент на использование редактора sed в командной строке, имея прицел на использование его в качестве фильтра в программных каналах (pipes). По этой причине я опустил многочисленные команды sed, применяющиеся только в его скриптах.
Существует множество любителей редактора sed, и множество статей на тему скриптописания, в том числе и в Рунете. Так что для заинтересовавшихся этой замечательной программой не составит труда пополнить свои знания.
Программа sed и символы кириллицы
Как видно из примеров в этой статье, программа sed на правильно русифицированной системе свободно владеет "великим и могучим" языком.
Резюме программы sed
Программа sed — это многофункциональный редактор потока данных, незаменимый для:
- Редактирования больших текстовых массивов
- Редактирования файлов любой величины, когда последовательность редактирующих действий слишком сложна
- Редактирования данных по мере их поступления, в том числе в режиме реального времени — то есть в случаях, когда затруднительно или вовсе невозможно использовать интерактивные текстовые редакторы.
Для освоения программы sed в полном объёме потребуются недели или даже месяцы работы, так как для этого необходимо:
- Изучить регулярные выражения
- Научиться писать скрипты sed, освоив несложный язык программирования, применяющийся в этих скриптах
С другой стороны, освоить несколько наиболее употребительных команд редактора sed не сложнее, чем любую команду UNIX; надеюсь, данная статья поможет вам в этом.
Таблица соответствия спецсимволов
Использование HEX-16 позволяет вставлять спецсимволы
Символ в ASCII | Соответствие в HEX-16 | Символ в ASCII | Соответствие в HEX-16 |
---|---|---|---|
! | \x21 | " | \x22 |
# | \x23 | $ | \x24 |
% | \x25 | & | \x26 |
' | \x27 | ( | \x28 |
) | \x29 | * | \x2A |
+ | \x2B | , | \x2C |
- | \x2D | . | \x2E |
/ | \x2F | 0 | \x30 |
1 | \x31 | 2 | \x32 |
3 | \x33 | 4 | \x34 |
5 | \x35 | 6 | \x36 |
7 | \x37 | 8 | \x38 |
9 | \x39 | : | \x3A |
; | \x3B | < | \x3C |
= | \x3D | > | \x3E |
? | \x3F | @ | \x40 |
A | \x41 | B | \x42 |
C | \x43 | D | \x44 |
E | \x45 | F | \x46 |
G | \x47 | H | \x48 |
I | \x49 | J | \x4A |
K | \x4B | L | \x4C |
M | \x4D | N | \x4E |
O | \x4F | P | \x50 |
Q | \x51 | R | \x52 |
S | \x53 | T | \x54 |
U | \x55 | V | \x56 |
W | \x57 | X | \x58 |
Y | \x59 | Z | \x5A |
[ | \x5B | \ | \x5C |
] | \x5D | ^ | \x5E |
_ | \x5F | ` | \x60 |
a | \x61 | b | \x62 |
c | \x63 | d | \x64 |
e | \x65 | f | \x66 |
g | \x67 | h | \x68 |
i | \x69 | j | \x6A |
k | \x6B | l | \x6C |
m | \x6D | n | \x6E |
o | \x6F | p | \x70 |
q | \x71 | r | \x72 |
s | \x73 | t | \x74 |
u | \x75 | v | \x76 |
w | \x77 | x | \x78 |
y | \x79 | z | \x7A |
{ | \x7B | | | \x7C |
} | \x7D | ~ | \x7E |
DEL | \x7F |
Пример использования:
Требуется: заменить "hello", на "hello world",
sed 's/\x22hello\x22\x2C/\x22hello world\x22\x2C/g'
Ссылки
За основу статьи взята информация с open-club.ru
Таблица символов ASCII
Bash-скрипты, часть 7: sed и обработка текстов
Изучаем команды Linux: sed