Все о тюнинге авто

Регулярные команды и команды с командой sed. Sed — Ай да Linux Wiki Sed примеры использования

Введение

Команда sed - это редактор потока данных (Stream EDitor) для автоматического редактирования текстов. "Редактор потока" - в том смысле, что может редактировать входящий поток данных непрерывно, скажем, в составе программного канала (pipe). Автоматически - это значит, что, как только вы зададите правила редактирования, дальнейшее происходит без вашего утомительного участия. Другими словами, редактор sed не является интерактивным.

Программа sed сложнее, чем те команды, что мы уже успели рассмотреть в предыдущих статьях цикла HuMan. В ее составе арсенал собственных команд, поэтому, дабы избежать тавтологии и путаницы, в этой статье команда sed впредь будет именоваться "программой" или "редактором", а команды редактора sed - просто командами.

Программа sed способна выполнять сложные задания, и нужно потратить время, чтобы научиться эти задания формулировать.

Но наряду со сложными действиями, у команды sed есть простые, но весьма полезные возможности, освоить которые не труднее, чем прочие команды Юникс. Не позволяйте себе из-за сложности освоения всей программы, отказываться от ее простых аспектов.

Мы начнем от простого к сложному, так что вы всегда сможете понять, где следует остановиться.

Команда s - substitution (замена)

Программа sed имеет множество собственных команд. Большинство пользователей знают только команду s, и этого вполне хватает, чтобы работать с редактором sed. Команда s заменяет ОБРАЗЕЦ на ЗАМЕНУ:

sed s/ОБРАЗЕЦ/ЗАМЕНА/

$ echo день | sed s/день/ночь/ (Enter) ночь

Проще не бывает. А вот пример с вводом из файла zar.txt:

По утрам он делал зарядку. Молния - электрический заряд. $ sed s/заряд/разряд/ zar.txt По утрам он делал разрядку. Молния - электрический разряд.

Я не брал выражение s/ОБРАЗЕЦ/ЗАМЕНУ/ в кавычки, так как данный пример не нуждается в кавычках, но если бы в нем присутствовали метасимволы, то кавычки были бы обязательны. Чтобы не ломать себе каждый раз голову, и не ошибиться ненароком, всегда ставьте кавычки, лучше более "сильные" одинарные, это хорошая привычка. Кашу маслом не испортишь. Я тоже во всех последующих примерах не буду манкировать кавычками.

Как мы видим, заменяющая команда s имеет четыре составляющих:

S сама команда /.../.../ разделитель ОБРАЗЕЦ образец для поиска и последующей замены ЗАМЕНА выражение, которое заменит собой ОБРАЗЕЦ, буде таковой найден.

Прямой слэш (/) используется в качестве разделителя по традиции, так как предок программы sed - редактор ed использует их (как и редактор vi). В некоторых случаях такой разделитель весьма неудобен, например, когда надо менять пути (path) к директориям, которые тоже содержат прямой слэш (/usr/local/bin). В этом случае приходится разделять прямые слэши обратными:

Sed "s/\/usr\/local\/bin/\/common\/bin/"

Это называется "частокол" и выглядит весьма уродливо, а главное, непонятно.

Уникальность программы sed в том, что она позволяет использовать любой разделитель, например знак подчеркивания:

$ echo день | sed s_день_ночь_ ночь

или двоеточие:

$ echo день | sed s:день:ночь: ночь

Если в поисках разделителя, который вам нравится, вы получаете сообщение "незавершенная команда `s"", значит этот символ не годится в качестве разделителя, или вы просто забыли поставить один-два разделителя.

В этой статье я вынужден использовать традиционный разделитель (/) чтобы не сбивать читателя с толку, но в случае необходимости стану использовать в качестве разделителя тильду (~).

Регулярные выражения (РВ)

(Regular expressions, regexp, RE)

Тема регулярных выражений настолько обширна, что ей посвящены целые книги (смотри ссылки в конце статьи). Тем не менее, говорить всерьез о редакторе sed, не применяя регулярных выражений, также непродуктивно, как разговаривать о тригонометрии при помощи счетных палочек. Поэтому необходимо рассказать хотя бы о тех регулярных выражениях, которые часто используются с программой sed.

с Или любая другая буква. Большинство букв, цифр и прочих неспециальных символов считаются регулярными выражениями, представляющими сами себя.

* Астериск, следующий за каким-либо символом или регулярным выражением, означает любое число (в том числе и нулевое) повторов этого символа или регулярного выражения.

\+ Означает один или более повтор символа или регулярного выражения.

\? Означает ни одного или один повтор.

\{i\} Означает ровно i повторов.

\{i,j\} Число повторов находится в интервале от i до j включительно.

\{i,\} Число повторов больше или равно i.

\{,j\ } Число повторов меньше или равно j.

\(RE\ ) Запомнить регулярное выражение или его часть с целью дальнейшего использования как единое целое. Например, \(а-я\)* будет искать любое сочетание любого количества (в том числе и нулевого) строчных букв.

. Означает любой символ, в том числе символ новой строки.

^ Означает нулевое выражение в начале строки. Другими словами, то, перед чем стоит этот знак, должно появляться в начале строки. Например, ^#include будет искать строки, начинающиеся с #include.

$ То же, что и предыдущее, только относится к концу строки.

[СПИСОК] Означает любой символ из СПИСКА. Например, будет искать любую английскую гласную букву.

[^СПИСОК] Означает любой символ, кроме тех, что в списке. Например, [^aeiou] будет искать любую согласную. Примечание: СПИСОК может быть интервалом, например [а-я], что будет означать любую строчную букву. Если нужно включить в СПИСОК ] (квадратную скобку) укажите ее в списке первой; если нужно включить в СПИСОК - (дефис), то укажите его в списке первым или последним.

RE1\|RE2 Означает РВ1 или РВ2.

RE1RE2 Означает объединение регулярных выражений РВ1 и РВ2.

\n Означает символ новой строки.

\$; \*; \.; \[; \\; \^ Означают соответственно: $; *; .; [; \; ^

Внимание: Остальные условные обозначения на основе обратного слэша (\), принятые в языке С, не поддерживаются программой sed.

\1 \2 \3 \4 \5 \6 \7 \8 \9 Означает соответствующую по счету часть регулярного выражения, запомненную при помощи знаков \(и \).

Несколько примеров:

abcdef Означает abcdef

a*b Означает ноль или любое количество букв а и одна буква b. Например, aaaaaab; ab; или b.

a\?b Означает b или ab

a\+b\+ Означает одну или больше букв а и одну или больше букв b. Например: ab; aaaab; abbbbb; или aaaaaabbbbbbb.

.* Означает все символы на строке, на всех строках, включая пустые.

.\+ Означает все символы на строке, но только на строках, содержащих хотя бы один символ. Пустые строки не соответствуют данному регулярному выражению.

^main.*(.*) Будет искать строки, начинающиеся со слова main, а также имеющие в своем составе открывающую и закрывающие скобки, причем перед и после открывающей скобки может находиться любое количество символов (а может и не находиться).

^# Будет искать строки, начинающиеся со знака # (например комментарии).

\\$ Будет искать строки, заканчивающиеся обратным слэшем (\).

Любые буквы или цифры

[^ ]\+ (В квадратной скобке, кроме символа ^, содержится еще пробел и табуляция) --Означает один или любое количество любых символов, кроме пробела и табуляции. Обычно имеется в виду слово.

^.*A.*$ Означает заглавную букву А точно в середине строки.

A.\{9\}$ Означает заглавную букву А, точно десятую по счету от конца строки.

^.\{,15\}A Означает заглавную букву А, точно шестнадцатую по счету от начала строки.

Теперь, когда мы познакомились с некоторыми регулярными выражениями, вернемся к команде s редактора sed.

Использование символа & когда ОБРАЗЕЦ неизвестен "Как это неизвестен?", - спросите вы - "Ты разве не знаешь, что хочешь заменить?" Отвечу: я хочу взять в скобки любые цифры, найденные в тексте. Как это сделать? Ответ: применить символ &.

Символ & (амперсанд), будучи помещен в состав ЗАМЕНЫ, означает любой найденный в тексте ОБРАЗЕЦ. Например:

$ echo 1234 | sed "s/*/(&)/" (1234)

Звездочка (астериск) после интервала нужна чтобы заменены были все цифры, встретившиеся в образце. Без нее получилось бы:

$ echo 1234 | sed "s//(&)/" (1)234

То есть в качестве образца взята была первая же найденная цифра.

Вот пример со вполне осмысленной нагрузкой: составим файл formula.txt:

A+432-10=n

и применим к нему команду:

$ sed "s/*-*/(&)/" formula.txt a+(432-10)=n

Математическая формула приобрела однозначный смысл.

Еще символ амперсанда можно использовать для удвоения ОБРАЗЦА:

$ echo 123 | sed "s/*/& &/" 123 123

Тут есть одна тонкость. Если мы чуть усложним пример:

$ echo "123 abc" | sed "s/*/& &/" 123 123 abc

как и следовало ожидать, удваиваются только цифры, так как в ОБРАЗЦЕ нет букв. Но если мы поменяем части текста местами:

$ echo "abc 123" | sed "s/*/& &/" abc 123

то никакого удвоения цифр не получится. Это особенность регулярного выражения * - оно ищет соответствия только в первом символе строки. Если мы хотим удвоения цифр, где бы они ни находились, нужно доработать регулярное выражение в ЗАМЕНЕ:

$ echo "abc defg 123" | sed "s/*/& &/" abc defg 123 123

тогда цифры будут удваиваться, независимо от количества предшествующих "слов".

Использование условных знаков \(, \) и \1 для обработки части ОБРАЗЦА Условные знаки \(и \) (escaped parentheses) применяются для запоминания части регулярного выражения.

Условный знак \1 означает первую запомненную часть, \2 - вторую, и так далее, вплоть до девяти запомненных частей (больше программа не поддерживает). Разберем пример:

$ echo abcd123 | sed "s/\(*\).*/\1/" abcd

Здесь \(*\) означает, что программа должна запомнить все буквенные символы в любом количестве; .* означает любое количество символов после первой запомненной части; а \1 означает, что мы хотим видеть только первую запомненную часть. Так и есть: в выводе программы мы видим только буквы и никаких цифр.

Для того, чтобы поменять слова местами, нужно запомнить два суб-ОБРАЗЦА, а потом поменять их местами:

$ echo глупый пингвин |sed "s/\([а-я]*\) \([а-я]*\)/\2 \1/" пингвин глупый

Здесь \2 означает второй суб-ОБРАЗЕЦ, а \1 -первый. Обратите внимание на интервал между первым выражением \([а-я]*\) и вторым выражением \([а-я]*\). Он необходим, чтобы были найдены два слова.

Знак \1 вовсе не обязан быть только в ЗАМЕНЕ, он может присутствовать также и в ОБРАЗЦЕ, например, когда мы хотим удалить дубликаты слов:

$ echo пингвин пингвин | sed "s/\([а-я]*\) \1/\1/" пингвин

Модификаторы замены команды s

Модификаторы замены ставятся после последнего разделителя. Эти модификаторы определяют действия программы в случае, если в строке нашлось более одного совпадения с ОБРАЗЦОМ, и каким образом производить замену.

Модификатор /g

Глобальная замена (Global replacement)

Программа sed, как и большинство утилит Юникс, при работе с файлами считывают по одной строке. Если мы приказываем заменить слово, программа заменит только первое совпавшее с ОБРАЗЦОМ слово на данной строке. Если мы хотим изменить каждое слово, совпавшее с образцом, то следует ввести модификатор /g.

Без модификатора /g:

$ echo кот этот, был самый обычный кот | sed "s/кот/котенок/" котенок этот, был самый обычный кот

Редактор заменил только первое совпавшее слово.

А теперь с модификатором глобальной замены:

$ echo кот этот, был самый обычный кот | sed "s/кот/котенок/g" котенок этот, был самый обычный котенок

Все совпадения в данной строке были заменены.

А если нужно изменить все слова, скажем взять их в скобки? Тогда на помощь снова придут регулярные выражения. Чтобы выбрать все буквенные символы, как верхнего, так и нижнего регистра, можно воспользоваться конструкцией [А-Яа-я], но в нее не попадут такие слова как "что-то" или "с"езд". Гораздо удобнее конструкция [^ ]*, которая соответствует всем символам, кроме пробела. Итак:

$ echo глупый пингвин робко прячет | sed "s/[^ ]*/(&)/g" (глупый) (пингвин) (робко) (прячет)

Как выбрать нужное совпадение из нескольких

Если не применять модификаторов, то программа sed заменит только первое совпавшее с ОБРАЗЦОМ слово. Если применить модификатор /g, то программа заменит каждое совпавшее слово. А как можно выбрать одно из совпадений, если их несколько на строке? - При помощи уже знакомых нам условных знаков \(и \) запомнить суб-ОБРАЗЦЫ и выбрать нужный при помощи знаков \1 - \9.

$ echo глупый пингвин | sed "s/\([а-я]*\) \([а-я]*\)/\2 /" пингвин

В этом примере мы запомнили оба слова, и, поставив второе (пингвин) на первое место, первое (глупый) удалили, поставив в секции ЗАМЕНЫ вместо него пробел. Если мы поставим вместо пробела какое-либо слово, то оно заменит первое (глупый):

$ echo глупый пингвин | sed "s/\([а-я]*\) \([а-я]*\)/\2 умный /" пингвин умный

Числовой модификатор

Это одно/двух/трех -значное число, которое ставится после последнего разделителя и указывает, какое по счету совпадение подлежит замене.

$ echo очень глупый пингвин | sed "s/[а-я]*/хороший/2" очень хороший пингвин

В этом примере каждое слово является совпадением, и мы указали редактору, какое по счету слово мы хотим заменить, поставив модификатор 2 после секции ЗАМЕНЫ.

Можно комбинировать цифровой модификатор с модификатором /g. Если нужно оставить неизменным первое слово, а второе и последующие заменить на слово "(удалено)", то команда будет такая:

$ echo очень глупый пингвин | sed "s/[а-я]*/(удалено)/2g" очень (удалено) (удалено)

Если нужно действительно удалить все последующие совпадения, кроме первого, то в секции ЗАМЕНЫ следует поставить пробел:

$ echo очень глупый пингвин | sed "s/[а-я]*/ /2g" очень

Или вовсе ничего не ставить:

$ echo очень глупый пингвин | sed "s/[^ ]*//2g" очень

Числовой модификатор может быть любым целым числом от 1 до 512. Например, если нужно поставить двоеточие после 80 символа каждой строки, то поможет команда:

$ sed "s/./&:/80" имя_файла

Модификатор /p - выдавать на стандартный выход (печатать - print)

Программа sed и так по умолчанию выдает результат на стандартный выход (например экран монитора). Этот модификатор применяется только с опцией sed -n, которая как раз блокирует вывод результата на экран.

Модификатор /w

Позволяет записывать результаты обработки текста в указанный файл:

$ sed "s/ОБРАЗЕЦ/ЗАМЕНА/w имя_файла

Модификатор /e (расширение GNU)

Позволяет указать команду шелла (не программы sed) в качестве ЗАМЕНЫ. Если соответствие ОБРАЗЦУ будет найдено, то оно будет заменено на вывод указанной в секции ЗАМЕНЫ команды. Пример:

$ echo ночь | sed "s/ночь/echo день/e" день

Модификаторы /I и /i (расширение GNU)

Делают процесс замены нечувствительным к регистру символов.

$ echo Night | sed "s/night/day/i" day

Комбинации модификаторов

Модификаторы можно комбинировать, когда это имеет смысл. При этом следует ставить модификатор w последним.

Условные обозначения (расширение GNU ) Их всего пять:

\L переводит символы ЗАМЕНЫ в нижний регистр \l переводит следующий символ ЗАМЕНЫ в нижний регистр \U переводит символы ЗАМЕНЫ в верхний регистр \u переводит следующий символ ЗАМЕНЫ в верхний регистр \E отменяет перевод, начатый \L или \U По очевидным причинам эти условные обозначения применяются по одиночке. Например:

$ echo глупый пингвин | sed "s/глупый/\u&/" Глупый пингвин

$ echo маленький щенок | sed "s/[а-я]*/\u&/2" маленький Щенок

Мы рассмотрели почти все аспекты команды s редактора sed. Теперь настала очередь рассмотреть опции этой программы.

Опции программы sed

Программа имеет на удивление мало опций. (Что несколько компенсирует избыток команд, модификаторов и прочих функций). Кроме общеизвестных опций --help (-h) и --version (-V), которые мы рассматривать не будем, их всего три:

Опция -e --expression=набор_команд

Один из способов выполнения нескольких команд - применение опции -e. Например:

Sed -e "s/a/A/" -e "s/b/B/" имя_файла

Все предыдущие примеры в этой статье не требовали применения опции -e только потому, что содержали одну команду. Мы могли поставить в примерах опцию -e, это ничего бы не изменило.

Опция -f Если требуется выполнить большое количество команд, то удобнее записать их в файл и применить опцию -f:

Sed -f sedscript имя-файла

Sedscript здесь - имя файла, содержащего команды. Этот файл называется скриптом программы sed (далее просто скрипт). Каждая команда скрипта должна занимать отдельную строку. Например:

# комментарий - Этот скрипт изменит все строчные гласные буквы на заглавные s/a/A/g s/e/E/g s/i/I/g s/o/O/g s/u/U/g

Назвать скрипт можно как угодно, важно не путать файл скрипта с обрабатываемым файлом.

Опция -n Программа sed -n не выводит ничего на стандартный выход. Чтобы получить вывод нужно специальное указание. Мы уже познакомились с модификатором /p, при помощи которого можно дать такое указание. Вспомним файл zar.txt:

$ sed "s/1-9/&/p" zar.txt По утрам он делал зарядку. Молния - электрический заряд.

Так как совпадений с ОБРАЗЦОМ не найдено (в файле нет цифр), то команда s с модификатором /p и знаком & в качестве ЗАМЕНЫ (напомню, что амперсанд означает сам ОБРАЗЕЦ), работает как команда cat.

Если ОБРАЗЕЦ будет найден в файле, то строки, содержащие ОБРАЗЕЦ, будут удвоены:

$ sed "s/зарядку/&/p" zar.txt По утрам он делал зарядку. По утрам он делал зарядку. Молния - электрический заряд.

Теперь добавим опцию -n:

$ sed -n "s/зарядк/&/p" zar.txt По утрам он делал зарядку.

Теперь наша программа работает как команда grep - возвращает только строки, содержащие ОБРАЗЕЦ.

Выбор нужных элементов редактируемого текста

Используя лишь одну команду s, мы убедились в необыкновенно широких возможностях редактора sed. А ведь все, что он делает, сводится к поиску и замене. Причем в процессе работы sed редактирует каждую строку поодиночке, не обращая внимания на другие. Было бы удобно ограничить круг строк, подлежащих изменению, например:

  • Выбирать строки по номерам
  • Выбирать строки в некотором диапазоне номеров
  • Выбирать только строки, содержащие некое выражение
  • Выбирать только строки между некоторыми выражениями
  • Выбирать только строки от начала файла и до некоторого выражения
  • Выбирать только строки от некоторого выражения и до конца файла

Программа sed умеет все это и даже больше. Любая команда редактора sed может применяться адресно, в некотором диапазоне адресов, или с вышеперечисленными ограничениями круга строк. Адрес или ограничение должны непосредственно предшествовать команде:

Sed "адрес/ограничение команда"

Выбор строк по номерам

Это самый простой случай. Просто указываем номер нужной строки перед командой:

$ sed "4 s/[а-я]*//i" gumilev.txt Какая странная нега В ранних сумерках утра, В таянии вешнего снега, всем, что гибнет и мудро.

$ sed "3 s/В/(В)/" gumilev.txt Какая странная нега В ранних сумерках утра, (В) таянии вешнего снега, Во всем, что гибнет и мудро.

Выбор строк в диапазоне номеров

Диапазон указывается, как не удивительно, через запятую:

$ sed "2,3 s/В/(В)/" gumilev.txt Какая странная нега (В) ранних сумерках утра, (В) таянии вешнего снега, Во всем, что гибнет и мудро.

Если нужно указать диапазон до последней строки файла, а вы не знаете, сколько в нем строк, то воспользуйтесь знаком $:

$ sed "2,$ s/в/(в)/i" gumilev.txt Какая странная нега (в) ранних сумерках утра, (в) таянии вешнего снега, (в)о всем, что гибнет и мудро.

Выбор строк, содержащих некое выражение

Искомое выражение заключается в прямые слэши (/) и ставится перед командой:

$ sed "/утра/ s/в/(в)/i" gumilev.txt Какая странная нега (в) ранних сумерках утра, В таянии вешнего снега, Во всем, что гибнет и мудро.

Выбор строк в диапазоне между двумя выражениями

Также как и в случае с номерами строк, диапазон задается через запятую:

$ sed "/утра/,/мудро/ s/в/(в)/i" gumilev.txt Какая странная нега (в) ранних сумерках утра, (в) таянии вешнего снега, (в)о всем, что гибнет и мудро.

Выбор строк от начала файла и до некоего выражения

$ sed "1,/снега/ s/в/(в)/i" gumilev.txt Какая странная нега (в) ранних сумерках утра, (в) таянии вешнего снега, Во всем, что гибнет и мудро.

Выбор строк от некоего выражения и до конца файла

$ sed "/снега/,$ s/в/(в)/i" gumilev.txt Какая странная нега В ранних сумерках утра, (в) таянии вешнего снега, (в)о всем, что гибнет и мудро.

Другие команды редактора sed

Команда d (delete)

Удаляет из стандартного вывода указанные строки:

$ sed "2 d" gumilev.txt Какая странная нега В таянии вешнего снега, Во всем, что гибнет и мудро.

Причем чаще пишут проще (без пробела):

Sed "2d" gumilev.txt

Все, что было сказано в предыдущем разделе о адресации строк, справедливо и для команды d (как и для почти всех команд редактора sed).

При помощи команды d удобно выбросить ненужную "шапку" какого-нибудь почтового сообщения:

$ sed "1,/^$/ d" имя_файла

(Удалить строки с первой и до первой пустой строки).

Избавится от комментариев в конфигурационном файле:

$ sed "/^#/ d" /boot/grub/menu.lst

И мало ли, где нужно удалить лишние строчки!

Команда p (print)

Английское слово "print" переводится как "печатать", что в русском языке ассоциируется с принтером, или, по крайней мере, с клавиатурой. На самом же деле, слово это в английском контексте зачастую означает просто вывод на экран монитора. Так что команда p ничего не печатает, а просто выводит на экран указанные строки.

Будучи примененной сама по себе, команда p удваивает строки в выводе (ведь программа sed по умолчанию выводит строку на экран, а команда p выводит ту же строку вторично).

$ echo у меня есть кот | sed "p" у меня есть кот у меня есть кот

Этому свойству находится применение, например удвоить пустые строки для улучшения вида текста:

$ sed "/^$/ p имя_файла

Но истинное свое лицо команда p раскрывает в сочетании с опцией -n, которая, как вы помните, запрещает вывод строк на экран. Комбинируя опцию -n с командой p, можно получить в выводе только нужные строки.

Например, просмотреть строки с первой по десятую:

$ sed -n "1,10 p" имя_файла

Или только комментарии:

$ sed -n "/^#/ p" /boot/grub/menu.lst # GRUB configuration file "/boot/grub/menu.lst". # generated by "grubconfig". Вск 23 Мар 2008 21:45:41 # # Start GRUB global section # End GRUB global section # Linux bootable partition config begins # Linux bootable partition config ends # Linux bootable partition config begins # Linux bootable partition config ends

Что весьма напоминает работу программы grep, с чем мы уже сталкивались, когда говорили об опции -n с модификатором /p. Но, в отличие от команды grep, редактор sed дает возможность не только найти эти строки, но и изменить их, заменив, например, везде Linux на Unix:

$ sed -n "/^#/ p" /boot/grub/menu.lst | sed "s/Linux/Unix/" # GRUB configuration file "/boot/grub/menu.lst". # generated by "grubconfig". Вск 23 Мар 2008 21:45:41 # # Start GRUB global section # End GRUB global section # Unix bootable partition config begins # Unix bootable partition config ends # Unix bootable partition config begins # Unix bootable partition config ends

Команда!

Иногда нужно бывает редактировать все строки, кроме тех, что соответствуют ОБРАЗЦУ, либо выбору. Символ восклицательного знака (!) инвертирует выбор. Например удалим все строки, кроме второй из четверостишия Гумилева:

$ sed "2 !d" gumilev.txt В ранних сумерках утра,

Или выберем все строки, кроме комментариев, из файла /boot/grub/menu.lst:

$ sed -n "/^#/ !p" /boot/grub/menu.lst default 1 timeout 20 gfxmenu (hd0,3)/boot/message title SuSe on (/dev/hda3) root (hd0,2) kernel /boot/vmlinuz root=/dev/hda3 ro vga=773 acpi=off title Linux on (/dev/hda4) root (hd0,3) kernel /boot/vmlinuz root=/dev/hda4 ro vga=0x317

Команда q (quit)

Команда q прекращает работу программы sed после указанной строки. Это удобно, если нужно прекратить редактирование после достижения определенного места в тексте:

$ sed "11 q" имя_файла

Эта команда закончит работу по достижению 11-й строки.

Команда q - одна из немногих команд sed, не принимающих диапазонов строк. Не может же команда прекратить работу 10 раз подряд, если мы введем:

Sed "1,10 q" Абсурд!

Команда w (write)

Подобно модификатору w команды s, эта команда позволяет записать вывод программы в файл:

$ sed -n "3,$ w gum.txt" gumilev.txt

Мы получим файл gum.txt, содержащий две последние строки четверостишия Гумилева из файла gumilev.txt. Причем, если такой файл уже существует, то будет перезаписан. Если не ввести опцию -n, то программа, кроме создания файла gum.txt, еще и выведет на экран все содержание файла gumilev.txt.

Для работы в командной строке, удобнее пользоваться обычным перенаправлением вывода (> или >>), но в sed скриптах, вероятно, команда w найдет свое применение.

Команда r (read)

Эта команда не только прочтет указанный файл, но и вставит его содержимое в нужное место редактируемого файла. Для выбора "нужного места" используется уже знакомая нам адресация (по номерам строк, по выражениям, и проч.). Пример:

$ echo Из стихотворения Гумилева: | sed "r gumilev.txt"

Из стихотворения Гумилева:

Какая странная нега В ранних сумерках утра, В таянии вешнего снега, Во всем, что гибнет и мудро.

Команда =

Выдаст номер указанной строки:

$ sed "/снега/=" gumilev.txt Какая странная нега В ранних сумерках утра, 3 В таянии вешнего снега, Во всем, что гибнет и мудро.

$ sed -n "/снега/=" gumilev.txt 3

Команда принимает только один адрес, не принимает интервалов.

Команда y

Эта команда заменяет символы из секции ОБРАЗЕЦ символами секции ЗАМЕНА, работая как программа tr .

$ echo Автомобиль - наследие прошлого | sed "y/Авто/Паро/" Паромобиль - наследие прошлого

Команда y работает, только если количество символов в ОБРАЗЦЕ равно количеству символов в ЗАМЕНЕ.

Скрипты программы sed

Для того, чтобы пользоваться редактором sed как полноценным текстовым редактором, необходимо освоить составление скриптов sed. Программа sed имеет собственный несложный язык программирования, позволяющий составлять скрипты, способные творить чудеса.

Эта статья не может вместить описания скриптов sed, как и ее автор не ставит себе задачу освоение языка программирования sed. В этой статье я делал акцент на использование редактора sed в командной строке, имея прицел на использование его в качестве фильтра в программных каналах (pipes). По этой причине я опустил многочисленные команды sed, применяющиеся только в его скриптах.

Существует множество любителей редактора sed, и множество статей на тему скриптописания, в том числе и в Рунете. Так что для заинтересовавшихся этой замечательной программой не составит труда пополнить свои знания.

Программа sed и символы кириллицы

Как видно из примеров в этой статье, программа sed на правильно русифицированной системе свободно владеет "великим и могучим" языком.

Резюме программы sed

Программа sed - это многофункциональный редактор потока данных, незаменимый для:

  • Редактирования больших текстовых массивов
  • Редактирования файлов любой величины, когда последовательность редактирующих действий слишком сложна
  • Редактирования данных по мере их поступления, в том числе в режиме реального времени - то есть в случаях, когда затруднительно или вовсе невозможно использовать интерактивные текстовые редакторы.

Для освоения программы sed в полном объеме потребуются недели или даже месяцы работы, так как для этого необходимо:

  • Изучить регулярные выражения
  • Научиться писать скрипты sed, освоив несложный язык программирования, применяющийся в этих скриптах

С другой стороны, освоить несколько наиболее употребительных команд редактора sed не сложнее, чем любую команду Юникс; надеюсь, данная статья поможет вам в этом.

Послесловие

До сих пор, в статьях цикла HuMan, я стремился хотя бы вкратце раскрыть каждую опцию, каждый параметр описываемой команды, так чтобы статья могла заменить маны. В дальнейшем я буду продолжать придерживаться этого принципа.

Данная статья является исключением, так как не описывает всех возможностей программы. Для полного их описания потребовалась бы не статья, а книга. Тем не менее, статья позволяет получить представление о редакторе sed и начать работать с этой удивительной программой, используя наиболее употребительные ее команды.

sed обрабатывает поток последовательно, строчка за строчкой, начиная с первой и кончая последней (конечно если в sed-скрипте не указано иного, например можно обрабатывать только первые строки, и завершить обработку после выполнения какого-нибудь условия), обычно каждая строка обрабатывается отдельно, в три этапа.

Важно

Нижеприведённая схема в дальнейшем будет часто упоминаться, к примеру "на первом этапе обработки строки" как раз и обозначает - первый этап из этой схемы.

Процедура 2.1. Обработка текста утилитой sed.

    На этом этапе строка загружается в буфер. Буфером называется выделенная sed область памяти, размер которой не ограничен (для GNU версии sed, ну конечно на практике размер ограничен объёмом оперативной, и swap-памяти).

    Загрузка заканчивается после чтения из потока символа новой строки (\n), или после завершения потока. При этом символ новой строки хотя и читается из потока, однако не пишется в буфер.

    Обработка строки.

    На этом этапе выполняется sed-скрипт, при этом содержимое буфера обычно изменяется. sed-скрипт состоит из особых sed-команд, каждая из которых представляет собой одну из букв латинского алфавита. Как обычно, малые и БОЛЬШИЕ буквы различаются: n и N это разные команды. Проще всего записывать sed-команды в командной строке, сразу после sed и её ключей, например:

    Sed -n "p;p;p"

    Для разделения команд используется точка с запятой (;).

    Предостережение

    Если вы пишете скрипты прямо после команды, то всегда заключайте их в одиночные "кавычки", дело в том, что только в этом случае оболочка не будет обрабатывать эти скрипты, в некоторых случаях допустимо использовать двойные кавычки, например если вы хотите внести внутрь скрипта shell-переменную, однако при этом будьте внимательны: shell попытается раскрыть многие служебные символы в вашем скрипте.

    Подсказка

    Если внутри скрипта вам необходимо использовать символ одиночной кавычки, то вы можете воспользоваться её шестнадцатеричным представлением: «\x27 » .

    Команды sed могут изменить содержимое буфера, но кроме того, как и в других языках программирования, в sed-скриптах можно применять команды условных и безусловных переходов (b , t , и T ), имеются также команды прерывания работы (q и Q ). Некоторые команды воздействуют не только на этап обработки строки, но и на другие этапы, кроме того, внутри скрипта можно ввести ещё одну или несколько строк из входного потока (как на первом этапе).

    Важно

    Нужно понимать, что sed работает с потоком, а не с файлом, она просматривает строки только последовательно, с начала и до конца. Потому невозможно прочитать десятую строку после двадцатой - если в этом есть необходимость, следует сохранить десятую строку во время её обработки. Так-же невозможно узнать, что данная строка является например предпоследней, не смотря на то, что вполне можно определить номер строки от начала потока. Можно выяснить, что данная строка является последней, но только в момент её обработки.

    Перед (почти)любой командой sed вы можете поставить адресное выражение, в таком случае, команда выполнится тогда, и только тогда, когда адресное выражение истинно. В качестве адресного выражения можно использовать

    Номер строки Тогда команда выполнится только для той строки, чей номер указан Диапазон номеров строк Команда выполнится для всех строк из указанного диапазона(диапазон указывается через запятую, вместо второго числа допустимо указывать `$", этот символ обозначает последнюю строку. Регулярное выражение

    Команда выполнится только если в буфере найдётся данное RE.

    Комбинированный диапазон.

    Можно создать и более сложное условие, к примеру от заданного RE, и до строки $ (до конца). Или от первого RE до второго (включительно).

    Замечание

    Строки в sed нумеруются с единицы. Сначала производится поиск строки, в которой есть совпадение с первым адресом диапазона, для этой строки выполняется команда. Начиная со следующей строки производится поиск второго адреса диапазона. Однако, для первой строки такое поведение можно изменить: если записать не `1,RE", а `0,RE", то регулярное выражение будет проверятся так-же и в первой строке.

    Подсказка

    Если вы хотите, что-бы одно адресное выражение действовало сразу не несколько команд, тогда заключите эти команды в {фигурные скобки}.

    Замечание

    Допустимы вложенные блоки, кроме того, допустимо внутри блока использовать адресные выражения в т.ч. и для вложенных блоков.

    Кроме написания скрипта сразу после команды, вы можете записать его в файл, для выполнения такого файла можно использовать опцию -f , например:

    $ sed -f my_script.sed test_file.txt

    Эта команда выполнит sed-скрипт my_script.sed для файла test_file.txt . Кроме того, используя sha-bang

    #!/bin/sed -f

    вы можете заставить исполнять ваши скрипты оболочку, например, если вы дописали в ваш скрипт в первую строку этот sha-bang, и кроме того у вас есть право выполнения этого скрипта, то прошлый пример можно выполнить так:

    $ ./my_script.sed test_file.txt

    Предостережение

    Первое время, я-бы рекомендовал записывать в файлы все sed-скрипты из тех, в которых более одной команды. Во первых их понять намного проще, во вторых они таким образом сохраняются, и в третьих их намного удобнее редактировать. Кроме того, в sed-файлах вы можете использовать любые кавычки. Следует так-же учесть, что некоторые команды необходимо записывать последними в строке, что часто невозможно, если строка одна. И наконец, в файле вы можете использовать комментарии, которые позволят вам быстро приспособить уже готовый скрипт для нового применения.
  1. Вывод буфера

    После завершения работы скрипта sed выводит содержимое буфера в выходной поток. Однако, это далеко не всегда необходимо, если вам это не нужно, воспользуйтесь опцией -n , которая блокирует вывод буфера. Кроме того, на этом же этапе происходит вывод и некоторой другой информации, если в скрипте выполнились команды a , c , и/или i . Эти команды тоже выводят информацию в выходной поток, но не во время исполнения, а в этом этапе. Существуют три команды (d , D и Q ), которые так-же подавляют вывод буфера на этом этапе.

Первые sed-скрипты.

Для начала изучения sed нам потребуется какой-нибудь простой текст, например этот:

Пример 2.1. Текст используемый для проверки скриптов.

Вы можете пожертвовать небольшую сумму яндекс-денег на счёт 41001666004238 для оплаты хостинга, интернета, и прочего. Это конечно добровольно, однако это намного улучшит данный документ (у меня будет больше времени для его улучшения). На самом деле, проект часто находится на грани закрытия, ибо никаких денег никогда не приносил, и приносить не будет. Вы можете мне помочь. Спасибо.

И я не могу найти хорошо написанные учебники.

Позвольте мне сказать, что я работал с регулярным выражением на других языках (Python, JavaScript, Java), поэтому это не должно быть проблемой.

Итак, вот мои вопросы («теоретические» и более практичные):

    регулярные выражения, используемые в sed точно такие же, как те, которые используются Python / JS / Java? Я читал о BRE и EREs, но насколько они различны? Не должно ли ERE быть расширением BRE?

    если я хочу, скажем, просто извлечь что-то из выходного канала, что такое синтаксис sed ?

Подробности по второму вопросу: скажем, у меня есть выход uptime с sed:

Uptime | sed ...

Учитывая пример выхода от uptime: 18:13 up 5:12, 2 users, load averages: 0,45 0,37 0,40 , я хочу разобрать единовременное время работы в виде двух разделенных номеров (часы и минуты) , а затем я хочу отобразить их в виде xxhyym (xx – часы, yy минуты).

И чтобы закончить, вот что я сделал бы на Python:

Hh, mm = re.match(r"\s+ up \s+(\d{1,2}):(\d{1,2})").groups() print "%sh%sm" % (hh, mm)

2 Solutions collect form web for “Регулярные команды и команды с командой sed”

Традиционные инструменты unix поддерживают BRE или ERE (базовые или расширенные регулярные выражения). POSIX кодирует оба. Википедия объясняет их. Большинство современных инструментов расширяют ERE, часто с дополнительными функциями, впервые представленными в Perl (который известен как PCRE).

ERE расширяет функциональность BRE, но не расширяет синтаксис. В BRE только символы \[.*^$ Имеют особое значение, а некоторые операторы, такие как группировка \(…\) используют обратную косую черту. В ERE +?|() Также являются специальными, а обратная косая черта, сопровождаемая не-буквенно-цифровым символом, никогда не бывает особенной.

BRE не имеет Python / PCRE \d и \s . Вы можете выразить эти наборы символов с помощью традиционных наборов конструкций и классов символов: \d is [[:digit:]] и \s is [[:space:]] . Обратите внимание на двойные скобки: один для указания набора символов и один для обозначения класса символов; например, «буквы, тире или символы подчеркивания» можно записать [-_[:alpha:]] .

У BRE нет оператора + (некоторые реализации sed поддерживают \+ как расширение синтаксиса BRE); X+ совпадает с XX* . Для групп и совпадений требуется дополнительная обратная косая черта.

Таким образом, BRE эквивалент Python \s+ up \s+(\d{1,2}):(\d{1,2}) является [[:space:]][[:space:]]* up [[:space:]][[:space:]]*\([[:digit:]]\{1,2\}\):\([[:digit:]]\{1,2\}\) . Обратите внимание, что вы слишком много пробегаете: \s+ и пробел означает как минимум два пробельных символа.

Вам нужно будет сопоставить всю строку, так как команда sed переписывает строку. Не существует отдельной команды для записи строки, собранной из сохраненных групп. Исправляя лишние пробелы, аналог вашего фрагмента Python:

Uptime | sed "s/^.*[[:space:]][[:space:]]*up[[:space:]][[:space:]]*\([[:digit:]]\{1,2\}\):\([[:digit:]]\{1,2\}\).*$/\1h\2m/"

В отличие от фрагмента Python, это извлекает первый матч, а не последний матч, но здесь это не имеет значения.

Вывод uptime содержит символы пробела и цифры ASCII, поэтому вы можете упростить регулярное выражение:

Uptime | sed "s/^.* up *\(\{1,2\}\):\(\{1,2\}\).*$/\1h\2m/"

Это будет соответствовать только выходному uptime если машина была меньше 1 дня. Я оставлю соответствующее количество дней в качестве упражнения. (Подсказка: напишите два выражения: sed -es/AS ABOVE/\1h\2m/ -e "s/EXERCISE/\1d\2h\3m/")

Каждый инструмент использует (в основном) собственную библиотеку RE. Даже среди разных версий sed вы найдете здесь различия. Два популярных стандарта – стандартные регулярные выражения POSIX, многие из которых принимают их (по крайней мере, с некоторыми опциями), другой популярный набор – это библиотека регулярного выражения Perl Compatible Regular Expression (PCRE). Но последние немного отличаются от «ванильных» RE …

В твоем случае:

Uptime | sed -e "s/^ \(\):\(\).*$/\1h\2m/"

(Пробовали на Fedora 18, sed-4.2.1-10.fc18.x86_64, GNU sed).

Обновление: что не так с большой документацией на главной странице GNU sed ? Или этот учебник? Информационная документация для GNU sed немного длинная, но полная.


Автор: Rares Aioanei
Дата публикации: 19 ноября 2011 года
Перевод: А. Кривошей
Дата перевода: июль 2012 г.

Николай Игнатушко проверил на GNU sed version 4.2.1 в дистрибутиве Gentoo все команды, упомянутые в этой статье. Не все скрипты хорошо отрабатывали на версии GNU sed. Но дело касалось мелочей, которые исправлены. Только скрипт по замене hill на mountains пришлось существенно переделать.

1. Введение

Добро пожаловать во вторую часть нашей серии, которая посвящена sed, версии GNU. Существует несколько версий sed, которые доступны на разных платформах, но мы сфокусируемся на GNU sed версии 4.x. Многие из вас слышали о sed, или уже использовали его, скорее всего в качестве инструмента замены. Но это только одно из предназначений sed, и мы постараемся показать вам все аспекты использования этой утилиты. Его название расшифровывается как "Stream EDitor" и слово "stream" (поток) в данном случае может означать файл, канал, или просто stdin. Мы надеемся, что у вас уже есть базовые знания о Linux, а если вы уже работали с регулярными выражениями, или по крайней мере знаете, что это такое, то все для вас будет намного проще. Объем статьи не позволяет включить в нее полное руководство по регулярным выражениям, вместо этого мы озвучим базовые концепции и дадим большое количество примеров использования sed.

2. Установка

Здесь не нужно много рассказывать. Скорее все sed у вас уже установлен, так как он используется различными системными скриптами, а также пользователями Linux, которые хотят повысить эффективность своей работы. Вы можете узнать, какая версия sed у вас установлена, с помощью команды:

$ sed --version

В моей системе эта команда показывает, что у меня установлен GNU sed 4.2.1 плюс дает ссылку на домашнюю страницу программы и другие полезные сведения. Пакет называется "sed" независимо от дистрибутива, кроме Gentoo, где он присутствует неявно.

3. Концепции

Перед тем, как идти дальше, мы считаем важным акцентировать внимание на том, что делает "sed", так как словосочетание "потоковый редактор" мало что говорит о его назначении. sed принимает на входе текст, выполняет заданные операции над каждой строкой (если не задано другое) и выводит модифицированный текст. Указанными операциями могут быть добавление, вставка, удаление или замена. Это не так просто, как выглядит: предупреждаю, что имеется большое количество опций и их комбинаций, которые могут сделать команду sed очень трудной для понимания. Поэтому мы рекомендуем вам изучить основы регулярных выражений, чтобы понимать, как это работает. Перед тем, как приступить к руководству, мы хотели бы поблагодарить Eric Pement и других за вдохновление и за то, что он сделал для всех, кто хочет изучать и использовать sed.

4. Регулярные выражения

Так как команды (скрипты) sed для многих остаются загадкой, мы чувствуем, что наши читатели должны понимать базовые концепции, а не слепо копировать и вставлять команды, значения которых они не понимают. Когда человек хочет понять, что представляют собой регулярные выражения, ключевым словом является "соответствие", или, точнее, "шаблон соответствия". Например, в отчете для своего департамента вы написали имя Nick, обращаясь к сетевому архитектору. Но Nick ушел, а на его место пришел John, поэтому теперь вы должны заменить слово Nick на John. Если файл с отчетом называется report.txt, вы должны выполнить следующую команду:

$ cat report.txt | sed "s/Nick/John/g" > report_new.txt

По умолчанию sed использует stdout, вы можете использовать оператор перенаправления вывода, как показано в примере выше. Это очень простой пример, но мы проиллюстрировали несколько моментов: мы ищем все соответствия шаблону "Nick" и заменяем во всех случаях на "John". Отметим, что sed призводит поиск с учетом регистра, поэтому будьте внимательны и проверьте выходной файл, чтобы убедиться, что все замены были выполнены. Приведенный выше пример можно было записать и так:

$ sed "s/Nick/John/g" report.txt > report_new.txt

Хорошо, скажете вы, но где же здесь регулярные выражения? Да, мы хотели сначала показать пример, а теперь начинается самая интересная часть.
Если вы не уверены, написали ли вы "nick" или "Nick", и хотите предусмотреть оба случая, необходимо использовать команду sed "s/Nick|nick/John/g". Вертикальная черта имеет значение, которое вы должны знать, если изучали C, то есть ваше выражение будет соответствовать "nick" или "Nick". Как вы увидите ниже, канал может использоваться и другими способами, но смысл остается тот же самый. Другие операторы, широко использующиеся в регулярных выражениях - это "?", который соответствует повторению предшествующего символа ноль или один раз (то есть flavou?r будет соответствовать flavor и flavour), "*" - ноль или более раз, "+" - один или более раз. "^" соответствует началу строки, а "$" - наоборот. Если вы - пользователь vi или vim, многие вещи покажутся вам знакомыми. В конце концов, эти утилиты, вместе с awk и С уходят корнями в ранние дни UNIX. Мы не будем больше говорить на эту тему, так как проще понять значение этих символов на примерах, но вы должны знать, что существуют различные реализации регулярных выражений: POSIX, POSIX Extended, Perl, а также различные реализации нечетких регулярных выражений, гарантирующие вам головную боль.

5. Примеры использования sed

Синтаксис команды Описание

Sed "s/Nick/John/g" report.txt

Заменяет каждое вхождение Nick на John в файле report.txt

Sed "s/Nick\|nick/John/g" report.txt

Заменяет каждое вхождение Nick или nick на John.

Sed "s/^/ /" file.txt > file_new.txt

Добавляет 8 пробелов слева от текста для улучшения качества печати.

Sed -n "/Of course/,/attention you pay/p" myfile

Выводит все абзацы, начинающиеся с "Of course" и заканчивающиеся на "attention you pay".

Sed -n 12,18p file.txt

Выводит только строки 12-18 файла file.txt

Sed 12,18d file.txt

Выводит весь файл file.txt за исключением строк с 12 по 18
Вставляет пустую строку после каждой строки в file.txt

Sed -f script.sed file.txt

Записывает все команды в script.sed и выполняет их.

Sed "5!s/ham/cheese/" file.txt

Заменяет ham на cheese в file.txt за исключением 5-й строки

Sed "$d" file.txt

Удаляет последнюю строку

Sed -n "/\{3\}/p" file.txt

Печатает только строки с тремя последовательными цифрами

Sed "/boom/s/aaa/bb/" file.txt

Если найден "boom", заменить aaa на bb

Sed "17,/disk/d" file.txt

Удаляет все строки, начиная с 17-й, до "disk". Если строк с "disk" несколько, удаляет до первой из них.

Echo ONE TWO | sed "s/one/unos/I"

Заменяет one на unos независимо от регистра, поэтому будет напечатано "unos TWO"

Sed "G;G" file.txt

Вставляет две пустые строки после каждой строки в file.txt

Sed "s/.$//" file.txt

Способ замены dos2unix:). В общем случае удаляет последний символ в каждой строке.

Sed "s/^[ \t]*//" file.txt

Удаляет все пробелы/табы перед каждой строкой в file.txt

Sed "s/[ \t]*$//" file.txt

Удаляет все пробелы/табы в конце каждой строки в file.txt

Sed "s/^[ \t]*//;s/[ \t]*$//" file.txt

Удаляет все пробелы/табы в начале и в конце каждой строки в file.txt

Sed "s/foo/bar/" file.txt

Заменяет foo на bar только в первом вхождении в строке.

Sed "s/foo/bar/4" file.txt

Заменяет foo на bar только в четвертом вхождении в строке.

Sed "s/foo/bar/g" file.txt

Заменяет foo на bar для всех вхождений в строке.

Sed "/baz/s/foo/bar/g" file.txt

Заменить foo на bar только если строка содержит baz.

Sed "/./,/^$/!d" file.txt

Сжать все последовательные пустые строки до одной. Пустой строки сверху не остается.

Sed "/^$/N;/\n$/D" file.txt

Сжать все последовательные пустые строки до одной, но оставить верхнюю пустую строку.

Sed "/./,$!d" file.txt

Удалить все начальные пустые строки

Sed -e:a -e "/^\n*$/{$d;N;};/\n$/ba" file.txt

Удалить все замыкающие пустые строки

Sed -e:a -e "/\\$/N; s/\\\n/ /; ta" file.txt

Если строка заканчивается обратным сплешем, соединить ее со следующей (полезно для скриптов оболочки)

Sed -n "/regex/,+5p" file.txt

Выводит 5 строк после строки содержащей regex

Sed "1~3d" file.txt

Удалить каждую третью строку, начиная с первой.

Sed -n "2~5p" file.txt

Печатать каждую пятую строку, начиная со второй.

Sed "s/ick/John/g" report.txt

Другой способ записи некоторых приведенных выше примеров. Вы можете предложить свой?

Sed -n "/RE/{p;q;}" file.txt

Печатает строку с первым соответствием RE (регулярного выражения)

Sed "0,/RE/{//d;}" file.txt

Удаляет строку с первым соответствием

Sed "0,/RE/s//to_that/" file.txt

Изменяет только первое соответствие

Sed "s/^[^,]*,/9999,/" file.csv

Заменяет на 9999 все значения в первой колонке CSV-файла

S/^ *\(.*[^ ]\) *$/|\1|/; s/" *, */"|/g; : loop s/| *\([^",|][^,|]*\) *, */|\1|/g; s/| *, */||/g; t loop s/ *|/|/g; s/| */|/g; s/^|\(.*\)|$/\1/;

Скрипт sed для конвертирования CSV-файла в файл с вертикальной чертой в качестве разделителя (работает только с некоторыми типами CSV, со встроенными кавычками и запятыми).

Sed ":a;s/\(^\|[^0-9.]\)\(\+\)\(\{3\}\)/\1\2,\3/g;ta" file.txt

Меняет формат чисел в file.txt с 1234.56 на 1.234.56

Sed -r "s/\<(reg|exp)+/\U&/g"

Переводит любое слово, начинающееся с reg или exp в верхний регистр.

Sed "1,20 s/Johnson/White/g" file.txt

Производит замену Johnson на White только в строках 1 - 20.

Sed "1,20 !s/Johnson/White/g" file.txt

Предыдущий пример наоборот (заменяет везде, кроме строк 1-20)

Sed "/from/,/until/ { s/\<red\>/magenta/g; s/<blue\>/cyan/g; }" file.txt

Заменяет только между "from" и "until". Если областей "from"-"until" несколько, заменяет в каждой из них.

Sed "/ENDNOTES:/,$ { s/Schaff/Herzog/g; s/Kraft/Ebbing/g; }" file.txt

Заменяет только со слова "ENDNOTES:" и до EOF

Sed "/./{H;$!d;};x;/regex/!d" file.txt

Печатает абзац только если он содержит regex

Sed -e "/./{H;$!d;}" -e "x;/RE1/!d;/RE2/!d;/RE3/!d" file.txt

Печатает абзацы только если они содержат RE1, RE2 и RE3. Порядок RE1, RE2 и RE3 не имеет значения.

Sed "s/14"/fourteen inches/g" file.txt

Так вы сможете использовать двойные кавычки

Sed "s/\/some\/UNIX\/path/\/a\/new\/path/g" file.txt

Работа с путями Unix

Sed "s///g" file.txt

Удаляет все символы, начиная с a и заканчивая g из файла file.txt

Sed "s/\(.*\)foo/\1bar/" file.txt

Заменяет только последнее в строке соответствие foo на bar

Sed "1!G;h;$!d"

Замена команды tac

Sed "/\n/!G;s/\(.\)\(.*\n\)/&\2\1/;//D;s/.//"

Замена команды rev

Sed 10q file.txt

Замена команды head

Sed -e:a -e "$q;N;11,$D;ba" file.txt

Замена команды tail

Sed "$!N; /^\(.*\)\n\1$/!P; D" file.txt

Замена команды uniq

Sed "$!N; s/^\(.*\)\n\1$/\1/;t; D" file.txt

Обратная команда (что эквивалентно uniq -d)

Sed "$!N;$!D" file.txt

Эквивалент tail -n 2

Sed -n "$p" file.txt

... tail -n 1 (или tail -1)

Sed "/regexp/!d" file.txt

Эквивалент grep

Sed -n "/regexp/{g;1!p;};h" file.txt

Печатает строку, находящуюся перед первым соответствием регулярному выражению, но не включающую само соответствие

Sed -n "/regexp/{n;p;}" file.txt

Печатает строку, находящуюся после первого соответствия регулярному выражению, но не включающую само соответствие

Sed "/pattern/d" file.txt

Удаляет строки, соответствующие шаблону pattern

Sed "/./!d" file.txt

Удаляет все пустые строки из файла

Sed "/^$/N;/\n$/N;//D" file.txt

Сжимает все последовательные пустые строки до двух пустых. Одинарные пустые строки не изменяются.

Sed -n "/^$/{p;h;};/./{x;/./p;}" file.txt

Удаляет последнюю строку каждого абзаца
Получает заголовок письма. Другими словами - удаляет все после первой пустой строки.

НАЗВАНИЕ

sed — потоковый редактор

СИНТАКСИС

sed [-Ealn] command

sed [-Ealn] [-e command] [-f command_file] [-i extension]

ОПИСАНИЕ

Утилита sed читает указанный файл, либо стандартный ввод, если файл не указан,модифицирует ввод,как указано в списке команд. Затем, вход пишется на стандартный выход.Одна команда может быть указана, как первый аргумент sed. Множественные команды могут быть указаны использованием опций -e или -f. Все команды применяются в порядке их указания, вне зависимости от их происхождения. Доступны следующие опции:

Интерпретирует регулярные выражения как расширенные (современные), регулярные выражения чаще, чем основные регулярные выражения. Страница документации наre_format(7) полностью описывает оба формата.

Файлы перечисленные как параметры функции «w» создаются (или удаляются)прежде, чем начнется процесс по умолчанию. Опция -a заставляет sed откладывать открытие каждого файла до тех пор, пока команда содержащая связную функцию «w» не применяется к строке ввода.

Добавляет команды редактирования определенные аргументом command, к списку команд

Добавляет команды редактирования найденные в файле command_file к списку команд. Каждая команда редактирования должна быть перечислена в отдельной строке.

Редактирует файлы с замещением, сохраняя резервную копию с указанным расширением. Если расширение не указано (нулевой длины), резервная копия не будет сохраняться. Не рекомендуется присваивать нулевое расширение к замещаемым файлам, поскольку вы рискуете полностью или частично повредить файл, когда место на диске исчерпано.

создает буфер выходных строк.

по умолчанию, каждая линия ввода выводиться на стандартный вывод, после того как были применены все команды. Опция -n отменяет это поведение.

Форма команд sed следующая:

]function

Пробелы (whitespaces) могут быть вставлены до первого адреса и частями функции команды.

Обычно sed циклически копирует строку ввода, не включая завершающий символ новойстроки, в шаблон пробелов, (до тех пор, пока кто-нибудь не оставит «D» функцию) применяет все команды с адресами которые выбрали этот шаблон, копирует шаблон на стандартный вывод, добавляя символ новой строки и удаляя шаблон.

Некоторые функции используют hold space, для сохранения всего или части шаблона для последующего поиска.

Адреса Sed

Адрес не обязателен, но если он указан, то адрес должен являться номером (который считает строки входных файлов), знаком доллара (‘$’), который указывает на последнюю введенную строку или контекстный адрес (который содержит регулярное выражение,которому предшествует, и следует за ним, разделитель).

Командная строка без адресов выбирает каждый шаблон.Командная строка с одним адресом выбирает все шаблоны, которые совпадают с адресом.

Командная строка с двумя адресами выбирает включительный диапазон. Диапазон начинается с первого шаблона который совпадает с первым адресом. Конец диапазона следующий шаблон, который совпадает со вторым адресом. Если номер второго адреса равно или меньше номера строки первого, в таком случае эта строка будет выбрана.

В случае, когда второй адрес — контекстный адрес, sed не производит повторногосравнения второго адреса с шаблоном, который совпадает с первым адресом. Начиная с первой строки, сопровождаемой выбранным диапазоном, sed начинает поиск первого адреса снова.

Редактирование команд может применяться к невыбранным шаблонам, через использование символа («!»).

Регулярные выражения sed

Регулярные выражения используемые в sed, по умолчанию, являются основными регулярными выражениями (смотрите re_format(7), для более детальной информации), но вместо них могут использоваться раширенные (новые) регулярные выражения, если будет использован флаг -E.

Вдобавок, sed имеет следующие дополнения к регулярным выражениям:

1. В контекстном адресе, любой символ отличный от обратного слеша («\») или символа новой строки, может использоваться для разграничения регулярного выражения. Так же, использование обратного слеша перед разграничительным символом, заставляет символ являться литерой. Например, в контекстном адресе xabcxdefx,разграничивающим символом в регулярном выражении является «x», второй «x» будет являться литерой, поэтому регулярное выражение будет «abcxdef».

2. последовательности
совпадает с символом новой строки, встроенным в шаблон. Вы не можете использовать литеры символа новой строки в адресе, или команде подмены.

Единственной особенностью, присущей регулярным выражениям sed, является особенность быть, по умолчанию, по отношению к последему используемому регулярному выражению. Если регулярное выражение пустое, то есть, только указан разграничивающий символ, в таком случае будет использовано последнее использовавшееся регулярное выражение. Последнее регулярное выражение определяется как последнее использовавшееся регулярное выражение, как часть адреса или команды подмены, во время запуска, а не во время компиляции. Например, команда «/abc/s//XXX/» заменит «XXX» на шаблон «abc».

Функции sed

В следующем списке команд, максимальное количество разрешенных адресов для каждой команды показывается как , , или , представляя ноль, один или два адреса. Аргумент text содержит одну или более строк. Что бы включить символ новой строки в текст, поставьте перед ним символ обратного слеша. Другие символы обратного слеша в тексте удаляются и следующие за ними символы рассматриваются как литеры.

Функции «r» и «w» берут опциональный параметр файла, который должен быть отделен от функционального символа пробелом (whitespace). Каждый файл, заданный как аргумент для sed’а, создается (или содержимое его урезается) прежде, чем начнется любая обработка ввода.

Функции «b», «r», «s», «t», «w», «y», «!», и «:» принимают дополнительные аргументы. Следующий пример показывает, какие аргументы должны быть отделены из символов функций, пробелами (whitespaces).

Две функции составляют список функций. Список функций sed разделяется символами новой строки, как показано в следующим примере:

«{» может предворяться пробелом и сопровождаться пробелом. Функции могут предворяться пробелом. Звершающая «}» может пердворяться символом новой строки или пробелом.

Function-list Запускает список функций только, когда выбран шаблон.

text Записывает text в стандартный вывод незамедлительно, до попыток прочитать строку ввода, используется ли функция «N» или начинается новый цикл.

b Разветвляет функцию «:» определенным лейблом. Если лейбл не указан, разветвление происходит в конце скрипта.

text Удаляет шаблон. С 0 или 1 адреса, или диапазон 2 адресов, text выводится на стандартный вывод.

d Удаляет шаблон и начинает новый цикл.

D Удаляет начальный сегмент шаблона через первый символ новой строки и начинает новый цикл.

g Заменяет содержимое шаблона содержимым hold space.

G Добавляет символ новой строки, сопровождаемый содержимым hold space.

h Замещает содержимое hold space, сождержимым шаблона.

H Добавляет символ новой строки, сопровождаемы содержимым шаблона

i ext Записывает text на стандартный вывод.

l (буква эль). Записывает шаблон на стандартный вывод в визуально однозначной форме. Эта форма следующая:

обратный слэш \

возврат каретки

табуляция

вертикальня табуляция v

Непечатные символы записываются, как трехзначные восмеричные номера (предваряемые обратным слешем) для каждого байта в символе (наиболее важные байты сначала).

Длинные строки переносятся с указанием точки переноса в виде обратного слеша сопровождаемого символом новой строки. Конец каждой строки указан символом «$».

n Записывает шаблон на стандартный вывод если вывод по умолчанию не был переопределен, и заменяте шаблон следующей строкой ввода.

N Добавляет следующую строку к шаблону, используя встроенный символ новой строки, для разделения добавляемого материала от оригинального содержимого.

p Записывает шаблон на стандартный вывод.

P Записывает шаблон до первого символа новой строки, на стандартный вывод.

q Разветвляет конец скрипта и выходит без загрузки нового цикла.

r file Копирует содержимое file на стандартный вывод сразу же, прежде чем произойдет следующая попытка чтения строки. Если file не может быть прочитан, по любой причине, он тихо игнорируется и состояние ошибки не устанавливается.

s/regular expression/replacement/flags

Подменяет, замещаемую строку, первым регулярным выражением в шаблоне. Любой символ отличный от обратного слеша или символа новой строки может быть использован вместо обратного слеша или символа новой строки, вместо слеша, что бы разделить регулярное выражение и замещение. Внутри регулярного выражения и замещения, разделитель регулярных выражений сам может быть использован как литера, если он предварен обратным слешем.

Амперсанд («&») появляется в замене, если замещаемая строка совпадает с регулярным выражением. Особое значение «&» в этом контексте может быть изменено, предварением амперсанда обратным слешем. Строка «#», где «#» цифра, которая замещается текстом совпавшим с передачей обратного выражения.

Строка может быть разделена добавлением символа новой строки в нее. Для определения символа новой строки в замещаемой строке, предварите ее обратным слешем.

Значение flags в заменяемой функции — ноль или одна из следующих:

N Создавать замену только для N’ повторений регулярного выражения в шаблоне.

g Создавать замену для всех неперекрывающих совпадений регулярного выражения,не только для первого.

p Записывать шаблон на стандартный вывод, если сделано замещение. Если замещаемая строка совпадает с замещаемой, она все еще расценивается как замещение.

w Добавляет шаблон к file если замещение произошло. Если замещаемая строка совпадает с замещаемой, она все еще расценивается как замещение.

Разветвление функции «:» лейбл, если любая замена была сделана с момента нового чтения строки ввода или запуска функции «t». Если лейбл не определен,разветвление идет до конца скрипта.

w file Добавляет шаблон к file.

x Меняет содержимое шаблона и hold spaces.

y/string1/string2/

Замещает все повторения символа в string1 в шаблоне с соответствующими символами из string2. Любой символ, отличный от обратного слеша или символа новой строки может использоваться вместо обратного слеша или символа новой строки для разделения строк. Внутри string1 и string2 обратный слеш сопровождается любым символам отличным от символа новой строки, который является литерой и обратный слеш сопровождаемый «n» замещается символом новой строки.

Function

Function-list

Применяет функцию или список функций только для строк которые не выбраны адресом.

Эта функция ничего не делает, она вызывает лейбл в котором команды «b» и «t» могут разветвляться.

Записывает номер строки на стандартный вывод спопровождаемый символом новой строки.

Игнорирует пустые строки.

«#» и остаток строки игнорируются (расценивается как коментарий), с единственным исключением что если первые два символа в файле являются «#n», вывод по умолчанию подавляетс. То же самое, что и определение опции -n в командной строке.

Окружение

Переменные COLUMNS, LANG, LC_ALL, LC_CTYPE и LC_COLLATE препятствуют запуску sed ,как описано в environ(7).

Состояние выхода

утилита sed выходит с установкой 0 если выход прошел успешно, и >0 если возникли

Смотрите так же

awk(1), ed(1), grep(1), regex(3), re_format(7)

Стандарт

утилита sed, как ожидается, будет в наборе спецификаций EEE Std 1003.2 («POSIX.2»)

Опции -E, -a и -i не стандартны для расширений FreeBSD и могут быть недоступны для других операционных систем.

команда sed написана L. E. McMahon, появилась в Version 7 AT&T UNIX.

Мультибайтовые символы, содержащие значение 0x5C (ASCII `\’) могут быть распознаны

некорректно как продолжение символов строки в аргументах команд `a», «c» и «i»

Мультибайтовые символы не могут использоваться как разделители с командами