| GAWK(1) | Narzędzia | GAWK(1) |
gawk - język wyszukiwania i przetwarzania wzorców.
Uwaga! To tłumaczenie może być nieaktualne!
Gawk jest implementacją GNU języka programowania AWK. Odpowiada on definicji tego języka z POSIX 1003.2 Command Language And Utilities Standard. Wersja ta jest z kolei oparta na opisie z The AWK Programming Language, napisanym przez Aho, Kernighana i Weinbergera, z dodatkowymi właściwościami, zdefiniowanymi w wersji awk z SysVR4. Gawk udostępnia również najświeższe rozszerzenia awk z Bell Laboratories oraz parę rozszerzeń specyficznych dla GNU.
Pgawk jest profilującą wersją gawk. W każdym aspekcie jest identyczny z gawk, z wyjątkiem tego, że programy działają wolniej, a na zakończenie automatycznie tworzony jest profil wykonania w pliku awkprof.out. Zobacz opcja --profile, poniżej.
Wiersz poleceń składa się z opcji dla gawk, tekstu programu (jeśli nie podano go poprzez opcję -f lub --file) i wartości, które mają być udostępnione w predefiniowanych zmiennych ARGC i ARGV.
Opcje gawk mogą być zarówno tradycyjnymi POSIX-owymi jednoliterowymi opcjami, jak i długimi opcjami w stylu GNU. Opcje POSIX-owe zaczynają się pojedynczym “-”, a opcje GNU “--”. Opcje w stylu GNU są udostępniane zarówno dla właściwości specyficznych dla GNU, jak i dla właściwości POSIX-owych. Inne implementacje AWK prawdopodobnie jednak będą przyjmować tylko tradycyjne, jednoliterowe opcje.
Zgodnie ze standardem POSIX, specyficzne dla gawk opcje są przekazywane przez argumenty opcji -W. Można podać wiele opcji -W, lub wiele jej argumentów (oddzielonych przecinkami, lub ujętych w cudzysłowy i oddzielonych białymi spacjami). Wielkość liter w argumentach przekazanych opcji -W jest ignorowana. Każda opcja -W ma odpowiadająca sobie długą opcję w stylu GNU, jak opisano niżej. Argumenty przekazywane długim opcjom w stylu GNU są łączone z opcją przy użyciu znaku =, bez dodatkowych spacji lub przekazywane w następnym argumencie wiersza poleceń (tj. bez znaku równości i po spacji).
Gawk przyjmuje następujące, wymienione alfabetycznie, opcje.
Lista wszystkich zmiennych globalnych to dobry sposób na wyszukanie błędów typograficznych w programach. Może się też przydać, gdy masz wielki program z mnóstwem funkcji a chcesz się upewnić, że nie używają one przypadkiem ze zmiennych globalnych, które uważasz za lokalne. (Szczególnie łatwo pomylić się przy prostych nazwach zmiennych, jak i, j, i tak dalej.)
Forma -W source= tej opcji używa reszty argumentu wiersza poleceń jako tekstu programu; dalsze opcje -W nie będą rozpoznawane w tym samym argumencie.
W trybie zgodności wszelkie inne opcje są zaznaczane jako niepoprawne, lecz poza tym są ignorowane. W normalnym trybie działania, jeśli dostarczono tekst programu AWK, nieznane opcje są mu przekazywane w tablicy ARGV, aby mógł je sobie sam przetworzyć. Przydaje się to w praktyce do uruchamiania programów AWK przez mechanizm “#!” interpretera.
Program AWK składa się z sekwencji instrukcji wzorzec-akcja oraz opcjonalnych definicji funkcji.
wzorzec { instrukcje akcji }
function nazwa(lista parametrów) {
instrukcje }
Gawk najpierw odczytuje źródło programu z podanych plików-programu. Gawk czyta tekst programu tak, jakby wszystkie pliki-programu zostały połączone ze sobą w całość. Przydaje się do budowania bibliotek funkcji AWK, bez konieczności włączania ich do każdego nowego programu AWK, który z nich korzysta. Umożliwia to również łączenie funkcji bibliotecznych z programami z wiersza poleceń.
Zmienna środowiskowa AWKPATH określa ścieżkę przeszukiwania, używaną do znajdowania plików źródłowych podanych w opcji -f. Jeśli zmienna ta nie istnieje, domyślną ścieżką staje się ".:/usr/local/share/awk". (Faktyczny katalog może być różny, zależnie od tego jak skompilowano i zainstalowano awk.) Jeśli nazwa pliku, podana opcji -f zawiera znak “/”, nie jest dokonywane żadne przeszukiwanie ścieżki.
Gawk wywołuje programy AWK w następującej kolejności. Najpierw dokonuje wszelkich inicjalizacji zmiennych, zadanych w opcjach -v. Następnie kompiluje program do postaci wewnętrznej. Potem wywołuje kod, zawarty w blokach BEGIN (jeśli istnieją), a następnie zaczyna odczytywać każdy z plików, podanych w tablicy ARGV. Jeśli nie podano takich nazw plików, gawk odczytuje standardowe wejście.
Jeśli nazwa pliku w wierszu poleceń ma postać var=val , to jest traktowana jako inicjalizacja zmiennej. Zmienna var uzyska wartość val. (Dzieje się to po uruchomieniu każdego bloku BEGIN.) Ten sposób inicjalizowania zmiennych najbardziej przydaje się do dynamicznego nadawania wartości zmiennym, których AWK używa do określania sposobu, w jaki wejście rozbijane jest na pola i rekordy. Jest też użyteczny do kontroli stanu, jeśli zachodzi potrzeba wielokrotnego czytania danego pliku danych.
Jeśli wartość konkretnego elementu ARGV jest pusta (""), to gawk ją pomija.
Dla każdego rekordu wejścia gawk dokonuje porównania, sprawdzając czy odpowiada on jakiemuś wzorcowi z programu AWK. Jeśli wzorzec będzie odpowiadał rekordowi, zostanie wykonana związana z nim akcja. Wzorce są sprawdzane w kolejności ich pojawienia się w programie.
Na koniec, gdy wyczerpane zostanie całe wejście, gawk wywołuje kod zawarty w bloku END.
Zmienne AWK są dynamiczne; zaczynają istnieć gdy są po raz pierwszy użyte. Ich wartości są zmiennoprzecinkowe, znakowe (ciągi znaków) lub jedne i drugie naraz, zależnie od sposobu użycia. AWK posiada również tablice jednowymiarowe; symulowane mogą być również tablice wielowymiarowe. Podczas działania programu ustawianych jest kilka predefiniowanych zmiennych; będą one opisane niżej.
Zwykle rekordy rozdzielane są znakami nowej linii [czyli rekordem jest pojedyncza linia]. Możesz kontrolować sposób, w jaki będą separowane rekordy przypisując wartość wbudowanej zmiennej RS Jeżeli zawiera ona pojedynczy znak, to jest on ogranicznikiem rekordów. W przeciwnym przypadku, RS jest wyrażeniem regularnym. Tekst wejściowy pasujący do tego wyrażenia rozdziela rekord. Jednakże, w trybie zgodności do rozdzielania rekordów zostanie użyty tylko jego pierwszy znak. jeżeli RS jest ustawiony na łańcuch pusty, to rekordy rozdzielane są pustymi liniami. W tym przypadku znak nowej linii zawsze działa jako ogranicznik pola, oprócz wartości ogranicznika ustawionej przez FS.
Po przeczytaniu każdego rekordu wejściowego, gawk rozbija go na pola, używając do tego celu wartości separatora pól, FS. Jeśli FS jest pojedynczym znakiem, to pola są rozdzielane tym właśnie znakiem. W przeciwnym wypadku FS powinien być wyrażeniem regularnym. W szczególnym wypadku, kiedy FS jest pojedynczą spacją, pola są oddzielane dowolną ilością białych spacji (spacji, tabulatorów, nowych linii). (Ale patrz omówienie --posix). UWAGA: Wartość zmiennej IGNORECASE (patrz niżej) również wpływa na sposób rozdzielania pól i rekordów (w wypadku gdy odpowiednio FS bądź RS jest wyrażeniem regularnym).
Jeśli zmienną FIELDWIDTHS ustawiono na listę oddzielonych spacjami liczb, to każde pole powinno mieć stałą szerokość, zaś gawk dokonuje podziału przy użyciu podanych szerokości. Wartość FS jest wtedy ignorowana. Przyznanie zmiennej FS nowej wartości unieważnia użycie FIELDWIDTHS, i przywraca domyślne zachowanie.
Do każdego pola w rekordzie wejściowym można odwołać się przez jego pozycję, $1, $2, itd. $0 jest całym rekordem (zwykle linią). Do pól nie musisz się odwoływać przez stałe:
n = 5
print $n
wypisze piąte pole rekordu wejściowego.
Zmienna NF jest ustawiana na całkowitą liczbę pól w rekordzie wejściowym.
Odniesienia do pól nieistniejących (np. pól znajdujących się za $NF) dają łańcuch zerowy. Jednak nadanie nieistniejącemu polu wartości (np. $(NF+2) = 5) zwiększa wartość licznika NF, a pola znajdujące się `pomiędzy', inicjuje łańcuchem zerowym. Przypisanie to poowoduje również ponowne przetworzenie wartości zmiennej $0, w której pola zostaną rozdzielone wartością OFS.
Przypisanie wartości istniejącemu polu powoduje ponowne utworzenie całego rekordu podczas odwołania się do $0. Podobnie, przypisanie wartości do $0 powoduje, że rekord jest ponownie dzielony, tworząc nowe wartości pól.
Wbudowanymi zmiennymi Gawk są:
Tak więc jeśli IGNORECASE nie jest równe zero, /aB/ odpowiada wszystkim następującym łańcuchom -- "ab", "aB", "Ab", i "AB". Jak ze wszystkimi zmiennymi AWK, początkowa wartość IGNORECASE jest zerem, więc operacje na wyrażeniach regularnych są wrażliwe na wielkość znaków. W Unixie przy ignorowaniu wielkości znaków używany jest pełny zestaw znaków ISO-8859-1 Latin-1.
Tablice są indeksowane wyrażeniem, ujętym w nawiasy kwadratowe ([ i ]). Jeśli wyrażenie jest listą wyrażeń (wyraż, wyraż ...) to indeks tablicy jest sklejany z wartości (łańcuchowych) każdego wyrażenia, oddzielonych wartością zmiennej SUBSEP. [Uwaga: jest tak dlatego, że AWK używa tablic asocjacyjnych - tak jakby słownikowych - nie ma tu normalnych liczbowych indeksów - indeksem może być cokolwiek, najczęściej łańcuch. Symulowanie tablic wielowymiarowych polega właśnie na sklejaniu poszczególnych indeksów w unikalny łańcuch -- przyp. tłum.] Właściwość ta jest używana do symulacji wielowymiarowych tablic. Na przykład:
przypisuje łańcuch "hello, world\n" elementowi tablicy x, o indeksie będącym łańcuchem "A\034B\034C". Wszystkie tablice w AWK są asocjacyjne, tj. indeksowane wartościami łańcuchowymi.
Do sprawdzenia czy dana tablica posiada oczekiwany indeks [łańcuchowy], można użyć operatora in, który ma zastosowanie przede wszystkim w instrukcjach if lub while.
if (val in array) print array[val]
Jeśli tablica posiada wielokrotne indeksy, można użyć konstrukcji (i, j) in array.
Konstrukcja in może być również użyta w pętli for do iterowania poprzez wszystkie elementy tablicy [ponieważ jest ona asocjacyjna, nie można jej iterować przez przelecenie indeksu od zera do najwyższej wartości - indeks może być tu przecież dowolnym łańcuchem - przyp. tłum.]
Element można skasować z tablicy przy użyciu polecenia delete. Poleceniem delete można się też posłużyć do skasowania całej zawartości tablicy, przez podanie jej nazwy bez indeksu.
Zmienne oraz pola mogą być liczbami (zmiennoprzecinkowymi), łańcuchami lub jednym i drugim naraz. Interpretacja wartości zmiennej zależy od kontekstu. Jeśli jest użyta w wyrażeniu numerycznym, jest interpretowana jako liczba; jeśli jest użyta w wyrażeniu łańcuchowym, to jest traktowana jak łańcuch.
Aby wymusić traktowanie zmiennej jako liczby, dodaj do niej 0; aby wymusić traktowanie jej jako łańcucha, doklej do niej łańcuch zerowy.
Podczas konwersji łańcucha na liczbę, obróbka jest dokonywana przy użyciu funkcji strtod(3). Liczba jest przekształcana na łańcuch przy użyciu wartości CONVFMT jako parametru formatującego dla sprintf(3), oraz wartości numerycznej jako argumentu. Jednak, nawet mimo że wszystkie liczby w AWK są zmiennoprzecinkowe, wartości całkowite są zawsze konwertowane jak całkowite (integer). Tak więc, przy
CONVFMT = "%2.2f" a = 12 b = a ""
zmienna b uzyskuje wartość łańcuchową "12", a nie "12.00".
Gawk dokonuje porównań w następujący sposób: Jeśli dwie wartości są numeryczne, to są porównywane numerycznie. Jeśli jedna z wartości jest numeryczna, a druga łańcuchowa, która jest “łańcuchem numerycznym”, to porównania są również dokonywane numerycznie. W przeciwnym wypadku wartość numeryczna jest konwertowana do łańcucha i dokonywane jest porównanie łańcuchowe. Dwa łańcuchy są, oczywiście, porównywane jako łańcuchy. Zwróć uwagę, że standard POSIX stosuje pojęcie “łańcucha numerycznego” wszędzie, nawet do stałych łańcuchowych. Jednak jest to oczywiście nieprawidłowe i gawk tego nie robi. (Na szczęście, poprawiono to w następnej wersji standardu.)
Zauważ, że stałe znakowe, takie jak "57" nie są łańcuchami numerycznymi - są one stałymi łańcuchowymi. Pojęcie “łańcuchów numerycznych” odnosi się wyłącznie do pól, wejścia getinput, FILENAME, elementów ARGV, ENVIRON i elementów tablicy utworzonej funkcją split() będących łańcuchami numerycznymi. Podstawową koncepcją jest to, że wyglądające na numeryczne dane z wejścia użytkownika, i tylko one, są traktowane w opisany sposób.
Niezainicjalizowane zmienne mają wartość numeryczną zero i łańcuchową "" (zero lub pusty łańcuch).
Poczynając od wersji 3.1 gawk , w kodzie źródłowym programów AWK można korzystać ze stałych ósemkowych i szesnastkowych w stylu języka C. Na przykład, ósemkowa wartość 011 jest równa dziesiętnej 9, a szesnastkowa 0x11 jest równa dziesiętnej 17.
Stałe łańcuchowe w AWK są sekwencjami znaków ujętymi w cudzysłowy ("). Wewnątrz łańcuchów rozpoznawane są pewne sekwencje specjalne, jak w C. Są to:
Sekwencji specjalnych można też używać wewnątrz stałych wyrażeń regularnych (np., /[ \t\f\n\r\v]/ dopasowuje białe znaki).
W trybie zgodności, znaki reprezentowane przez ósemkowe lub szesnastkowe sekwencje specjalne są traktowane dosłownie, jeśli użyto ich w stałych wyrażeniach regularnych. Zatem, /a\52b/ jest równoważnikiem /a\*b/.
AWK jest językiem zorientowanym liniowo. Najpierw przychodzi wzorzec, a potem akcja. Instrukcje akcji są zawarte w nawiasach { i }. Pominąć można zarówno wzorzec, jak i akcję, lecz oczywiście nie obydwa te pola naraz. Jeśli pominięto wzorzec, to akcja jest wykonywana dla każdego z rekordów wejścia. Brakująca akcja jest z kolei równoważna akcji
{ print }
która wypisuje cały rekord.
Komentarze rozpoczynają się znakiem “#” i trwają aż do końca linii. Do oddzielania instrukcji można używać pustych linii. Zwykle instrukcja kończy się wraz z nową linią, jednak nie jest to regułą w przypadku linii kończących się na “,”, “{”, “?”, “:”, “&&” lub “||”. Dla liniach kończących się na do lub else również wystąpi automatyczna kontynuacja instrukcji w następnej linii. W innych wypadkach, linia może być kontynuowana przez zakończenie jej znakiem “\”; w takim wypadku znak nowej linii jest ignorowany.
Wiele instrukcji można też zgrupować w jednej linii, oddzielając je znakiem “;”. Tyczy się to zarówno instrukcji w części akcji z pary wzorzec-akcja (zwykły przypadek), jak i do samych instrukcji wzorzec-akcja.
Wzorce w AWK mogą być jedną z następujących rzeczy:
BEGIN END /wyrażenie regularne/ wyrażenie relacyjne wzorzec && wzorzec wzorzec || wzorzec wzorzec ? wzorzec : wzorzec (wzorzec) ! wzorzec wzorzec1, wzorzec2
BEGIN i END są dwoma specjalnymi rodzajami wzorców, które nie są porównywane z danymi wejściowymi. Części akcji wszelkich wzorców BEGIN są łączone, tak jakby wszystkie one zostały napisane w pojedynczym bloku BEGIN. Są one wykonywane przed rozpoczęciem odczytywania danych wejściowych. Podobnie, wszelkie bloki END są również łączone i wykonywane po wyczerpaniu danych wejściowych. (lub po dojściu do instrukcji exit.) Wzorce BEGIN i END nie mogą być łączone z innymi wzorcami w wyrażeniach wzorcowych. Wzorcom BEGIN i END nie może brakować części definiującej akcję.
Dla wzorców /wyrażeń regularnych/ powiązana instrukcja wykonywana jest dla każdego rekordu wejściowego, który odpowiada zadanemu wyrażeniu regularnemu. Wyrażenia regularne są tymi samymi wyrażeniami, które można spotkać w egrep(1), i są podsumowane niżej.
wyrażenie relacyjne może używać dowolnego operatora ze zdefiniowanych w sekcji o akcjach operatorów. Ogólnie, testują one, czy określone pola odpowiadają określonym wyrażeniom regularnym.
Operatory &&, ||, i ! są logicznymi AND, OR i NOT, podobnie jak w języku C. Są one obliczane w sposób skrócony, podobnie jak w C, i służą głównie do łączenia bardziej podstawowych wyrażeń wzorcowych. Podobnie jak w większości języków, dla wymuszenia kolejności porównywania można użyć nawiasów.
Operator ?: działa podobnie jak ten sam operator w C. Jeśli pierwszy wzorzec jest prawdziwy, to do testowania używany jest następny wzorzec; w przeciwnym wypadku używany jest trzeci wzorzec. Obliczany jest tylko albo drugi albo trzeci wzorzec.
Forma wzorzec1, wzorzec2 wyrażenia jest nazywana wzorcem zakresu. Dopasowuje ona wszystkie rekordy wejście, poczynając od rekordu, który odpowiada wzorcowi1, aż do rekordu pasującego do wzorzec2, włącznie. Nie łączy się to z innymi rodzajami wyrażeń wzorcowych.
Wyrażenia regularne są rozszerzoną formą tego, co można znaleźć w egrep. Składają się one z następujących znaków:
Wyrażenia powtarzane dostępne są tylko wtedy, gdy w wierszu poleceń użyto albo opcji --posix albo --re-interval.
Sekwencje specjalne (escape sequences), które są prawidłowe w stałych łańcuchowych (patrz niżej) są również poprawne w wyrażeniach regularnych.
Klasy znaków są nową własnością wprowadzoną w standardzie POSIX. Klasa znaków jest specjalną notacją służącą do opisu listy znaków posiadających szczególną cechę. Dla danej klasy rzeczywiście występujące w niej znaki mogą być różne w zależności od kraju i/lub używanego zestawu znaków. Na przykład, pojęcie o tym, co jest znakiem alfabetu jest odmienne w USA niż we Francji.
Klasa znaków dozwolona jest wyłącznie w wyrażeniu regularnym wewnątrz nawiasów klamrowych listy znaków. Klasy znaków składają się z [:, słowa kluczowego opisującego klasą, i kończącego :]. POSIX definiuje następujące klasy znaków:
Na przykład, przed standardem POSIX, by dopasować znaki alfanumeryczne musiałbyś napisać /[A-Za-z0-9]/. Jeśli twój zestaw znaków zawiera inne znaki alfabetyczne, powyższe ich nie dopasuje, a jeśli kolejność znaków w zestawie jest inna niż w ASCII, to wyrażenie to może nawet nie dopasowywać znaków alfanumerycznych ASCII. Za pomocą POSIX-owych klas znaków, możesz napisać /[[:alnum:]]/, i dopasowuje to wszystkie alfabetyczne i numeryczne znaki z twojego zestawu znaków.
W listach znaków mogą pojawić się dodatkowe sekwencje specjalne. Dotyczy to zestawów znaków różnych od ASCII, które mogą posiadać pojedyncze symbole (zwane elementami porównywania - collating elements) reprezentowane przez więcej niż jeden znak, jak i kilka znaków równoważnych w operacjach porównywania, czy sortowania. (np. we francuskim, zwykłe “e” i akcentowane (grave) e` są równoważne.)
Cechy te są bardzo wartościowe w ustawieniach lokalnych innych niż dla języka angielskiego. Funkcje biblioteczne, których gawk używa do dopasowywania wyrażeń regularnych rozpoznają obecnie wyłącznie POSIX-owych klas znaków; nie rozpoznają one symboli porównywania ani klas równoważności.
Operatory \y, \B, \<, \>, \w, \W, \` oraz \' są specyficzne dla gawk; są one rozszerzeniami opartymi na możliwościach bibliotek wyrażeń regularnych GNU.
Różne opcje wiersza poleceń kontrolują sposób, w jaki gawk interpretuje znaki w wyrażeniach regularnych.
Instrukcje akcji są zawarte w nawiasach { i }. Instrukcje akcji składają się ze zwyczajnych instrukcji przypisania, warunków i instrukcji pętli, które można znaleźć w większości innych języków programowania. Operatory, instrukcje sterującymi, a także instrukcje wejścia/wyjścia są opracowane na podstawie tych, spotykanych w języku C.
Operatory w AWK, w kolejności malejącego priorytetu, to
Instrukcje sterujące są następujące:
if (warunek) instrukcja [ else instrukcja ]
while (warunek) instrukcja
do instrukcja while (warunek)
for (wyraż1; wyraż2; wyraż3) instrukcja
for (var in tablica) instrukcja
break
continue
delete tablica[indeks]
delete tablica
exit [ wyrażenie ]
{ instrukcje }
Instrukcje I/O są następujące:
Dozwolone są też dodatkowe przekierowania wejścia i wyjścia dla print i printf.
Polecenie getline zwraca zero na końcu pliku, a -1 przy błędzie. W przypadku błędu, ERRNO zawiera łańcuch opisujący problem.
UWAGA: używając potoku lub procesu współbieżnego do getline albo z print czy printf wewnątrz pętli, musisz użyć close() do utworzenia nowych instancji tego polecenia. AWK nie zamyka automatycznie potoków ani procesów współbieżnych gdy zwrócą one EOF.
Wersje AWK instrukcji printf oraz funkcji sprintf() (patrz niżej) przyjmują następujące formaty konwersji:
Między % a literą sterującą mogą znaleźć się opcjonalne parametry dodatkowe:
Dynamiczne właściwości width i prec z printf() używanego w języku C są również wspierane. Znak gwiazdki * w miejscu specyfikacji zarówno width jak i prec powoduje, że ich wartości są pobierane z listy argumentów, przekazywanej printf lub sprintf(). Chcąc użyć specyfikatora pozycyjnego z dynamiczną szerokością lub dokładnością należy podać n$ po * w łańcuchu formatu. Na przykład, "%3$*2$.*1$s".
Podczas przekierowań I/O przy użyciu print czy też printf do pliku, albo przy użyciu getline z pliku, gawk rozpoznaje wewnętrznie pewne specjalne nazwy plików. Te nazwy plików umożliwiają dostęp do otwartych deskryptorów plików, dziedziczonych po procesie rodzicielskim gawk'a (zazwyczaj powłoce). Inne pliki specjalne zapewniają dostęp do informacji o uruchomionym procesie gawk. Z tych specjalnych nazw plików można również korzystać w wierszu poleceń do określania plików danych. Te nazwy to:
Są one szczególnie przydatne do komunikatów o błędach. Na przykład:
podczas gdy w przeciwnym wypadku musiałbyś użyć
Poniższych specjalnych nazw plików można używać z operatorem procesu współbieżnego |& do tworzenia witrualnych połączeń sieciowych TCP/IP.
Inne specjalne nazwy plików zapewniające informacje o działającym procesie gawk. Te nazwy plików są obecnie przestarzałe. Do uzyskania informacji, jakie podają, należy skorzystać z tablicy PROCINFO . Nazwy tych plików to:
AWK ma następujące wbudowane funkcje arytmetyczne:
AWK ma następujące wbudowane funkcje łańcuchowe:
Ponieważ jednym z podstawowych zadań programów AWK jest przetwarzanie plików z logami, które zawierają informacje czasowe, gawk udostępnia następujące funkcje, umożliwiające uzyskiwanie znaczników czasu (timestamps) i ich formatowanie.
Począwszy od wersji 3.1 gawk, dostępne są poniższe funkcje operujące na bitach. Działają przez konwersję wartości zmiennoprzecinkowych podwójnej precyzji na całkowite unsigned long, wykonanie operacji, a następnie konwersję wyniku z powrotem na zmiennoprzecinkowy. Te funkcje to:
Począwszy od wersji 3.1 gawk, można używać wewnątrz programów AWK funkcji do tłumaczenia łańcuchów podczas wykonania programu. Szczegóły opisano w GAWK: Efektywne programowanie w AWK.
Domyślną domeną jest wartość TEXTDOMAIN. Jeśli katalog jest łańcuchem pustym (""), to bindtextdomain() zwraca bieżące wiązanie dla zadanej domeny.
Jeśli podaje się wartość kategorii, to musi to być łańcuch równy jednej ze znanych kategorii locale opisanych w GAWK: Efektywne programowanie w AWK. Trzeba również podać domenę tekstową. Użyj TEXTDOMAIN, jeśli chcesz korzystać z bieżącej domeny.
Funkcje w AWK są definiowane następująco:
Funkcje są wykonywane po wywołaniu ich z wyrażeń występujących we wzorcach lub akcjach. Do tworzenia instancji parametrów formalnych, zadeklarowanych w funkcji używane są parametry faktyczne użyte w wywołaniu funkcji. Tablice są przekazywane przez wskazanie, inne zmienne przez wartość.
Ponieważ funkcje pierwotnie nie były częścią języka AWK, obsługa zmiennych lokalnych jest trochę niezdarna: Są one deklarowana jako dodatkowe parametry w liście parametrów. Konwencja polega na separowaniu zmiennych lokalnych od parametrów dodatkowymi spacjami w liście parametrów. Na przykład:
function f(p, q, a, b) { # a i b są lokalne
..... }
/abc/ { ... ; f(1, 2) ; ... }
Lewy nawias w wywołaniu funkcji musi występować bezpośrednio za nazwą funkcji, bez wtrąconej białej spacji. Ma to na celu zapobieżenie niejednoznaczności składni z operatorem konkatenacji (łączenia). Ograniczenie to nie odnosi się do funkcji wbudowanych, które są opisane powyżej.
Funkcje mogą wołać siebie nawzajem i mogą być rekurencyjne. Parametry funkcji używane jako zmienne lokalne są podczas wywołania funkcji inicjalizowane na łańcuch pusty i liczbę zero. Chcąc, by funkcja zwracała wartość należy posłużyć się składnią: return wyraż. Wartość zwracana przez funkcję jest niezdefiniowana jeśli nie podano wartości zwracanej lub funkcja kończy pracę bez jawnej instrukcji powrotu.
Jeżeli użyto --lint, to gawk ostrzega o wywołaniach niezdefiniowanych funkcji podczas analizy składni, a nie w czasie wykonania. Wywołanie niezdefiniowanej funkcji w czasie wykonania powoduje błąd krytyczny.
Zamiast słowa function można używać słowa funct.
Począwszy od wersji 3.1 gawk, można dynamicznie dodawać nowe funkcje wbudowane do pracującego interpretera gawk. Dokładne szczegóły wykraczają poza zakres tej strony podręcznika. Można je znaleźć w GAWK: Efektywne programowanie w AWK.
Ta funkcja jest dostarczana i dokumentowana w GAWK: Efektywne programowanie w AWK, ale wszystko dotyczące tej cechy może się zmienić w kolejnym wydaniu. SILNIE zalecamy, byś nie używał tej funkcji do czegoś, czego nie masz zamiaru robić ponownie.
pgawk przyjmuje dwa sygnały. SIGUSR1 powoduje, że zrzuca on profil i stos wywołąń funkcji do pliku profilu, którym jest albo awkprof.out, albo plik podany z opcją --profile. Następnie kontynuuje działanie. SIGHUP powoduje, że zrzuca on profil i stos wywołąń funkcji a następnie kończy pracę.
Wypisz i posortuj nazwy zgłoszeniowe (login) wszystkich użytkowników:
BEGIN { FS = ":" }
{ print $1 | "sort" }
Zlicz linie w pliku:
{ nlines++ }
END { print nlines }
Poprzedź każdą linię jej numerem w pliku:
{ print FNR, $0 }
Konkatenatuj i numeruj linie (wariacja tematu):
{ print NR, $0 }
Stałe łańcuchowe są ciągami znaków ujętymi w cudzysłowy. W środowiskach innych niż angielskojęzyczne, możliwe jest oznakowanie łańcuchów w programie AWK jako wymagających tłumaczenia na włąsny język narodowy. Łańcuchy takie są oznaczone w programie AWK przez początkowy znak podkreślenia (“_”). Na przykład,
zawsze wypisuje hello, world. Ale,
we Francji może wypisać bonjour, monde.
W tworzeniu i uruchamianiu zlokalizowanego programu AWK wyróżnia się kilka etapów.
BEGIN { TEXTDOMAIN = "myprog" }
Umożliwia to gawkowi znalezienie pliku .mo związanego z programem. Be ztego kroku, gawk używa domeny tekstowej messages, która prawdopodobnie nie zawiera tłumaczeń dla naszego programu.
Funkcje internacjonalizacji opisano szczegółowo w GAWK: Efektywne programowanie w AWK.
Podstawowym celem gawk była zgodność ze standardem POSIX, a także zgodność z najnowszymi wersjami UNIX awk. W tym celu gawk zawiera następujące widzialne dla użytkownika właściwości, które nie są opisane w książce o AWK, lecz są częścią awk z Bell Laboratories (Systemu Vr4), a także są częścią standardu POSIX.
Książka wskazuje, że przypisanie w wierszu poleceń zachodzi gdy awk w innym wypadku otworzył by argument jako plik, co następuje po wykonaniu bloku BEGIN. Jednak we wcześniejszych implementacjach, gdy takie przypisanie pojawiło się przed jakimikolwiek nazwami plików, następowało ono przed uruchomieniem bloku BEGIN. Aplikacje z czasem zaczęły polegać na tej “właściwości”. Gdy awk został zmieniony tak, by odpowiadał dokumentacji, dodano opcję -v do przypisywania wartości zmiennym przed wykonaniem programu, aby usatysfakcjonować aplikacje, które zależały od starego zachowania. (Właściwość ta została uzgodniona między programistami Bell Laboratories i GNU).
Opcja -W, przeznaczona dla właściwości zależnych od implementacji należy do standardu POSIX.
Podczas przetwarzania argumentów, gawk używa specjalnej opcji “--”, sygnalizującej koniec argumentów. W trybie zgodności będzie ostrzegał, lecz poza tym ignorował opcje niezdefiniowane. W normalnym trybie działania, argumenty takie są przekazywane do programu AWK, aby je przetworzył.
Książka o AWK nie definiuje wartości zwracanej przez srand(). Wersja SVr4 UNIX awk (oraz standard POSIX) zwracają wartość poprzedniego używanego nasionka, umożliwiając śledzenie kolejnych sekwencji liczb losowych. Dlatego srand() w gawk również zwraca poprzednio używane nasionko.
Innymi nowymi właściwościami są: używanie wielu opcji -f (z MKS awk), tablica ENVIRON, sekwencje specjalne \a oraz \v (opracowane oryginalnie w gawk i przeniesione z powrotem do wersji Bell Laboratories); funkcje wbudowane tolower() i toupper() (z Bell Laboratories) oraz specyfikacje konwersji ANSI C w printf (zrobione pierwotnie w wersji Bell Laboratories).
Istnieją dwie historyczne właściwości AWK, obsługiwane przez gawk. Po pierwsze, możliwe jest wywołanie funkcji wbudowanej length() nie tylko bez argumentów, ale również bez nawiasów! Tak więc
a = length # Święty Algol 60, Batman!
oznacza to samo co jedno z poniższych
a = length()
a = length($0)
Właściwość ta jest oznaczona jako “nieaprobowana” w standardzie POSIX i gawk wypisuje ostrzeżenie o jej użyciu, o ile podano w wierszu poleceń opcję -W lint.
Inną właściwością jest używanie instrukcji continue lub break poza ciałami pętli while, for lub do. Tradycyjne implementacje AWK traktowały takie użycie jako równoważnik instrukcji next. Gawk realizuje ten sposób użycia, jeśli podano opcję --traditional.
Gawk ma kilka rozszerzeń w stosunku do POSIX awk. Są one opisane w tej sekcji. Wszystkie rozszerzenia, które są tu opisane można wyłączyć, wywołując gawk z opcją --traditional.
Następujące właściwości gawk nie są dostępne w wersjach POSIX awk.
Książka o AWK nie definiuje wartości zwracanej przez funkcję close(). Zaimplementowana w Gawk funkcja close() zwraca wartość z fclose(3) lub pclose(3), zależnie czy zamykano plik czy potok. Zwraca kod zakończenia procesu przy zamykaniu potoku wejściowego. Wartością zwracaną jest -1 jeśli dany plik, potok czy proces współbieżny nie były otwarte za pomocą przekierowania.
Gdy gawk jest wywołany z opcją --traditional, jeśli argumentem fs opcji -F jest “t”, to FS jest ustawiane na znak tabulacji. Zauważ, że wpisanie gawk -F\t ... powoduje po prostu zacytowanie przez powłokę znaku “t” i nie przesyła “\t” do opcji -F. Ponieważ jest to raczej brzydki przypadek specjalny, nie jest to zachowanie domyślne. Zachowanie to nie pojawia się również po podaniu opcji -W posix. Aby faktycznie uzyskać znak tabulacji jako separator pól, najlepiej posłużyć się apostrofami jako znakami cytowania: gawk -F'\t' ....
Do podania listy katalogów przeglądanych przez gawk podczas poszukiwania plików zadanych opcjami -f i --file można posłużyć się zmienną środowiskową AWKPATH.
Jeśli w środowisku istnieje zmienna POSIXLY_CORRECT to gawk zachowuje się tak, jakby podano mu w wierszu poleceń opcję --posix. Jeśli podano opcję --lint, gawk wyda ostrzeżenie o tym efekcie.
egrep(1), getpid(2), getppid(2), getpgrp(2), getuid(2), geteuid(2), getgid(2), getegid(2), getgroups(2)
The AWK Programming Language, Alfred V. Aho, Brian W. Kernighan, Peter J. Weinberger, Addison-Wesley, 1988. ISBN 0-201-07981-X.
GAWK: Efektywne programowanie w AWK, Edition 3.0,
opublikowana przez Free Software Foundation, 2001.
[od tłum.: powyższa publikacja dostarczana jest razem z
opisywaną wersją programu]
Opcja -F niekoniecznie ma właściwość przypisywania zmiennych; pozostaje tylko dla zgodności wstecznej.
Niepoprawne składniowo programy z pojedynczego znaku mogą powodować przepełnienie stosu analizatora, dając niezbyt pomocny komunikat. Programy takie są zaskakująco trudne do do analizy w całkiem ogólnym przypadku, a wysiłek, by to jednak robić nie jest tego wart.
Oryginalna wersja UNIX awk była opracowana i zaimplementowana przez Alfreda Aho, Petera Weinbergera i Briana Kernighana z Bell Laboratories. Brian Kernighan wciąż pracuje nad nią i rozszerza ją.
Paul Rubin i Jay Fenlason, z Free Software Foundation, napisali wersję gawk, zgodną z oryginalną wersją awk, rozprowadzaną w Seventh Edition UNIX. John Woods wprowadził wiele poprawek. David Trueman, z pomocą Arnolda Robbinsa, uczynił gawk zgodnym z nową wersją UNIX awk. Arnold Robbins jest bieżącym opiekunem projektu.
Pierwotny port pod DOS został dokonany przez Conrada Kwoka i Scotta Garfinkle. Scott Deifik jest obecnym opiekunem wersji DOS. Pat Rankin zrobił port na VMS, a Michal Jaegermann zrobił port na Atari ST. Port na OS/2 został zrobiony przez Kai Uwe Rommela, przy udziale i pomocy Darrela Hankersona. Fred Fish zapewnił obsługę dla Amigi, Stephen Davies przeniesienie na Tandem, a Martin Brown na BeOS.
Ta strona podręcznika man opisuje gawk, w wersji numer 3.1.0.
Jeśli znajdziesz w gawk błąd, proszę o przesłanie listu pocztą elektroniczną na adres bug-gnu-utils@gnu.org, z kopią (carbon copy) na arnold@gnu.org. Proszę o załączenie wersji systemu operacyjnego, wersji gawk (otrzymanej z gawk --version), wersji kompilatora C, którym została skompilowana, oraz możliwie małego programu testowego i danych, które umożliwiają powtórzenie problemu.
Przed wysłaniem raportu o błędzie, zrób dwie rzeczy. Najpierw sprawdź, czy masz najnowszą wersję gawk. Wiele błędów (zwykle subtelnych) jest poprawianych w każdej nowej wersji i jeśli twoja wersja jest przedawniona, to być może problem jest już rozwiązany. Po drugie, proszę, przeczytaj uważnie tę stronę podręcznika man oraz podręczniki, aby się upewnić, że to, co uważasz za błąd, jest nim naprawdę, a nie tylko dziwactwem w konstrukcji języka.
Cokolwiek zrobisz, NIE wysyłaj zgłoszenia błędu na grupę dyskusyjną comp.lang.awk. Mimo, że opiekunowie projektu gawk czasami czytają tę grupę, wysyłanie na nią zgłoszeń jest drogą niepewną. Proszę, użyj zamiast tego podanych wyżej adresów poczty elektronicznej.
Brian Kernighan z Bell Laboratories dał wartościowe wsparcie podczas testowania i debuggowania. Dziękujemy.
[Sekcja nietłumaczona z uwagi na ograniczenie zawarte w ostatnim akapicie]
Copyright © 1989, 1991-2001 Free Software Foundation, Inc.
Permission is granted to make and distribute verbatim copies of this manual page provided the copyright notice and this permission notice are preserved on all copies.
Permission is granted to copy and distribute modified versions of this manual page under the conditions for verbatim copying, provided that the entire resulting derived work is distributed under the terms of a permission notice identical to this one.
Permission is granted to copy and distribute translations of this manual page into another language, under the above conditions for modified versions, except that this permission notice may be stated in a translation approved by the Foundation.
Powyższe tłumaczenie pochodzi z nieistniejącego już Projektu Tłumaczenia Manuali i może nie być aktualne. W razie zauważenia różnic między powyższym opisem a rzeczywistym zachowaniem opisywanego programu lub funkcji, prosimy o zapoznanie się z oryginalną (angielską) wersją strony podręcznika za pomocą polecenia:
Prosimy o pomoc w aktualizacji stron man - więcej informacji można znaleźć pod adresem http://sourceforge.net/projects/manpages-pl/.
| 29 maja 2001 | Free Software Foundation |