web-dev-qa-db-ja.com

シェルからのGROUP BY / SUM

次のようなデータを含む大きなファイルがあります。

a 23
b 8
a 22
b 1

これを入手できるようにしたい:

a 45
b 9

最初にこのファイルを並べ替えてから、Python=でファイルを1回スキャンすることでそれを実行できます。これを行う直接的なコマンドラインの方法は何ですか?

33
Legend

編集:数年前のコメントで述べたように、最新の(GNU/Linux)ソリューション;-)。

awk '{
    arr[$1]+=$2
   }
   END {
     for (key in arr) printf("%s\t%s\n", key, arr[key])
   }' file \
   | sort -k1,1

古いUnix sortオプションに基づく、最初に投稿されたソリューション:

awk '{
    arr[$1]+=$2
   }
   END {
     for (key in arr) printf("%s\t%s\n", key, arr[key])
   }' file \
   | sort +0n -1

これがお役に立てば幸いです。

32
shellter

このPerlのワンライナーは仕事をするようです:

Perl -nle '($k, $v) = split; $s{$k} += $v; END {$, = " "; foreach $k (sort keys %s) {print $k, $s{$k}}}' inputfile
8

ここでawkする必要も、ソートする必要もありません。Bash4.0を使用している場合は、連想配列を使用できます。

#!/bin/bash
declare -A values
while read key value; do
  values["$key"]=$(( $value + ${values[$key]:-0} ))
done
for key in "${!values[@]}"; do
  printf "%s %s\n" "$key" "${values[$key]}"
done

...または、最初にファイルをソートした場合(メモリ効率が向上します。GNU sortは、メモリよりも大きいファイルをソートするトリックを実行できます。これは単純なスクリプトです。 awkでは、pythonまたはShell-通常は機能しません)、これは古いバージョンで機能する方法で実行できます(bash 2.0で次のように機能することを期待しています)。

#!/bin/bash
read cur_key cur_value
while read key value; do
  if [[ $key = "$cur_key" ]] ; then
    cur_value=$(( cur_value + value ))
  else
    printf "%s %s\n" "$cur_key" "$cur_value"
    cur_key="$key"
    cur_value="$value"
  fi
done
printf "%s %s\n" "$cur_key" "$cur_value"
8
Charles Duffy

Perlを使用する1つの方法:

Perl -ane '
    next unless @F == 2; 
    $h{ $F[0] } += $F[1]; 
    END { 
        printf qq[%s %d\n], $_, $h{ $_ } for sort keys %h;
    }
' infile

infileの内容:

a 23
b 8
a 22
b 1

出力:

a 45
b 9
2
Birei

GNU awk(バージョンが4未満)の場合:

WHINY_USERS= awk 'END {
  for (E in a)
    print E, a[E]
    }
{ a[$1] += $2 }' infile

GNU awk> = 4の場合:

awk 'END {
  PROCINFO["sorted_in"] = "@ind_str_asc"
  for (E in a)
    print E, a[E]
    }
{ a[$1] += $2 }' infile
2

これは、次のシングルライナーで簡単に実現できます。

cat /path/to/file | termsql "SELECT col0, SUM(col1) FROM tbl GROUP BY col0"

または。

termsql -i /path/to/file "SELECT col0, SUM(col1) FROM tbl GROUP BY col0"

ここでは、Pythonパッケージ、 termsql 、が使用されています。これは、SQLiteのラッパーです。現在 PyPI にアップロードされていないことに注意してください。)また、システム全体にのみインストールできます(setup.pyは少し壊れています)のように:

Sudo pip install https://github.com/tobimensch/termsql/archive/master.Zip
1
saaj