閉じる

NumPyのファンシーインデックスで配列を並べ替える方法:効率的な抽出とソートの書き方

NumPyは、Pythonにおけるデータサイエンスや機械学習の基盤を支える強力なライブラリとして、2026年現在も進化を続けています。

データ処理の現場では、配列内の要素を特定の順序で並べ替えたり、条件に合致する要素を効率的に抽出したりする操作が頻繁に求められます。

その際に非常に強力な武器となるのが「ファンシーインデックス」という機能です。

ファンシーインデックスを使いこなすことで、複雑なインデックス操作をシンプルかつ高速に記述することが可能になります。

本記事では、ファンシーインデックスを用いた配列の並べ替えや、効率的なデータ抽出の手法について詳しく解説します。

ファンシーインデックスの基本概念

ファンシーインデックスとは、整数配列やリストをインデックスとして渡すことで、複数の要素を一度に取得する手法のことです。

通常のスライス操作では「開始:終了:ステップ」という連続的な範囲を指定しますが、ファンシーインデックスでは不連続な要素も自由に指定できます。

まずは、1次元配列における基本的なファンシーインデックスの使い方を確認しましょう。

Python
import numpy as np

# 配列の作成
arr = np.array([10, 20, 30, 40, 50])

# インデックスをリストで指定して抽出
indices = [0, 3, 4]
result = arr[indices]

print(result)
実行結果
[10 40 50]

このように、指定したインデックスの順番通りに新しい配列が生成されるのが特徴です。

この性質を利用することで、既存の配列を任意の順序に並べ替えることが容易になります。

ファンシーインデックスによる配列の並べ替え

配列の並べ替えを行う際、特定のルールに基づいて要素を再配置したい場合があります。

ファンシーインデックスを使えば、インデックスを指定する配列自体の順番を入れ替えるだけで、元の配列をソートしたかのような結果を得られます。

任意の順序への並べ替え

例えば、5つの要素を持つ配列を逆順、あるいは特定の順序に並べ替えるコードは以下のようになります。

Python
import numpy as np

arr = np.array(["A", "B", "C", "D", "E"])

# 指定した順番に並べ替えるためのインデックス配列
order = [4, 0, 2, 1, 3]
sorted_arr = arr[order]

print(sorted_arr)
実行結果
['E' 'A' 'C' 'B' 'D']

このように、「どの位置の要素を次に持ってくるか」をインデックス配列として定義するのがポイントです。

argsortメソッドとの組み合わせ

実務で最も多く使われるパターンは、np.argsortメソッドとの組み合わせです。

np.argsortは、配列をソートした際の「元の位置(インデックス)」を配列として返す関数です。

Python
import numpy as np

# ランダムな数値配列
data = np.array([35, 10, 55, 20, 45])

# 値が小さい順に並べた場合のインデックスを取得
sort_indices = np.argsort(data)

print(f"ソート用インデックス: {sort_indices}")

# ファンシーインデックスで並べ替えを実行
sorted_data = data[sort_indices]

print(f"ソート結果: {sorted_data}")
実行結果
ソート用インデックス: [1 3 0 4 2]
ソート結果: [10 20 35 45 55]

この手法は、複数の配列を「ある1つの配列の基準」に合わせて同時に並べ替えたい時に非常に便利です。

多次元配列におけるファンシーインデックス

多次元配列(行列)に対しても、ファンシーインデックスを適用することができます。

行と列のそれぞれに対してインデックス配列を指定することで、特定の行や列を抽出したり、順番を入れ替えたりすることが可能です。

Python
import numpy as np

# 3x3の行列作成
matrix = np.array([
    [1, 2, 3],
    [4, 5, 6],
    [7, 8, 9]
])

# 行の順番を入れ替える(3行目、1行目、2行目の順)
row_indices = [2, 0, 1]
reordered_matrix = matrix[row_indices]

print(reordered_matrix)
実行結果
[[7 8 9]
 [1 2 3]
 [4 5 6]]

多次元配列においてファンシーインデックスを適用する場合、以下のルールを覚えておくとスムーズです。

  • 1つの配列のみを渡すと「行」の選択になる。
  • カンマ区切りで2つの配列を渡すと「(行, 列)」のペアとして抽出される。
  • 特定の列だけを並べ替える場合はスライスと組み合わせる。

特に、特定の列の値を基準に行全体をソートする操作はデータ分析で多用されます。

Python
import numpy as np

# 顧客データ(ID, スコア)
customers = np.array([
    [101, 80],
    [102, 95],
    [103, 70]
])

# スコア(1列目)に基づいて行のインデックスを取得
score_indices = np.argsort(customers[:, 1])

# スコアが低い順に行を並べ替え
sorted_customers = customers[score_indices]

print(sorted_customers)
実行結果
[[103  70]
 [101  80]
 [102  95]]

ファンシーインデックス使用時の注意点

非常に便利なファンシーインデックスですが、使用する際に注意すべきパフォーマンス上の特性があります。

コピーとビューの違い

NumPyのスライス操作は元の配列の「ビュー(参照)」を返しますが、ファンシーインデックスは常にデータの「コピー」を生成します。

つまり、ファンシーインデックスで取得した配列の値を書き換えても、元の配列には影響を与えません。

大規模なデータセットを扱う場合、頻繁なコピーはメモリを圧迫する可能性があるため、注意が必要です。

代入操作における挙動

ファンシーインデックスを左辺に用いて値を代入する場合は、元の配列が更新されます。

ただし、同じインデックスが複数回含まれている場合の代入には注意が必要です。

Python
import numpy as np

x = np.zeros(5)
indices = [1, 1, 1]
x[indices] = [1, 2, 3]

print(x)
実行結果
[0. 3. 0. 0. 0.]

この場合、インデックス1に対して順次1, 2, 3が代入され、最終的に3が残ります。

直感に反する複雑な挙動を避けるため、代入時はインデックスの重複を避けるのが無難です。

ファンシーインデックスと他の手法の比較

NumPyには他にも配列を操作する方法があります。

状況に応じて適切なメソッドを選択できるように、以下の表を参考にしてください。

手法主な特徴戻り値の形式
スライス連続的な範囲の抽出。高速。ビュー(参照)
ファンシーインデックス不連続な指定や並べ替えが可能。コピー
ブールインデックス条件式(True/False)に基づく抽出。コピー
np.take()ファンシーインデックスと同等の機能。軸指定が容易。コピー

特にプログラム内で動的に抽出対象が変わる場合は、ファンシーインデックスが最も柔軟に対応できます。

まとめ

NumPyのファンシーインデックスは、配列の要素を柔軟かつ効率的に抽出・並べ替えするための不可欠な機能です。

整数配列を用いたインデックス指定により、複雑なソート処理もわずか一行のコードで記述できるようになります。

特にnp.argsortとの連携は、データ分析において実数値を基準にした順序制御を行う際の定石です。

ただし、スライスとは異なり常にデータのコピーが作成されるという性質を理解し、メモリ使用量に配慮することも忘れないようにしましょう。

このテクニックを習得することで、NumPyを用いたデータ処理の生産性は飛躍的に向上します。

URLをコピーしました!