敗者木ソートを使用する

敗者木ソート (loser tree sort) は、各要素を葉とする完全二分木でトーナメントを行い、最小を繰り返し取り出す整列である。内部ノードに勝者ではなく敗者(昇順なら大きい方のインデックス)を残し、全体の勝者だけを根の外(ls[0])に置く点がトーナメントソート(勝者木)と異なる。

更新時は「新しい挑戦者」と各内部ノードに記録された敗者だけを比較すればよく、左右の子を両方読み直さずにパス上の再試合で新しい全体勝者を決められる。k 本の整列済み列を併合する外部マージでも、同じ形の敗者木が比較更新を O(log k) に抑える部品として使われる。

  1. 木の準備: 要素数 n 以上の 2 の冪 k を葉数とし、配列 ls(長さ k)を用意する。ls[0] は全体の勝者インデックス、ls[1..k) は各内部ノードの敗者インデックスを持つ。葉 ii ≥ n は無効)は値配列上の位置そのものとみなす。
  2. 構築: 葉から根へ向かい、左右の子の勝者同士を比較して敗者を ls[i] に書き、勝者を親へ渡す。最終的な勝者を ls[0] に置く。
  3. 抽出: ls[0] が示す位置の値を出力へ書き、その葉を番兵(比較上の無限大)で無効化する。
  4. 更新: 無効化した葉から親へ遡る。各内部ノードでは挑戦者 s と記録済み敗者 ls[t] を比べ、大きい方を新しい敗者として残し、小さい方を s として上へ進める。根に達したら ls[0] を更新する。
  5. 繰り返し: n 回手順 3〜4 を行えば昇順に整列する。
procedure adjust(A, ls, k, s)
  t = parent of leaf s   // (s + k) / 2
  while t > 0
    if key(A, s) > key(A, ls[t])
      swap s and ls[t]   // loser stays in ls[t], winner continues as s
    t = t / 2
  ls[0] = s

procedure loser_tree_sort(A)
  n = length(A)
  k = smallest power of 2 with k >= n
  build ls[1..k) with losers bottom-up; ls[0] = overall winner
  for pos from 0 to n - 1
    idx = ls[0]
    output[pos] = A[idx]
    mark A[idx] as removed (sentinel)
    adjust(A, ls, k, idx)
  copy output back into A

比較回数は構築・抽出合わせて O(n log n)、敗者木と出力バッファに O(n) の追加領域が要る。等値の扱いは規約依存で、一般に不安定である。勝者木と同じ漸近計算量だが、パス上の再試合が「記録済み敗者との 1 比較」に落ちるため、k 分マージの実装では敗者木が選ばれやすい。

類似アルゴリズムとの相違点

トーナメントソートは内部ノードに勝者を置く勝者木であり、更新時に左右の子の勝者を読み直す。

選択ソートと同じく最小を繰り返し確定するが、木で比較結果を再利用する。

ファンネルソートの k 入力マージャも多入力併合だが、本稿の敗者木は固定長のトーナメント構造そのものを整列の本体にする。

計算時間量および空間計算量を計測する

Size Average time Maximum time Average memory Maximum memory
256 0.000009 0.000069 8 8
512 0.000020 0.000134 16 16
1024 0.000043 0.000140 32 32
2048 0.000092 0.000169 64 64
4096 0.000201 0.000468 128 128
8192 0.000434 0.000752 256 256
16384 0.000946 0.002635 512 512
32768 0.002032 0.008853 1024 1024
65536 0.004436 0.008370 2048 2048
131072 0.009761 0.026974 4096 4096
262144 0.023467 0.126202 8192 8192
計測に使用したコードを表示する

set -euo pipefail

WORKDIR="$(mktemp -d)"
trap 'rm -rf "$WORKDIR"' EXIT

cat > "$WORKDIR/Dockerfile" <<'EOF'
FROM rust:1.95.0

WORKDIR /app

RUN mkdir -p src

RUN cat > Cargo.toml <<'CARGO'
[package]
name = "rust-benchmark"
version = "0.1.0"
edition = "2021"

[profile.release]
lto = true
codegen-units = 1
panic = "abort"
CARGO

RUN cat > src/main.rs <<'RUST'
use std::{
    alloc::{GlobalAlloc, Layout, System},
    env,
    process::Command,
    sync::atomic::{AtomicUsize, Ordering},
    time::{Duration, Instant},
};

/// Counts live heap bytes and the high-water mark so auxiliary sort buffers
/// (swap Vecs, etc.) are measured as explicit heap growth during the sort.
struct TrackingAllocator;

static LIVE_BYTES: AtomicUsize = AtomicUsize::new(0);
static PEAK_BYTES: AtomicUsize = AtomicUsize::new(0);

fn record_alloc(size: usize) {
    let live = LIVE_BYTES.fetch_add(size, Ordering::Relaxed) + size;
    PEAK_BYTES.fetch_max(live, Ordering::Relaxed);
}

unsafe impl GlobalAlloc for TrackingAllocator {
    unsafe fn alloc(&self, layout: Layout) -> *mut u8 {
        let ptr = System.alloc(layout);
        if !ptr.is_null() {
            record_alloc(layout.size());
        }
        ptr
    }

    unsafe fn dealloc(&self, ptr: *mut u8, layout: Layout) {
        LIVE_BYTES.fetch_sub(layout.size(), Ordering::Relaxed);
        System.dealloc(ptr, layout);
    }

    unsafe fn alloc_zeroed(&self, layout: Layout) -> *mut u8 {
        let ptr = System.alloc_zeroed(layout);
        if !ptr.is_null() {
            record_alloc(layout.size());
        }
        ptr
    }

    unsafe fn realloc(&self, ptr: *mut u8, layout: Layout, new_size: usize) -> *mut u8 {
        let new_ptr = System.realloc(ptr, layout, new_size);
        if !new_ptr.is_null() {
            LIVE_BYTES.fetch_sub(layout.size(), Ordering::Relaxed);
            record_alloc(new_size);
        }
        new_ptr
    }
}

#[global_allocator]
static GLOBAL: TrackingAllocator = TrackingAllocator;
const MIN_POWER: u32 = 8;
const MAX_POWER: u32 = 18;
const RUNS: usize = 8192;


fn player_key(a: &[usize], idx: usize) -> usize {
    if idx == usize::MAX {
        usize::MAX
    } else {
        a[idx]
    }
}

fn loser_and_winner(a: &[usize], left: usize, right: usize) -> (usize, usize) {
    match (left, right) {
        (usize::MAX, r) => (usize::MAX, r),
        (l, usize::MAX) => (usize::MAX, l),
        (l, r) => {
            if player_key(a, l) <= player_key(a, r) {
                (r, l)
            } else {
                (l, r)
            }
        }
    }
}

fn adjust_loser_tree(a: &[usize], ls: &mut [usize], k: usize, mut s: usize) {
    let mut t = (s + k) / 2;
    while t > 0 {
        if player_key(a, s) > player_key(a, ls[t]) {
            core::mem::swap(&mut s, &mut ls[t]);
        }
        t /= 2;
    }
    ls[0] = s;
}

fn loser_tree_sort(a: &mut [usize]) {
    let n = a.len();
    if n <= 1 {
        return;
    }
    let k = n.next_power_of_two();
    let mut ls = vec![usize::MAX; k];
    let mut winner = vec![usize::MAX; 2 * k];
    for i in 0..k {
        winner[k + i] = if i < n { i } else { usize::MAX };
    }
    for i in (1..k).rev() {
        let (loser, win) = loser_and_winner(a, winner[2 * i], winner[2 * i + 1]);
        ls[i] = loser;
        winner[i] = win;
    }
    ls[0] = winner[1];

    let mut out = vec![0usize; n];
    for pos in 0..n {
        let idx = ls[0];
        out[pos] = a[idx];
        a[idx] = usize::MAX;
        adjust_loser_tree(a, &mut ls, k, idx);
    }
    a.copy_from_slice(&out);
}


fn benchmark_sort(array: &mut [usize]) {

    loser_tree_sort(array);

}

fn is_non_decreasing(a: &[usize]) -> bool {
    a.windows(2).all(|w| w[0] <= w[1])
}

fn same_multiset(a: &[usize], b: &[usize]) -> bool {
    if a.len() != b.len() {
        return false;
    }

    let mut left = a.to_vec();
    let mut right = b.to_vec();
    left.sort_unstable();
    right.sort_unstable();
    left == right
}

fn check_correctness_case(label: &str, mut input: Vec<usize>) {
    let original = input.clone();

    benchmark_sort(&mut input);

    if !is_non_decreasing(&input) {
        panic!("correctness case {}: output is not sorted", label);
    }

    if !same_multiset(&input, &original) {
        panic!("correctness case {}: elements were lost or added", label);
    }
}

fn few_unique_values(size: usize, unique: usize, seed: u64) -> Vec<usize> {
    let mut state = seed;

    (0..size)
        .map(|_| {
            state ^= state << 13;
            state ^= state >> 7;
            state ^= state << 17;
            (state as usize % unique) + 1
        })
        .collect()
}

fn run_correctness_checks() {
    check_correctness_case("empty", vec![]);
    check_correctness_case("single", vec![42]);
    check_correctness_case("duplicates", vec![3, 1, 3, 2, 1, 2]);
    check_correctness_case("sorted", vec![1, 2, 3, 4, 5]);
    check_correctness_case("reverse", vec![5, 4, 3, 2, 1]);
    check_correctness_case("all_equal", vec![7, 7, 7, 7]);
    check_correctness_case("skewed_range", vec![1_000_000, 2, 1_000_001, 1, 999_999]);
    // Static-buffer Grail skips the in-buffer build when key collection is sparse
    // (ideal_buffer = false). Exercising that path catches regressions in buffer gating.
    check_correctness_case(
        "few_keys_len16",
        vec![2, 2, 2, 2, 2, 2, 2, 2, 4, 3, 1, 2, 3, 4, 1, 4],
    );
    // Seed 0 is a fixed point of the xorshift below, so it would degenerate into
    // yet another all-equal case instead of a 4-value mix. Start at 1.
    for seed in 1..=32 {
        check_correctness_case(
            &format!("few_keys_len32_seed_{seed}"),
            few_unique_values(32, 4, seed),
        );
    }
}


fn shuffled(size: usize, seed: u64) -> Vec<usize> {
    let mut v: Vec<usize> = (1..=size).collect();

    let mut state = seed;

    for i in (1..size).rev() {
        state ^= state << 13;
        state ^= state >> 7;
        state ^= state << 17;

        let j = (state as usize) % (i + 1);

        v.swap(i, j);
    }

    v
}

fn micros(d: Duration) -> u128 {
    d.as_micros()
}

fn input_array(size: usize, seed: u64) -> Vec<usize> {
    shuffled(size, seed)
}

/// Peak heap growth during `benchmark_sort`, in KiB (explicit buffers such as swap).
fn run_once(size: usize, seed: usize) -> (u128, usize) {
    let mut array = input_array(size, seed as u64);

    let base_bytes = LIVE_BYTES.load(Ordering::Relaxed);
    PEAK_BYTES.store(base_bytes, Ordering::Relaxed);

    let start = Instant::now();

    benchmark_sort(&mut array);

    let elapsed = start.elapsed();
    let peak_bytes = PEAK_BYTES.load(Ordering::Relaxed);
    let aux_kb = peak_bytes.saturating_sub(base_bytes) / 1024;

    let expected: Vec<usize> = (1..=size).collect();
    if array != expected {
        panic!(
            "sort failed with seed {} for size {}",
            seed,
            size
        );
    }

    (micros(elapsed), aux_kb)
}

fn run_child(args: &[String]) {
    let size = args[2].parse::<usize>().expect("invalid size");
    let seed = args[3].parse::<usize>().expect("invalid seed");
    let (elapsed_us, mem) = run_once(size, seed);
    println!("{} {}", elapsed_us, mem);
}

fn main() {
    let args: Vec<String> = env::args().collect();
    if args.get(1).is_some_and(|arg| arg == "--run-once") {
        run_child(&args);
        return;
    }

    run_correctness_checks();

    println!(
        "| {:>10} | {:>15} | {:>15} | {:>15} | {:>15} |",
        "Size",
        "Average time",
        "Maximum time",
        "Average memory",
        "Maximum memory"
    );

    println!(
        "|{:-<11}:|{:-<16}:|{:-<16}:|{:-<16}:|{:-<16}:|",
        "",
        "",
        "",
        "",
        ""
    );

    for power in MIN_POWER..=MAX_POWER {
        let size = 1usize << power;

        let mut total_time: u128 = 0;
        let mut max_time: u128 = 0;

        let mut total_mem: usize = 0;
        let mut max_mem: usize = 0;

        for seed in 1..=RUNS {
            let output = Command::new(env::current_exe().expect("failed to find current executable"))
                .arg("--run-once")
                .arg(size.to_string())
                .arg(seed.to_string())
                .output()
                .expect("failed to run benchmark child process");

            if !output.status.success() {
                panic!(
                    "benchmark child process failed: {}",
                    String::from_utf8_lossy(&output.stderr)
                );
            }

            let stdout = String::from_utf8(output.stdout)
                .expect("child process returned non-UTF-8 output");
            let mut fields = stdout.split_whitespace();
            let elapsed_us = fields
                .next()
                .expect("missing elapsed time")
                .parse::<u128>()
                .expect("invalid elapsed time");
            let aux_mem = fields
                .next()
                .expect("missing memory usage")
                .parse::<usize>()
                .expect("invalid memory usage");

            total_time += elapsed_us;

            if elapsed_us > max_time {
                max_time = elapsed_us;
            }

            total_mem += aux_mem;

            if aux_mem > max_mem {
                max_mem = aux_mem;
            }
        }

        let avg_time = total_time / RUNS as u128;
        let avg_mem = total_mem / RUNS;

        println!(
            "| {:>10} | {:>15} | {:>15} | {:>15} | {:>15} |",
            size,
            format!("{}.{:06}", avg_time / 1_000_000, avg_time % 1_000_000),
            format!("{}.{:06}", max_time / 1_000_000, max_time % 1_000_000),
            avg_mem,
            max_mem
        );
    }
}
RUST

RUN cargo build --release

CMD ["./target/release/rust-benchmark"]
EOF

docker build -t rust-benchmark "$WORKDIR"
docker run --rm --init rust-benchmark