Summary
NVIDIA DGX Spark (ARM64 + CUDA 13.0) 環境での開発ガイド。PyTorch のインストール、ARM64 wheel の取得、GPU 関連の設定を行う。「DGX Spark」「CUDA」「PyTorch インストール」「ARM64 の GPU 環境」「Blackwell」などのリクエストで使用する。
schroneko/skills
NVIDIA DGX Spark (ARM64 + CUDA 13.0) 環境での開発ガイド。PyTorch のインストール、ARM64 wheel の取得、GPU 関連の設定を行う。「DGX Spark」「CUDA」「PyTorch インストール」「ARM64 の GPU 環境」「Blackwell」などのリクエストで使用する。
npx skills add schroneko/skills --skill dgx-spark
NVIDIA DGX Spark (ARM64 + CUDA 13.0) 環境での開発ガイド。PyTorch のインストール、ARM64 wheel の取得、GPU 関連の設定を行う。「DGX Spark」「CUDA」「PyTorch インストール」「ARM64 の GPU 環境」「Blackwell」などのリクエストで使用する。
Related neighbors and high-traction skills in the same topics — useful to compare before installing.
Optimize Apache Spark jobs with partitioning, caching, shuffle optimization, and memory tuning.…
9.4K installsUse when writing Spark jobs, debugging performance issues, or configuring cluster settings for …
3.3K installsDiscovers requirements and generates guidance to design and deploy a governed, secure agentic-a…
2.6K installsPreflight and diagnose the ten known failure modes for ML training on NVIDIA DGX Spark. Use whe…
1.3K installsManage unified memory and thermals during long-running ML jobs on NVIDIA DGX Spark. Use when pl…
1.3K installsSet up a working ML training/inference environment on NVIDIA DGX Spark (GB10, aarch64, CUDA 13)…
1.3K installsOther skills from schroneko/skills · top by installs.
npx skills add schroneko/skills
Declared targets from SKILL.md / docs. Unmarked agents are not listed — the skill may still install via the CLI.
main
Files included with this skill beyond the listing page.
SKILL.md
4,904 B
SUMMARY.md
311 B
このマシンは NVIDIA DGX Spark。
121GB のメモリは CPU と GPU で共有するユニファイドメモリで、使い切るとマシンごと落ちる。実際に flash-attn と gptqmodel を MAXJOBS=10 で同時ソースビルドして DGX Spark がクラッシュし、さらに flash-attn 単体を MAXJOBS=4 NVCCTHREADS=1 TORCHCUDAARCHLIST=12.1 に絞ってもクラッシュして再起動した実績がある。
MAX_JOBS=1 で試すMAXJOBS=2 から MAXJOBS=4、NVCCTHREADS=1 に制限する。gptqmodel 5.8.0 は MAXJOBS=4 で数分でビルドできたfree -h を確認し、available が 30GB を切ったら並列度を下げるか処理を止める/usr/bin/python3) には Python.h が無く、--no-build-isolation の CUDA 拡張ビルドが失敗する。uv python install 3.12 と uv sync --managed-python で uv 管理 Python(ヘッダ同梱)に切り替える--no-build-isolation-package <pkg> を付けて venv の torch を見せるUSEAVX2 を定義していて aarch64 で mmmalloc.h エラーになる。#if defined(__x86_64__) ガードを当てれば JIT 拡張は sm_120 でビルド・動作する(上流バグ)cmake -B build -DGGMLCUDA=ON -DCMAKECUDA_ARCHITECTURES=121 と cmake --build build -j 4 で問題なくビルドできる(121 は自動で 121a に置換される)パッケージのインストール、削除、更新をエージェントやスクリプトから実行する場合は apt-get を使う。man apt では apt は end-user tool とされ、version 間で behavior が変わる可能性があるため、scripts では backward compatibility のため apt-get / apt-cache を prefer すべきと説明されている。
例:
sudo apt-get install -y kitty
対話的に人間が手元で実行するだけなら apt install kitty でもよいが、DGX Spark スキル内の手順やエージェント実行では apt-get を優先する。
PyPI の stable torch 2.11.0 以降は ARM64 + CUDA 13(cu130)の wheel を同梱しており、torch>=2.4 を PyPI からそのまま入れるだけで torch.cuda.is_available() が True になる(2026-07 に DGX Spark 実機で確認済み)。まず PyPI stable を試す。
stable で ARM64 + CUDA wheel が取れない場合のみ、PyTorch nightly から取得する。
pyproject.toml に torch と triton を両方明示し、uv.sources で nightly インデックスを指定する:
[project]
requires-python = ">=3.11,<3.12"
dependencies = [
"torch==2.11.0.dev20260105",
"triton",
]
[tool.uv.sources]
torch = { index = "pytorch-nightly-cu130" }
triton = { index = "pytorch-nightly-cu130" }
[[tool.uv.index]]
name = "pytorch-nightly-cu130"
url = "https://download.pytorch.org/whl/nightly/cu130"
explicit = true
ポイント:
explicit = true で他のパッケージは PyPI から取得する以下のパッケージは ARM64 wheel がない: