芝浦工大「Ozaki Scheme II」、NVIDIA CUDA 13.4に採用 低精度GPUで倍精度計算

芝浦工大「Ozaki Scheme II」、NVIDIA CUDA 13.4に採用 低精度GPUで倍精度計算

※記事を視覚化したイメージであり、実際の事象とは異なります。

本サイトの記事や画像は、AIが公的資料や複数の報道を基に事実関係を整理・再構成し制作したものです。[続きを表示]特定の報道内容や表現を再利用・要約することを目的としたものではありません。ただし、誤りや不確定な情報が含まれる可能性がありますので、参考の一助としてご覧いただき、実際の判断は公的資料や各出典元の原文をご確認ください。[私たちの取り組み]

芝浦工業大学は2026年9月30日、尾崎克久教授らが考案した計算手法「Ozaki Scheme II」が、NVIDIAのCUDA Toolkit 13.4に採用されたと発表した。倍精度行列積を扱うcuBLASでは、従来のOzaki Scheme Iより性能上の利点がある場合にOzaki Scheme IIが使われる。

AI向けGPUの演算能力を科学技術計算に生かす

Ozaki Schemeは、AI向けに強化されたGPUの低精度演算能力を、科学技術計算で求められる倍精度の行列計算に活用する手法だ。芝浦工業大学は応用分野として、気象予測、耐震設計、新材料開発などを挙げる。Ozaki Scheme IIは専用の演算回路を追加するものではなく、NVIDIA Ampere世代以降のGPU上でソフトウェアとして動作する。

2012年に発表されたOzaki Scheme Iは「誤差なし変換」に基づく。一方、IIは整数の剰余と中国剰余定理を用いる別方式で、尾崎教授と理化学研究所の内野佑基氏、今村俊幸氏が共同研究した。IIは2025年にプレプリントとして発表され、2026年7月に国際学術誌で論文が公開された。Iは2025年10月にcuBLASへ実装され、CUDA Toolkit 13.4でIIも利用可能になった。

精度の制御と示された性能値

NVIDIAによると、cuBLASの倍精度エミュレーションは入力行列を固定小数点表現に変換して計算する。標準の動的制御では、FP64と同等以上の精度に必要なビット数を実行時に求め、上限を超える場合は通常のFP64演算へ切り替える。利用者がビット数を固定し、性能と精度を調整することもできる。

CUDA 13.4のリリースノートによると、B200 GPUでのエミュレーション性能は実数のDGEMMで最大175 TFLOPS、複素数のZGEMMで最大295 TFLOPS。ZGEMMは2Mアルゴリズムを組み合わせた値だ。

理化学研究所は「富岳NEXT」の数値計算ライブラリ開発で、Ozaki SchemeによるFP64行列演算エミュレーションを使い、低精度演算器を活用する方針を示している。

参考・出典

ニュースはAIで深化する—。日々の出来事を深掘りし、次の時代を考える視点をお届けします。

本サイトの記事や画像はAIが公的資料や報道を整理し制作したものです。
ただし誤りや不確定な情報が含まれることがありますので、参考の一助としてご覧いただき、
実際の判断は公的資料や他の報道を直接ご確認ください。
[私たちの取り組み]