JP7843975B1 - 情報処理システム、情報処理方法、プログラム及び記憶媒体 - Google Patents
情報処理システム、情報処理方法、プログラム及び記憶媒体Info
- Publication number
- JP7843975B1 JP7843975B1 JP2026507626A JP2026507626A JP7843975B1 JP 7843975 B1 JP7843975 B1 JP 7843975B1 JP 2026507626 A JP2026507626 A JP 2026507626A JP 2026507626 A JP2026507626 A JP 2026507626A JP 7843975 B1 JP7843975 B1 JP 7843975B1
- Authority
- JP
- Japan
- Prior art keywords
- processor
- memory
- machine learning
- information processing
- learning model
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/045—Combinations of networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/06—Physical realisation, i.e. hardware implementation of neural networks, neurons or parts of neurons
- G06N3/063—Physical realisation, i.e. hardware implementation of neural networks, neurons or parts of neurons using electronic means
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Theoretical Computer Science (AREA)
- Health & Medical Sciences (AREA)
- Life Sciences & Earth Sciences (AREA)
- Biomedical Technology (AREA)
- Biophysics (AREA)
- General Health & Medical Sciences (AREA)
- Data Mining & Analysis (AREA)
- Evolutionary Computation (AREA)
- Computational Linguistics (AREA)
- Molecular Biology (AREA)
- Computing Systems (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Mathematical Physics (AREA)
- Software Systems (AREA)
- Artificial Intelligence (AREA)
- Neurology (AREA)
- Advance Control (AREA)
Abstract
Description
本開示の第1実施形態は、機械学習モデルに基づいて所定のタスクを実行する情報処理システムの一例である。本実施形態では、機械学習モデルは、注意機構を有するニューラルネットワークを含んでもよい。注意機構を有するニューラルネットワークは、一例として、トランスフォーマー(Transformer)等とも呼ばれるニューラルネットワークでもよい。
本実施形態に係る情報処理システムの全体構成について、図2乃至図4を参照しながら説明する。
情報処理システム1000が実行する機械学習モデルの推論処理について、図5を参照しながら説明する。図5は、機械学習モデルの推論処理の一例を示すフローチャートである。ここでは、図2に示した情報処理システム1000が機械学習モデルの推論処理を実行する例を説明する。
上記の実施形態では、情報処理システム1000が、機械学習モデルの推論処理を実行する構成を説明した。機械学習モデルの推論処理は、機械学習モデルの訓練処理のために実行されてもよい。
以上の説明から明らかなように、本開示の一実施形態に係る情報処理システム1000は、少なくとも1つの第1のメモリと、少なくとも1つの第1のメモリに接続された少なくとも1つの第1のプロセッサと、少なくとも1つの第2のメモリと、少なくとも1つの第2のメモリに接続された少なくとも1つの第2のプロセッサと、を備える。少なくとも1つの第1のプロセッサは、入力情報を機械学習モデルに入力することで、中間データを生成し、中間データの少なくとも一部を少なくとも1つの第2のメモリへ送信する。少なくとも1つの第2のプロセッサは、少なくとも1つの第1のプロセッサが少なくとも1つの第2のメモリへ送信した中間データの少なくとも一部を用いて、機械学習モデルの出力情報を生成する。少なくとも1つの第1のプロセッサの演算速度に対する少なくとも1つの第1のメモリのデータ転送速度の比は、少なくとも1つの第2のプロセッサの演算速度に対する少なくとも1つの第2のメモリのデータ転送速度の比よりも低い。
前述した実施形態における各装置(サーバ装置10,20)の一部又は全部は、ハードウェアで構成されていてもよいし、CPU(Central Processing Unit)、GPU(Graphics Processing Unit)等が実行するソフトウェア(プログラム)の情報処理で構成されてもよい。ソフトウェアの情報処理で構成される場合には、前述した実施形態における各装置の少なくとも一部の機能を実現するソフトウェアを、CD-ROM(Compact Disc-Read Only Memory)、USB(Universal Serial Bus)メモリ等の非一時的な記憶媒体(非一時的なコンピュータ可読媒体)に収納し、コンピュータに読み込ませることにより、ソフトウェアの情報処理を実行してもよい。また、通信ネットワークを介して当該ソフトウェアがダウンロードされてもよい。さらに、ソフトウェアの処理の全部又は一部がASIC(Application Specific Integrated Circuit)、FPGA(Field Programmable Gate Array)等の回路に実装されることにより、当該ソフトウェアによる情報処理がハードウェアにより実行されてもよい。
少なくとも1つの第1のメモリと、
前記少なくとも1つの第1のメモリと接続された少なくとも1つの第1のプロセッサと、
少なくとも1つの第2のメモリと、
前記少なくとも1つの第2のメモリと接続された少なくとも1つの第2のプロセッサと、を有し、
前記少なくとも1つの第1のプロセッサは、
入力情報を機械学習モデルに入力することで、中間データを生成し、
前記中間データの少なくとも一部を前記少なくとも1つの第2のメモリへ送信し、
前記少なくとも1つの第2のプロセッサは、
前記少なくとも1つの第1のプロセッサが前記少なくとも1つの第2のメモリに送信した前記中間データの少なくとも一部を用いて、前記機械学習モデルの出力情報を生成し、
前記少なくとも1つの第1のプロセッサの演算速度に対する前記少なくとも1つの第1のメモリのデータ転送速度の比は、前記少なくとも1つの第2のプロセッサの演算速度に対する前記少なくとも1つの第2のメモリのデータ転送速度の比よりも低い、
情報処理システム。
前記少なくとも1つの第1のメモリは、前記機械学習モデルの少なくとも一部のパラメータを記憶し、
前記少なくとも1つの第2のメモリは、前記機械学習モデルの少なくとも一部のパラメータを記憶する、
付記1に記載の情報処理システム。
前記少なくとも1つの第1のプロセッサは、
前記機械学習モデルを用いて、プレフィル過程の処理を実行することで前記中間データを生成し、
前記少なくとも1つの第2のプロセッサは、
前記機械学習モデルを用いて、デコード過程の処理により前記出力情報を生成する、
付記1又は2に記載の情報処理システム。
前記機械学習モデルは、注意機構を有するニューラルネットワークを含む、
付記3に記載の情報処理システム。
前記中間データの少なくとも一部は、前記注意機構で用いられるキーベクトル及びバリューベクトルの少なくとも一部を含む、
付記4に記載の情報処理システム。
前記少なくとも1つの第1のプロセッサは、
前記機械学習モデルを用いて、演算律速となる第1の処理を実行することで前記中間データを生成し、
前記少なくとも1つの第2のプロセッサは、
前記機械学習モデルを用いて、メモリ律速となる第2の処理により前記出力情報を生成する、
付記1から5のいずれかに記載の情報処理システム。
前記第1の処理は、前記機械学習モデルを用いたプレフィル過程の処理であり、
前記第2の処理は、前記機械学習モデルを用いたデコード過程の処理である、
付記6に記載の情報処理システム。
前記機械学習モデルは、状態空間モデルを含む、
付記6に記載の情報処理システム。
前記中間データの少なくとも一部は、前記状態空間モデルにおける状態の少なくとも一部を含む、
付記8に記載の情報処理システム。
前記少なくとも1つの第2のプロセッサは、
過去に実行した前記第2の処理で生成された前記出力情報を用いて前記第2の処理を繰り返し実行する、
付記6から9のいずれかに記載の情報処理システム。
前記少なくとも1つの第1のプロセッサは、
前記中間データの生成が完了する前に、前記中間データの少なくとも一部の送信を開始する、
付記1から10のいずれかに記載の情報処理システム。
前記少なくとも1つの第1のプロセッサは、
前記中間データの生成が完了した後に、前記中間データの少なくとも一部の送信を開始する、
付記1から11のいずれかに記載の情報処理システム。
前記演算速度に対する前記データ転送速度の比は、前記機械学習モデルに関する処理全体を実行したときの総演算回数に対する総データ転送量の比である、
付記1から12のいずれかに記載の情報処理システム。
前記演算速度に対する前記データ転送速度の比は、前記機械学習モデルに関する処理を実行したときの単位時間当たりの演算回数に対する単位時間当たりのデータ転送量の比である、
付記1から13のいずれかに記載の情報処理システム。
複数の前記第2のメモリと、
複数の前記第2のプロセッサと、を有し、
前記少なくとも1つの第1のプロセッサは、
前記複数の前記第2のメモリそれぞれに、前記中間データの少なくとも一部を送信する、
付記1から14のいずれかに記載の情報処理システム。
前記複数の前記第2のプロセッサは、クラスタを構成する、
付記15に記載の情報処理システム。
複数の前記第1のメモリと、
複数の前記第1のプロセッサと、を有し、
前記複数の前記第1のプロセッサは、
前記複数の前記第1のプロセッサそれぞれで生成された前記中間データの少なくとも一部を結合して前記少なくとも1つの第2のメモリに送信する、
付記1から16のいずれかに記載の情報処理システム。
前記情報処理システムは、
前記機械学習モデルの推論処理を実行する、
付記1から17のいずれかに記載の情報処理システム。
前記情報処理システムは、
前記機械学習モデルの訓練処理のために前記推論処理を実行する、
付記18に記載の情報処理システム。
前記少なくとも1つの第1のメモリと、前記少なくとも1つの第1のメモリと接続された前記少なくとも1つの第1のプロセッサと、を有する第1の処理装置と、
前記少なくとも1つの第2のメモリと、前記少なくとも1つの第2のメモリと接続された前記少なくとも1つの第2のプロセッサと、を有する第2の処理装置と、
を有する、
付記1から19のいずれかに記載の情報処理システム。
少なくとも1つの第1のメモリと接続された少なくとも1つの第1のプロセッサが、
入力情報を機械学習モデルに入力することで、中間データを生成し、
前記中間データの少なくとも一部を、少なくとも1つの第2のメモリへ送信し、
前記少なくとも1つの第2のメモリと接続された少なくとも1つの第2のプロセッサが、
前記少なくとも1つの第1のプロセッサが前記少なくとも1つの第2のメモリへ送信した前記中間データの少なくとも一部を用いて、前記機械学習モデルの出力情報を生成し、
前記少なくとも1つの第1のプロセッサの演算速度に対する前記少なくとも1つの第1のメモリのデータ転送速度の比は、前記少なくとも1つの第2のプロセッサの演算速度に対する前記少なくとも1つの第2のメモリのデータ転送速度の比よりも低い、
情報処理方法。
少なくとも1つの第1のメモリと接続された少なくとも1つの第1のプロセッサに、
入力情報を機械学習モデルに入力することで、中間データを生成し、
前記中間データの少なくとも一部を、少なくとも1つの第2のメモリへ送信する、
処理を実行させ、
前記少なくとも1つの第2のメモリと接続された少なくとも1つの第2のプロセッサに、
前記少なくとも1つの第1のプロセッサが前記少なくとも1つの第2のメモリへ送信した前記中間データの少なくとも一部を用いて、前記機械学習モデルの出力情報を生成する、
処理を実行させ、
前記少なくとも1つの第1のプロセッサの演算速度に対する前記少なくとも1つの第1のメモリのデータ転送速度の比は、前記少なくとも1つの第2のプロセッサの演算速度に対する前記少なくとも1つの第2のメモリのデータ転送速度の比よりも低い、
プログラム。
100,200:処理装置
110,210:プロセッサ
120,220:メモリ
130,230:ネットワークインタフェース
1000:情報処理システム
Claims (56)
- 少なくとも1つの第1のメモリと、
前記少なくとも1つの第1のメモリと接続された少なくとも1つの第1のプロセッサと、
少なくとも1つの第2のメモリと、
前記少なくとも1つの第2のメモリと接続された少なくとも1つの第2のプロセッサと、を有し、
前記少なくとも1つの第1のプロセッサは、
入力情報を機械学習モデルに入力することで、中間データを生成し、
前記少なくとも1つの第2のプロセッサは、
前記少なくとも1つの第1のプロセッサが生成した前記中間データの少なくとも一部を用いて、前記機械学習モデルの出力情報を生成し、
前記少なくとも1つの第1のプロセッサの演算速度に対する前記少なくとも1つの第1のメモリのデータ転送速度の比は、前記少なくとも1つの第2のプロセッサの演算速度に対する前記少なくとも1つの第2のメモリのデータ転送速度の比よりも低く、
前記第1のプロセッサと前記第2のプロセッサとは、異なる種類のプロセッサである、
情報処理システム。 - 前記少なくとも1つの第1のメモリは、前記機械学習モデルの少なくとも一部のパラメータを記憶し、
前記少なくとも1つの第2のメモリは、前記機械学習モデルの少なくとも一部のパラメータを記憶する、
請求項1に記載の情報処理システム。 - 前記少なくとも1つの第1のプロセッサは、
前記機械学習モデルを用いて、プレフィル過程の処理を実行することで前記中間データを生成し、
前記少なくとも1つの第2のプロセッサは、
前記機械学習モデルを用いて、デコード過程の処理を実行することで前記出力情報を生成する、
請求項1に記載の情報処理システム。 - 前記機械学習モデルは、注意機構を有するニューラルネットワークを含む、
請求項3に記載の情報処理システム。 - 前記中間データの少なくとも一部は、前記注意機構で用いられるキーベクトル及びバリューベクトルの少なくとも一部を含む、
請求項4に記載の情報処理システム。 - 前記少なくとも1つの第1のプロセッサは、
層ごとに生成された前記キーベクトル及びバリューベクトルを、前記層ごとに前記少なくとも1つの第2のメモリに送信する、
請求項5に記載の情報処理システム。 - 前記少なくとも1つの第1のプロセッサは、
前記機械学習モデルを用いて、第1の処理を実行することで前記中間データを生成し、
前記少なくとも1つの第2のプロセッサは、
前記機械学習モデルを用いて、第2の処理を実行することで前記出力情報を生成する、
請求項1に記載の情報処理システム。 - 前記第1の処理は、演算律速となる処理であり、
前記第2の処理は、メモリ律速となる処理である、
請求項7に記載の情報処理システム。 - 前記第1の処理は、プレフィル過程の処理であり、
前記第2の処理は、デコード過程の処理である、
請求項7に記載の情報処理システム。 - 前記機械学習モデルは、状態空間モデルを含む、
請求項7に記載の情報処理システム。 - 前記中間データの少なくとも一部は、前記状態空間モデルにおける状態の少なくとも一部を含む、
請求項10に記載の情報処理システム。 - 前記少なくとも1つの第2のプロセッサは、
過去に実行した前記第2の処理で生成された前記出力情報を用いて前記第2の処理を繰り返し実行する、
請求項7に記載の情報処理システム。 - 前記演算速度に対する前記データ転送速度の比は、前記機械学習モデルに関する処理全体を実行したときの総演算回数に対する総データ転送量の比である、
請求項1に記載の情報処理システム。 - 前記演算速度に対する前記データ転送速度の比は、前記機械学習モデルに関する処理を実行したときの単位時間当たりの演算回数に対する単位時間当たりのデータ転送量の比である、
請求項1に記載の情報処理システム。 - 前記少なくとも1つの第2のメモリは、積層された3次元構造のメモリを含む、
請求項1に記載の情報処理システム。 - 複数の前記第2のメモリと、
複数の前記第2のプロセッサと、を有し、
複数の前記第2のプロセッサのそれぞれは、
前記少なくとも1つの第1のプロセッサが生成した前記中間データの少なくとも一部を用いて、前記機械学習モデルの前記出力情報を生成する、
請求項1から15のいずれかに記載の情報処理システム。 - 前記複数の前記第2のプロセッサは、クラスタを構成する、
請求項16に記載の情報処理システム。 - 複数の前記第1のメモリと、
複数の前記第1のプロセッサと、を有し、
前記複数の前記第1のプロセッサは、
前記複数の前記第1のプロセッサそれぞれで生成された前記中間データの少なくとも一部を結合して前記少なくとも1つの第2のメモリに送信する、
請求項1から15のいずれかに記載の情報処理システム。 - 前記情報処理システムは、
前記機械学習モデルの推論処理を実行する、
請求項1から15のいずれかに記載の情報処理システム。 - 前記情報処理システムは、
前記機械学習モデルの訓練処理のために前記推論処理を実行する、
請求項19に記載の情報処理システム。 - 前記少なくとも1つの第1のメモリと、前記少なくとも1つの第1のメモリと接続された前記少なくとも1つの第1のプロセッサと、を有する第1の処理装置と、
前記少なくとも1つの第2のメモリと、前記少なくとも1つの第2のメモリと接続された前記少なくとも1つの第2のプロセッサと、を有する第2の処理装置と、
を有し、
前記第1の処理装置と前記第2の処理装置とは、異なる種類の処理装置である、
請求項1から15のいずれかに記載の情報処理システム。 - 前記第1の処理装置は、前記中間データの生成が完了する前に、前記中間データの少なくとも一部の前記第2の処理装置への送信を開始する、
請求項21に記載の情報処理システム。 - 前記第1の処理装置は、前記中間データの生成が完了した後に、前記中間データの少なくとも一部の前記第2の処理装置への送信を開始する、
請求項21に記載の情報処理システム。 - 前記第1の処理装置は、第1のGPUパッケージであり、
前記第2の処理装置は、第2のGPUパッケージである、
請求項21に記載の情報処理システム。 - 前記第1の処理装置は、第1の種類のアクセラレータであり、
前記第2の処理装置は、第2の種類のアクセラレータである、
請求項21に記載の情報処理システム。 - 前記第1の処理装置と前記第2の処理装置は、インターコネクトで接続されている、
請求項21に記載の情報処理システム。 - 複数の前記第1の処理装置と、複数の前記第2の処理装置と、を有する、
請求項21に記載の情報処理システム。 - 前記複数の前記第1の処理装置の数と前記複数の前記第2の処理装置の数は同一である、
請求項27に記載の情報処理システム。 - クラスタを構成する、
請求項1から15のいずれかに記載の情報処理システム。 - 少なくとも1つの第1のメモリと接続された少なくとも1つの第1のプロセッサが、
入力情報を機械学習モデルに入力することで、中間データを生成し、
少なくとも1つの第2のメモリと接続された少なくとも1つの第2のプロセッサが、
前記少なくとも1つの第1のプロセッサが生成した前記中間データの少なくとも一部を用いて、前記機械学習モデルの出力情報を生成し、
前記少なくとも1つの第1のプロセッサの演算速度に対する前記少なくとも1つの第1のメモリのデータ転送速度の比は、前記少なくとも1つの第2のプロセッサの演算速度に対する前記少なくとも1つの第2のメモリのデータ転送速度の比よりも低く、
前記第1のプロセッサと前記第2のプロセッサとは、異なる種類のプロセッサである、
情報処理方法。 - 前記少なくとも1つの第1のプロセッサは、
前記機械学習モデルを用いて、プレフィル過程の処理を実行することで前記中間データを生成し、
前記少なくとも1つの第2のプロセッサは、
前記機械学習モデルを用いて、デコード過程の処理を実行することで前記出力情報を生成する、
請求項30に記載の情報処理方法。 - 前記機械学習モデルは、注意機構を有するニューラルネットワークを含む、
請求項31に記載の情報処理方法。 - 前記中間データの少なくとも一部は、前記注意機構で用いられるキーベクトル及びバリューベクトルの少なくとも一部を含む、
請求項32に記載の情報処理方法。 - 前記少なくとも1つの第1のプロセッサは、
層ごとに生成された前記キーベクトル及びバリューベクトルを、前記層ごとに前記少なくとも1つの第2のメモリに送信する、
請求項33に記載の情報処理方法。 - 前記少なくとも1つの第1のプロセッサは、
前記機械学習モデルを用いて、第1の処理を実行することで前記中間データを生成し、
前記少なくとも1つの第2のプロセッサは、
前記機械学習モデルを用いて、第2の処理を実行することで前記出力情報を生成する、
請求項30に記載の情報処理方法。 - 前記第1の処理は、演算律速となる処理であり、
前記第2の処理は、メモリ律速となる処理である、
請求項35に記載の情報処理方法。 - 前記第1の処理は、プレフィル過程の処理であり、
前記第2の処理は、デコード過程の処理である、
請求項35に記載の情報処理方法。 - 前記少なくとも1つの第2のプロセッサは、
過去に実行した前記第2の処理で生成された前記出力情報を用いて前記第2の処理を繰り返し実行する、
請求項35に記載の情報処理方法。 - 複数の前記第2のプロセッサのそれぞれが、
前記少なくとも1つの第1のプロセッサが生成した前記中間データの少なくとも一部を用いて、前記機械学習モデルの前記出力情報を生成する、
請求項30から38のいずれかに記載の情報処理方法。 - 複数の前記第1のプロセッサが、
前記複数の前記第1のプロセッサそれぞれで生成された前記中間データの少なくとも一部を結合して前記少なくとも1つの第2のメモリに送信する、
請求項30から38のいずれかに記載の情報処理方法。 - 前記機械学習モデルの推論処理を実行する、
請求項30から38のいずれかに記載の情報処理方法。 - 前記機械学習モデルの訓練処理のために前記推論処理を実行する、
請求項41に記載の情報処理方法。 - 第1の処理装置は、前記少なくとも1つの第1のメモリと、前記少なくとも1つの第1のメモリと接続された前記少なくとも1つの第1のプロセッサと、を有し、
第2の処理装置は、前記少なくとも1つの第2のメモリと、前記少なくとも1つの第2のメモリと接続された前記少なくとも1つの第2のプロセッサと、を有し、
前記第1の処理装置が、前記中間データの生成が完了する前に、前記中間データの少なくとも一部の前記第2の処理装置への送信を開始する、
請求項30から38のいずれかに記載の情報処理方法。 - 請求項30乃至38のいずれかに記載の情報処理方法を、
少なくとも1つの第1のメモリと、前記少なくとも1つの第1のメモリと接続された少なくとも1つの第1のプロセッサと、少なくとも1つの第2のメモリと、前記少なくとも1つの第2のメモリと接続された少なくとも1つの第2のプロセッサと、を備える情報処理システムであって、前記少なくとも1つの第1のプロセッサの演算速度に対する前記少なくとも1つの第1のメモリのデータ転送速度の比は、前記少なくとも1つの第2のプロセッサの演算速度に対する前記少なくとも1つの第2のメモリのデータ転送速度の比よりも低く、前記第1のプロセッサと前記第2のプロセッサとは、異なる種類のプロセッサである、情報処理システムに実行させるための、
プログラム。 - 少なくとも1つの第1のメモリと接続された少なくとも1つの第1のプロセッサに、
入力情報を機械学習モデルに入力することで、中間データを生成する、
処理を実行させ、
少なくとも1つの第2のメモリと接続された少なくとも1つの第2のプロセッサに、
前記少なくとも1つの第1のプロセッサが生成した前記中間データの少なくとも一部を用いて、前記機械学習モデルの出力情報を生成する、
処理を実行させ、
前記少なくとも1つの第1のプロセッサの演算速度に対する前記少なくとも1つの第1のメモリのデータ転送速度の比は、前記少なくとも1つの第2のプロセッサの演算速度に対する前記少なくとも1つの第2のメモリのデータ転送速度の比よりも低く、
前記第1のプロセッサと前記第2のプロセッサとは、異なる種類のプロセッサである、
プログラム。 - 前記少なくとも1つの第1のプロセッサに、
前記機械学習モデルを用いて、プレフィル過程の処理を実行することで前記中間データを生成し、
前記少なくとも1つの第2のプロセッサに、
前記機械学習モデルを用いて、デコード過程の処理を実行することで前記出力情報を生成する、
処理を実行させる、請求項45に記載のプログラム。 - 前記機械学習モデルは、注意機構を有するニューラルネットワークを含む、
請求項46に記載のプログラム。 - 前記中間データの少なくとも一部は、前記注意機構で用いられるキーベクトル及びバリューベクトルの少なくとも一部を含む、
請求項47に記載のプログラム。 - 前記少なくとも1つの第1のプロセッサに、
層ごとに生成された前記キーベクトル及びバリューベクトルを、前記層ごとに前記少なくとも1つの第2のメモリに送信する、
処理を実行させる、請求項48に記載のプログラム。 - 前記少なくとも1つの第1のプロセッサに、
前記機械学習モデルを用いて、第1の処理を実行することで前記中間データを生成し、
前記少なくとも1つの第2のプロセッサに、
前記機械学習モデルを用いて、第2の処理を実行することで前記出力情報を生成する、
処理を実行させる、請求項45に記載のプログラム。 - 少なくとも1つの第1のメモリと接続された少なくとも1つの第1のプロセッサに、
入力情報を機械学習モデルに入力することで、中間データを生成する、
処理を実行させ、
少なくとも1つの第2のメモリと接続された少なくとも1つの第2のプロセッサに、
前記少なくとも1つの第1のプロセッサが生成した前記中間データの少なくとも一部を用いて、前記機械学習モデルの出力情報を生成する、
処理を実行させ、
前記少なくとも1つの第1のプロセッサの演算速度に対する前記少なくとも1つの第1のメモリのデータ転送速度の比は、前記少なくとも1つの第2のプロセッサの演算速度に対する前記少なくとも1つの第2のメモリのデータ転送速度の比よりも低く、
前記第1のプロセッサと前記第2のプロセッサとは、異なる種類のプロセッサである、
プログラムを記憶しているコンピュータ読み取り可能な記憶媒体。 - 前記少なくとも1つの第1のプロセッサに、
前記機械学習モデルを用いて、プレフィル過程の処理を実行することで前記中間データを生成し、
前記少なくとも1つの第2のプロセッサに、
前記機械学習モデルを用いて、デコード過程の処理を実行することで前記出力情報を生成する、
処理を実行させる前記プログラムを記憶している、請求項51に記載の記憶媒体。 - 前記機械学習モデルは、注意機構を有するニューラルネットワークを含む、
請求項52に記載の記憶媒体。 - 前記中間データの少なくとも一部は、前記注意機構で用いられるキーベクトル及びバリューベクトルの少なくとも一部を含む、
請求項53に記載の記憶媒体。 - 前記少なくとも1つの第1のプロセッサに、
層ごとに生成された前記キーベクトル及びバリューベクトルを、前記層ごとに前記少なくとも1つの第2のメモリに送信する、
処理を実行させる前記プログラムを記憶している、請求項54に記載の記憶媒体。 - 前記少なくとも1つの第1のプロセッサに、
前記機械学習モデルを用いて、第1の処理を実行することで前記中間データを生成し、
前記少なくとも1つの第2のプロセッサに、
前記機械学習モデルを用いて、第2の処理を実行することで前記出力情報を生成する、
処理を実行させる前記プログラムを記憶している、請求項51に記載の記憶媒体。
Applications Claiming Priority (3)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| JP2024173485 | 2024-10-02 | ||
| JP2024173485 | 2024-10-02 | ||
| PCT/JP2025/034436 WO2026075067A1 (ja) | 2024-10-02 | 2025-09-29 | 情報処理システム、情報処理方法及びプログラム |
Related Child Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP2026037385A Division JP2026077982A (ja) | 2024-10-02 | 2026-03-09 | 情報処理システム |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| JP7843975B1 true JP7843975B1 (ja) | 2026-04-13 |
Family
ID=99357896
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| JP2026507626A Active JP7843975B1 (ja) | 2024-10-02 | 2025-09-29 | 情報処理システム、情報処理方法、プログラム及び記憶媒体 |
Country Status (2)
| Country | Link |
|---|---|
| JP (1) | JP7843975B1 (ja) |
| WO (1) | WO2026075067A1 (ja) |
Citations (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2019207458A (ja) * | 2018-05-28 | 2019-12-05 | ルネサスエレクトロニクス株式会社 | 半導体装置及びメモリアクセス設定方法 |
| JP2020529676A (ja) * | 2017-07-30 | 2020-10-08 | ニューロブレード リミテッド | メモリベースの分散型プロセッサアーキテクチャ |
| CN114897133A (zh) * | 2022-04-22 | 2022-08-12 | 中山大学 | 一种通用可配置的Transformer硬件加速器及其实现方法 |
-
2025
- 2025-09-29 JP JP2026507626A patent/JP7843975B1/ja active Active
- 2025-09-29 WO PCT/JP2025/034436 patent/WO2026075067A1/ja active Pending
Patent Citations (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2020529676A (ja) * | 2017-07-30 | 2020-10-08 | ニューロブレード リミテッド | メモリベースの分散型プロセッサアーキテクチャ |
| JP2019207458A (ja) * | 2018-05-28 | 2019-12-05 | ルネサスエレクトロニクス株式会社 | 半導体装置及びメモリアクセス設定方法 |
| CN114897133A (zh) * | 2022-04-22 | 2022-08-12 | 中山大学 | 一种通用可配置的Transformer硬件加速器及其实现方法 |
Also Published As
| Publication number | Publication date |
|---|---|
| WO2026075067A1 (ja) | 2026-04-09 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JP7430744B2 (ja) | 機械学習モデルを改良して局所性を改善させること | |
| KR102175044B1 (ko) | 인공 신경망 역방향 트레이닝 실행용 장치와 방법 | |
| US20210264220A1 (en) | Method and system for updating embedding tables for machine learning models | |
| US11922282B2 (en) | Selective batching for inference system for transformer-based generation tasks | |
| KR102891573B1 (ko) | 텐서 처리 방법, 가속기 및 이를 포함한 가속기 시스템 | |
| KR20190107766A (ko) | 계산 장치 및 방법 | |
| CN118170874A (zh) | 用于对话ai系统和应用的可自定义领域的模型 | |
| WO2020119268A1 (zh) | 一种基于模型进行预测的方法和装置 | |
| US10997497B2 (en) | Calculation device for and calculation method of performing convolution | |
| TWI758223B (zh) | 具有動態最小批次尺寸之運算方法,以及用於執行該方法之運算系統及電腦可讀儲存媒體 | |
| TW202347122A (zh) | 用於以三角形輸入遮罩來遮罩及正規化資料的硬體加速之系統與方法 | |
| KR102883346B1 (ko) | 호스트 프로세서 및 가속기의 동작 방법 및 이들을 포함한 전자 장치 | |
| CN116579373A (zh) | 数据处理方法及装置、电子设备、存储介质 | |
| US12499604B2 (en) | Updating shader scheduling policy at runtime | |
| WO2026075067A1 (ja) | 情報処理システム、情報処理方法及びプログラム | |
| JP2026077982A (ja) | 情報処理システム | |
| US20250005101A1 (en) | Techniques for twiddle factor generation for number-theoretic- transrom and inverse-number-theoretic-tranform computations | |
| CN113688089B (zh) | 数据处理方法、计算系统和计算机存储介质 | |
| CN119025259A (zh) | 模型执行方法、装置及存储介质、设备 | |
| JP7648352B2 (ja) | データ処理方法、データ処理装置、データ処理システムおよびデータ処理プログラム | |
| TW202427266A (zh) | 應用於類神經網路的記憶內運算的加速器 | |
| US20250005102A1 (en) | Techniques for twiddle factor generation for number-theoretic-transform and inverse-number-theoretic-transform computations | |
| CN110826704B (zh) | 一种用于防止神经网络过拟合的处理装置及系统 | |
| TW202301130A (zh) | 深度學習網路裝置、其使用的記憶體存取方法與非揮發性儲存媒介 | |
| CN111723917A (zh) | 运算方法、装置及相关产品 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| A521 | Request for written amendment filed |
Free format text: JAPANESE INTERMEDIATE CODE: A523 Effective date: 20260206 |
|
| A621 | Written request for application examination |
Free format text: JAPANESE INTERMEDIATE CODE: A621 Effective date: 20260206 |
|
| A871 | Explanation of circumstances concerning accelerated examination |
Free format text: JAPANESE INTERMEDIATE CODE: A871 Effective date: 20260206 |
|
| TRDD | Decision of grant or rejection written | ||
| A01 | Written decision to grant a patent or to grant a registration (utility model) |
Free format text: JAPANESE INTERMEDIATE CODE: A01 Effective date: 20260224 |
|
| A61 | First payment of annual fees (during grant procedure) |
Free format text: JAPANESE INTERMEDIATE CODE: A61 Effective date: 20260323 |
|
| R150 | Certificate of patent or registration of utility model |
Ref document number: 7843975 Country of ref document: JP Free format text: JAPANESE INTERMEDIATE CODE: R150 |