ELYZA、「AIによるAI開発」研究組織を設立 llm-jp-4推論モデル2種を商用公開

ELYZA、「AIによるAI開発」研究組織を設立 llm-jp-4推論モデル2種を商用公開

※記事を視覚化したイメージであり、実際の事象とは異なります。

本サイトの記事や画像は、AIが公的資料や複数の報道を基に事実関係を整理・再構成し制作したものです。[続きを表示]特定の報道内容や表現を再利用・要約することを目的としたものではありません。ただし、誤りや不確定な情報が含まれる可能性がありますので、参考の一助としてご覧いただき、実際の判断は公的資料や各出典元の原文をご確認ください。[私たちの取り組み]

ELYZAは2026年10月2日付の発表で、「AIによるAI開発」を推進する研究組織「ELYZA RSI Research」を設立すると発表した。また、llm-jp-4を追加学習した推論モデル2種を商用利用可能な形で公開した。今回の成果は再帰的自己改善(RSI)に向けた要素技術の研究で、同社はRSIそのものを実現したわけではないと明記している。

モデル、動作制御、評価を研究対象に

研究対象は基盤モデルに加え、AIの動作やツール利用を制御する「ハーネス」と評価機構にも及ぶ。改善結果を評価し、次の開発へ反映する仕組みを研究する。将来は、開発・改善を担うAIエージェント自身も改善対象にする構想だ。

評価基盤「ELYZA Agent Tasks: Customer Service」は音声とテキストに対応し、業務手順の選択やツール利用、最終結果などを評価する。問い合わせ応答のハーネス改善では、改善に使っていないテストデータの完遂率が34.3%から52.9%へ18.6ポイント上昇したと同社は報告した。

公開モデルの性能と業務への展開

公開したのは「ELYZA-Thinking-1.0-llm-jp-4-33b」と「ELYZA-Thinking-1.0-llm-jp-4-32b-a3b」。中間学習・事後学習から評価まで、人が介在する作業を1〜2人日程度に抑えたとしている。両モデルのライセンスはApache 2.0だ。

33bモデルの評価では、日本語知識を測るJamC-QAが66.35でllm-jp-4.1の57.69を上回る一方、JMATH-500は90.00で同モデルの92.40を下回った。

ITmediaが掲載したELYZAの追加説明によると、モデルカードの「Fully domestic foundation」は国内企業で作成したという意図で、「完全国産」という日本語訳のニュアンスは想定と異なるという。

ELYZAは研究成果を業界・業務特化型AI事業に活用し、第一弾として「ELYZA Voice Agent」を開発した。現在は実現場への導入に向けた検証と機能の高度化を進めている。

参考・出典

本サイトの記事や画像は、AIが公的資料や複数の報道を基に事実関係を整理・再構成し制作したものです。特定の報道内容や表現を再利用・要約することを目的としたものではありません。ただし、誤りや不確定な情報が含まれる可能性がありますので、参考の一助としてご覧いただき、実際の判断は公的資料や各出典元の原文をご確認ください。[私たちの取り組み]

ニュースはAIで深化する—。日々の出来事を深掘りし、次の時代を考える視点をお届けします。

本サイトの記事や画像はAIが公的資料や報道を整理し制作したものです。
ただし誤りや不確定な情報が含まれることがありますので、参考の一助としてご覧いただき、
実際の判断は公的資料や他の報道を直接ご確認ください。
[私たちの取り組み]