Day 1(11月18日) 10:50 - 11:10 A(Room1)
キーノート その他 初級者

LLMを「動かす」から「みんなで使う」へ — Agent Routerで作るマルチテナント推論基盤

LLMを組織の中で活用するには、単にモデルを動かすだけでは十分ではありません。複数のチームやユースケースにLLMを提供するには、認証・アクセス制御、テナントごとの利用量管理、モデルへのルーティングなど、LLMを「サービス」として提供するための仕組みが必要になります。 本セッションでは、LINEヤフーにおけるLLM Inference Serviceを題材に、なぜLLMをSelf-hostingするのか、なぜMulti-tenancyが必要なのか、そしてなぜAI Gatewayが必要になるのかを紹介します。特に、EnvoyをベースとしたAgent Router(旧 Envoy AI Gateway)を活用し、複数のテナントから共通のLLM Inference Serviceを利用できるようにするアーキテクチャを解説します。 さらに、実際の設計・開発・運用を通じて見えてきた課題や、LLMを組織の中で提供するためにどのような責務をどこに持たせるべきかといった設計上の考え方についても紹介します。

スピーカー

Shingo Omura
Shingo Omura
LINEヤフー株式会社 Principal Architect of AI Infrastructure
LINEヤフーにて、大規模なGPU KubernetesクラスタやAI/ML向けプラットフォームの設計・開発・運用に携わり、近年は社内向けLLM Inference Serviceの設計・開発・運用にも参画。 Kubernetesでは、SIG Node、SIG Scheduling、Dynamic Resource Allocation(DRA)などの領域でUpstream開発に参加。コミュニティでは、Cloud Native Computing Japan(CNCJ)でAI Infra SIGの立ち上げにも携わるなど、Kubernetesを中心としたAI/ML基盤に関する知見を積極的に共有している。

Background