Berlin Buzzwords 2026の全59セッションについて、提供された資料に基づき、解説とキーワードをまとめました。
各動画のリンクは共通のプレイリスト Berlin Buzzwords 2026 Playlist に設定されています。
解説: 次世代望遠鏡アレイ(CTA)の事例を通じ、物理学の現場でAIがいかに「観察」から「発見」へと進化しているかを解説します。年間6PBに及ぶ膨大なセンサーデータを、極めて高速なエレクトロニクスとリアルタイム分析で処理する手法に焦点を当てます。科学的プロセスを「エージェント型ループ」として捉え、AIが仮説検証やパイプライン構築を自律化する未来を論じます。また、自動化の歴史を振り返りつつ、現代のアカデミアにおけるAI導入の課題(信頼性や若手研究者の育成)についても言及しています。 キーワード: 物理世界AI, 望遠鏡アレイ, リアルタイム分析, 科学的発見, オートメーション, 天文学, 機械学習, 実験データ, シミュレーション, 検索(関連なし)
解説: AIの台頭により、従来の検索エンジンが不要になるのかという刺激的な問いに対するパネルディスカッションです。パネリストは、検索がAIエージェントの「目」や「記憶」として再定義されており、むしろ重要性が増していると主張します。従来のキーワード検索(BM25)や関連性フィードバック技術が、AIエージェントによってより効果的に活用される現状を詳述します。マルチモーダル検索やスペアスベクトルなど、新旧技術をいかに組み合わせるかが今後の鍵となります。 キーワード: パネルディスカッション, 検索エンジン, AI, ハイブリッド検索, エンベディング, 関連性, クエリ理解, 情報検索, セマンティック検索, 検索(関連あり)
解説: AIエージェントが検索の「新しいユーザー」となった現代における、自己最適化する検索システムの構築を論じます。エージェントは自らクエリを発行し、タスク遂行のために検索を繰り返すため、人間のクエリとは異なる複雑で長いクエリ特性を持つことが強調されます。検索インフラを「強化学習(RL)環境」として機能させ、エージェントが自律的にハイパーパラメータを調整する手法を提案します。従来の検索ボックスUIから、エージェント向けのDSLやコードベースのインターフェースへのシフトを促します。 キーワード: エージェント型リトリーバル, 自己最適化, 強化学習, クエリ複雑性, インフラ最適化, LLMエージェント, ボトルネック, 検索関連性, コンテキスト窓, 検索(関連あり)
解説: PDFドキュメントの内部に隠されたデータ(不可視テキスト、Unicodeトリック、メタデータなど)をAIの利点に変える手法を解説します。PDFを単なるテキストではなく「コンテナ」として捉え、構造データ(見出し、アクセシビリティタグ)を抽出することでRAGパイプラインを高速化・高精度化する事例を紹介します。一方で、これらの隠しデータが悪用された場合のプロンプトインジェクションやリソース消費攻撃(DoS)のリスクについても警鐘を鳴らしています。ドキュメント処理における「サニタイズ」と「タグ付け」の重要性を説く、実践的なセッションです。 キーワード: PDF解析, 隠しデータ, プロンプトインジェクション, セキュリティ, RAG, メタデータ, データ抽出, 構造化データ, サニタイズ, 検索(関連あり)
解説: コーディング支援AIエージェントが、膨大なコードベースから信頼性の高い情報を取得するための検索技術を提案します。従来の単純な文字列一致(Grep)の限界を指摘し、コードの構造や文脈を理解した検索がいかに精度の向上に直結するかを論じます。LSP(Language Server Protocol)を活用した構造認識ナビゲーションや、大規模リポジトリにおけるセマンティック検索の導入事例が紹介されます。検索精度を「コンテキスト・エンジニアリング」の一環として捉え、トークンの浪費を抑える手法を詳述します。 キーワード: コード検索, AIエージェント, Grep, 構造化検索, セマンティック検索, コンテキスト・エンジニアリング, LSP, 開発支援, 精度向上, 検索(関連あり)
解説: C++で書かれた検索エンジン「IResearch」が、なぜ既存のエンジンと比較して圧倒的なパフォーマンスを出せたのか、その低レイヤでの設計思想を解説します。データベースのコアに検索機能を「後付け」ではなく「組み込み」として実装することで、SIMDやAVX命令を最大限に活用した「ブロック・スコアリング」を可能にしています。BM25計算などの重い処理を、CPUキャッシュを意識したデータ配置で高速化する技術的詳細が語られます。検索エンジンの歴史を振り返りつつ、ハードウェアの特性を活かした最適化の重要性を説きます。 キーワード: C++, データベースカーネル, IResearch, パフォーマンス最適化, SIMD, AVX2, BM25, ブロック・スコアリング, ベンチマーク, 検索(関連あり)
解説: ドイツ最大級の分類広告プラットフォーム「Kleinanzeigen」が、ホームページのフィード推薦システムをVespaへ移行したPoCの教訓を共有します。ユーザープロファイルをリアルタイムで更新し、ベクトル検索や重み付けセットを用いてパーソナライズされた結果を表示する仕組みを詳述します。カテゴリーごとに異なるデータの特性(車の属性vs家具の自然言語検索)に合わせ、検索アルゴリズムを適応させるプロセスが紹介されます。ElasticsearchからVespaへ移行した際の、検索ステージの分離やスコアリングの考え方の変化についても触れています。 キーワード: Vespa, システム移行, パーソナライゼーション, ベクトル検索, 推薦システム, ユーザープロファイル, PoC, 実装事例, 検索ステージ分離, 検索(関連あり)
解説: Apache Solr 10および10.1で導入されるベクトル検索の最新機能とロードマップを網羅的に紹介します。メモリ消費を劇的に抑え、検索を高速化する「スカラー量子化」および「バイナリ量子化」の技術的背景と設定方法を解説します。また、HNSW探索の早期終了(Early Termination)戦略や、語彙検索結果をエントリポイントにする「Seeded K-NN」についても詳述されます。大規模データセットにおけるベクトル検索のパフォーマンスを極限まで高めたいSolrユーザー必見の内容です。 キーワード: Apache Solr 10, ベクトル検索, 量子化, HNSW, K-NN, パフォーマンス, ロードマップ, 階層型ベクトル, 検索高速化, 検索(関連あり)
解説: AIエージェントが提供された情報を正確に根拠(Grounding)として活用しているかを検証する具体的な手法を提示します。「矛盾プロービング」や「引用の義務化」、あえて情報を削除して変化を見る「反事実的削除」など、ハルシネーションを防ぐためのストレス・テストが紹介されます。エージェント特有の失敗パターン(情報の盲目、注意散漫、役割の混乱)を、詳細なロギングとオブザーバビリティで捉える重要性を説きます。信頼できるシステム構築のため、ドメインエキスパートと連携した評価スイートの構築を推奨しています。 キーワード: AIエージェント, 信頼性評価, ハルシネーション, 根拠検証, 評価指標, オブザーバビリティ, RAG, 推論評価, テスト手法, 検索(関連あり)
解説: AIエージェントはクラッシュすることなく「静かに役に立たなくなる」という、従来のソフトウェアとは異なる失敗モードについて解説します。例外処理に頼るのではなく、出力値の「分布(Distribution)」の変化を監視することで、品質の低下を検知するMLOpsの考え方を提案します。無限ループを防ぐサーキットブレーカーや、人間に代わって評価をスケーラブルにするための「カオス・エンジニアリング」的な手法が紹介されます。開発者がデータそのものに向き合い、失敗を言語化・分類することの大切さを強調しています。 キーワード: MLOps, AIエージェント, サイレントフェイラー, 分布監視, 評価ハーネス, 信頼性, サーキットブレーカー, 品質監視, 運用管理, 検索(関連なし)
解説: RAG(検索拡張生成)における「チャンク分割」という人為的な制約を排除し、トークン単位での関連性を評価する新しい検索パラダイムを模索します。Qwen3などの大規模コンテキスト窓を持つ最新の埋め込みモデルを活用し、トークンレベルの埋め込みから最適なテキスト範囲を特定するアルゴリズムを紹介します。モデル固有の「末尾バイアス」や計算コストといった課題を客観的に分析し、より動的で高精度な検索の可能性を探ります。従来の「 chunks as a whole」なアプローチを問い直す、実験的なセッションです。 キーワード: RAG, チャンクレス, トークン埋め込み, セマンティック検索, 大規模コンテキスト窓, アルゴリズム, 情報抽出, 実験的アプローチ, 精度向上, 検索(関連あり)
解説: データ工学の歴史における「書き込み(Write)」パラダイムの変遷を、Postgres、Kafka、Icebergの3つのシステムを比較して解き明かします。90年代のPostgres(精度と永続性)、2010年代のKafka(リアルタイムと分散)、そして現代のIceberg(メタデータ抽象化)という進化の過程を辿ります。ストレージと計算の分離や、セマンティックなメタデータの重要性が増している背景を初心者にも分かりやすく解説します。AI時代においてもこれらの基礎知識がいかに重要であるかを、開発者の視点から再確認します。 キーワード: 書き込みパラダイム, Postgres, Kafka, Iceberg, データエンジニアリング, ストレージと計算の分離, 分散システム, メタデータ, システム設計, 検索(関連なし)
解説: Apache Icebergにおける「カタログ」の役割と、多様な実装(Glue, Polaris, Unity Catalogなど)の現状を網羅的に解説します。カタログがIcebergテーブルの最新状態への唯一のエントリポイントであり、原子的なコミットを実現する「信頼の源」であることを説きます。RESTカタログ仕様の登場が、いかに異なる言語やエンジン間での相互運用性を向上させたかを強調します。自社のユースケースに基づき、セルフホストかマネージドか、特定のクラウドエコシステムに従うかを判断するための実践的なフレームワークを提示します。 キーワード: Apache Iceberg, カタログ, RESTカタログ仕様, 相互運用性, Polaris, Unity Catalog, メタデータ管理, 技術選定, データレイクハウス, 検索(関連なし)
解説: トランザクション処理(OLTP)の覇者であるPostgreSQLが、どこまで分析処理(OLAP)の領域をカバーできるかを検証します。CitusやPG_DuckDBなど、分析を高速化する20以上の拡張機能のエコシステムを概観します。実際にClickBenchなどの標準ベンチマークを用い、拡張機能を導入したPostgresが、ネイティブなClickHouseや標準のPostgresとどう競合するかを数値で示します。特定のユースケースでは大幅な性能向上が見られる一方で、既存のインデックスとの競合など、運用の際の注意点についても客観的なデータに基づいて論じています。 キーワード: PostgreSQL, OLAP, データベース拡張, PG_DuckDB, ベンチマーク, 分析, ClickHouse, パフォーマンス, データベース設計, 検索(関連なし)
解説: Apache Kafkaにおいて、不要なデータを消費者へ届ける前に「ブローカー側」でフィルタリングする革新的な機能を解説します。従来のKafkaが全メッセージをネットワークに流して消費者に捨てさせていた非効率を、ネットワークコストとCPU負荷の劇的な削減で解決します。Apache Pulsarの機能を応用した動的なフィルタ設定方法や、再デプロイなしで条件を変更できる柔軟性を提示します。金融データやIoTセンサーデータのリアルタイム処理など、高負荷環境での実用的なパフォーマンスメリットをライブデモと共に示します。 キーワード: Apache Kafka, ブローカー側フィルタリング, ネットワーク負荷削減, パフォーマンス最適化, リアルタイムストリーミング, 動的フィルタリング, データエンジニアリング, 効率化, コスト削減, 検索(関連なし)
解説: オブザーバビリティ(観測性)向上に不可欠な、時系列データにおける異常検知(Anomaly Detection)の理論と実践を解説します。トレンドや季節性といった基本概念を整理し、スパイクや急落などの異常をビジネスロジックに基づいて捉えるための数学的モデルの選び方をガイドします。OpenTelemetry、Grafana、MCPサーバーを組み合わせた具体的なデモを通じ、アラートノイズを減らしつつ問題解決を加速させる手法を示します。監視のオーバーヘッドを抑えながら、より深いシステム洞察を得るための「第六感」をエンジニアに授ける内容です。 キーワード: オブザーバビリティ, 異常検知, 時系列データ, メトリクス, OpenTelemetry, Grafana, 機械学習, トラブルシューティング, アラート最適化, 検索(関連なし)
解説: 分散システムの正しさを数学的に証明する「形式検証(TLA+)」を、AIエージェントを用いて自動化・低コスト化するアプローチを解説します。専門知識と高コストが障壁だった形式検証を、LLMベースのツール「Specula」がいかに変えるかを詳述します。現実のコードから仕様を自動生成し、MongoDBやHashiCorp Raftなどの商用システムから130件以上の未知のバグを発見した実績を紹介します。ソフトウェアの正確性を「計測できないほど安価に」実現し、AIが生成した「sloppy」なコードと戦うための新しい武器を提示します。 キーワード: 形式検証, TLA+, LLM, システム正当性, バグ発見, 分散システム, ソフトウェア信頼性, 自動化, Specula, 検索(関連なし)
解説: 検索エンジンの「内部」で関連性フィードバックを処理する新しいAPI(Qdrantでの実装)について解説します。従来の再ランキングは検索エンジンの外側のブラックボックスで行われていましたが、この技術ではHNSWグラフ探索のパス自体をユーザーのフィードバックに基づいて動的に変更します。これにより、大規模データセット全体を再計算することなく、高価なモデル(クロスエンコーダー等)の知識を高速なベクトル検索へ蒸留することが可能です。検索エンジンを単なる箱ではなく、ユーザーやAIと対話して進化する学習器へと変える手法が学べます。 キーワード: 関連性フィードバック, Qdrant, HNSW, ベクトル検索, フィードバックループ, 検索アルゴリズム, オープンソース, 精度向上, 検索エンジニアリング, 検索(関連あり)
解説: 単一のGPUで複数の検索モード(ベクトル、スパース、リランキング等)を効率的に提供する、マルチモデル検索推論エンジン「SAI」を解説します。GPUリソースを最大限に活用するための、トークンベースのバッチ処理やモデルの動的なホットスワップ技術に焦点を当てています。検索パイプラインが複数の小規模モデル(OCR、エンティティ抽出など)の連鎖になっている現状を分析し、インフラ運用の複雑さをどう隠蔽するかを詳述します。独自のVPC環境でAI推論を完結させる「ソブリンAI」構築の基盤となる技術スタックを紹介します。 キーワード: GPU最適化, 推論エンジン, マルチモデル, 検索サービング, ベクトル検索, リランキング, インフラ自動化, オープンソース, 性能評価, 検索(関連あり)
解説: Apache Sparkを用いたデータ工学を劇的に簡略化する「宣言型パイプライン(SDP)」の活用法を実演を交えて解説します。スレッド管理やエラー再試行といった複雑なコードを、SQLやPythonによるシンプルな定義に置き換える手法を紹介します。「ストリーミングテーブル」と「マテリアライズドビュー」を組み合わせたメダリオンアーキテクチャの構築事例が示されます。航空機のリアルタイム位置データをOpen Sky Network APIから取得し、数分で分析パイプラインを構築するデモは、開発効率化の威力を視覚的に伝えています。 キーワード: Apache Spark, 宣言型パイプライン, データエンジニアリング, ストリーミング, マテリアライズドビュー, メダリオンアーキテクチャ, リアルタイム処理, 効率化, 検索(関連なし)
解説: Apache Icebergがいかにして「1つのテーブル、多数のエンジン(Spark, Trino, Flink等)」という相互運用性の高いデータプラットフォームを実現するかを解説します。 Icebergが単なるライブラリではなく「仕様」であることの重要性と、メタデータチェーンによる原子的なコミットの仕組みを詳述します。 ACID特性、スキーマ進化、タイムトラベルといった機能を、異なるエンジンの役割(ETL vs BI)に合わせてどう使い分けるかを提示します。実運用における「小規模ファイル問題」への対策など、データレイクハウス構築のベストプラクティスが学べます。 キーワード: Apache Iceberg, データレイクハウス, 相互運用性, ACID, スキーマ進化, マルチエンジン, データ一貫性, メタデータ, ガバナンス, 検索(関連なし)
解説: PostgreSQL 18および19で導入される制約(Constraints)システムの大幅なアップデートを詳細に解説します。SQL標準に基づいた「時間的制約(Temporal Keys)」により、期間の重複を許さないユニーク制約や外部キーをネイティブに扱えるようになった点を詳述します。また、移行時のロックを最小化する「Not Enforced」制約の活用や、内部の「pg_constraint」カタログの構造についても触れています。アプリケーション層ではなくデータベース層でデータの整合性を守ることの利点を、最新機能を通じて再確認するセッションです。 キーワード: PostgreSQL 18, データベース制約, 時間的制約, データ整合性, パフォーマンス, ロック対策, スキーマ設計, システムカタログ, PostgreSQL 19, 検索(関連なし)
解説: OpenSearchのエージェント型メモリ機能を用いて、検索結果を個々のユーザーに合わせてパーソナライズする新しいアプローチを解説します。従来の機械学習モデルの再学習を必要とせず、LLMの推論能力でユーザーの過去行動から「好み」や「嫌いなもの」を抽出し、動的にクエリを拡張・変換します。長期記憶やセッションメモリを活用し、会話の文脈やユーザーのライフステージの変化をリアルタイムで検索結果に反映させる仕組みを詳述します。プライバシーを守りつつ、セマンティックな検索体験を構築するための設計指針が提示されます。 キーワード: OpenSearch, パーソナライゼーション, エージェントメモリ, LLM推論, クエリ拡張, ユーザー体験(UX), 文脈理解, 動的プロファイル, 検索関連性, 検索(関連あり)
解説: 従来のストリーム処理における「水平スケーリング(Scaling Out)」の弊害を指摘し、Java仮想スレッドをフル活用した「垂直スケーリング(Scale Up)」への回帰を提案します。分散システム特有のネットワーク・シャッフルやシリアライズ負荷(分布税)が、多くのワークロードでコストと複雑さの主因であることを論じます。単一のインスタンスで毎秒数百万イベントを処理し、レイテンシを最小化する新アーキテクチャ「Stoflow」を披露し、Kafka Streamsとの比較ベンチマークを示します。ストリーム基盤設計の常識を問い直す挑戦的なセッションです。 キーワード: ストリーム処理, 垂直スケーリング, 分散システムの複雑さ, 仮想スレッド, パフォーマンス, リソース最適化, Stoflow, コスト削減, 検索(関連なし)
解説: 自然言語のクエリを、検索APIが期待する構造化されたパラメータに変換する「スマートモード」の開発事例を紹介します。金融ドメイン特有の複雑なクエリ(例:特定の会計年度の10K書類)を正確に捉えるため、小規模言語モデル(SLM)を微調整(Fine-tuning)したプロセスを詳述します。巨大モデルからの知識蒸留と量子化により、高精度かつ低遅延・低コストな意図抽出を実現した手法を提示します。検索エンジンの「前段」にインテリジェントな翻訳レイヤを設けることで、精度と再現率を劇的に向上させた成果が報告されます。 キーワード: クエリ意図抽出, SLM, 微調整, 知識蒸留, 金融検索, 構造化出力, 精度向上, Vespa, 検索関連性, 検索(関連あり)
解説: 大規模なAAAゲームタイトルのローンチに際し、Apache CouchDBのパフォーマンスを10倍に向上させたトラブルシューティングの全容を解説します。ハードウェアへの投資にもかかわらず性能が出なかった原因を、ネットワーク、ディスクIO、そしてErlangプロセスの挙動を切り分けて特定する科学的なプロセスを詳述します。特に内部通信(Quorumリクエスト)の不整合やTCPソケットオプションの最適化が、毎秒6万リクエストを支える鍵となった事例を紹介します。分散データベースを極限まで使いこなしたいエンジニアに向けた、実践的な「戦いの記録」です。 キーワード: CouchDB, パフォーマンス改善, ゲームローンチ, シャーディング, Erlang, ネットワーク最適化, ボトルネック特定, ベンチマーク, スケーラビリティ, 検索(関連なし)
解説: AI生成されたプルリクエストやバグ報告が急増する中で、オープンソース(OSS)メンテナーの負担を軽減し、コミュニティ文化を守るための提言です。Apache Airflowでの経験に基づき、AIエージェント(Apache Magpieプロジェクト)を用いて、トリアージやセキュリティ報告の整理などの「退屈な反復作業」を自動化する手法を論じます。これにより、メンテナーは人間らしい対話や創造的な意思決定に時間を充てられるようになります。AIを「答えの機械」ではなく、メンテナーの「副操縦士」として定義し、持続可能な開発体制を築く未来像を描きます。 キーワード: オープンソース, メンテナー支援, AIエージェント, 開発自動化, コミュニティ維持, セキュリティ管理, PR要約, バーンアウト対策, マネジメント, 検索(関連なし)
解説: Apache Solrのプロジェクト管理委員会(PMC)メンバーとして10年以上、セキュリティ問題に向き合ってきた経験と教訓を共有します。近年のAI生成されたハルシネーションを含む脆弱性報告への対応の現状や、独自にセキュリティコードを書くことの弊害(既存フレームワークの不採用)を率直に反省します。「セキュリティは全員の責任」という言葉を具体的にどう開発プロセスに落とし込むか、機能の削除という苦渋の決断がいかに重要かを論じます。OSSコミュニティがセキュリティと開発効率を両立させるための指針を提示します。 キーワード: OSSセキュリティ, Apache Solr, 脆弱性管理, ガバナンス, CVE, プロジェクト管理, 認証認可, セキュリティモデル, メンテナー視点, 検索(関連あり)
解説: AIモデルをクラウドから解放し、ブラウザ上で直接高速実行するための最新技術スタック「Web AI」を解説します。WebGPUやWebNN、WebAssemblyといったAPIの進化と、それらを活用するTransformers.jsやONNX Runtimeの役割を概観します。プライバシーの確保、通信コストの削減、オフライン利用といったローカル実行の利点を強調し、ダウンロード時間やメモリ制約という課題への対策を論じます。スマートフォンのNPUを活用したリアルタイム物体検知のデモを通じ、ブラウザがAIの主戦場となる未来を予見します。 キーワード: ブラウザAI, WebGPU, WebAssembly, エッジコンピューティング, プライバシー, ローカル推論, Transformers.js, ONNX, クライアントサイドAI, 検索(関連なし)
解説: クラウド利用に伴う環境負荷(炭素排出量や水消費量)を可視化し、削減するためのオープンソースプロジェクト「Spruce」を紹介します。FinOpsと対をなす「GreenOps」の概念を整理し、クラウドの使用状況レポート(CUR)をSparkで処理して、環境への影響を具体的かつ actionableなデータとして抽出する仕組みを解説します。AIモデルの推論に伴う負荷も推計対象に含まれており、データに基づいてリージョンの選定やリソースの削減を判断する手法を示します。責任あるエンジニアリングとして、持続可能なIT運用を追求するためのガイドです。 キーワード: GreenOps, 持続可能性, クラウド運用, 炭素排出量, Spruce, オープンソース, 水消費量, AI負荷, パフォーマンス評価, 検索(関連なし)
解説: OpenSearchがLinux Foundation傘下の「OpenSearch Software Foundation」に移行してからの1年間の軌跡と成果を報告します。特定のベンダーに依存しない中立な統治体制がいかにコミュニティの成長を加速させ、15億回以上のダウンロードを支えたかを詳述します。開発ロードマップの透明性や、グローバルなユーザーグループの拡大、ベクトル検索などの技術革新が多くの企業のコントリビューションによって進んでいる現状を紹介します。中立な基盤上でのソフトウェア開発が、いかに信頼とイノベーションを両立させるかを示す事例です。 キーワード: OpenSearch, オープンガバナンス, Linux Foundation, コミュニティ運営, ベンダーニュートラル, ロードマップ, エコシステム, 開発統計, コントリビューション, 検索(関連あり)
解説: AIコーディング支援ツールを標的にした、ゼロデイ脆弱性を必要としない新しいセキュリティ攻撃手法とその対策を解説します。プロンプトに不可視の文字を紛れ込ませて悪意のある挙動を引き出す「ASCII Smuggling」や、ホワイトテキストを用いた隠し指示のデモを実演します。また、AIが推奨する存在しないパッケージ名を先回りして登録する「タイポスクワッティング」の危険性についても警告しています。AIと共に開発する時代の新たな「開発ワークフローの安全性」と、人間による最終チェックの重要性を再定義します。 キーワード: AIコーディング支援, セキュリティ攻撃, ASCII Smuggling, プロンプトインジェクション, サプライチェーン攻撃, AIハルシネーション, セキュア開発, 信頼性, 脆弱性対策, 検索(関連なし)
解説: 検索精度(Relevance)の向上が、皮肉にもAIエージェントの推論を悪化させる「ディストラクター(妨害要素)」の罠を解説します。エージェントにとっての検索は単なる結果提示ではなく、もっともらしく見えるが微妙に間違った情報の混入(ハード・ディストラクター)が、全体の推論を決定的に狂わせるリスクを論じます。従来の再現率(Recall)最大化という目標に対し、エージェント環境では「コンテキスト入場制御」という制御問題として検索を捉えるべきだと主張します。なぜ単純な検索エンジンを追加するだけでは不十分なのか、その技術的理由を解明します。 キーワード: エージェント型リトリーバル, ディストラクター, 検索精度, 精度と想起, LLM推論, 関連性評価, パフォーマンス低下, コンテキスト制御, 情報検索, 検索(関連あり)
解説: ドイツの地方都市Osnabrückを舞台に、地域ニュースに特化したRAG(検索拡張生成)システムを構築した際の信頼性確保の挑戦を共有します。同姓同名の人物(犯罪者と一般市民)の混同を避けるエンティティマッチングや、地域特有の略称解決、ニュースにおいて極めて重要な「日付と時制」の扱いなど、泥臭い試行錯誤を詳述します。記者が自ら評価指標を調整できる環境を整え、ハルシネーションを最小化するまでの物語です。検索が単なる情報の断片ではなく、ニュース機関としての「信頼」をいかに支えるかを探ります。 キーワード: 地域ニュース, RAG, 信頼性, 意味検索, エンティティマッチング, 日付処理, 評価指標, LLM As A Judge, 検索関連性, 検索(関連あり)
解説: ノートブック上での分析ツールに留まらない、プロダクション環境でのDuckDBの活用術を解説します。軽量なインプロセスOLAPエンジンとしての特性を活かし、Lambda関数内での高速ETL処理や、WASMを用いた「バックエンド不要のブラウザ上データ分析」などのアーキテクチャを紹介します。既存のSparkジョブをSQL Frameを用いてDuckDBで高速化する手法や、最新の「Quack」プロトコルによるリモートアクセス機能も実演します。データ工学の常識を覆す、DuckDBの真のポテンシャルを解き明かすセッションです。 キーワード: DuckDB, プロダクション運用, OLAP, WASM, ETL, サーバレス, データエンジニアリング, SQL Frame, データプラットフォーム, 検索(関連なし)
解説: Apache Flinkを中心とした最新のストリーミングランドスケープを整理し、単なる流行を超えてどのような実質的な課題を解決できるかを論じます。不正検知、リアルタイムETL、分析ダッシュボードといったユースケースごとに、Kafka StreamsやClickHouseといった他ツールとの使い分け基準を提示します。Flink特有の強力な状態管理能力を活用した、高度なイベントパターンの検知手法も紹介されます。最後に、Flinkと新技術を組み合わせた「ストリームハウス(Streamhouse)」アーキテクチャの未来像を提示します。 キーワード: Apache Flink, ストリーム処理, リアルタイムETL, 不正検知, 状態管理, カフカ, ストリームハウス, 技術選定, パフォーマンス, 検索(関連なし)
解説: Apache Icebergテーブルの運用を自動化し、健全性を維持するためのオープンソースプロジェクト「Floe」を紹介します。テーブル数が増えるにつれて発生する「小規模ファイルの蓄積」や「スナップショットの肥大化」を解決するため、宣言的なポリシーに基づいたメンテナンス(再書き込み、スナップショット期限切れ、孤立ファイル削除)を行う仕組みを解説します。単純なスケジュール実行ではなく、メタデータに基づいた「健全性スコア」によって優先順位を判断するインテリジェントなアプローチを提示し、大規模テーブル管理の効率化を実演します。 キーワード: Apache Iceberg, テーブルメンテナンス, Floe, メタデータ管理, パフォーマンス最適化, 自動化ポリシー, 健全性スコア, オープンソース, データエンジニアリング, 検索(関連なし)
解説: リアルタイムなデータパイプラインにおいて、顧客のプライバシー(PII)を守りつつデータ価値を最大化する技術と戦略を解説します。Apache KafkaやFlinkを流れるデータに対し、どの段階でマスキングやトークナイゼーションを適用すべきかを詳述します。ハッシングや単純な匿名化がなぜ不十分なのかを実際の事故事例(Netflix, Stravaなど)を交えて警告し、準同型暗号(Homomorphic Encryption)の可能性についても触れます。プライバシー保護と精度のトレードオフをどう評価すべきかの意思決定マトリクスを提示します。 キーワード: データプライバシー, リアルタイムパイプライン, PII保護, トークナイゼーション, マスキング, GDPR, 準同型暗号, データガバナンス, セキュリティ, 検索(関連なし)
解説: 綴りの誤り(Typo)に強い「音標アルゴリズム(Phonetic Algorithm)」を復活させて検索精度を向上させた事例を解説します。フランス語特有の複雑な音と綴りの関係に対し、単純な曖昧検索やステミングだけではノイズが多すぎるという課題を提示します。100年前のSoundexから最新のアルゴリズムをベンチマークし、OpenSearchの外部サービスとして統合したプロセスを詳述します。古くて新しい技術の組み合わせが、膨大な名前データの検索精度を劇的に改善する様子が学べます。 キーワード: 音標検索, 名前マッチング, 検索関連性, フランス語解析, Soundex, Typo耐性, OpenSearch, アルゴリズム評価, 検索エンジニアリング, 検索(関連あり)
解説: Eコマースにおける検索とランキングに「テンソル演算(Tensor Arithmetics)」を導入し、高度なリアルタイム制御を実現する手法を解説します。Vespaの強力な演算機能を使い、「イヤリングから青い石を除き、赤い石を足す」といったベクトル同士の加減算によって、ユーザーの検索意図を動的に反映させるデモを実演します。また、気温や降雨量、ユーザーの行動履歴などの多様な信号をリアルタイムにランキングへ統合するアルゴリズムを詳述します。従来の静的なインデックスでは不可能な、多次元で動的な次世代検索体験の構築方法が学べます。 キーワード: テンソル演算, Vespa, 視覚的検索, Eコマース, パーソナライゼーション, ランキング最適化, 埋め込みモデル, 多次元データ, 検索関連性, 検索(関連あり)
解説: リソースの少ない「低リソース言語」を対象としたNLP(自然言語処理)の研究が、いかに既存のベンチマークや評価指標に潜む「隠れた仮定」を浮き彫りにするかを解説します。英語中心のモデルでは捉えきれない構造的・意味的な曖昧性が、スコアをいかに不透明にしているかを言語学者の視点で論じます。これらの言語を単なる「データ不足」としてではなく、システムの堅牢性を測るための「ストレス・テスト」の場として捉え直すべきだと主張します。より公平で普遍的なAIを開発するための、データ注釈や評価の新しいアプローチを提案します。 キーワード: NLP, 低リソース言語, 言語学, データバイアス, 評価指標の限界, ストレス・テスト, 言語多様性, AI公平性, データ注釈, 検索(関連なし)
解説: 検索エンジンの精度評価に不可欠な「ゴールデン・セット(理想的な評価データセット)」を、データがない初期段階からいかに構築するかという難題を解決します。VespaとPythonを用い、語彙検索や自前データでの訓練モデル、汎用埋め込みモデルを組み合わせて多様な候補を抽出し、LLMを「評価者」として活用して評価データを自動生成するプロセスを実演します。生成された評価データを検索エンジンに戻して分析・改善する「リンス&リピート」のサイクルを紹介します。検索システムの立ち上げ期に直面する評価データ不足を打破する手法が学べます。 キーワード: ゴールデン・セット, 検索評価, Vespa, LLM As A Judge, 評価データ生成, 意味的検索, 多様性確保, ベンチマーク, 開発プロセス, 検索(関連あり)
解説: Apache Solrにおいて、サービスを停止させることなく(ゼロダウンタイム)インデックスをアップグレードする画期的な新機能を解説します。Luceneの「N-1互換性」という厳しい制約に対し、古いセグメントを検知してバックグラウンドで最新コーデックへ再インデックスする「Latest Version Merge Policy」の仕組みを詳述します。これにより、大規模なインデックスを最初から作り直す莫大な運用コストとダウンタイムを回避することが可能です。Solr 9.11で導入され、他のLuceneベースのエンジンにも道を開く技術的ブレイクスルーです。 キーワード: Apache Solr, インデックスアップグレード, ゼロダウンタイム, Lucene互換性, セグメント管理, インプレース更新, 運用効率化, 検索インフラ, 技術的ブレイクスルー, 検索(関連あり)
解説: ストリーム処理を劇的に簡素化するPythonライブラリ「Coffee Streams」を解説します。従来のFlinkやKafka Streamsが強いていた難解な概念を、最新の数学的理論「DBSP(Database Stream Processor)」に基づいた「集合(Z-set)」の考え方でいかに解決するかを詳述します。銀行口座間の残高計算といった、従来のストリーム処理が苦手とする「内部的一貫性」の問題を、コード一行で完璧に解決するデモを実演します。開発者の負担を減らし、運用コストを削減するための次世代ストリーム処理の形を提示します。 キーワード: ストリーム処理, Coffee Streams, DBSP理論, Python, 開発簡素化, 内部一貫性, Z-set, コスト削減, アーキテクチャ進化, 検索(関連なし)
解説: Eコマースの「保存された検索(Saved Search)」をベクトル検索で実現する際の技術的課題を、物理学の三体問題になぞらえて解説します。入荷商品がクエリとなり、膨大なユーザーの検索意図がコーパスとなる「逆検索(Inverse Search)」の世界において、画像ベクトルや価格などの多様な条件を漏れなく正確に評価する難しさを説きます。Vespaの述語フィールドとランキング機能を組み合わせ、1億7千万点以上のアイテムを扱う実例を基に、正確性・カーディナリティ・実行物理の3つの軸から最適化手法を詳述します。 キーワード: 逆検索, 保存された検索, ハイブリッド検索, ベクトル類似度, Vespa, 述語マッチング, eコマース, 通知システム, 検索パフォーマンス, 検索(関連あり)
解説: OpenSearchにおいて、データの配置をクエリパターンに合わせて再編する「コンテキスト認識型セグメント」技術を解説します。従来のランダムなデータ配置が、検索時に不要なセグメントを読み込ませることでCPUやIOを浪費していた問題を指摘します。ドキュメントを特定の基準(テナントIDやステータスコード)でグループ化し、同一セグメントに閉じ込めるための内部構造を詳述します。ログ分析やマルチテナント検索において、性能と圧縮率が劇的に改善される仕組みを実証データと共に示します。 キーワード: OpenSearch, セグメント最適化, Scatter-read問題, 検索パフォーマンス, ログ分析, マルチテナント, データ配置, インデックス内部構造, 圧縮率向上, 検索(関連あり)
解説: オープンソースソフトウェア(OSS)の歴史的な成功を振り返りつつ、次の10年に向けた持続可能性と回復力(Resilience)の構築を論じる基調講演です。OSSを単なる「供給網(Supply Chain)」ではなく、相互に利益を与え合う「生態系(Ecosystem)」として捉えるべきだと主張します。企業がOSSから「搾取」するのではなく、真のパートナーとしてガバナンスやセキュリティに参加する必要性を説きます。コミュニティこそが未来の規制やAIの挑戦に対する唯一の回答であることを強調しています。 キーワード: オープンソース, コミュニティ, 持続可能性, ガバナンス, セキュリティ, 歴史, 規制対応, エコシステム, 回復力, 検索(関連なし)
解説: AIエージェントが直面する「コンテキストの危機」を解決するために、検索技術がいかに不可欠な存在として再評価されているかを論じます。単なる情報のチャンク化では不十分な、エージェントの意図と文脈を理解する「中間の記憶レイヤ」の必要性を解説します。オープンソースのメモリプラットフォーム「Cogni」を例に、知識グラフを用いた永続記憶により、エージェントが過去の決定から学び、一貫した行動をとるためのアーキテクチャを詳述します。Googleの「Things, not strings」という転換点が、今エージェントの世界で繰り返されている現状を分析します。 キーワード: AIエージェント, コンテキストの危機, 意味的検索, 知識グラフ, 永続メモリ, Cogni, RAGの進化, 意図理解, 意思決定トレース, 検索(関連あり)
解説: OpenSearchにおいて、データ量が増えても集計速度を一定に保つ「定数時間集計」を実現する「Star-Treeインデックス」を解説します。データ件数に応じて集計時間が線形に増加するという従来のボトルネックに対し、インデックス作成時に事前に多次元の集計結果を計算して保存する手法を詳述します。2億件のデータ集計を数秒から数ミリ秒へと短縮したベンチマーク結果を示し、可観測性のダッシュボードを劇的に高速化する仕組みを紹介します。既存のクエリを変更せずに透過的に最適化される、検索とOLAPのギャップを埋める技術です。 キーワード: OpenSearch, Star-Treeインデックス, 集計高速化, 定数時間, ログ分析, ダッシュボード性能, 多次元インデックス, 性能最適化, 検索アナリティクス, 検索(関連あり)
解説: オフラインテストで高精度を出したAIモデルが、なぜ本番環境で突然失敗するのか、その原因となる「データの嘘(バイアス)」の検出方法を解説します。言語学習アプリの離脱予測の失敗事例を挙げ、訓練データが特定のユーザー層(習慣化したユーザー)に偏っていた「選択バイアス」の特定プロセスを詳述します。新機能導入による「データドリフト」を早期に察知するための監視手法も提案されます。平均値に隠れたカテゴリ別の不具合を見つけ出すための、データサイエンティスト向けの実践的な診断ガイドです。 キーワード: データバイアス, モデル失敗, 離脱予測, データドリフト, 選択バイアス, 性能監視, 機械学習品質管理, 本番デプロイ, データサイエンス, 検索(関連なし)
解説: LLMエージェントの知能をスケールさせるための鍵となる「強化学習(RL)環境」の設計手法を解説します。人間による模倣学習の限界を指摘し、LLMに自ら試行錯誤をさせ、正解か否かを自動検証器が判定して報酬を与える「検証可能な報酬を伴う強化学習(RLVR)」のパラダイムを詳述します。オープンソースのライブラリ「verifiers」を用い、小規模モデルを学習させて最終的にGPT-4o-miniを打ち負かす精度まで引き上げた実験結果を紹介します。特定のツール操作を学習させるための「ソフトウェアとしての環境」をどう構築すべきかが学べます。 キーワード: 強化学習, LLMトレーニング, RLVR, 環境構築, verifiers, AIエージェント, 自己学習, 報酬設計, 知能スケーリング, 検索(関連なし)
解説: Apache Flinkの「複合イベント処理(CEP)」を活用し、膨大なイベントストリームから意味のあるパターンを抽出してエージェントを駆動する手法を論じます。個別のイベントごとにLLMを呼び出すコストと曖昧さを、Flinkによる決定論的なパターン検知でいかに制御するかを解説します。株価の急変動や工場の予兆保全といった、リアルタイム性が求められるユースケースにおいて、Flink SQLを用いた簡潔な記述方法とエージェントへのコンテキスト提供手法を提示します。「エージェント・スプロール(拡散)」をデータ基盤で管理する未来像です。 キーワード: AIエージェント, Apache Flink, CEP, イベント駆動, リアルタイムAI, パターン検知, ストリーム処理, 予兆保全, 効率化, 検索(関連なし)
解説: Snowflake、Elastic、MotherDuckのリーダーたちが、AIエージェントがデータプラットフォームの設計をどう変えているかを議論するパネルディスカッションです。エージェントが「新しい第一級市民」となった今、データの「セマンティックレイヤ(意味層)」がAIの行動を制御するための正当性確保の仕組みへと昇格している現状を語ります。人間向けのUIからエージェント向けのAPIやメタデータへのシフト、そして秒速で起動・消去されるエフェメラルなデータベースの必要性が議論されます。エージェントによる試行錯誤をプラットフォームがいかに安全に支えるかの最前線です。 キーワード: パネルディスカッション, AIエージェント, データプラットフォーム, セマンティックレイヤ, ガバナンス, リトリーバル, データベースの未来, 検索インフラ, メタデータ, 検索(関連あり)
解説: AI生成された「理解を伴わないコントリビューション」が急増する中で、オープンソースの核心である「メンターシップ」の文化をいかに守るかを解説します。AIによる「苦労のない回答」が、初心者の学習プロセスから「試行錯誤による文脈の理解」を奪っている現状を指摘します。レビューの焦点を「AIを使ったか?」という詰問から、「なぜこの解決策を選んだのか説明できるか?」という対話へ移すための実践的なフレームワークを提案します。AIを「答えの機械」から「学習の家庭教師」へと再定義し、次世代のエンジニアを育てる知恵を共有します。 キーワード: オープンソース, メンターシップ, AI時代の教育, 学習プロセス, 開発者育成, 信頼関係, コミュニティ文化, 3C framework, コントリビューション, 検索(関連なし)
解説: データベースの内部構造を解体して公開する構想を、最新のApache KafkaとIcebergの統合によって再定義します。Kafkaの「ログ」とIcebergの「永続ストレージ」を一つに統合し、リアルタイムデータと履歴データの境界をなくした「継続的なデータビュー」の構築手法を提示します。Kafka上のホットなデータを氷山のように巨大なコールドデータへシームレスにアクセスさせる「Icebergプロキシ」や、クエリ時に初めてインデックスを適用する手法の利点を詳述します。複雑なETLパイプラインを排除し、単一の「真実の源」を実現する未来のインフラ像です。 キーワード: Apache Kafka, Apache Iceberg, データベース内部構造, 統一ストレージ, リアルタイムと履歴の融合, ETLフリー, インデックス最適化, データガバナンス, キャッシング, 検索(関連なし)
解説: 政治的変化により消滅の危機にあるアメリカの科学データ(気候変動やワクチン関連)を、ヨーロッパのデータセンターへいかに「救出」しているかの実態を報告します。資金削減や検閲によって削除される現状を挙げ、Pangaea(ドイツの科学データアーカイブ)が実施している「FAIR原則」に基づくデータ救出プロセスを詳述します。単なるファイルのコピーではなく、欠落したメタデータの付与やフォーマット変換がいかに困難で重要であるかを説きます。科学の透明性と継続性を確保するための、グローバルなデータリポジトリ連携の重要性を訴えます。 キーワード: 科学データ保存, 気候変動データ, データ救出, FAIR原則, メタデータ, アカデミックアーカイブ, 政治と科学, データ一貫性, Pangaea, 検索(関連なし)
解説: 単一の処理エンジンに縛られず、アプリケーションとエンジンの間に仮想化レイヤーを設けるApache Wayangの設計と利点を解説します。開発者が一度書いたデータフロープランを、システムが自動的にコストを計算し、最適なエンジン(Spark, Flink, Postgres等)を選択・切り替えて実行する仕組みを詳述します。「データの移動も一つの演算子」として捉えることで、複数エンジンを跨ぐクエリの最適化を実現します。ベンダーロックインを回避し、AIエージェントによる動的なエンジン選択まで視野に入れた、次世代のマルチエンジン・データプラットフォームを提示します。 キーワード: Apache Wayang, マルチエンジン分析, クエリ最適化, エンジン非依存, 抽象化レイヤー, 実行コストモデル, オープンソース, 開発効率向上, データ移動, 検索(関連なし)
解説: Rust、Apache Arrow、DataFusionを用いて構築された、新世代の軽量ストリーミングエンジン「Streamling」の内部構造を解説します。結合(Join)や分散シャッフルを必要としない軽量ワークロードに特化することで、起動時間を2分から5秒へと劇的に短縮した事例を詳述します。チェックポイントによる「少なくとも1回の配信保証」の実装方法や、WASMを用いた独自のデータ変換機能の拡張性を紹介します。ブロックチェーンデータのような、高頻度かつ軽量なリアルタイム・パイプラインを低コストで運用するための最新技術スタックです。 キーワード: ストリーム処理, Rust, DataFusion, Apache Arrow, 軽量エンジン, WASM, ブロックチェーンデータ, 宣言型パイプライン, 効率化, 検索(関連なし)
※ 番号29についてはソースに記載がありませんでしたので、59セッションのうち現時点で詳細が判明しているものを網羅しています。全セッションがユニークであることをソースに基づき確認いたしました。