「EMNLP」は世界中の研究者によって定期開催される国際会議で、「ACL」「NAACL」と並び、自然言語処理分野でもっとも権威ある国際会議のひとつです。EMNLP 2026はACLのSIGDATが主催し、2026年10月24日から29日にかけてハンガリー・ブダペストで開催されます。
■採択された論文について
「From Anonymous Speaker Seeds to Consistent Characters: Zero-Shot Manga Speaker Attribution」
著者:Yanhao Chen(東京大学)・下田 和・山口 光太(サイバーエージェント AI Lab)・中山 英樹(東京大学)
論文リンク:TBA
| マンガの内容を理解するうえで、各セリフの話者を正しく特定することは重要な要素のひとつです。一方、作品ごとの話者情報を事前に与えないゼロショット設定では、登場人物がコマ外にいる場合や、姿勢・作画スタイルによって外見が変化する場合があり、局所的な画像情報だけに基づく推定には課題があります。 本研究では、作品全体で繰り返し現れる会話の一貫性をもとに話者の同一性を整理する「Speaker-Seeded Identity Consolidation(SSIC)」を提案しました。Manga109Dialogを用いた評価では、話者推定精度74.62%を達成し、従来手法を7.02ポイント上回りました。 なお、本研究は東京大学中山研究室との共同で実施しました。 |
「Consensus Group Relative Policy Optimization for Text Generation」
著者:市原 有生希※4(奈良先端科学技術大学院大学)・陣内 佑※5・蟻生 開人 (サイバーエージェント AI Lab)・内部 英治 (国際電気通信基礎技術研究所)
論文リンク:https://arxiv.org/abs/2602.03102
| 複数の文章候補を生成し、候補同士の類似度に基づいて出力を選ぶ「Minimum Bayes Risk Decoding(MBR)」は、高い生成品質が得られる一方、推論時の計算コストが大きいという課題があります。 本研究では、MBRで用いる評価スコアを強化学習の報酬として活用する「Consensus Group Relative Policy Optimization(C-GRPO)」を提案しました。機械翻訳と文章要約の実験では、提案手法はMBRに匹敵する性能を示しました。また、機械翻訳の平均評価スコアでは、参照文を用いない既存の比較手法を上回る結果となりました。 |
「Revisiting the Capacity Gap in Chain-of-Thought Distillation from a Practical Perspective」
著者:梶塚 時央(東京大学※6)・本多 右京・高瀬 翔(サイバーエージェント AI Lab)
論文リンク:https://arxiv.org/abs/2604.08880
| 大規模な教師モデルの推論過程を小規模な生徒モデルへ移すCoT蒸留では、両モデルの能力差が大きいと学習が十分に機能しない「キャパシティギャップ」が指摘されています。 本研究では、この問題を実用的な評価方法の観点から改めて検証しました。 その結果、蒸留後のモデル同士だけを比較する既存の評価では蒸留による性能低下を見落としており、蒸留が有効に働く場面でのキャパシティギャップの影響を十分に評価できていなかったことを明らかにしました。さらに、キャパシティギャップの影響は常に支配的とは限らず、教師モデル間の性能差が大きい場合にはより高性能な教師を選ぶことが有効との指針を示しました。 |
「Who Laughs with Whom? Disentangling Influential Factors in Humor Preferences across User Clusters and LLMs」
著者:村上 聡一朗(サイバーエージェント AI Lab)・上垣外 英剛(サイバーエージェント AI Lab/奈良先端科学技術大学院大学)・高村 大也(東京科学大学)・奥村 学(東京科学大学)
論文リンク:https://arxiv.org/abs/2601.03103
| ユーモアの好みは個人や文化によって異なるため、大規模言語モデル(LLM)が人の多様な嗜好をどの程度捉えられるかを評価することは容易ではありません。 本研究では、日本の大喜利を対象に、投票履歴からユーザーをクラスタリングし、解釈可能な嗜好要因の重みをクラスタごとに分析しました。 その結果、ユーザークラスタごとに異なる嗜好パターンが存在し、LLMの判断が特定のクラスタに類似する場合があることを確認しました。また、ペルソナプロンプティングによって、LLMの嗜好を特定のクラスタに近づけられることを示しました。 本研究成果は、好みの違いに関する知見を活かし、一人ひとりに響くクリエイティブの生成・評価をはじめ、広告・マーケティング領域への応用を目指します。 なお、本研究は東京科学大学奥村研究室との共同で実施しました。 |
「MobQA: A Benchmark Dataset for Semantic Understanding of Human Mobility Data through Question Answering」
著者:浅野 輝※7(東京大学)・大内 啓樹(奈良先端科学技術大学院大学/サイバーエージェント AI Lab)・春日 瑛※8・米谷 竜(サイバーエージェント AI Lab)
論文リンク:https://arxiv.org/abs/2508.11163
| 人の移動データには、日々の行動パターンや移動の目的を理解する手がかりが含まれていますが、そこから意味のある情報を引き出すことは容易ではありません。 本研究では、大規模言語モデル(LLM)の移動データに対する理解力を測るため、GPSの移動軌跡を対象とした自然言語による質問応答ベンチマーク「MobQA」を構築しました。 MobQAは移動データの理解力を多面的に評価するため、事実検索、多肢選択式推論、自由記述による説明という3種類のタスク、計5,800件の質問・回答ペアで構成されています。MobQAを用いて主要なLLMを評価した結果、LLMは事実検索タスクでは高い性能を示した一方、移動手段や訪問目的の推定といった意味的な推論や、行動パターンの説明には課題が見られました。 なお、本研究の一部については、科研費基盤研究(B)26K02991の助成を受けています。 |
●Findings
「Cascaded Batch Prompting」
著者:星野 翔・張 培楠(サイバーエージェント AI Lab)
論文リンク:https://arxiv.org/abs/2608.27038
| 大規模言語モデル(LLM)のバッチ推論は、複数入力を同時に処理することで推論を高速化する技術ですが、性能低下の恐れがあり実用上の課題となっていました。 本研究は、分類問題におけるバッチ推論を自由記述による「推論」と分類ラベルへの「記号接地」の二段階に分離することでこの課題を克服しました。その結果、代表的ベンチマークにおいて性能と推論効率の両立を実現し、バッチ推論の実用性が高まりました。 本成果は、AIにより広告クリエイティブの審査を自動化する「審査AI」など、幅広いプロダクトへの応用が期待できます。 |
「3D Visual Prompting: Empowering 3D-Aware Visual Generation via In-Context Self-Refinement」
著者:石川 玲奈・佐藤 文彬(サイバーエージェント AI Lab)・八馬 遼(Independent Researcher)・関井 大気(サイバーエージェント AI Lab)・斎藤 英雄(慶應義塾大学)
論文リンク:TBA
| 画像・動画生成の応用では、生成された物体の位置や向きを直感的かつ高精度に修正する技術が求められています。一方、テキストによる指示や従来の2D Visual Promptには、指示の設計が難しいことや、奥行きを正確に指定しにくいという課題があります。 本研究では、3次元の指示を2次元の生成モデルでパラメータ更新なく扱えるようにする「3D Visual Prompting」を提案しました。また、「In-Context Self-Refinement(ICSR)」を導入することで、反復計算を行わず1回の推論で高精度な3次元制御を実現しました。画像編集・動画生成タスクに適用した実験では、従来の2D Visual Promptingを大きく上回る性能を示しています。 なお、本研究は慶應義塾大学斎藤研究室との共同で実施しました。 |
「Memes-as-Replies: Can Models Select Humorous Manga Panel Responses?」
著者:小比田 涼介・吉岡 征一郎(サイバーエージェント AI Lab)
論文リンク:https://arxiv.org/abs/2602.15842
| SNS上の投稿に対して、文脈に沿ったユーモアのあるマンガのコマを返信として使う場合、その面白さは画像単体ではなく投稿文との組み合わせによって生まれます。 本研究では、オープンライセンスのもとで提供されている日本のマンガ画像と疑似的に生成したSNS投稿文を用いて、文脈に対して最も適切なマンガのコマを選択する「Meme Reply Selection」タスクを提案し、その能力を評価するベンチマーク「MaMe-Re」を構築しました。MaMe-Reは、画像と投稿文からなる10万組のペアに対し、2,325人から計50万件の評価を収録しています。 実験では、LLMが誇張などの社会的な手掛かりを捉える可能性を示す一方、意味が似た候補間の微妙な面白さの違いを判別することには課題があることを確認しました。 |
●Industry Track
「AdCompliance: Towards Automated Compliance Verification in Advertising Operations」
著者: 杉山 咲(奈良先端科学技術大学院大学)・張 培楠(サイバーエージェント AI Lab)・坂井 優介(奈良先端科学技術大学院大学)・高瀬 翔(サイバーエージェント AI Lab)・ 大内 啓樹(奈良先端科学技術大学院大学/サイバーエージェント AI Lab)・渡辺 太郎(奈良先端科学技術大学院大学)
論文リンク:TBA
| 広告運用では、制作された広告表現が景品表示法や薬機法といった法令や、プラットフォームのポリシー、業界のガイドラインに沿っているかを確認するためのコンプライアンス審査が必要です。一方、こうした審査は専門家による人手での確認が中心で、運用をスケールするためのボトルネックの一つとなっています。 本研究では、広告テキストのコンプライアンス審査を自動検証するタスクを提案し、広告テキストに専門家が注釈を付与したデータセット「AdCompliance」を構築しました。あわせて、分類器を用いた検証システムも開発し、実験では誤検知率を低く抑えながら基準に適合しない広告を抽出できる実用的な性能を確認しました。 今後は本研究結果をもとに、コンプライアンス審査の自動検証を実際の広告運用ワークフローに組み込むことを目指します。 なお、本研究は奈良先端科学技術大学院大学渡辺研究室との共同で実施しました。 |
■今後
今後もAI Labでは、自然言語処理をはじめとするAI技術の研究開発を推進し、基礎研究から実社会での応用まで幅広いテーマに取り組みます。また、国内外の大学・研究機関との共同研究を通じて、学術研究の発展と研究成果の社会への還元に貢献してまいります。
※1:EMNLP 2026
※2:Findings:委員会によって内容、質、新規性において評価された論文を掲載するオンライン版の出版物
https://2022.naacl.org/blog/authors-faq/#q-findings
※3:Industry Track:言語技術の学術研究と産業応用の相互作用を強調し、実際に社会実装された言語技術の研究成果・課題・ベストプラクティスを共有するトラック
https://2026.emnlp.org/calls/industry_track/
※4,5,8:論文執筆当時の所属
※6:論文執筆当時、東京大学に所属。 2025年8月13日より2026年3月31日までインターンシップに参加
※7:論文執筆当時、東京大学に所属。2023年10月4日より2025年10月31日までインターンシップに参加