募集中
【学生インターンシップ】ABEMAにおけるエンタメ×AIで「番組づくりの裏側」を変える。MLエンジニア募集!
皆さんが「ABEMA」で普段目にしているコンテンツは、配信用の完成版映像です。しかしその裏側では、複数のカメラで撮影された映像や、出演者ごとのマイクで収録された音声など、完成版をはるかに超える量の映像・音声データが日々生まれています。
コンテンツ制作や宣伝の現場では、この膨大な映像の中から「目的のシーンを探し出す」場面が日常的に発生します。ところが、映像は文書のように一覧したり、キーワードで引いたりすることができません。どこに何が映っていて、誰が何を話しているのか。現在はスタッフが時間をかけて映像を確認しながら探しており、ここに多くの時間が費やされています。
私たちはこの課題に対して、映像・音声・文字起こしテキストといったマルチモーダルな情報を活用した「シーン検索」の仕組みづくりを進めています。人物・発話内容・場面の状況といった切り口で映像を検索できるようになれば、コンテンツ制作に関わるさまざまな業務のあり方が大きく変わります。さらにその先には、数値では捉えにくい人間関係や感情の機微、場の空気といった「言葉にしにくいもの」をどう捉えるか、という解のない問いも待っています。
これらは、コンピュータービジョン・音声処理・自然言語処理・マルチモーダルAIといった技術がまさに活きる領域です。「番組づくりの裏側」を機械学習で変えていく挑戦、一緒にやってみませんか?
コンテンツ制作や宣伝の現場では、この膨大な映像の中から「目的のシーンを探し出す」場面が日常的に発生します。ところが、映像は文書のように一覧したり、キーワードで引いたりすることができません。どこに何が映っていて、誰が何を話しているのか。現在はスタッフが時間をかけて映像を確認しながら探しており、ここに多くの時間が費やされています。
私たちはこの課題に対して、映像・音声・文字起こしテキストといったマルチモーダルな情報を活用した「シーン検索」の仕組みづくりを進めています。人物・発話内容・場面の状況といった切り口で映像を検索できるようになれば、コンテンツ制作に関わるさまざまな業務のあり方が大きく変わります。さらにその先には、数値では捉えにくい人間関係や感情の機微、場の空気といった「言葉にしにくいもの」をどう捉えるか、という解のない問いも待っています。
これらは、コンピュータービジョン・音声処理・自然言語処理・マルチモーダルAIといった技術がまさに活きる領域です。「番組づくりの裏側」を機械学習で変えていく挑戦、一緒にやってみませんか?
募集要項
募集対象 |
▼必須スキル ・大学・大学院で、以下いずれかの分野を専攻 or それに準ずる知識を独学で習得している方 └ 統計学 / 機械学習 / 情報工学 / 数理・情報系分野 etc. ・Python を使ったデータ分析・機械学習の実装経験 └ 例:NumPy / pandas / scikit-learn / PyTorch / Jupyter などを使った分析・実装 ・映像・音声、エンタメコンテンツ、番組制作の裏側のいずれかに強い関心がある方 ・課題にあった論文やライブラリを調査し、手を動かして試せること ▼歓迎スキル ※いずれかの知識・経験 ・コンピュータービジョン(動画理解・シーン検出・ハイライト抽出など)の研究・開発・コンペ経験 ・音声処理(音源分離・音声認識・話者分離など)の研究・開発経験 ・マルチモーダルモデル・基盤モデル(VLM・音声認識モデルなど)の活用経験 ・機械学習・人工知能系の国際カンファレンスや査読誌での採択実績 ・映像編集の経験(趣味レベルでも歓迎します) |
|---|---|
選考フロー |
エントリー→書類選考→面接(2回)→合否連絡 |
お問い合わせ先
お問い合わせは下記窓口宛にご連絡ください。