02 / 07GRADUATION PROJECT · TEAM OF 4

NOTERA AI

授業・動画・画像の情報を、AIで読みやすいノートへ。

Role

AI Document Intelligence · AI / Product Builder · 卒業制作チームリーダー

期間
2025 - 2026
状態
確認済み

01

IDEA

最初にあったのは、ひとつの方向だけ。

授業や動画、画像の中の情報を、AIが読みやすいノートに整理できたら。

作ってみて分かったのは、難しいのは「AIに要約させること」ではないということ。何を残すか、画像をどう理解するか、コードをどう保つか、そしてチームで時間内に終わらせることだった。

発想の流れ

VIDEO / IMAGE / SLIDE → AI → NOTE
  1. 01

    Video / Image / Slide

    映像・画像・スライド

  2. 02

    AI

    AIによる読み取り

  3. 03

    Note

    読みやすいノート

三つの要素

  1. 01VIDEO / IMAGE / SLIDE

    映像・画像・スライド

    授業で扱った素材をそのまま持ち込む。

  2. 02AI

    AIによる読み取り

    文字と見た目を一緒に読み、内容を整理する。

  3. 03NOTE

    読みやすいノート

    構造化されたノートに整える。

章の結論最初の方向はひとつでも、難しいのはその中身を決めることだった。NOTERA / 01 · IDEA

02

SCOPE

やりたいことは多い。だから、まず選ぶ。

WANT / MUST / LATER に分け、限られた時間で終わる範囲を先に決めた。

全部はできない。だから、残すものと後回しにするものを最初に分けた。

範囲シート

WANT / MUST / LATER
WANTやりたいこと
  1. 01授業・動画・画像の中の情報を、AIで整理する
  2. 02読みやすいノートとして残す
MUST必須
  1. 01画像・動画の内容を処理できる
  2. 02構造化ノートを生成できる
  3. 03多言語とコードの中身が誤って除外されない
  4. 04実際にデモできる
LATERあとで
  1. 01より完全な知識管理
  2. 02より大きなモデル/複雑な分析
  3. 03さらなる個人化

範囲の決め方

WANT / MUST / LATER
  1. 01WANT

    やりたいこと

    最初の広い方向。ここから範囲を絞る。

  2. 02MUST

    時間内に終えるための条件

    画像・動画の処理、構造化ノート、多言語とコード、そしてデモ。

  3. 03LATER

    今はやらないこと

    範囲の外に置いた三つ。あとで戻る。

章の結論機能は多いほど良いわけではない。まず、主要な流れを本当に走らせることが先だった。NOTERA / 02 · SCOPE

03

TEAM

4人の卒業制作で、チームリーダーとして方向を整理し、開発に参加。

チームリーダーとして、題目の提案と全体設計を整理し、自分の担当部分を実装した。メンバーは資料整理、レポート、発表を支えた。

最初から全員が同じ作業をする必要はない。先に、何を作るか、どこまで作るかを言葉にした。

役割の地図

4人の卒業制作

私の担当(チームリーダー)

  1. 01IDEA題目の提出
  2. 02ARCHITECTURE全体アーキテクチャ
  3. 03INTEGRATION統合の判断

メンバーの担当

  1. 01DOCUMENT資料整理
  2. 02TEST提出の確認
  3. 03PRESENTATIONPPTと発表

担当の内訳

開発と資料の担当
  1. 01私の担当(チームリーダー)

    IDEA / 題目の提出

    問いを立て、主要な構想をまとめる。

  2. 02私の担当(チームリーダー)

    ARCHITECTURE / 全体アーキテクチャ

    設計と開発の方向を決める。

  3. 03私の担当(チームリーダー)

    INTEGRATION / 統合の判断

    つなぎ目を合わせ、最後を判断する。

  4. 04メンバーの担当

    DOCUMENT / 資料整理

    資料を整理し、報告にまとめる。

  5. 05メンバーの担当

    TEST / 提出の確認

    提出物の確認を支える。

  6. 06メンバーの担当

    PRESENTATION / PPTと発表

    PPTと発表資料を作る。

章の結論私の仕事は、全部を一人でやることではない。題目とアーキテクチャを先に固め、4人の仕事を同じ成果へ向けることだった。NOTERA / 03 · TEAM

04

PLAN

時間内に終わる大きさに、先に切る。

最初から各自で書き始めるのではなく、資料がどう入り、どう処理され、最後にどう見えるかを先に確かめた。

進行の区切り

RESEARCH → UI → CORE → DOCS → PRESENTATION
  1. 01RESEARCH

    資料の入り口を確かめる。

    担当
    私の担当(チームリーダー)
    成果
    資料がどう入るか
  2. 02UI

    見せ方を実装する。

    担当
    私の担当(チームリーダー)
    成果
    どう見えるか
  3. 03CORE

    全体をつなぐ。

    担当
    私の担当(チームリーダー)
    成果
    つながった主要な流れ
  4. 04DOCS

    資料と報告をまとめる。

    担当
    メンバーの担当
    成果
    技術レポート
  5. 05PRESENTATION

    PPTと発表資料をまとめる。

    担当
    メンバーの担当
    成果
    PPTと発表資料

先に決めた三つ

IN / PROCESS / VIEW
  1. 01IN

    資料はどう入るか

    入力の形を先に決める。

  2. 02PROCESS

    どう処理されるか

    読み取りと整理の流れ。

  3. 03VIEW

    最後にどう見えるか

    ノート画面まで含めて考える。

章の結論順番を決めると、限られた時間でも前に進めた。NOTERA / 04 · PLAN

05

BUILD

入力からノートまでの流れ。

作ったのは、INPUT → UNDERSTAND → ORGANIZE → OUTPUT の一本の流れ。

技術名を並べるより、どこでつながっているかを見える形にした。

構築の流れ

INPUT → UNDERSTAND → ORGANIZE → OUTPUT
  1. 01

    INPUT

    映像・画像の入力

  2. 02

    UNDERSTAND

    文字と画像の読み取り

  3. 03

    ORGANIZE

    要点整理と重複の削除

  4. 04

    OUTPUT

    構造化ノート

Vue 3 / FastAPI / Local AI / Docker

四つの工程

  1. 01INPUT

    映像・画像の入力

    動画と画像をそのまま読み込む。

  2. 02UNDERSTAND

    文字と画像の読み取り

    OCR + VLM(Vision-Language Model)で、文字と画像を一緒に読む。

  3. 03ORGANIZE

    要点整理と重複の削除

    残す内容を選ぶ。

  4. 04OUTPUT

    構造化ノート

    読みやすい形に整える。

章の結論つなぎ目が見えると、どこで詰まっているかも分かった。NOTERA / 05 · BUILD

06

DECISIONS

OCR-First から VLM-First へ。音声はやめてスライドだけに。

価値があったのは、最後に何を使ったかではなく、途中でどう変えたかだった。

読み取りの中心を替え、材料も絞った。どちらも、限られた時間で主要な流れを守るための変更だった。

二つの転換

OCR中心 → VLM-First

音声+スライド → スライドのみ

判断 01

OCR中心 → VLM-First

変更前

  1. OCR
  2. 言語/文字の判定
  3. ノート

変更後

  1. 画像とOCR文字
  2. VLM 分析
  3. ノート

コードや英語、混在した言語の内容が、誤って落ちやすかった。

判断 01 の理由

OCR中心 → VLM-First
  1. 01

    何が問題だったか

    コード・英語・混在言語が落ちやすい。

  2. 02

    どう変えたか

    Screenshot + OCR を VLM で分析し、文字と見た目を一緒に読む。

判断 02

音声+スライド → スライドのみ

変更前

  1. 音声+スライド
  2. 判定

変更後

  1. スライド
  2. 出力

音声は収音の状態が悪く、効果が出なかった。

判断 02 の理由

音声+スライド → スライドのみ
  1. 01

    何が問題だったか

    音声とスライドの両方で判断しようとしたが、音声の状態が悪かった。

  2. 02

    どう変えたか

    スライドだけで出力する形に変えた。

章の結論主経路を先に動かすと決めたことが、いちばん大きい判断だった。NOTERA / 06 · DECISIONS

07

RESULT

実際のデモで締める。

動画の入力、処理状態、ノートの出力まで、実際の画面で流れを示す。

卒業制作として発表し、実際にデモできる版まで作った。Ollama で qwen3-vl:4b をローカル実行し、PaddleOCR-VL と合わせて素材を処理する。短い動画は処理できるが、長い動画は手元の計算資源に制約がある。

デモの記録

INPUT / VIDEO LIST / NOTE
動画一覧と処理状態の画面
01 / INPUT動画一覧から、保留中・完了した処理の状態を確認する。記録状況 · 確認済み
読み込んだ動画の一覧
02 / VIDEO LIST読み込んだ動画の一覧。処理の進み具合と保存先を確認できる。記録状況 · 確認済み
講義ノートと重要用語リストの生成結果
03 / NOTE処理結果から、講義ノートと重要用語リストが生成される。記録状況 · 確認済み

残ったもの

確認済み
  1. 01SUPPORTED

    入力から構造化ノートまでの流れ

    Vue 3 と FastAPI、Docker でつないだ。

    確認済み
  2. 02SUPPORTED

    4人の分担と統合の判断

    範囲を切り、読み取りの方向を決め、つなぎ目で合わせた。

    確認済み
  3. 03SUPPORTED

    卒業制作としての発表

    発表スライドと技術レポートをまとめ、発表した。

    確認済み

記録状況

NOTERA / 07

入力から構造化ノートまで、確認できた範囲とチームの判断を中心にまとめる。

章の結論画面より、入力からノートまでの流れのほうが、この制作の成果だった。NOTERA / 07 · RESULT

NOTERA AI — LIN CHIACHENG