Назад
AWS опублікувала агентну архітектуру аналізу відеозаписів
SiTech AI Team2 წთ. საკითხავი

AWS опублікувала агентну архітектуру аналізу відеозаписів

AWS Machine Learning Blog описав архітектуру рішення, яке відповідає на запитання про відеозаписи природною мовою: система поєднує Strands Agents SDK, Amazon Bedrock, Amazon Rekognition і Amazon Transcribe та кешує результати аналізу.

Команди з медіа, безпеки й страхування записують значно більше відео, ніж встигають передивлятися: записи зустрічей накопичуються на спільних дисках, а камери фіксують тижні непереглянутого матеріалу. Потрібні деталі — рішення, ухвалене тижні тому, чи прихід людини до дверей — зазвичай можна знайти лише після годин перегляду.

AWS Machine Learning Blog опублікував архітектуру рішення, яке робить цей вміст доступним для запитів природною мовою. Користувач завантажує запис і запитує «Які рішення ухвалили на цій зустрічі?», а система відповідає з позначками часу. Раніше проаналізований матеріал отримує відповідь менш ніж за секунду, тоді як перший аналіз нового відео триває 5–10 хвилин.

Інтерфейс відеоаналітики

Один агент замість фіксованих конвеєрів

Основа рішення — Strands Agents SDK. Замість заздалегідь зібраного конвеєра для кожного типу запиту — транскрибування, візуальний пошук, розпізнавання облич — єдиний агент вирішує на льоту, які сервіси викликати: запитання про мовлення переходять до Amazon Transcribe, візуальні — до Amazon Rekognition, а шаром міркування слугує Amazon Bedrock. Результати кешуються в Amazon S3, тож повторні запити не перераховують відео.

Результати та сценарії використання

Кожен сервіс AWS — це функція Python з декоратором @tool, а її docstring підказує моделі, коли його застосовувати. Для запиту на пошук обличчя агент виконує два залежні кроки — індексує еталонне фото, потім шукає його у відео — і повідомляє час появи з оцінкою впевненості.

Медіакомпанія впровадила цей підхід у межах проєкту AWS Professional Services, щоб робити запити до записів дослідницьких сесій. Згідно з внутрішнім порівнянням замовника, час ручного перегляду скоротився приблизно на 80% для понад 200 багатогодинних записів; AWS зазначає, що показник не підтверджено незалежно.

Архітектура рішення

Розгортання, витрати й обмеження

Еталонна реалізація працює на Amazon ECS з AWS Fargate за внутрішнім балансувальником, доступним лише через Amazon CloudFront. Доступ — лише за запрошенням, через облікові записи Amazon Cognito з обов'язковою багатофакторною автентифікацією; завантаження зберігаються в префіксах S3 з 24-годинним життєвим циклом.

Транскрибування 60-хвилинного відео коштує близько $1,44, кожне додаткове запитання — $0,05–0,15, аналіз облич чи об'єктів — близько $6 одноразово. Агент обирає інструменти за описами, тож Amazon Textract, AWS HealthScribe чи Amazon Comprehend додаються без зміни робочого процесу.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.