
AWS опублікувала агентну архітектуру аналізу відеозаписів
AWS Machine Learning Blog описав архітектуру рішення, яке відповідає на запитання про відеозаписи природною мовою: система поєднує Strands Agents SDK, Amazon Bedrock, Amazon Rekognition і Amazon Transcribe та кешує результати аналізу.
Команди з медіа, безпеки й страхування записують значно більше відео, ніж встигають передивлятися: записи зустрічей накопичуються на спільних дисках, а камери фіксують тижні непереглянутого матеріалу. Потрібні деталі — рішення, ухвалене тижні тому, чи прихід людини до дверей — зазвичай можна знайти лише після годин перегляду.
AWS Machine Learning Blog опублікував архітектуру рішення, яке робить цей вміст доступним для запитів природною мовою. Користувач завантажує запис і запитує «Які рішення ухвалили на цій зустрічі?», а система відповідає з позначками часу. Раніше проаналізований матеріал отримує відповідь менш ніж за секунду, тоді як перший аналіз нового відео триває 5–10 хвилин.
Один агент замість фіксованих конвеєрів
Основа рішення — Strands Agents SDK. Замість заздалегідь зібраного конвеєра для кожного типу запиту — транскрибування, візуальний пошук, розпізнавання облич — єдиний агент вирішує на льоту, які сервіси викликати: запитання про мовлення переходять до Amazon Transcribe, візуальні — до Amazon Rekognition, а шаром міркування слугує Amazon Bedrock. Результати кешуються в Amazon S3, тож повторні запити не перераховують відео.
Результати та сценарії використання
Кожен сервіс AWS — це функція Python з декоратором @tool, а її docstring підказує моделі, коли його застосовувати. Для запиту на пошук обличчя агент виконує два залежні кроки — індексує еталонне фото, потім шукає його у відео — і повідомляє час появи з оцінкою впевненості.
Медіакомпанія впровадила цей підхід у межах проєкту AWS Professional Services, щоб робити запити до записів дослідницьких сесій. Згідно з внутрішнім порівнянням замовника, час ручного перегляду скоротився приблизно на 80% для понад 200 багатогодинних записів; AWS зазначає, що показник не підтверджено незалежно.
Розгортання, витрати й обмеження
Еталонна реалізація працює на Amazon ECS з AWS Fargate за внутрішнім балансувальником, доступним лише через Amazon CloudFront. Доступ — лише за запрошенням, через облікові записи Amazon Cognito з обов'язковою багатофакторною автентифікацією; завантаження зберігаються в префіксах S3 з 24-годинним життєвим циклом.
Транскрибування 60-хвилинного відео коштує близько $1,44, кожне додаткове запитання — $0,05–0,15, аналіз облич чи об'єктів — близько $6 одноразово. Агент обирає інструменти за описами, тож Amazon Textract, AWS HealthScribe чи Amazon Comprehend додаються без зміни робочого процесу.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.