Ученые МФТИ создали алгоритм, позволяющий роботам эффективно и экономно анализировать видео
Ученые МФТИ разработали метод, позволяющий большим языковым моделям анализировать происходящее на видео, отслеживать движение объектов и их взаимодействие и прогнозировать последующие действия. Технология даст возможность экономить вычислительные ресурсы и может быть востребована для анализа окружающей обстановки роботами. Результаты опубликованы в журнале Technologies.
Компьютеры, которые управляют современными роботами, зачастую ограничены вычислительными мощностями. Соответственно, необходимы алгоритмы, позволяющие эффективно обрабатывать входящую информацию, экономя при этом ресурсы. В частности, речь идет о видео с камер, которое позволяет оценивать окружающую ситуацию. Об исследовании корреспонденту «Научной России» рассказал автор метода кандидат технических наук Сергей Линок.
«Мы предложили алгоритм, который умеет эффективно сжимать видеоряд, сохраняя структурное представление того, что наблюдает робот. Особенность метода в том, что алгоритм преобразует видеоряд в граф событий, где вершины — это объекты, которые участвуют в наблюдаемой сцене, а ребра — взаимосвязи между объектами. Эти связи позволяют решать пространственные и временные задачи. Совместно с эффективным алгоритмом сжатия мы помогаем роботам представлять окружающую сцену и отвечать на вопросы о происходящем с помощью большой языковой модели», — рассказал Сергей Линок.