TechCrunch · AI · 2 ч назад

Hark просматривает свой агент использования браузера для выполнения задач

Hark утверждает, что его агент использования браузера работает быстрее и дешевле, чем у конкурентов.

Источник TechCrunch
Опубликовано 2 ч назад
Оригинальный заголовок Hark previews its browser use agent for completing tasks
Важность 4/5
Почему это может быть интересно Важно для понимания, куда реально двигаются модели, агенты и продуктовые AI-инструменты.
← Назад к ленте Открыть оригинал
#ai#startups#tech

Подробности

Hark, стартап, который в мае привлек $700 млн в виде финансирования серии A, сегодня запустил своего агента Hark Handoff, который может эффективно использовать браузер для выполнения задач.

Компания утверждает, что Handoff может легко перемещаться по веб-сайтам, не имеющим официальных API, включая Target, Walmart, OpenTable и LinkedIn. В нем говорится, что агент Handoff просматривает структуру веб-сайта и визуальные данные, чтобы понять, нужно ли ему нажимать кнопки или вводить информацию.

Идея аналогична множеству браузерных агентов, выпущенных ранее. Дайте команду, и он выполнит за вас задачи, включая заказ еды или кофе, бронирование проездных билетов, подачу деклараций, покупку предметов первой необходимости, резервирование столика в ресторане или проведение исследований от вашего имени, просматривая различные источники.

В демонстрационном видео генеральный директор компании Бретт Адкок показал, что помощник может взять на себя команду создать букет из цветов, которые указывают пользователи, а также использовать нечеткие термины, такие как «некоторые из цветов по выбору флориста». Примечательно, что на видео показана только часть процесса, поэтому мы не можем точно оценить его эффективность.

Компания заявила, что для этого выпуска она использует модель после обучения и планирует провести предварительное обучение позже в этом году. Харк сказал, что благодаря такому подходу он сможет быстрее усовершенствовать свой конвейер данных, инфраструктуру обучения и методы. Харк также утверждает, что, в отличие от больших языковых моделей (LLM), предсказывающих следующий токен, его модель может предсказать следующее действие, которым могут быть часы или ввод с клавиатуры в определенном месте.