🆕 Новые модели 1 мин чтения

Google SensorFM: foundation-модель на 1 трлн минут данных с фитнес-браслетов

Google обучила SensorFM на данных от 5 млн человек. Модель сначала выучивает структуру физиологических сигналов, а затем переиспользует представление для предсказаний по кардиологии, метаболизму и сну. На 34 из 35 задач эмбеддинги превзошли ручные признаки.

Что

Google представила SensorFM — foundation-модель для анализа данных с носимых устройств. Обучение проведено на более чем 1 триллионе минут сенсорных данных, собранных у 5 миллионов пользователей фитнес-браслетов.

Как

Ключевая архитектурная идея — двухэтапный подход. Вместо того чтобы сразу сжимать сырые сигналы (пульс, движение, температура) в грубые усреднённые метрики, модель сначала выучивает внутреннюю структуру и закономерности этих физиологических сигналов. Затем это общее представление переиспользуется для решения конкретных downstream-задач.

Цифры

  • Объём данных: >1 трлн минут сенсорных данных.
  • Размер датасета: данные от 5 млн человек.
  • Качество: выученные эмбеддинги обошли инженерные (рукотворные) признаки на 34 из 35 задач предсказания.

Что перенять

Паттерн «сначала выучить структуру сырых сигналов, потом дообучать под задачу» применим к любым временным рядам с носимых устройств. Это аргумент против ручного фичеринга: если данных достаточно, эмбеддинги из предобученной модели могут заменить десятки рукотворных признаков.

Для данных с носимых устройств: предобученная модель на >1 трлн минут сырых сигналов даёт эмбеддинги, которые побеждают ручные признаки на 34/35 задач — эпоха ручного фичеринга для wearables заканчивается.