Вышла новая модель WeMM-Embedding
Предложено новое семейство универсальных мультимодальных эмбеддингов WeMM-Embedding (https://huggingface.co/collections/tencent/wemm-embedding) (2B, 4B, 9B) для текста, изображений, видео, визуальных документов и смешанных входов с гибкой размерностью выходного вектора.
Первым этапом обучения масштабно выровняли сотни миллионов пар (слабо контролируемые подписи, поиск, классификация, QA, градуированная релевантность), приведя задачи к единому парному формату с функциями потерь InfoNCE, CoSENT-ранжирования и MRL.
Вторым этапом выполняли дообучение на курированных данных (меньше по объёму, лучше качество) с добавлением ресэмплирования на основе семантических ID для баланса семантики, очистки и генерации сложных отрицательных примеров, обучения под контролем реранкеров (избирательно), а также дистилляции от более крупной модели (9B в качестве слияния специализированных вариантов служит учителем для 2B и 4B).
Архитектуру создали на основе Qwen3.5, пулинга последнего токена с L2-нормализацией и поддержки MRL (обрезание первых d измерений).
Метод MRL при 256 измерениях сохраняет более 97% качества, но при 512 уже 99%. В абляциях этапа 1 больше всего влияют пакетирование с учётом согласованности задач (-3.4 без него), инструкции (-0.8) и маскировка дубликатов (-0.5), при этом на этапе 2 последовательное добавление отобранных данных, реранкера, дистилляции и расширенного визуального бюджета даёт +2.2 на MMEB-v2.
В результате продемонстрировано 77.9 на MMEB-v2 у 2B (лучше прежних 8B-моделей) и 80.6 у 9B (SOTA), набрано 59.5 на MMEB-v3 у 9B (SOTA среди открытых, без аудио), показано 81.7 в кросс-модальном поиске (12 датасетов) у 9B и 79.8 у 2B (лучше проприетарных аналогов), одновременно на внутренних тестах (26 задач WeChat) у 2B зафиксировано 72.0 против 60.9 у Qwen3-VL-Embedding-2B. В 14 A/B-тестах были замечены улучшения, что вызвало развёртывание в рекомендациях и поиске WeChat (Каналы, Официальные аккаунты, Моменты, электронная коммерция).


