Максим Гришутин
Okko
Что нужно, чтобы маленькая локальная LLM перестала быть просто чат-ботом и превратилась в персонажа, который видит экран, понимает контекст и реагирует на происходящее?
На примере Mewmori разберем весь путь такого кота на Swift. Vision будет читать экран и возвращать OCR с координатами, из которых мы соберем компактный контекст для локальной Qwen 3.5 2B. Посмотрим, как через промпты, few-shot и структуру сообщений задать модели характер и заставить ее стабильно говорить от лица персонажа, а не пользователя.
Затем добавим коту тело: простой риг из отдельных частей, взгляд за курсором и несколько одновременно работающих анимаций. В итоге соберем полный пайплайн: экран → Vision → контекст → локальная LLM → характер → реакция → анимация.
Без облачных моделей и абстрактных AI-демок. После доклада останется небольшой Swift-проект, который можно использовать как основу для собственного локального AI-помощника.
Okko