Выключил интернет — а поиск работает
Запустил локальные модели на своём маке: эмбеддинги не хуже облачных, Mistral выделяет задачи из заметок. Приватность из красивого слова в питче превращается в реализуемую фичу.

Автор: Georg Malahov
Полторы недели назад я исследовал рынок голосовых заметок через Deep Research — режим глубокого исследования у OpenAI. Выводы отрезвляющие: конкурентов много, почти все — американские сервисы с облачным хранилищем. И именно тут наша возможная сильная сторона: у большинства слабое место — приватность, а мы сидим на немецком рынке, где вопрос «куда уходят мои данные» задают первым. Плюс вторая идея, которая мне нравится больше всего: zero effort — приложение с одной кнопкой, куда наговариваешь вразнобой всё подряд, а оно само раскладывает по полочкам, без ручного ввода. Такого толком нет ни у кого.
Но «приватность» в питче — красивое слово, пока распознавание и анализ крутятся в чужом облаке. Сегодня я проверял, насколько реально перенести это к пользователю. И я, прямо скажу, обалдел от того, какую экосистему уже построили вокруг локальных моделей.
Начал с эмбеддингов — числовых отпечатков смысла текста, на которых у меня ещё с декабря работает поиск по заметкам. Запустил локальную модель, заново векторизовал все свои заметки в локальном Postgres и сравнил поиск с текущим облачным вариантом от OpenAI. Результаты практически идентичные — настолько, что существенной разницы я вообще не вижу.
Дальше — генерация текста. Нашёл Ollama — инструмент, который ставит языковые модели на локальную машину почти как Docker образы: ollama pull и название модели. Поставил Mistral, к нему есть open-source интерфейс, похожий на привычный чат. А потом сделал контрольный эксперимент: выключил интернет, взял свои заметки, передал их локальной модели с промптом «выдели задачи» — и она правильно сформулировала закрытые задачи из моего куска текста. Всё это — на моём ноутбуке, без единого запроса наружу. Отличное ощущение.
Бонусом полистал Hugging Face — каталоге открытых моделей: там и анализ картинок, и text-to-speech, и чего только нет. Качество каждой надо проверять отдельно, но сам факт: из этого можно собрать локального Франкенштейна из моделей, заточенных под наши задачи, и запускать его хоть на своём сервере, хоть у пользователя.
Для проекта это меняет расклад в двух местах. Эксперименты теперь быстрее и бесплатные — не надо считать центы за каждый запрос к API. А приватность из маркетингового слова превращается в архитектурное решение, которое реально можно построить.
Впечатлениями я тут же поделился с первым сооснователем — наговорил ему голосовое. На неделе главная задача такая: собрать цепочку, которая выделяет и обновляет задачи из заметок, и показать команде, что локальные модели — это не игрушка.