Рубрики
На повестке дня

Пост @Weron2 — Искусственный интеллект — N/P

Заставил локальные модели играть в игру MasterMind

Недавно подключил MCP сервер firefox-dev-tools, запустил браузер в специальном режиме (firefox —marionette —remote-debugging-port) и наблюдал за тем как модели отгадывают заганные цвета.

Пример отгаданной комбинации за 5 ходов, локальный Qwen3.6 (36к токенов)
Пример отгаданной комбинации за 5 ходов, локальный Qwen3.6 (36к токенов)

В целом я почти не сомневался в том, что Qwen 3.6-35b справится, но интересно было проверить более мелкие модели, и они чаще всего провалились, иногда вызывали инструменты невпопад, часто они просто по нескольку раз подря проверяют одни и те же цвета и даже одни и те же комбинации по 2-5 раз (думаю могут и больше, но я не выдерживал такую глупость).

Позже я понял, что надо сделать версию для моделей — потому что в этой версии (что на скриншоте выше) инструмент snapshot не возвращал нормально результат и историю попыток, часто бывало модели видели 4 разных черных точки в разных попытках и считали что уже победили. После создания новой игры для ИИ, я прогнал еще несколько раз тестов для нескольких моделей. Я подключал MCP сервер напрямую в llamacpp, и просил сыграть в игру со страницы (https://boolkin.gitverse.site/html/Vibe/MasterMind/mastermind-ai.html).

Следующие тесты для Qwen35b оказались уже не такими впечатлительными, доходило и до 15 попыток, раз на раз не приходится, как говорится. Это же подтверждает и то, что один раз до победы дошла и Qwen3.4-9b, но остальные разы она чаще просто тупила, делая однотипные попытки раз за разом. Понравилось как решила Gemma4-26b — она запустила скрипт для проверки вариантов и довольно быстро решила задачу. В этом отношении впечатлился еще одной моделью на базе Квена (occamy) — она также сделала скрипт, но пошла дальше — скрипт который в автомате решает за минимальное число попыток, запустила его и отчиталась о проделанной работе (если что диалог сохранен). Я ее попросил сделать букмарклет, она и его сделала. Теперь есть и игра, и решатель.

Удивила маленькая модель MiniCPM5-2B-Q8_0 (2.7 Гб) — очень ловко орудует инструментами, но не хватает логики для решения именно игры — также множественные проверки повторяющихся цветов.

Большие умные модели из OpenCode (бесплатные BigPickle и Long Cat) тоже справились, естественно, и тоже с помощью скриптов, но BigPickle использовал не js в браузере, а Python.

В общем если вам тоже интересно попробовать свои модели, то подключайте MCP сервер к llama.cpp (создать файл mcp.json и запустить llama.cpp с флагом –mcp-servers-config /путь/к файлу/mcp.json). В файле прописать команду (у меня файрфокса)

{
  "mcpServers": {
    "firefox": {
      "command": "npx",
      "args": ["-y", "@mozilla/firefox-devtools-mcp", "--connect-existing", "--marionette-port", "2828"]
    }
  }
}

Если у вас другой браузер, то прописать для него MCP сервер, можно поискать в базе серверов (какой-нибудь mcpdb) нужный MCP, где иногда даже напишут настройки для json конфигураций.

Задавал я такой пропт:

Сыграй в готовую игру mastermind со страницы https://boolkin.gitverse.site/html/Vibe/MasterMind/mastermind-ai.html Угадай расположение 4 загаданных цветов. Важно! открывай игру в новом окне, и не начинай новую игру каждый раз (новая игра каждый раз загадывает другую последовательность из 4 цветов), доведи одну игру до победы, угадай комбинацию. Вспомни правила Mastermind и игровую стратегию и начинай играть.

Конечно такие мелкие уточнения возникли не просто так, часто бывало что модель открывает игру в той же вкладке в которой открыт чат с моделью, и тогда генерация прекращается моментально. Ну и про досрочную победу тоже — было что одна модель после каждой первой комбинации начинала новую игру. В общем попробуйте, напишите свои результаты, если вам такое интересно.

Читать дальше →