Заставил локальные модели играть в игру MasterMind
Недавно подключил MCP сервер firefox-dev-tools, запустил браузер в специальном режиме (firefox —marionette —remote-debugging-port) и наблюдал за тем как модели отгадывают заганные цвета.
В целом я почти не сомневался в том, что Qwen 3.6-35b справится, но интересно было проверить более мелкие модели, и они чаще всего провалились, иногда вызывали инструменты невпопад, часто они просто по нескольку раз подря проверяют одни и те же цвета и даже одни и те же комбинации по 2-5 раз (думаю могут и больше, но я не выдерживал такую глупость).
Позже я понял, что надо сделать версию для моделей — потому что в этой версии (что на скриншоте выше) инструмент snapshot не возвращал нормально результат и историю попыток, часто бывало модели видели 4 разных черных точки в разных попытках и считали что уже победили. После создания новой игры для ИИ, я прогнал еще несколько раз тестов для нескольких моделей. Я подключал MCP сервер напрямую в llamacpp, и просил сыграть в игру со страницы (https://boolkin.gitverse.site/html/Vibe/MasterMind/mastermind-ai.html).
Следующие тесты для Qwen35b оказались уже не такими впечатлительными, доходило и до 15 попыток, раз на раз не приходится, как говорится. Это же подтверждает и то, что один раз до победы дошла и Qwen3.4-9b, но остальные разы она чаще просто тупила, делая однотипные попытки раз за разом. Понравилось как решила Gemma4-26b — она запустила скрипт для проверки вариантов и довольно быстро решила задачу. В этом отношении впечатлился еще одной моделью на базе Квена (occamy) — она также сделала скрипт, но пошла дальше — скрипт который в автомате решает за минимальное число попыток, запустила его и отчиталась о проделанной работе (если что диалог сохранен). Я ее попросил сделать букмарклет, она и его сделала. Теперь есть и игра, и решатель.
Удивила маленькая модель MiniCPM5-2B-Q8_0 (2.7 Гб) — очень ловко орудует инструментами, но не хватает логики для решения именно игры — также множественные проверки повторяющихся цветов.
Большие умные модели из OpenCode (бесплатные BigPickle и Long Cat) тоже справились, естественно, и тоже с помощью скриптов, но BigPickle использовал не js в браузере, а Python.
В общем если вам тоже интересно попробовать свои модели, то подключайте MCP сервер к llama.cpp (создать файл mcp.json и запустить llama.cpp с флагом –mcp-servers-config /путь/к файлу/mcp.json). В файле прописать команду (у меня файрфокса)
{
"mcpServers": {
"firefox": {
"command": "npx",
"args": ["-y", "@mozilla/firefox-devtools-mcp", "--connect-existing", "--marionette-port", "2828"]
}
}
}
Если у вас другой браузер, то прописать для него MCP сервер, можно поискать в базе серверов (какой-нибудь mcpdb) нужный MCP, где иногда даже напишут настройки для json конфигураций.
Задавал я такой пропт:
Сыграй в готовую игру mastermind со страницы https://boolkin.gitverse.site/html/Vibe/MasterMind/mastermind-ai.html Угадай расположение 4 загаданных цветов. Важно! открывай игру в новом окне, и не начинай новую игру каждый раз (новая игра каждый раз загадывает другую последовательность из 4 цветов), доведи одну игру до победы, угадай комбинацию. Вспомни правила Mastermind и игровую стратегию и начинай играть.
Конечно такие мелкие уточнения возникли не просто так, часто бывало что модель открывает игру в той же вкладке в которой открыт чат с моделью, и тогда генерация прекращается моментально. Ну и про досрочную победу тоже — было что одна модель после каждой первой комбинации начинала новую игру. В общем попробуйте, напишите свои результаты, если вам такое интересно.