Можно ли предсказать, понравится ли человеку книга?
Представим, что у нас есть рукопись на 400 страниц. Мы ничего не знаем об авторе, не видели обложку и не читали аннотацию. Перед нами только текст.
Можно ли по нему понять, понравится ли книга читателю?
Сначала этот вопрос кажется почти абсурдным. Чтение ведь субъективно. Одному человеку нужен быстрый сюжет, другому важнее язык. Кто-то бросит роман из-за длинных описаний, а кто-то именно ради них и читает.
И всё же читатели довольно часто сходятся в своих оценках. Книги получают тысячи отзывов, а средняя оценка у них может быть удивительно устойчивой.
Значит, в самом тексте должно быть что-то, что с этим связано.
Нам стало интересно, можно ли это найти.
Что вообще можно измерить в книге?
Если смотреть на роман как на произведение искусства, измерить его качество довольно сложно. Но если посмотреть на него просто как на большой объём текста, появляется много вещей, которые можно посчитать.
Например, длину предложений и абзацев, частотность слов, соотношение диалогов и описаний, повторяемость конструкций, распределение частей речи, изменения темпа.
Можно посмотреть, как эти характеристики меняются от начала книги к концу. Или сравнить разные главы. А можно найти места, в которых текст заметно отличается от остальной рукописи.
Большинство из этих вещей практически невозможно удержать в голове во время обычного чтения. Мы воспринимаем историю, следим за героями, строим предположения о том, что произойдёт дальше. Мы редко думаем о том, сколько в последней главе предложений определённой длины.
Но это не значит, что такие особенности ничего не значат.
Возможно, за ними скрываются закономерности, которые мы воспринимаем интуитивно.
Мы решили проверить эту идею
Так появился Writers Lab.
В основе сервиса лежит довольно простая задача: взять большую рукопись и посмотреть на неё сразу с нескольких сторон.
Один слой анализа связан с формальными характеристиками текста. Другой использует искусственный интеллект, чтобы работать с содержанием рукописи.
В результате можно получить представление о стиле, темпе, структуре и логике текста, а также о других его характеристиках.
Но для нас самым интересным оказался другой вопрос: можно ли на основании самого текста сделать предположение о том, как его оценят читатели?
Для этого Writers Lab использует отдельный статистический алгоритм.
Это не означает, что алгоритм способен предсказать мнение конкретного человека. Но сама возможность искать связь между устройством текста и читательской оценкой кажется нам интересной.
Если такая связь существует, значит, часть того, что мы воспринимаем как простое «мне понравилось» или «мне не понравилось», может иметь вполне конкретные признаки.
А это уже интересно.
Что именно видит алгоритм?
Когда человек говорит, что книга ему понравилась, он обычно не может точно объяснить, почему. Он может сказать, что ему понравились персонажи, язык или что «сюжет затянул».
Но за этим впечатлением одновременно работает огромное количество деталей:
- ритм предложений;
- количество диалогов;
- то, насколько быстро меняются сцены;
- повторы;
- соотношение действия и описания;
- сложность синтаксиса;
- то, как разные элементы распределены по всей книге.
Читатель не обязан замечать их по отдельности. Достаточно почувствовать, что текст читается легко или, наоборот, требует слишком много усилий.
Алгоритм смотрит на те же страницы совершенно иначе.
Он может увидеть структуру, которая возникает из всего текста целиком: где меняется темп, какие характеристики остаются стабильными, какие фрагменты заметно отличаются от остальных.
И тогда возникает следующий вопрос: что с этим делать человеку, который написал книгу?
Что получает автор?
Допустим, анализ показывает, что темп в середине рукописи заметно отличается от остального текста. Сам по себе этот факт ещё ничего не говорит о качестве этой части. Автор может посмотреть на неё и обнаружить проблему. А может понять, что именно такой темп ему и нужен.
То же самое со стилем. Если одна глава сильно отличается от остальных, это может быть случайностью. А может быть сознательным художественным решением.
Поэтому результат анализа нельзя воспринимать как инструкцию по исправлению книги. Он скорее показывает на текст с другой стороны и позволяет обратить внимание на то, что во время обычной работы легко пропустить.
Иногда человек обнаруживает то, что давно чувствовал, но не мог сформулировать. Иногда видит, что проблема находится совсем не там, где ему казалось. А иногда получает подтверждение, что необычная особенность текста действительно выделяет определённый фрагмент.
В этом смысле анализ не заменяет чтение. Он позволяет вернуться к нему с новой информацией.
И всё-таки: можно ли предсказать, понравится ли книга?
Наверное, здесь стоит аккуратнее обращаться со словом «предсказать».
Невозможно взять роман и сказать, что конкретный человек поставит ему четыре звезды. Слишком многое зависит от самого читателя: его вкуса, опыта, настроения, того, что он читал до этого.
Один человек может полюбить роман за медленный темп, который другого заставит его закрыть.
Но из этого ещё не следует, что читательская реакция полностью случайна.
Если определённые особенности текста связаны с тем, как его воспринимают читатели, эти связи можно искать и в других рукописях.
И тогда вопрос становится немного другим:
Есть ли в тексте признаки, которые связаны с тем, как его обычно воспринимают читатели?
Именно эту возможность нам и интересно исследовать дальше в Writers Lab.
Возможно, со временем таких закономерностей удастся найти гораздо больше. А возможно, окажется, что некоторые вещи в литературе принципиально невозможно измерить.
Нам интересны оба результата.
Потому что в конечном счёте здесь речь идёт не о попытке превратить книгу в набор цифр. Скорее, о возможности посмотреть на знакомый текст ещё одним способом — и увидеть в нём то, что обычное чтение оставляет незамеченным.
Иногда этого достаточно, чтобы перечитать собственную книгу немного иначе.