Примечание - В настоящем стандарте с целью повышения точности оценки разборчивость синтезированной речи подразделена на два типа: смысловую разборчивость речи и интонационную разборчивость речи.
3.2 смысловая разборчивость речи: Относительное количество синтезированных фраз по заданному тексту с учетом правильной постановки ударений в словах, в том числе с учетом разрешения случаев омографии и правильности автоматической замены буквы "е" на "ё".
3.3 интонационная разборчивость речи: Относительное количество правильно синтезированных фраз по заданному тексту с учетом интонационного оформления.
Примечание - Показатель качества интонационной разборчивости не применим для синтезаторов речи класса "Информатор" (3.10).
3.4 естественность синтезированной речи: Величина, характеризующая субъективную оценку соответствия звучания синтезированной речи естественному произношению.
3.5 нормальный темп синтезированной речи: Синтез речи по тексту со скоростью приблизительно от 8 до 12 звуков в секунду.
Примечание - В целях удобства измерения скорость можно измерять в буквах в секунду. Для русского языка это будет также от 8 до 12 букв в секунду. Точность измерения в буквах в секунду является достаточной для определения класса темпа речи.
3.6 ускоренный темп синтезированной речи: Синтез речи по тексту со скоростью примерно 20 букв в секунду.
3.7 нормализация текста: Преобразование встречающихся в тексте чисел, аббревиатур, сокращений, символов, дат, времени, номеров телефонов, символов валют, иноязычных слов в соответствии с литературной нормой произнесения.
3.8 интонационное оформление синтезированной речи: Реализация в синтезированной речи интонации высказываний, соответствующей знакам препинания в тексте.
Примечание - Предложение, заканчивающееся точкой, должно оформляться интонацией завершения; предложение, заканчивающееся знаком вопроса, - вопросительной интонацией; предложение, заканчивающееся восклицательным знаком, - восклицательной интонацией; предложение, заканчивающееся многоточием или двоеточием, - интонацией незавершенности. Интонация незавершенности также должна быть реализована и в том случае, когда в тексте имеется запятая. В этом случае перед паузой (запятой) должна быть интонация незавершенности.
3.9 омография: Раздел лингвистики, изучающий одинаковые по написанию слова, имеющие различие в произношении в зависимости от контекста.
3.10 классы синтезаторов речи: Разделение синтезаторов речи по функциональности выражения интонации речи.
Примечание - В настоящем стандарте все синтезаторы речи разделены на 3 класса:
- "Информатор" - класс интонационной функциональности, который предполагает синтез речи для текста, содержащего только повествовательные предложения или вопросительные предложения;
- "Собеседник" - класс интонационной функциональности предполагает, что текст может содержать все виды предложений, включая предложения с интонацией незавершенности, интонация имеет нейтральную эмоциональную окраску.
- "Актер" - класс интонационной функциональности, который обеспечивает синтез любых видов интонации и эмоциональной окраски.
Уровень функциональности по способу выражения интонации речи увеличивается от класса "Информатор" к классу "Актер". При увеличении уровня функциональности возрастает количество критериев качества. Настоящий стандарт определяет критерии качества только для классов "Информатор" и "Собеседник".
4.1 При выполнении измерений должны быть применены измерительные системы, испытательное оборудование и средства измерений по ГОСТ Р 53188.1, ГОСТ 15150:
- программное обеспечение, выполняющее синтез речи по заданному тексту;
- динамические головные телефоны;
- шумомер по ГОСТ Р 53188.1, класс точности 3.
4.2 Для выполнения измерений допускается использование дополнительного оборудования:
- ПЭВМ;
- внешний носитель с тестами для проведения измерений.
5.1 Измерения следует проводить в нормальных климатических условиях по ГОСТ 15150.
5.2 Уровень акустического шума в помещении для испытаний должен быть не более 50 дБ (по шкале А ГОСТ 13107).
5.3 Прослушивание должно быть выполнено на головные телефоны, обеспечивающие звуковое давление не выше 79 дБ.
5.4 Измерения проводит бригада аудиторов. Аудитор должен быть в возрасте от 18 до 50 лет, не иметь явных дефектов слуха.
5.5 Размер бригады аудиторов зависит от измеряемого показателя качества.
5.6 Объем, представительность и вариативность тестового материала (число таблиц и их состав) должны быть такими, чтобы обеспечить полноту проверки объекта измерений и исключить возможность предварительной настройки синтезатора на конкретный состав тестового материала.
5.7 При повторном измерении показателя качества аудитор должен прослушивать тот тестовый материал, который он ранее не прослушивал на этапе обучения или в предыдущих измерениях.
5.8 Продолжительность одной непрерывной сессии измерений, производимой аудиторами, не должна превышать 45 мин. В сутки рекомендуется проводить не более 4 сессий, с перерывами между ними не менее 20 мин.
5.9 Результаты измерений для всех методов должны быть оформлены протоколом, содержащим следующую информацию:
- объект испытаний;
- результаты измерений.
При выполнении измерений естественности протокол должен дополнительно содержать следующую информацию:
- ширина спектра аудиосигнала: узкополосный (от 300 до 3700 Гц) или широкополосный (от 50 до 7000 Гц);
- средняя длительность синтезируемой речи: кратковременная (одно предложение, не более 10 слов), долговременная (три или более предложений, связанных общим смыслом, 20 или более слов);
- среднее значение оценки естественности для аудиозаписей, содержащих естественную речь;
- средние значения оценки естественности для аудиозаписей базовых синтезаторов (при наличии).
Рекомендуется дополнительно предоставлять следующую информацию:
- цель испытаний;
- дату и место проведения испытаний;
- условия и методику проведения испытаний;
- сведения о головных телефонах, использовавшихся для воспроизведения аудиосигнала;
- количество аудиторов;
- количество и длительность сеансов;
- профили участников, распределение по возрасту и полу;
- типы задействованных участников, например неопытные участники или эксперты.
6.1 Измерения проводит бригада аудиторов в количестве не менее 15 человек. Состав бригады - произвольный.
6.2 Бригада аудиторов работает в два этапа.
6.3 На первом этапе проводят обучение аудиторов на подготовленном речевом тесте. Речевой тест должен содержать мужской и женский голоса, естественную речь, синтезированную речь со всеми категориями ошибок. Аудиторы тренируются определять категорию ошибки синтезированной речи по образцам.
6.4 На втором этапе выполняют измерения испытуемого синтезатора. Синтезатор генерирует речь для таблицы А.1 (приложение А) и примеров, приведенных в А.2 (приложение А), с постоянным уровнем громкости в нормальном темпе речи.
6.5 Пауза между фразами при прослушивании должна составлять (3 +/- 2) с. Длительность паузы в заданном интервале определяется аудитором. Уровень громкости устанавливается аудитором на испытательном предложении "Не видали мы такого невода".
6.6 Аудитор прослушивает синтезированное предложение и ставит оценку разборчивости в диапазоне от 1 до 5. Оценку 1 ставят при фиксировании ошибок категории 4. Описание категорий ошибок указано в таблице 1. Оценку 2 ставят, когда наблюдаются ошибки категории 3. Оценку 3 - ошибки категории 2. Оценку 4 - ошибки категории 1. Оценку 5 ставят, когда в синтезированной речи отсутствуют ошибки. При наблюдении ошибок из разных категорий выбирают ошибку с наибольшей категорией.
При измерении смысловой разборчивости следует помнить, что при этом не учитывается точность реализации интонационного оформления фразы. Необходимо принимать во внимание только возможные ошибки, перечисленные в таблице 1.
Таблица 1
синтезированной речи
6.7 Измерение разборчивости включает в себя прослушивание всеми аудиторами всех фраз таблиц, подготовленных отдельно для мужского и женского голосов. Для каждого измерения выбирают разные таблицы. Протокол измерения смысловой разборчивости речи должен содержать дату измерения, идентификатора аудитора, идентификатор голоса синтезатора, идентификатор фразы и оценку разборчивости.
6.8 Проводят единичные измерения как средние значения разборчивости по оценкам аудитора для каждой пары таблица - голос. Для каждого измерения вычисляют среднее значение разборчивости S согласно [1] по формуле
где N - число единичных измерений (таблиц);
Si - единичное измерение (среднее значение в таблице 1).
Далее выявляют сомнительные значения Si, которые отбрасывают, и вычисляют новое значение S. Методика обработки приведена в 6.14.
6.9 Аудиторы, результаты которых имеют более двух отклонений от средних значений по бригаде аудиторов более чем на величины, указанные в таблице 2, подлежат замене или исключению из бригады.
Таблица 2
Максимальное нормальное отклонение
6.10 Измерения считают законченными при достижении бригадой повторяемых результатов измерения. Повторяемость результатов проверяют по статистической значимости различий средних величин разборчивости по t-критерию Стьюдента с уровнем значимости 0,05. Итоговым измерением является объединение последних единичных измерений, не имеющих статистически значимых различий.
6.11 После прослушивания в течение 45 мин делают перерыв на 20 мин. Время работы бригады должно быть не более 4 ч в сутки.
6.12 Классы разборчивости и нормы разборчивости речи - в соответствии с таблицей 3.
Таблица 3
Характеристики класса разборчивости
6.13 Метод следует использовать при аттестации синтезатора речи по тексту, не требующему нормализации.
С целью исключения спорных результатов измерений показателя качества производят следующую обработку полученных данных:
а) вычисляют среднее значение разборчивости по формуле (1);
б) вычисляют среднее квадратичное отклонение (СКО) по формуле
(2)в) единичные измерения, для которых
, исключают и производят вычисление нового среднего значения по формуле , (3)где N - число единичных измерений;
k - число исключенных измерений.
7.1 Измерения выполняют по методике раздела 6, за исключением установки темпа речи, приведенной в 6.4. Устанавливают ускоренный темп речи, как правило, от 20 знаков/с. Если необходимо измерение при более высоком ускорении, то это должно быть указано при организации аттестации синтезатора. В результате выполнения этой методики получают оценку разборчивости ускоренной синтезированной речи Sy.
7.2 Коэффициент деградации смысловой разборчивости ускоренной синтезированной речи рассчитывают по формуле
, (4)где Sn - оценка разборчивости, полученная при выполнении методики по разделу 6.
7.3 Метод следует использовать при аттестации синтезатора речи по тексту, применяемого в режиме синтеза ускоренной речи.
8.1 Измерения проводит бригада аудиторов в количестве не менее 15 человек. Состав бригады произвольный.
8.2 Бригада аудиторов работает в два этапа.
8.3 На первом этапе проводят обучение аудиторов на подготовленном речевом тесте. Речевой тест должен содержать мужской и женский голоса, естественную речь, синтезированную речь со всеми категориями ошибок. Аудиторы тренируются определять категорию ошибки синтезированной речи по образцам.
8.4 На втором этапе выполняют измерения испытуемого синтезатора. Синтезатор генерирует речь для таблицы Б.1 (приложение Б) с постоянным уровнем громкости в нормальном темпе речи.
8.5 Пауза между фразами при прослушивании должна составлять (3 +/- 2) с. Длительность паузы в заданном интервале определяется аудитором. Уровень громкости устанавливается аудитором на испытательном предложении "Не видали мы такого невода".
8.6 Аудитор прослушивает синтезированное предложение и ставит оценку разборчивости интонации - 0 или 1. Оценка 1 означает, что интонация точно соответствует знакам препинания; оценка 0 - интонация не соответствует. Монотонность интонации не должна влиять на оценку разборчивости.
8.7 Измерение интонационной разборчивости включает в себя прослушивание всеми аудиторами всех фраз подготовленной таблицы. Протокол измерения интонационной разборчивости речи должен содержать дату измерения, идентификатор аудитора, идентификатор голоса синтезатора, идентификатор фразы и оценку разборчивости.
8.8 Оценку интонационной разборчивости речи S, %, вычисляют по формуле
, (5)где N - число фраз в подготовленной таблице;
Si - значение оценки интонации отдельной фразы.
9.1 Измерения проводят по методике раздела 8, за исключением установки темпа речи, приведенной в 8.4. Устанавливают ускоренный темп речи, как правило, от 20 знаков/с. Если необходимо измерение при более высоком ускорении, то это должно быть указано при организации аттестации синтезатора. По данной методике выполняют оценку разборчивости ускоренной синтезированной речи Sy.
9.2 Коэффициент деградации интонационной разборчивости ускоренной синтезированной речи DS вычисляют по формуле:
, (6)где Sn - оценка разборчивости, полученная при выполнении методики по разделу 8.
9.3 Метод следует использовать при аттестации синтезатора речи по тексту, используемого в режиме синтеза ускоренной речи.
10.1 Измерения проводит бригада аудиторов в количестве не менее 20 человек. Отклонение доли мужчин от доли женщин не должно превышать 20%. Размер бригады определен для уровня значимости 0,05 с доверительным интервалом оценки среднего значения естественности, равным 0,03 балла по [1].
10.2 Бригада аудиторов работает в два этапа.
10.3 На первом этапе проводят обучение аудиторов на подготовленном речевом тесте. Речевой тест должен содержать мужской и женский голоса, естественную речь, синтезированную речь со всеми уровнями естественности. Аудиторы тренируются оценивать естественность синтезированной речи в баллах по образцам.
10.4 На втором этапе выполняют измерения испытуемого синтезатора. Синтезатор генерирует речь в нормальном темпе речи для таблиц, составленных в соответствии с правилами приложения В. Формируется тест для аудиторов как случайная последовательность различных аудиозаписей, содержащих либо естественную речь, либо синтезированную. Расстояние между аудиозаписями с естественной речью в последовательности аудиозаписей должно быть не более 5.
10.5 Пауза между фразами при прослушивании должна составлять (3 +/- 2) с. Длительность паузы в заданном интервале определяется аудитором. Уровень громкости устанавливается аудитором на испытательном предложении "Не видали мы такого невода".
10.6 Аудитор прослушивает аудиозаписи, ставит оценку естественности звучания речи по степени искажений речи. Субъективную оценку проводят в абсолютных категориях по 5-балльной шкале в соответствии с таблицей 4. Прилагательное "абсолютный" в наименовании шкалы указывает на то, что аудиторам необходимо оценить каждую аудиозапись безотносительно к другим аудиозаписям.
Таблица 4
Шкала оценок естественности речи
10.7 Измерение естественности включает в себя прослушивание аудиторами всех аудиозаписей не менее пяти таблиц, подготовленных отдельно для мужского и женского голосов. Для каждого измерения выбирают разные таблицы. Протокол измерения естественности речи должен содержать дату измерения, идентификатор аудитора, идентификатор голоса синтезатора или диктора, ширину спектра аудиосигнала, идентификатор фразы и оценку естественности.
10.8 Вычисляют единичные измерения как средние значения естественности по оценкам аудитора для каждой пары таблицы и голоса. Для каждого измерения вычисляют среднее значение естественности Q по формуле
, (7)где N - число единичных измерений;
Qi - единичное измерение.
Далее выявляют спорные значения Qi, которые не учитывают, и вычисляют новое значение Q. Методика обработки приведена в 6.14.
10.9 Измерения считают законченными при достижении бригадой повторяемых результатов измерения. Повторяемость результатов проверяют по статистической значимости различий средних величин естественности по t-критерию Стьюдента с уровнем значимости 0,05. Итоговым измерением является объединение последних единичных измерений, не имеющих статистически значимых различий.
10.10 После прослушивания 10 таблиц делают перерыв на 20 мин. Время работы бригады должно быть не более 4 ч за один день. Общее число таблиц за один рабочий день до 40.
10.11 Расчет оценок естественности выполняют отдельно по различным синтезированным голосам и совместно по всем естественным голосам.
10.12 Расчет оценки естественности синтезатора речи в целом определяют как среднее значение оценок естественности по отдельным голосам синтезатора.
10.13 Оценку естественности используют для сравнения синтезаторов речи с учетом ширины спектра аудиосигнала и средней длительности синтезируемой речи. Среднее значение естественности для синтезатора с узкополосным аудиосигналом уменьшается на 0,2 при сравнении со средним значением синтезатора с широкополосным аудиосигналом. Оценка естественности уменьшается с увеличением средней длительности синтезируемой речи.
10.14 Сравнивать оценки естественности синтезаторов речи, выполненных в двух различных измерениях, возможно только после корректировки различий начал отсчета координат и масштабов субъективных шкал экспериментов. Базой коррекции шкал являются оценки естественности для естественной речи и оценки естественности для базовых синтезаторов. Базовые синтезаторы - это синтезаторы, которые оценивают в нескольких измерениях.
11.1 Измерения проводит бригада аудиторов в количестве не менее 3 человек.
11.2 Бригада аудиторов работает без тренировки.
11.3 Синтезатор генерирует речь для всех примеров приложения Г с постоянным уровнем громкости в нормальном темпе.
11.4 Пауза между фразами при прослушивании должна составлять (3 +/- 2) с. Длительность паузы в заданном интервале определяется аудитором. Уровень громкости устанавливается аудитором на испытательном предложении "Не видали мы такого невода".
11.5 Аудитор прослушивает синтезированную речь, проверяя содержание речи по нормализованной форме текста, и фиксирует число ошибок (количество слов, которые не соответствуют расшифровкам), которые допустил синтезатор. Необходимо учитывать, что в одном предложении может быть несколько случаев нормализации, следовательно, и ошибок может быть несколько. Если ошибки нормализации отсутствуют, то указывают значение 0 (ноль). Протокол измерения качества нормализации синтезируемого текста должен содержать дату измерения, идентификатор аудитора, идентификатор голоса синтезатора, идентификатор фразы, количество случаев нормализации и количество ошибок.
11.6 Формируется итоговый протокол по измерениям аудиторов. Для каждой фразы количество ошибок нормализации принимают как медианное значение количества ошибок, вычисленное по всем аудиторам.
11.7 Качество нормализации синтезируемого текста SN, %, вычисляют по формуле
, (8)где Nо - общее число ошибок, зафиксированных в таблицах для проверки нормализации;
N - общее число случаев, где требуется нормализация.
12.1 Измерения проводит бригада аудиторов в количестве не менее 3 человек.
12.2 Измерение проводят на рекомендуемом подмножестве SSML-тегов и значений атрибутов [2], приведенном в таблице 5. В выделенное подмножество попали наиболее частотные, используемые на практике теги.
Таблица 5
Рекомендуемое подмножество SSML-тегов и значений атрибутов
12.3 Бригада аудиторов работает в два этапа.
12.4 На первом этапе проводят обучение аудиторов на подготовленном речевом тесте. Речевой тест должен содержать фразы с вариантами правильного и неправильного управления просодией речи. Аудиторы тренируются определять ошибки управления просодией речи по образцам.
12.5 На втором этапе выполняют проверку испытуемого синтезатора. Синтезатор генерирует речь для всех таблиц приложения Д с постоянным уровнем громкости в нормальном темпе, исключая случай управления громкостью и темпом речи.
12.6 Пауза между фразами при прослушивании должна составлять от 1 до 2 с. Длительность паузы в заданном интервале определяется аудитором. Уровень громкости устанавливается аудитором на испытательном предложении "Не видали мы такого невода".
12.7 Аудитор прослушивает синтезированную речь с учетом управляющего действия конкретного SSML-тега и фиксирует число ошибок (число несоответствий требуемому эффекту управляющего воздействия SSML-тега), которые допустил синтезатор. Если ошибки управления отсутствуют, то указывают значение 0 (ноль). Измерение качества управления следует проводить с учетом разборчивости синтезированного текста. Если управляющее воздействие тега привело к нарушению разборчивости произносимых слов, то такое управляющее воздействие считают ошибочным. Протокол измерения качества управления синтезом должен содержать дату измерения, идентификатор аудитора, идентификатор голоса синтезатора, идентификатор фразы и количество ошибок.
12.8 Формируют итоговый протокол по измерениям аудиторов. Для каждой фразы количество ошибок управления принимают в качестве медианного значения количества ошибок, вычисленного по всем аудиторам.
12.9 Качество управления синтезом SC, %, вычисляют по формуле
, (9)где Nо - общее количество ошибок итогового протокола;
N - общее число фраз, при котором использованы SSML-теги.
12.10 Оценку качества управления синтезированной речью используют для сравнения синтезаторов речи по критерию эффективности управления процессом синтеза.
К неоцениваемым функциональным возможностям синтезатора речи методами измерения, которые описаны в настоящем стандарте, можно отнести:
- передачу эмоциональной окраски синтезированной речи. Возможность управления эмоциональной окраской синтезированной речи;
- возможность переноса эмоциональной окраски и стиля речи с фразы образца речи на синтезированный голос;
- возможность настройки идентичности голоса синтезированной речи по голосу целевого диктора с использованием короткого образца речи (длительность не более 1 мин);
- возможность синтезирования несловной речи;
- возможность воспроизведения в синтезированной речи стихотворных текстов;
- пение.
(обязательное)
ПРАВИЛА СОСТАВЛЕНИЯ ТАБЛИЦ ДЛЯ ИЗМЕРЕНИЯ
СМЫСЛОВОЙ РАЗБОРЧИВОСТИ РЕЧИ
А.1 Таблицы для измерения смысловой разборчивости речи должны содержать по 50 уникальных нормализованных предложений. Предложение должно содержать от 1 до 12 слов. Часть предложений (рекомендуется не менее 20) должны содержать в своем составе запятую и/или омограф. В каждой таблице должно быть несколько слов с замененной "ё" на "е".
Измерение смысловой разборчивости производится без учета интонационной разборчивости.
Пример составления такой таблицы с учетом особенностей русского языка представлен в таблице А.1, которая содержит фонетически представительный текст с дополнительными предложениями, содержащими омографы.
Таблица А.1
Общий объем текста в подобных таблицах должен обеспечивать фонетическую представительность текстов русской речи. Рекомендуемый объем - 10 таблиц по 50 предложений. В этот объем должна быть включена проверка правильности разрешения омографов. Примеры предложений с омографами приведен ниже в этом приложении. Состав предложений с омографами также должен быть дополнен различными вариантами, чтобы избежать возможность предварительной настройки синтезатора.
А.2 Примеры различных вариантов омографов, разнообразные аналоги которых необходимо использовать в таблицах русского языка [2], выделенных подчеркиванием:
1. В
2. В
3. Летают
.4. Летают две
.5. Я ехал в вагоне метро с букетом красных
6. Я вбил в стену маленький
.7. Верной
идете!8.
друг, спасибо за добрые слова.9. И говорить об этом не
10. За этим человеком
11. Моя хата с
12. Мне довелось побывать на
13. Сухие и полусухие
14.
15. Мы живем в совершенно
16. Собака этой породы будет настоящим
17. Наши специалисты ответят на
18.
19. Забудьте обо
20.
21.
22. Она была в красном
23. На первых
24.
25. В
26. Ртутные
27. Наша компания также имеет возможность купить колесные
28.
29. Самарское общество охотников конского
30. Они обратили внимание на старинную бедуинскую забаву - верблюжьи
31.
32. Особенностью сдвижных автоматических
33.
34. Удовольствие от вина получаешь, когда за столом отодвигаешь момент
35. Сегодня турецкий морской
36. Двигатель с внешним подводом теплоты имеет устройство нагрева и охлаждения из двух подкамер, наполненных жидкостью и
37. Кто сочувствует нашему
38. Я
39. В покровской тюрьме была пресечена подготовка к
40. Я
41. Сотрудники английского торгового представительства организовали в Гамбурге клуб любителей
42. В Германии мы
43. До сих пор в области регистрировались единичные случаи заражения
.44. Мы
себя всемогущества, сознательно ограничивая свои возможности.45. Вот и закончилась эта зимняя сессия, и снова я умудрился закончить ее с одним
.46. Я
47. Мы снова в
(обязательное)
ПРАВИЛА СОСТАВЛЕНИЯ ТАБЛИЦ ДЛЯ ОЦЕНКИ
ИНТОНАЦИОННОЙ РАЗБОРЧИВОСТИ РЕЧИ
Оценку точности интонационной разборчивости предлагается проводить с помощью таблицы, содержащей от 50 и более уникальных нормализованных предложений. Предложение может содержать от 1 до 12 слов. Каждое из этих предложений должно быть повторено 4 раза и различаться только знаком препинания в конце предложения: точка, вопросительный знак, восклицательный знак, многоточие (или двоеточие).
Пример составления такой таблицы с учетом особенностей русского языка представлен в таблице Б.1, которая содержит фонетически представительный текст с дополнительными предложениями, содержащими омографы.
Таблица Б.1
Общий объем текста в подобных таблицах должен обеспечивать фонетическую представительность текстов русской речи. Рекомендуемый объем - 2 таблицы по 50 предложений. В этот объем должна быть включена проверка правильности разрешения омографов. Состав предложений с омографами также должен быть дополнен различными вариантами для того, чтобы избежать возможность предварительной настройки синтезатора.
(обязательное)
Таблицы для измерения естественности речи должны быть составлены в зависимости от средней длительности синтезируемой речи:
- для кратковременного синтеза таблицы должны содержать 100 строк. В каждой строке должно быть одно нормализованное предложение. Размер предложения - не более 10 слов. В каждой таблице необходимо обеспечить интонационную представительность предложений, т.е. должны быть утвердительные предложения с точкой в конце и вопросительные. В каждой из этих групп должно быть одно или несколько предложений, содержащих запятую, омограф. В каждой таблице должно быть несколько слов с замененной "ё" на "е";
- для долговременного синтеза таблицы должны содержать 50 строк. В каждой строке должен быть текст, содержащий не менее трех нормализованных предложений, связанных между собой общим смыслом. Средний размер текста должен быть не менее 20 слов. В каждой таблице необходимо обеспечить интонационную представительность предложений, т.е. должны быть утвердительные повествовательные, вопросительные, восклицательные предложения и предложения, заканчивающиеся многоточием. В каждой из этих групп должно быть одно или несколько предложений, содержащих запятую, омограф. В каждой таблице должно быть несколько слов с замененной "ё" на "е".
Общее число таблиц, представительность и вариативность текстов должны быть такими, чтобы исключить возможность предварительной настройки синтезатора на конкретный состав предложений в таблицах.
(обязательное)
Г.1 Таблицы для проверки нормализации текста должны содержать предложения для проверки нормализации чисел (римских чисел от 0 до 40), сокращений, специальных знаков, иноязычных слов. В каждой строке таблицы по одному предложению. Предложение должно содержать от трех слов и более. Для каждого типа нормализации (числа, сокращения, специальные знаки, иноязычные слова) должна быть отдельная таблица. Количество строк (предложений) в каждой таблице должно быть таким, чтобы охватить общеупотребительные варианты с вариативной словарной представительностью. Рекомендуется составить для каждого варианта нормализации от пяти вариантов примеров и более. Допускается использование нескольких примеров написания чисел в одном предложении.
Число строк в таблицах по разным типам нормализации и вариативность текста (чисел, сокращений, специальных знаков, иноязычных слов) должны быть такими, чтобы исключить возможность предварительной настройки синтезатора на конкретные тексты.
Г.2 Проверка качества нормализации чисел
Проверка качества нормализации чисел должна включать примеры реализации следующих правил:
- примеры использования количественных числительных;
- примеры использования порядковых числительных;
- примеры использования чисел с окончаниями;
- примеры использования чисел со словами (50-летие);
- примеры использования различных склонений чисел;
- примеры использования целых, дробных, отрицательных чисел;
- примеры использования римских цифр.
Г.2.1 Примеры предложений для проверки нормализации чисел
5 и 6 октября 2008 года в Москве был дождь.
Недавно мы отпраздновали 65-летие Победы.
С 80-х годов прошлого века это явление получило массовый характер.
Было опрошено 187 человек, в т.ч. 91 женщина, 67 мужчин и 29 подростков.
В 1660 году король Людовик XIV женился на инфанте Марии-Терезии Австрийской.
Г.2.2 Расшифровки предложений для проверки качества нормализации чисел
Расшифровки чисел даны в скобках после каждой числовой последовательности и выделены жирным шрифтом в нижеприведенных предложениях.
5 (пятого) и 6 (шестого) октября 2008 (две тысячи восьмого) года в Москве был дождь.
Недавно мы отпраздновали 65-летие (шестидесятипятилетие) Победы.
С 80-х (восьмидесятых) годов прошлого века это явление получило массовый характер.
Было опрошено 187 (сто восемьдесят семь) человек, в т.ч. 91 (девяносто одна) женщина, 67 (шестьдесят семь) мужчин и 29 (двадцать девять) подростков.
В 1660 (тысяча шестьсот шестидесятом) году король Людовик XIV (четырнадцатый) женился на инфанте Марии-Терезии Австрийской.
Г.3 Проверка качества нормализации сокращений
Проверка качества нормализации сокращений должна включать примеры сокращений, образованных по правилам, перечисленным в пункте 4 ГОСТ Р 7.0.12-2011. Для подготовки примеров предложений с сокращениями, также следует использовать материал по ГОСТ Р 7.0.12-2011 (приложение А).
Г.3.1 Примеры предложений для проверки нормализации сокращений
Ул. Бармалеева, д. 12, кв. 36.
К 2020 г. работа будет закончена.
Стихотворение сопровождает комментарий (на с. 275).
Пробка вылетает из бутылки шампанского со скоростью 13 м/с (около 50 км/ч).
Здание было отреставрировано в XX в.
Г.3.2 Расшифровки предложений для проверки нормализации сокращений
Расшифровки сокращений даны в скобках после каждого сокращения и выделены жирным шрифтом.
Ул. (улица) Бармалеева, д. (дом) 12, кв. (квартира) 36.
К 2020 г. (году) работа будет закончена.
Стихотворение сопровождает комментарий (на с. (странице) 275).
Пробка вылетает из бутылки шампанского со скоростью 13 м/с (метров в секунду) [около 50 км/ч (километров в час)].
Здание было отреставрировано в XX в. (веке).
Г.4 Проверка качества нормализации специальных знаков
Проверка качества нормализации специальных знаков должна включать примеры использования:
- знаков наиболее частотных в использовании валют;
- записи температуры;
- записи процентов;
- записи частотных служебных символов: *, #, ~ и др.
Г.4.1 Примеры предложений для проверки нормализации специальных знаков
Железная дорога стоимостью $4,2 млрд.
Температура воздуха +15 °C.
Так считают 58% граждан в возрасте от 20 до 35 лет.
Нужно набрать на клавиатуре *#06#.
Есть опасения, что закроются около 40% предприятий.
Г.4.2 Расшифровки предложений для проверки нормализации специальных знаков
Расшифровки специальных знаков даны в скобках после каждого специального знака и выделены жирным шрифтом.
Железная дорога стоимостью $4,2 млрд (долларов).
Температура воздуха + (плюс) 15 °C (градусов Цельсия).
Так считают 58% (процентов) граждан в возрасте от 20 до 35 лет.
Нужно набрать на клавиатуре: * (звездочка) # (решетка) 06# (решетка).
Есть опасения, что закроются около 40% (процентов) предприятий.
Г.5 Проверка качества нормализации иноязычных слов
Проверка качества нормализации иноязычных слов должна включать следующие примеры использования:
- наименований интернет адресов;
- наименований компаний, торговых марок, марок автомобилей и другой техники;
- наименований информационных агентств;
- наименований стран, континентов, морей, рек, городов и других часто используемых географических наименований;
- имен и фамилий известных людей;
- частотных аббревиатур.
Г.5.1 Примеры предложений для проверки нормализации иноязычных слов
Наш адрес в Интернете: www.speechpro.ru.
Аукционный дом Sotheby's открыл выставку в Третьяковской галерее.
Реклама размещена на каналах CNN и Euronews.
Магазины IKEA начали летнюю распродажу.
Следует установить программу на ваш PC.
Г.5.2 Расшифровки предложений для проверки нормализации иноязычных слов
Расшифровки иноязычных вставок даны в скобках после каждой иноязычной вставки и выделены жирным шрифтом в нижеприведенных предложениях.
Наш адрес в Интернете: www.speechpro.ru (три даблйю точка спичпро точка ру).
Аукционный дом Sotheby's (Сотбис) открыл выставку в Третьяковской галерее.
Реклама размещена на каналах CNN (СиЭнЭн) и Euronews (Евроньюс).
Магазины IKEA (Икеа) начали летнюю распродажу.
Следует установить программу на ваш PC (ПиСи).
(обязательное)
Таблицы для проверки управления синтезом должны содержать строки текста, содержащие варианты управляющих сочетаний: SSML-тегов/атрибутов. В каждой строке таблицы должны быть от одного до нескольких предложений, различающихся только сочетаниями тег/атрибут тега. Состав и правила применения тегов с атрибутами в тексте должны соответствовать стандарту SSML. Пример таблицы представлен в таблице Д.1.
Таблица Д.1
Примеры применения тегов с атрибутами
Выбор атрибутов тегов должен быть таким, чтобы явным образом показать работоспособность тега. Это означает, что значения атрибутов (для тегов break, prosody, emphasis) должны представлять среднее значение и возможный диапазон на границах, при которых действие тега происходит требуемым образом, но при этом речь все еще остается разборчивой. Оценка разборчивости требует прослушивания нескольких предложений для каждого сочетания тег/атрибут тега (это относится к таким тегам, как break, prosody, emphasis).
Некоторые теги не имеют атрибутов, например теги <p>, <s>. Эти теги в таблицах применяют без атрибутов.
Вернуться в "Каталог нормативных документов"
Источник информации: https://internet-law.ru/documents/prod/gost-r_gosudarstvennyj-standart/23/gost_12021.html
На правах рекламы:
|
||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||