BS ISO 24624-2016 PDF
Название на английском:
STB BS ISO 24624-2016
Название на русском:
СТБ BS ISO 24624-2016
Оригинальный стандарт BS ISO 24624-2016 в PDF полная версия. Дополнительная инфо + превью по запросу
Полное наименование и описание
СТБ BS ISO 24624-2016 — национальная нумерация/маркировка, основанная на международном стандарте ISO 24624:2016 «Language resource management — Transcription of spoken language» (Управление языковыми ресурсами — Транскрипция устной речи). Стандарт задаёт правила представления транскрипций аудио- и видео‑записей устных взаимодействий в XML-документах с опорой на рекомендации TEI и обеспечивает согласование с практиками аннотированных корпусов.
Аннотация
Документ описывает структуру и элементы, рекомендуемые для кодирования транскрипций устной речи (включая метаданные, тайм-коды, обозначения говорящих, парalingвистические явления и пр.), а также содержит пример полного кодирования и индекс элементов/атрибутов в приложениях. Применим для социолингвистики, анализа разговоров, корпусной лингвистики, разработки языковых технологий и качественных социальных исследований; не предназначен для транскрипции рукописных источников.
Общая информация
- Статус: Действующий (публикация ISO подтверждена; национальные издания — действующие).
- Дата публикации: 2016 (издание 1, обозначение 2016‑08). Некоторые национальные/торговые издания указывают июль/август 2016; в разных публикациях техническая страничность может отличаться.
- Организация-издатель: Международная организация по стандартизации (ISO); при адаптации может публиковаться национальными органами (например, British Standards Institution как BS ISO 24624:2016 и в национальных каталогах под маркировкой СТБ BS ISO 24624-2016).
- ICS / категории: 01.140.10 (Writing and transliteration / Письменность и транслитерация).
- Редакция / версия: Edition 1 (2016). Стандарт периодически пересматривается; по информации ISO он был подтверждён при очередном пересмотре.
- Количество страниц: базовая англоязычная версия ISO — около 32 страниц; у национальных или коммерческих копий (BS‑вариант и пр.) может быть иная нумерация/формат (в некоторых прайс‑листах указывается 46 страниц).
Область применения
Стандарт применяется для кодирования и представления транскрипций устной речи в цифровых ресурсах: корпусах, репозиториях, исследовательских наборах данных и при создании инструментов обработки речи и лингвистического аннотирования. Поддерживает обмен данными между исследовательскими группами и инструментами за счёт единого набора правил и XML‑структур, совместимых с рекомендациями TEI. Не охватывает транскрипцию рукописей и другие виды текстовой оцифровки, не являющиеся записью устной речи.
Ключевые темы и требования
- Модель представления транскрипции в XML с набором элементов и атрибутов, согласованных с TEI.
- Правила кодирования говорящих, ролей, переключений, перекрытий и временных меток (тайм‑кодирование).
- Обработка паралингвистических явлений (продолжительности, паузы, интонационные маркеры и т. п.).
- Связь транскрипций с аннотациями корпуса и метаданными для последующего анализа и обмена.
- Примеры полного кодирования и индекс элементов/атрибутов для реализации в инструментах и схемах.
Применение и пользователи
Основные пользователи: лингвисты (социолингвистика, корпусная лингвистика), исследователи разговорной речи и дискурса, разработчики языковых технологий (ASR, NLP), архивы устной истории, центры по созданию и публикации языковых корпусов, образовательные организации, а также команды, разрабатывающие инструменты для аннотирования аудио/видео. Национальные и отраслевые издатели/каталоги могут публиковать адаптированные версии (например, BS ISO варианты).
Связанные стандарты
Стандарт логически связан с рекомендациями TEI (Text Encoding Initiative) по кодированию текстов и с прочими стандартами в сфере управления языковыми ресурсами и корпусной разметки. Также может использоваться вместе с национальными руководствами по аннотированию и форматам обмена корпусными данными. При внедрении часто опираются на сопутствующие стандарты ISO/TC 37.
Ключевые слова
транскрипция устной речи; XML; TEI; языковые ресурсы; корпусная лингвистика; аннотированный корпус; тайм‑коды; разметка разговора; ISO 24624.
FAQ
В: Что это за стандарт?
О: Международный стандарт ISO 24624:2016, предназначенный для описания правил представления транскрипций устной речи в форматах XML с опорой на TEI; в национальных каталогах он может фигурировать как BS ISO 24624:2016 или под комбинированной маркировкой (например, СТБ BS ISO 24624-2016).
В: Что он регулирует?
О: Формализует элементы и атрибуты для кодирования говорящих, тайм‑меток, паралингвистических маркеров, перекрытий, пауз и сопутствующих метаданных, а также даёт пример полного XML‑кодирования и индекс элементов/атрибутов. Это рекомендации по представлению транскрипций с целью совместимости и обмена.
В: Кто обычно использует?
О: Лингвисты, исследователи разговорной речи, разработчики NLP/ASR, архивы устной истории, создатели корпусов и разработчики инструментов аннотирования и обмена корпусами. Также стандарт интересен организациям, публикующим национальные версии ISO и предприятиям, создающим форматы обмена данными.
В: Он актуален или заменён?
О: По состоянию на последнее плановое пересмотрение информация на странице ISO показывает, что издание 2016 года было подтверждено (проверяется в пятигодичном цикле пересмотра). Это означает, что версия 2016 остаётся актуальной до очередного изменения. При внедрении рекомендуется сверяться с национальными органами стандартизации на предмет адаптаций.
В: Это часть серии?
О: Стандарт входит в область работ ISO/TC 37 (языковые ресурсы) и логически дополняет другие стандарты и руководства по управлению языковыми ресурсами и аннотированию, а также совместим с рекомендациями TEI по кодированию текстов.
В: Какие ключевые слова?
О: транскрипция устной речи, XML, TEI, языковые ресурсы, корпус, тайм‑коды, ISO 24624.