OOXML — фикция: LibreOffice обвинила Microsoft в манипуляциях

OOXML — фикция: LibreOffice обвинила Microsoft в манипуляциях

OOXML — фикция: LibreOffice обвинила Microsoft в манипуляциях

Проблемы совместимости остаются одной из главных причин, по которым пользователи не спешат переходить с Microsoft Office на LibreOffice. Формально всё работает, но на практике время от времени всплывают странности с вёрсткой, форматированием и отображением данных. И, как считают в The Document Foundation (TDF), дело тут вовсе не в LibreOffice.

Фонд, стоящий за LibreOffice, снова выступил с жёсткой критикой Microsoft. В блоге Итало Виньоли — одного из основателей TDF — корпорация из Редмонда обвиняется в том, что она игнорирует интересы отрасли ради собственных коммерческих целей.

По его словам, утверждение «OOXML — это стандарт, и его просто нужно принять» выглядит, мягко говоря, странно.

Виньоли настаивает: Office Open XML (OOXML) не может считаться полноценным стандартом, пока Microsoft не готова радикально переработать сами приложения Office. В качестве примера он напомнил о давней проблеме Excel с автопреобразованием данных — истории, которая напрямую затронула научное сообщество.

Excel годами автоматически превращал текстовые значения в даты. Для обычных таблиц это удобно, но для генетиков — катастрофа. Названия генов вроде MARCH1, SEPT1 или DEC1 Excel воспринимал как даты и превращал их в «1-Mar», «1-Sep» и «1-Dec».

В 2016 году журнал Genome Biology проанализировал почти 3,6 тысячи научных работ с Excel-файлами и выяснил, что примерно в каждой пятой были ошибки, вызванные именно автозаменой форматов.

Долгое время Microsoft считала проблему нишевой и не давала возможность отключить такое поведение. Лишь в 2023 году компания добавила соответствующую настройку; уже после того, как Комитет по номенклатуре генов человека (HGNC) был вынужден переименовать около 27 генов, чтобы избежать ошибок. К тому моменту ущерб для исследований уже был нанесён.

По словам Виньоли, OOXML «открыт» лишь формально. Спецификация формата занимает около 7 000 страниц, что делает полноценную и корректную реализацию сторонними разработчиками почти невозможной.

Кроме того, Microsoft Office сам не использует строгую версию стандарта (Strict OOXML), предпочитая так называемый Transitional-вариант. В нём до сих пор есть зависимости от старых, проприетарных форматов и поведения древних версий Word — вплоть до элементов с названиями вроде autoSpaceLikeWord95 или shapeLayoutLikeWW8.

Отдельно Виньоли критикует рекомендации использовать Windows Metafile для графики вместо открытых и кросс-платформенных форматов вроде SVG.

Для пользователей всё это выливается в знакомую проблему: документы между Office и LibreOffice открываются, но не всегда так, как ожидалось. Для TDF же это очередное подтверждение того, что формат Office по-прежнему работает как инструмент удержания пользователей внутри экосистемы Microsoft.

Спор вокруг OOXML длится уже много лет, и новый выпад со стороны LibreOffice ясно показывает: вопрос совместимости и «открытых стандартов» по-прежнему далёк от закрытия.

Права авторов при обучении ИИ уточнят в подзаконных актах осенью

Новый закон о поддержке развития искусственного интеллекта не отменяет Гражданский кодекс и не превращает произведения авторов в бесплатный корм для нейросетей. Об этом заявила советник президента России Елена Ямпольская. Закон, подписанный президентом 26 июля, разрешает использовать общедоступные и правомерно опубликованные материалы для обучения российских алгоритмов ИИ.

Однако правообладатель может закрыть свои работы от такой обработки техническими средствами. Бесконтрольно загружать в модели всё, до чего дотянулся парсер, нельзя.

Как именно будет работать этот механизм, пока предстоит решить. Подзаконные акты, по данным «Ведомостей», начнут появляться осенью. При их подготовке власти обещают учесть опасения творческих отраслей, представители которых предупреждали об обесценивании интеллектуальной собственности.

Эксперты тем временем предлагают несколько способов помирить нейросети с авторами. Среди них — отказ от использования произведений по требованию правообладателя, коллективное лицензирование и отчисление части прибыли ИИ-продуктов в компенсационный фонд.

В РАНХиГС считают, что разработчиков генеративных моделей стоит обязать вести закрытые реестры обучающих данных и показывать их регуляторам. Так можно будет понять, чьи произведения попали в датасет, не раскрывая коммерческую тайну.

Юрист Михаил Семенов предлагает разделять сценарии. Если модель копирует голос актёра, манеру художника или тексты конкретного писателя, потребуется прямой договор и выплаты. При массовом обучении на миллиардах материалов искать каждого автора нереально — здесь пригодился бы аналог авторского общества для ИИ.

В отрасли есть и более жёсткий взгляд: чрезмерные ограничения могут ударить и по экономике, и по культуре. Поэтому властям предстоит настроить систему так, чтобы модели не остались голодными, а авторы — с красивым обещанием вместо денег.

RSS: Новости на портале Anti-Malware.ru