не е, всички са така.
малко разследване:
това, което показах, е от вградения ридър на хрома.
в акробата не е така.
може би с външен екстеншън с други pdf библиотеки в хрома ще е друго, ама не ми се експериментира, поне за сега.
файла е 70МБ (за сравнение подобен pdf от ментора е 100-200К максимум).
информацията с какво е слепен е оскъдна
бодро е обявена версия на pdf 1.4, макар че има елементи и от следващите спецификации.
но така или иначе това са само декларации, никой рендер не им обръща внимание.
тежка компресия, при това в поредица от матрьошки - в компресиран обект има други компресирани обекти, които също съдържат такива.
без компресия са ~55K обекта, след първата декомпресия скочиха на 130К (от 70МБ на 230МБ)
но още не се виждат обектите на самия текст как са дефинирани и от къде идват тия произволни тълкувания.
огромни части от файла са посветени на JS (всичко е ~3.5 млн реда)
та си извадих само една страничка, да ми е по-лесно (JS частта си замина, явно не е част от всяка страница).
все пак остава един съществен 'бинарен' блоб, който популярните библиотеки не го декомпресират и е трудно да се видят точните примитиви.
предварителното ми заключение е, че става някаква каша с интерпретацията в различни библиотеки на кърнинга в шрифтове със смесен енкодинг. в случая Times New Roman е вкаран и в двата варианта (ТТF и PF*), отделно се ползва и вградения в рендера. Всичко това цъфва в неймспейса едновременно и кой шрифт в кое текстово поле ще се 'обади' е непредсказуемо.
определено следното търсене на шрифт
ще дава различни резултати в акробата и в гугъля. последните надали са били склонни да плащат роялтита за всеки хром по света.
как да е.
трябва да се живее с тая ситуация.
заключение: лалтиумски файлове трябва да се ровят с акробат (само)